# robotmafia > Notizen zu Arbeiten aus der KI-Forschung - erklaert, eingeordnet und mit Quelle. Archiv statt Nachrichtenstrom. Jede Notiz behandelt EINE Arbeit, nennt sie mit Titel, Autoren und Adresse und begründet in einem eigenen Abschnitt, warum sie ausgewählt wurde. Zahlen sind gegen den Volltext der Quelle belegt. Ausgewählt wird knapp und gegen die Nachrichtenlage: keine Modellveröffentlichungen, keine Produktmeldungen, keine Ankündigungen. Sprache: Deutsch. Alle Notizen im Volltext als eine Datei: https://robotmafia.com/llms-full.txt Lizenz der Texte: CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). Übernehmen, kürzen und zitieren ist erlaubt, auch kommerziell, solange die Quelle genannt und auf den Text verlinkt wird. Die Bilder sind davon ausgenommen. ## Notizen - [Was einzeln auffliegt, überlebt den langen Arbeitsgang](https://robotmafia.com/artikel/was-einzeln-auffliegt-ueberlebt-den-langen-arbeitsgang.html): Ein Deep-Research-Agent zerlegt eine Frage, sucht, liest, verdichtet Zwischenstände und schreibt am Ende einen Bericht. Zwischen der ersten Suche und dem letzten Absatz liegen viele Schritte, in denen Material … – Quelle: Is Deep Research Reliable? Misleading Knowledge Induces False Conclusions, P. Zhu, L. Li, L. Yang, S. Su, J. Shao, 2026-07-30 - https://arxiv.org/abs/2607.20891 - [Der Zuschnitt der Bindetasche verrät die richtige Antwort](https://robotmafia.com/artikel/der-zuschnitt-der-bindetasche-verraet-die-richtige-antwort.html): Wer einen Wirkstoff sucht, lässt den Rechner große Molekülbibliotheken in eine Proteintasche legen und nach Passgenauigkeit sortieren. Die Funktion, die dabei die Punkte vergibt – im Fach scoring function –, ist seit … – Quelle: How Bias Shapes the Leaderboard: Scoring Function Performance Under Scrutiny, D. Graber, J. Kopko, P. Stockinger, R. Nakandalage, B. Kuhn, S. Mishra, 2026-07-30 - https://doi.org/10.64898/2026.07.27.740774 - [Die Genauigkeit merkt nicht, dass die Antwort zerfällt](https://robotmafia.com/artikel/die-genauigkeit-merkt-nicht-dass-die-antwort-zerfaellt.html): Wer von zwei getrennten Bevölkerungen abstammt, trägt ein Erbgut wie ein Flickenteppich: Jedes Stück Chromosom stammt aus der einen oder der anderen Quelle. Das Verfahren, das diesen Teppich zurückrechnet – die … – Quelle: What limits local ancestry inference at low divergence: a feasibility threshold, a metric that conceals failure, and a deficit of input more than architecture, Q. Tian, 2026-08-03 - https://doi.org/10.64898/2026.07.30.741148 - [Netz und Gehirn treffen sich in der Textur, nicht im Gegenstand](https://robotmafia.com/artikel/netz-und-gehirn-treffen-sich-in-der-textur-nicht-im-gegenstand.html): Tiefe neuronale Netze sagen die Antworten des menschlichen Sehsystems über dessen Stufen hinweg vorher, und das gilt weithin als Hinweis darauf, dass beide dasselbe tun: Gegenstände erkennen. Zwei Beobachtungen passten … – Quelle: Shared texture-like representations underlie deep neural network alignment with human visual processing, Jessica Loke, Lynn K. A. Sörensen, Iris I. A. Groen, Natalie Cappaert, H. Steven Scholte (Universität Amsterdam; MIT), 2026-08-06 - https://doi.org/10.1101/2025.08.29.673066 - [Ein Modell rechnet mit den Wörtern, die es aussprechen könnte](https://robotmafia.com/artikel/ein-modell-rechnet-mit-den-woertern-die-es-aussprechen-koennte.html): Ein Sprachmodell zeigt seine Antwort, nicht den Weg dorthin. Teil eins dieser Reihe handelte davon, dass sich eine Selbstauskunft nur prüfen lässt, wenn man die Antwort vorher kennt. Diese Arbeit geht von der anderen … – Quelle: Verbalizable Representations Form a Global Workspace in Language Models, Wes Gurnee, Nicholas Sofroniew, Adam Pearce u. a. (Anthropic, sechzehn Autoren; Korrespondenz Jack Lindsey), 2026-07-16 - https://arxiv.org/abs/2607.15495 - [Was ein Modell über sich sagt, lässt sich im Gespräch nicht prüfen](https://robotmafia.com/artikel/was-ein-modell-ueber-sich-sagt-laesst-sich-im-gespraech-nicht-pruefen.html): Sprachmodelle äußern sich über ihr Inneres. Sie sagen, sie hätten etwas übersehen, sie seien unsicher, sie hätten das eigentlich anders gemeint. Ob davon irgendetwas stimmt, ist im Gespräch nicht zu klären – und zwar … – Quelle: Emergent Introspective Awareness in Large Language Models, Jack Lindsey (Anthropic), 2026-01-05 - https://arxiv.org/abs/2601.01828 - [Was Handlungsblöcke besser macht, ist der Blick zurück](https://robotmafia.com/artikel/was-handlungsbloecke-besser-macht-ist-der-blick-zurueck.html): Wer heute einen Roboterarm aus menschlichen Vorführungen lernen lässt, lässt ihn selten Schritt für Schritt handeln. Die Steuerung sagt aus einer einzigen Beobachtung gleich eine ganze Folge von Bewegungen voraus – in … – Quelle: Why Does Action Chunking Improve Behavioral Cloning Performance in Robotic Control?, F. Lazzati, K. Stachowicz, W. Chen, A. M. Metelli, A. Wagenmaker, S. Levine (Politecnico di Milano; UC Berkeley), 2026-08-03 - https://arxiv.org/abs/2608.02547 - [Verständlich heißt nicht verstanden](https://robotmafia.com/artikel/verstaendlich-heisst-nicht-verstanden.html): Ein Radiologiebefund ist nicht für Patienten geschrieben, und Patienten lesen ihn trotzdem. Seit Sprachmodelle Fachsprache mühelos in Alltagssprache übersetzen, liegt der Vorschlag nahe, jedem Befund eine Laienfassung … – Quelle: The Illusion of Understanding: A Randomized Controlled Trial of LLM-Generated Lay Summaries of Brain MRI Reports, B. Le Guellec, R. Bentegeac, V.-T. Tran, M. El Homsi, P. Amouyel, G. Kuchcinski, A. Hamroun (Lille University Hospital; Paris Cité University), 2026-08-07 - https://doi.org/10.64898/2026.08.05.26359773 - [Was AlphaFold zu sicher faltet, verraten ein paar Kaliumionen](https://robotmafia.com/artikel/was-alphafold-zu-sicher-faltet-verraten-ein-paar-kaliumionen.html): Das Tau-Protein stabilisiert in Nervenzellen die Mikrotubuli, und zwar überwiegend über seine Wiederholungsabschnitte. Einer davon, R2, ist ungeordnet: An das Protofilament gebunden zeigt ihn eine Cryo-EM-Struktur … – Quelle: Deep-learning predictions of biomolecular structures: persistent limitations and new horizons extended by explicit ion addition, J. Marien, S. Sritharan, B. Caviglia u. a., S. Sacquin-Mora, A. Taly (CNRS / Université Paris Cité, IBPC; 17 Autoren), 2026-07-26 - https://doi.org/10.64898/2026.07.24.740587 - [Mehrere Zeitfenster helfen am meisten, wenn die Zukunft fehlt](https://robotmafia.com/artikel/mehrere-zeitfenster-helfen-am-meisten-wenn-die-zukunft-fehlt.html): Wer einem Geräusch zuhört, hat nie den ganzen Klang. Erkennen muss man aus dem, was bis zu diesem Moment angekommen ist. Viele Modelle für Umgebungsgeräusche arbeiten anders: Sie bekommen das fertige Spektrogramm … – Quelle: Multiscale Temporal Processing Supports Sound Recognition under Causal Constraints, M. Esposito, T. Weidler, C. Ferreyra, B. L. Giordano, E. Formisano (Maastricht University; CNRS / Université Aix-Marseille), 2026-07-30 - https://doi.org/10.64898/2026.07.27.740874 - [Ein Prozent der Richtungen trägt den ganzen Gewinn](https://robotmafia.com/artikel/ein-prozent-der-richtungen-traegt-den-ganzen-gewinn.html): Die Frage, wie stark eine On-Policy-Destillation die Gewichte eines Modells umschreibt, hat im Sommer 2026 zwei Gruppen gleichzeitig beschäftigt. Diese hier sitzt in Nanjing und bei Alibaba, misst an zwölf Modellpaaren … – Quelle: Dense Supervision, Sparse Updates: On the Sparsity and Geometry of On-Policy Distillation, G. Yu, H.-X. Ma, J.-P. Jiang, H.-J. Ye (Nanjing University), W. Liu, Y. Hu (Amap, Alibaba Group), 2026-07-30 - https://arxiv.org/abs/2606.13657 - [Was nach zwanzig Prozent feststeht, trägt den Rest des Trainings](https://robotmafia.com/artikel/was-nach-zwanzig-prozent-feststeht-traegt-den-rest-des-trainings.html): Ein fertig vortrainiertes Sprachmodell wird auf drei Arten nachgeschärft. Beim überwachten Nachtrainieren lernt es aus fremden Musterlösungen. Beim Verstärkungslernen erzeugt es eigene Antworten und bekommt am Ende zu … – Quelle: On the Geometry of On-Policy Distillation, Z. Shen, Y. Li, Q. Yin, C. T. Leong u. a. (HKUST, Brown University, Zhejiang University u. a., 9 Autoren), 2026-06-14 - https://arxiv.org/abs/2606.07082 - [Ein Modell, das die Antwort nie sieht, kann sie nicht auswendig lernen](https://robotmafia.com/artikel/ein-modell-das-die-antwort-nie-sieht-kann-sie-nicht-auswendig-lernen.html): Ob ein Gen eine Krankheit verursacht oder nur mit ihr auftritt, lässt sich aus Beobachtungsdaten nicht ablesen. Zellzustand, Zellzyklus, Charge und die Ko-Expression der übrigen Gene können auf beides gleichzeitig … – Quelle: Comparison of nuisance function construction strategies for double machine learning causal inference in single-cell transcriptomics: shared unsupervised deep learning does not require cross-fitting, W. Ye, X. Jiang, F. Shen (Xiamen Susong Hospital / Xiamen University / Beijing University of Technology), 2026-07-26 - https://doi.org/10.64898/2026.07.22.739971 - [Wer mehr Neuronen misst, braucht weniger Versuche](https://robotmafia.com/artikel/wer-mehr-neuronen-misst-braucht-weniger-versuche.html): Ein Mikroskop nimmt heute zehntausend Neuronen gleichzeitig auf. Die Zahl der Versuchsdurchgänge steigt nicht mit: Ein Tier hält seine Aufmerksamkeit eine begrenzte Zeit, und wer viele Aufgabentypen prüfen will, bekommt … – Quelle: A predictive theory of experimental design for inferring neural population geometry in large-scale recordings, I. D. Landau, G. C. Mel, D. J. O'Shea u. a. (Stanford University / Centre de Recerca Matemàtica Barcelona), 2026-07-23 - https://doi.org/10.64898/2026.07.19.739385 - [Der Gleichstand kommt aus dem geerbten Teil](https://robotmafia.com/artikel/der-gleichstand-kommt-aus-dem-geerbten-teil.html): Ein Immunrezeptor ist unbekannt, und die Frage lautet, wogegen er sich richtet. Das übliche Verfahren sucht in einer Datenbank den ähnlichsten Rezeptor, dessen Ziel man kennt, und überträgt die Antwort. Ähnlichkeit … – Quelle: A germline shortcut in protein language model retrieval of adaptive immune receptors, S. Wang, A. Sengupta, S. Li, D. M. Standley (The University of Osaka / MyImmune Corporation), 2026-07-23 - https://doi.org/10.64898/2026.07.21.739963 - [Der Vorbehalt stand im selben Dokument](https://robotmafia.com/artikel/der-vorbehalt-stand-im-selben-dokument.html): Seit Ende Juni laufen hier vier Messreihen über die Arbeit mit einem KI-Assistenten. Sie zählen, wie oft eine Korrektur nötig war, wie oft der Assistent seinen Fehler selbst fand, wie oft er vor einem Problem im eigenen … – Quelle: Eigene Messreihen zur Arbeit mit einem KI-Assistenten, 20.06. bis 04.08.2026, Werkstattnotiz, 2026-08-04 - [Ob sich das Nachtraining lohnt, verrät der Verlust davor](https://robotmafia.com/artikel/ob-sich-das-nachtraining-lohnt-verraet-der-verlust-davor.html): Es gibt einen Streit darüber, was Verstärkungslernen mit einem Sprachmodell eigentlich anstellt. Die eine Seite sagt: Es schärft nur, was das Modell ohnehin schon bevorzugt hat. Die andere: Es bringt Fähigkeiten hervor … – Quelle: Understanding Reasoning from Pretraining to Post-Training, J. Shen, A. Li, S. Rahman, Y. Sun, M. Goldblum, M. Telgarsky, P. Izmailov (New York University u. a.), 2026-07-17 - https://arxiv.org/abs/2607.16097 - [Jede fünfte Störung sieht kein einziges Werkzeug](https://robotmafia.com/artikel/jede-fuenfte-stoerung-sieht-kein-einziges-werkzeug.html): Wenn in der genetischen Diagnostik eine Variante auftaucht, die noch niemand kennt, entscheidet häufig ein Vorhersageprogramm mit, ob sie als verdächtig gilt oder unter „vermutlich harmlos" abgelegt wird. Fünf solcher … – Quelle: A Reproducible MFASS Benchmark of Splice-Disruption Predictors Reveals a Shared Exon-Interior Blind Spot, B. F. Znabu, Z. Atif, P. Devkota u. a. (University of Nebraska-Lincoln / GIST Gwangju / University of Kansas Medical Center), 2026-07-26 - https://doi.org/10.64898/2026.07.21.739871 - [Das beste Bild liefert der Speicher, der nie gelesen wird](https://robotmafia.com/artikel/das-beste-bild-liefert-der-speicher-der-nie-gelesen-wird.html): Ein Videomodell soll eine Szene erzeugen, durch die sich eine Kamera bewegt. Sie dreht sich weg, filmt eine Weile etwas anderes und kommt zurück. Steht der Gegenstand dann noch da, wo er war? Ist es überhaupt derselbe … – Quelle: Echo-Memory: A Controlled Study of Memory in Action World Models, Wayne King, Zeyue Xue, Yuxuan Bian, Jie Huang u. a. (16 Autoren), 2026-06-08 - https://arxiv.org/abs/2606.09803 - [Wo die Frage steht, entscheidet mit, wer sie beantworten kann](https://robotmafia.com/artikel/wo-die-frage-steht-entscheidet-mit-wer-sie-beantworten-kann.html): Die Aufgabe ist so klein, dass man zögert, sie eine Aufgabe zu nennen: Gegeben sind n Bits und eine Nummer. Ausgegeben werden soll das Bit an dieser Stelle. Nachschlagen, mehr nicht. – Quelle: Indexing: the Beginning and the End, Alexander Kozachinskiy, Vicente Opazo, Felipe Urrutia (CENIA, Pontificia Universidad Católica de Chile), 2026-07-24 - https://arxiv.org/abs/2607.22361 - [Das nachgerüstete Gedächtnis macht den trainierten Agenten schlechter](https://robotmafia.com/artikel/das-nachgeruestete-gedaechtnis-macht-den-trainierten-agenten-schlechte.html): Zwei Verbesserungen, jede für sich unstrittig. Man kann einen Agenten mit bestärkendem Lernen auf seine Aufgabe trainieren. Und man kann ihm ein Gedächtnis anbauen, das Erfahrungen aufbewahrt und im richtigen Moment … – Quelle: AgentSpec: Understanding Embodied Agent Scaffolds Through Controlled Composition, Jixuan Chen, Jianzhi Shen, Haoqiang Kang u. a. (13 Autoren), 2026-06-12 - https://arxiv.org/abs/2606.14674 - [Wer nachtrainiert, hat den Prüfer schon gebaut](https://robotmafia.com/artikel/wer-nachtrainiert-hat-den-pruefer-schon-gebaut.html): Ein Agent, der eine Aufgabe in dreißig Schritten erledigt, soll unterwegs bewertet werden und nicht erst am Ende. Dafür baut man ein zweites Modell, das jeden Schritt benotet – trainiert auf annotierten Spuren, mit … – Quelle: Neglected Free Lunch from Post-training: Progress Advantage for LLM Agents, Changdae Oh, Wendi Li, Seongheon Park, Samuel Yeh, Tanwi Mallick, Sharon Li (University of Wisconsin–Madison, Argonne National Laboratory), 2026-06-24 - https://arxiv.org/abs/2606.26080 - [Nicht der Agent macht die Arbeit schwer, sondern das Repository](https://robotmafia.com/artikel/nicht-der-agent-macht-die-arbeit-schwer-sondern-das-repository.html): Wer wissen will, ob ein Programmier-Agent taugt, lässt ihn Aufgaben lösen und zählt die gelösten. Das ist die Logik hinter jeder Bestenliste in diesem Feld, und sie unterstellt, dass die Eigenschaft, um die es geht, im … – Quelle: Govern the Repository, Not the Agent: Measuring Ecosystem-Level Risk in AI-Native Software, Daniel Russo, 2026-06-26 - https://arxiv.org/abs/2606.28235 - [Das Modell findet das Werkzeug und weiß kaum, wozu es dient](https://robotmafia.com/artikel/das-modell-findet-das-werkzeug-und-weiss-kaum-wozu-es-dient.html): Ein Agent mit 47.000 verfügbaren Werkzeugen – verteilt auf rund 16.000 Schnittstellen – kann nicht bei jeder Anfrage alle Beschreibungen lesen. Also sucht er vorher. Eine Bauart, die dafür seit gut einem Jahr gehandelt … – Quelle: ToolSense: A Diagnostic Framework for Auditing Parametric Tool Knowledge in LLMs, Ashutosh Hathidara, Sai Shruthi Sistla, Sebastian Schreiber, Sahil Bansal (SAP Labs), 2026-06-04 - https://arxiv.org/abs/2606.12451 - [Was ein Diagnosemodell insgeheim lernt, steht in den Genen](https://robotmafia.com/artikel/was-ein-diagnosemodell-insgeheim-lernt-steht-in-den-genen.html): Wer wissen will, was ein Modell gelernt hat, fragt üblicherweise das Modell. Man hält ihm eine Eingabe hin, verändert sie und sieht zu, was sich am Ergebnis bewegt. Das Verfahren hat einen eingebauten Horizont: Es kann … – Quelle: Genetic decoding reveals druggable biology implicitly learned by a medical-history foundation model, W. Zeng, C. Langenberg, M. Pietzner u. a. (Berlin Institute of Health at Charité / Queen Mary University of London), 2026-07-29 - https://doi.org/10.64898/2026.07.28.26359117 - [Das Kleinhirn bekommt nicht bloß ein Fehlersignal, sondern einen Gradienten](https://robotmafia.com/artikel/das-kleinhirn-bekommt-nicht-bloss-ein-fehlersignal-sondern-einen-gradi.html): Der übliche Einwand gegen Deep Learning als Hirnmodell lautet: Ein Neuron, das viele Synapsen von der Muskulatur entfernt sitzt, kann unmöglich erfahren, welchen Anteil es am Fehler hatte. Genau das leistet die … – Quelle: Climbing fibers encode the gradient of a loss function for the cerebellum, J. Doostmohammadi, N. Mohammadrezaei, H. Elseweifi, A. Chandler, E. Taeckens, R. Shadmehr (Johns Hopkins School of Medicine), 2026-07-28 - https://doi.org/10.64898/2026.07.27.741034 - [Nicht die Datenmenge entscheidet, was ein Weltmodell lernt](https://robotmafia.com/artikel/nicht-die-datenmenge-entscheidet-was-ein-weltmodell-lernt.html): Die Gründungsannahme der Weltmodelle ist bequem: Wer gezwungen wird, die Zukunft vorherzusagen, muss sich die Physik seiner Umgebung aneignen. Alles Weitere ist dann eine Frage der Datenmenge. – Quelle: What Can Latent World Models Know? Physical Parameter Identifiability in Multimodal Predictive Representations, Kaizhen Tan, Xin Xu, Siru Tao, Hanzhe Hong, Yang Feng, Heqing Du (NYU / Carnegie Mellon / Columbia), 2026-07-29 - https://arxiv.org/abs/2607.27017 - [Das Modell denkt kürzer und verschweigt dabei mehr](https://robotmafia.com/artikel/das-modell-denkt-kuerzer-und-verschweigt-dabei-mehr.html): Nachdenken kostet. Jedes Wort, das ein Modell vor seiner Antwort produziert, wird bezahlt – in Rechenzeit, in Geld, in Wartezeit des Nutzers. Also trainiert man Modelle darauf, sich kürzer zu fassen: ein Abzug auf … – Quelle: Length Penalties Make Chain-of-Thought Less Monitorable, Bryce Little (ohne Institut), 2026-07-17 - https://arxiv.org/abs/2607.09786 - [Agenten scheitern früh und merken es zuletzt](https://robotmafia.com/artikel/agenten-scheitern-frueh-und-merken-es-zuletzt.html): Ein Programm, das eine Aufgabe selbständig in einer Kommandozeile erledigt, produziert dabei eine Spur: Befehl, Ausgabe, nächster Befehl, ein gescheiterter Lauf im Median siebenundzwanzig Schritte lang. Am Ende steht … – Quelle: Failure as a Process: An Anatomy of CLI Coding Agent Trajectories, Xiangxin Zhao, Han Li, Shuaiting Li, Tianyi Zhao, Earl T. Barr, Federica Sarro, He Ye, 2026-07-10 - https://arxiv.org/abs/2607.09510 - [Das Modell merkt sich den Raum, nicht das Bild](https://robotmafia.com/artikel/das-modell-merkt-sich-den-raum-nicht-das-bild.html): Ein Modell, das Video erzeugt, in dem man sich bewegen kann, hat ein Gedächtnisproblem. Dreht man die Kamera einmal im Kreis, muss der Schrank hinter einem noch derselbe Schrank sein. Das Modell erzeugt Bilder … – Quelle: Latent Spatial Memory for Video World Models, Weijie Wang, Haoyu Zhao, Yifan Yang u. a., 2026-06-08 - https://arxiv.org/abs/2606.09828 - [Wer vergisst, lernt bessere Grammatik](https://robotmafia.com/artikel/wer-vergisst-lernt-bessere-grammatik.html): Das erste Modell konnte nicht mehr richtig schreiben. Es produzierte Rechtschreibfehler in Serie – für die Autoren ein Hinweis darauf, dass selbst die kürzesten Abhängigkeiten gestört waren, die es gibt: die innerhalb … – Quelle: Human-like fleeting memory improves language learning but impairs reading time prediction in transformer language models, Abishek Thamma, Micha Heilbron (Univ. Amsterdam / MPI Nijmegen), 2026-05-08 - https://arxiv.org/abs/2508.05803 - [Spitzenmodelle lösen Olympiade-Aufgaben und verrutschen beim Abschreiben](https://robotmafia.com/artikel/spitzenmodelle-loesen-olympiade-aufgaben-und-verrutschen-beim-abschrei.html): Die Autoren stellen ihre Frage selbst, und sie ist unangenehm: Wenn ein Modell Medaillen-Niveau in Olympiade-Mathematik erreicht, warum sollte man ihm dann nicht zutrauen, eine Zeichenfolge fehlerfrei abzuschreiben? – Quelle: Frontier Language Models Struggle to Copy: Text Can Be Better Viewed in 2D, Haodong Wen, Yiran Zhang, Yingfa Chen, Kaifeng Lyu (Tsinghua University), 2026-07-17 - https://arxiv.org/abs/2607.16072 - [Vier Gigabyte, die niemand mehr brauchte](https://robotmafia.com/artikel/vier-gigabyte-die-niemand-mehr-brauchte.html): Ein Lauf über drei Bilder, sonst eine Sache von Minuten, zog sich über zwei Stunden hin – Wanduhr, samt Ladezeiten und einem vorangegangenen Fehlversuch. Pro Sampling-Schritt vergingen 63 bis 122 Sekunden statt der … – Quelle: Eigene Messung am Arbeitsplatz (Radeon RX 7800 XT, 16 GB), Werkstattnotiz, 2026-07-29 - [Gute Skills gewinnen, indem sie weniger kaputtmachen](https://robotmafia.com/artikel/gute-skills-gewinnen-indem-sie-weniger-kaputtmachen.html): Wenn man einem Agenten eine Handlungsanweisung mitgibt, misst man üblicherweise, wie viel besser er dadurch wird. Diese Zahl verschweigt die Gegenrichtung: Aufgaben, die er vorher konnte und jetzt nicht mehr. – Quelle: The Regression Tax: Decomposing Why Skills Help and Hurt LLM Agents, Darshan Tank, Baran Nama, 2026-07-24 - https://arxiv.org/abs/2607.22520 - [Der bessere Prüfer richtet den größeren Schaden an](https://robotmafia.com/artikel/der-bessere-pruefer-richtet-den-groesseren-schaden-an.html): Ein Modell verbessert sich selbst, indem ein zweites seine Ausgaben bewertet – solche Prüfmodelle heißen im Englischen verifiers. Die stillschweigende Annahme: besserer Prüfer, besserer Schüler. Sie hält nicht. – Quelle: When Good Verifiers Go Bad, Jianzhe Lin (Meta AI), 2026-06-12 - https://arxiv.org/abs/2606.14629 - [Der Mond ist auch da, wenn keiner hinsieht – Weltmodelle offenbar nicht](https://robotmafia.com/artikel/der-mond-ist-auch-da-wenn-keiner-hinsieht-weltmodelle-offenbar-nicht.html): Eine Katze sitzt auf dem Boden. Der Prompt lautet: „Im Schlafzimmer springt eine Katze aufs Bett." Die Kamera dreht sich weg, sieht sich kurz woanders um und kommt zurück. Wo ist die Katze? – Quelle: Current World Models Lack Persistent State Core (WRBench), Jinpeng Lu, Dexu Zhu u. a. (USTC, X-Humanoid, CAS, TU Dresden, PKU), 2026-06-18 - https://arxiv.org/abs/2606.20545 ## Prüfprotokolle Zu jeder Notiz ist festgehalten, worauf sich ihre Aussagen stützen: Zahl für Zahl gegen die Quelle, dazu die Befunde der Gegenlesung und die Korrekturen, die daraus folgten – einschließlich der Fälle, in denen die Belegliste selbst falsch lag. - [Übersicht aller Prüfprotokolle](https://robotmafia.com/pruefung/) - [Prüfprotokoll: Was einzeln auffliegt, überlebt den langen Arbeitsgang](https://robotmafia.com/pruefung/was-einzeln-auffliegt-ueberlebt-den-langen-arbeitsgang.html) – gegengelesen von: claude, gemini, grok - [Prüfprotokoll: Der Zuschnitt der Bindetasche verrät die richtige Antwort](https://robotmafia.com/pruefung/der-zuschnitt-der-bindetasche-verraet-die-richtige-antwort.html) – gegengelesen von: claude, gemini, grok - [Prüfprotokoll: Die Genauigkeit merkt nicht, dass die Antwort zerfällt](https://robotmafia.com/pruefung/die-genauigkeit-merkt-nicht-dass-die-antwort-zerfaellt.html) – gegengelesen von: claude, gemini, grok - [Prüfprotokoll: Netz und Gehirn treffen sich in der Textur, nicht im Gegenstand](https://robotmafia.com/pruefung/netz-und-gehirn-treffen-sich-in-der-textur-nicht-im-gegenstand.html) – gegengelesen von: claude, gemini, grok - [Prüfprotokoll: Ein Modell rechnet mit den Wörtern, die es aussprechen könnte](https://robotmafia.com/pruefung/ein-modell-rechnet-mit-den-woertern-die-es-aussprechen-koennte.html) – gegengelesen von: claude, gemini, grok - [Prüfprotokoll: Was ein Modell über sich sagt, lässt sich im Gespräch nicht prüfen](https://robotmafia.com/pruefung/was-ein-modell-ueber-sich-sagt-laesst-sich-im-gespraech-nicht-pruefen.html) – gegengelesen von: claude, gemini, grok - [Prüfprotokoll: Was Handlungsblöcke besser macht, ist der Blick zurück](https://robotmafia.com/pruefung/was-handlungsbloecke-besser-macht-ist-der-blick-zurueck.html) – gegengelesen von: claude, gemini, grok - [Prüfprotokoll: Verständlich heißt nicht verstanden](https://robotmafia.com/pruefung/verstaendlich-heisst-nicht-verstanden.html) – gegengelesen von: claude, gemini, grok - [Prüfprotokoll: Was AlphaFold zu sicher faltet, verraten ein paar Kaliumionen](https://robotmafia.com/pruefung/was-alphafold-zu-sicher-faltet-verraten-ein-paar-kaliumionen.html) – gegengelesen von: claude, gemini, grok - [Prüfprotokoll: Mehrere Zeitfenster helfen am meisten, wenn die Zukunft fehlt](https://robotmafia.com/pruefung/mehrere-zeitfenster-helfen-am-meisten-wenn-die-zukunft-fehlt.html) – gegengelesen von: claude, gemini, grok - [Prüfprotokoll: Ein Prozent der Richtungen trägt den ganzen Gewinn](https://robotmafia.com/pruefung/ein-prozent-der-richtungen-traegt-den-ganzen-gewinn.html) – gegengelesen von: claude, gemini, grok - [Prüfprotokoll: Was nach zwanzig Prozent feststeht, trägt den Rest des Trainings](https://robotmafia.com/pruefung/was-nach-zwanzig-prozent-feststeht-traegt-den-rest-des-trainings.html) – gegengelesen von: claude, gemini, grok - [Prüfprotokoll: Ein Modell, das die Antwort nie sieht, kann sie nicht auswendig lernen](https://robotmafia.com/pruefung/ein-modell-das-die-antwort-nie-sieht-kann-sie-nicht-auswendig-lernen.html) – gegengelesen von: claude, gemini, grok - [Prüfprotokoll: Wer mehr Neuronen misst, braucht weniger Versuche](https://robotmafia.com/pruefung/wer-mehr-neuronen-misst-braucht-weniger-versuche.html) – gegengelesen von: claude, gemini, grok - [Prüfprotokoll: Der Gleichstand kommt aus dem geerbten Teil](https://robotmafia.com/pruefung/der-gleichstand-kommt-aus-dem-geerbten-teil.html) – gegengelesen von: claude, gemini, grok - [Prüfprotokoll: Der Vorbehalt stand im selben Dokument](https://robotmafia.com/pruefung/der-vorbehalt-stand-im-selben-dokument.html) – gegengelesen von: claude, gemini, glm, grok, terra - [Prüfprotokoll: Ob sich das Nachtraining lohnt, verrät der Verlust davor](https://robotmafia.com/pruefung/ob-sich-das-nachtraining-lohnt-verraet-der-verlust-davor.html) – gegengelesen von: claude, gemini, grok - [Prüfprotokoll: Jede fünfte Störung sieht kein einziges Werkzeug](https://robotmafia.com/pruefung/jede-fuenfte-stoerung-sieht-kein-einziges-werkzeug.html) – gegengelesen von: claude, gemini, grok - [Prüfprotokoll: Das beste Bild liefert der Speicher, der nie gelesen wird](https://robotmafia.com/pruefung/das-beste-bild-liefert-der-speicher-der-nie-gelesen-wird.html) – gegengelesen von: claude, gemini, grok - [Prüfprotokoll: Wo die Frage steht, entscheidet mit, wer sie beantworten kann](https://robotmafia.com/pruefung/wo-die-frage-steht-entscheidet-mit-wer-sie-beantworten-kann.html) – gegengelesen von: claude, gemini, grok - [Prüfprotokoll: Das nachgerüstete Gedächtnis macht den trainierten Agenten schlechter](https://robotmafia.com/pruefung/das-nachgeruestete-gedaechtnis-macht-den-trainierten-agenten-schlechte.html) – gegengelesen von: claude, gemini, grok - [Prüfprotokoll: Wer nachtrainiert, hat den Prüfer schon gebaut](https://robotmafia.com/pruefung/wer-nachtrainiert-hat-den-pruefer-schon-gebaut.html) – gegengelesen von: claude, gemini, grok - [Prüfprotokoll: Nicht der Agent macht die Arbeit schwer, sondern das Repository](https://robotmafia.com/pruefung/nicht-der-agent-macht-die-arbeit-schwer-sondern-das-repository.html) – gegengelesen von: claude, gemini, grok - [Prüfprotokoll: Das Modell findet das Werkzeug und weiß kaum, wozu es dient](https://robotmafia.com/pruefung/das-modell-findet-das-werkzeug-und-weiss-kaum-wozu-es-dient.html) – gegengelesen von: claude, deepseek, gemini, gpt, grok, sol, terra - [Prüfprotokoll: Was ein Diagnosemodell insgeheim lernt, steht in den Genen](https://robotmafia.com/pruefung/was-ein-diagnosemodell-insgeheim-lernt-steht-in-den-genen.html) – gegengelesen von: claude, gemini, grok - [Prüfprotokoll: Das Kleinhirn bekommt nicht bloß ein Fehlersignal, sondern einen Gradienten](https://robotmafia.com/pruefung/das-kleinhirn-bekommt-nicht-bloss-ein-fehlersignal-sondern-einen-gradi.html) – gegengelesen von: claude, gemini, grok - [Prüfprotokoll: Nicht die Datenmenge entscheidet, was ein Weltmodell lernt](https://robotmafia.com/pruefung/nicht-die-datenmenge-entscheidet-was-ein-weltmodell-lernt.html) – gegengelesen von: claude, gemini, grok - [Prüfprotokoll: Das Modell denkt kürzer und verschweigt dabei mehr](https://robotmafia.com/pruefung/das-modell-denkt-kuerzer-und-verschweigt-dabei-mehr.html) – gegengelesen von: claude, gemini, grok - [Prüfprotokoll: Agenten scheitern früh und merken es zuletzt](https://robotmafia.com/pruefung/agenten-scheitern-frueh-und-merken-es-zuletzt.html) – gegengelesen von: claude, gemini, grok - [Prüfprotokoll: Das Modell merkt sich den Raum, nicht das Bild](https://robotmafia.com/pruefung/das-modell-merkt-sich-den-raum-nicht-das-bild.html) – gegengelesen von: claude, gemini, grok - [Prüfprotokoll: Wer vergisst, lernt bessere Grammatik](https://robotmafia.com/pruefung/wer-vergisst-lernt-bessere-grammatik.html) – gegengelesen von: claude, gemini, grok - [Prüfprotokoll: Spitzenmodelle lösen Olympiade-Aufgaben und verrutschen beim Abschreiben](https://robotmafia.com/pruefung/spitzenmodelle-loesen-olympiade-aufgaben-und-verrutschen-beim-abschrei.html) – gegengelesen von: claude, gemini, grok - [Prüfprotokoll: Vier Gigabyte, die niemand mehr brauchte](https://robotmafia.com/pruefung/vier-gigabyte-die-niemand-mehr-brauchte.html) - [Prüfprotokoll: Gute Skills gewinnen, indem sie weniger kaputtmachen](https://robotmafia.com/pruefung/gute-skills-gewinnen-indem-sie-weniger-kaputtmachen.html) – gegengelesen von: claude, gemini, grok - [Prüfprotokoll: Der bessere Prüfer richtet den größeren Schaden an](https://robotmafia.com/pruefung/der-bessere-pruefer-richtet-den-groesseren-schaden-an.html) – gegengelesen von: claude, gemini, grok - [Prüfprotokoll: Der Mond ist auch da, wenn keiner hinsieht – Weltmodelle offenbar nicht](https://robotmafia.com/pruefung/der-mond-ist-auch-da-wenn-keiner-hinsieht-weltmodelle-offenbar-nicht.html) – gegengelesen von: claude, gemini, grok ## Über diese Seite - [Wie diese Seite entstanden ist](https://robotmafia.com/seiten/ueber.html) - [Wie hier geprüft wird](https://robotmafia.com/seiten/pruefprozess.html) - [Impressum](https://robotmafia.com/seiten/impressum.html) - [Datenschutz](https://robotmafia.com/seiten/datenschutz.html)