GrundlagenBeurteilen und EinordnenKapitel 06von 8 im Pfad
Der Blick ins Modell
Grundkurs, Kapitel 16 stellt am Ende drei Fragen, die der Ablauf offenlässt. Zwei davon bekommen dort eine Adresse. Die dritte lautet, warum eine Rangliste so ausfällt, wie sie ausfällt, und die Antwort ist auch für die Hersteller nur zum Teil beantwortet. Dieses Kapitel sagt, welcher Teil das ist.
Eine Abgrenzung vorweg. Wie ein Modell gebaut ist, also Schichten, Köpfe und Parameterzahl, ist ein Bauplan, den jemand gezeichnet hat. Hier geht es um das, was sich beim Training darin gebildet hat und was niemand gezeichnet hat. Wer den Bauplan liest, weiß, wo gerechnet wird; er weiß nicht, was gerechnet wird.
Zwei Wörter für zwei verschiedene Sachen
Emergenz ist eine Beobachtung von außen: Ein Modell zeigt eine Fähigkeit, die ein kleineres nicht hatte.
Interpretierbarkeit ist ein Verfahren von innen: Jemand sieht in die Rechnung hinein und versucht zu benennen, was dort passiert.
Beide Wörter werden im Gespräch oft vermischt, und sie beantworten verschiedene Fragen. Die erste ist eine über Verhalten, die zweite eine über Mechanik.
Der Sprung, und der Streit darüber
Die Beobachtung wurde 2022 benannt:
Die zweite Hälfte der Behauptung wird seltener zitiert und ist die interessantere. Solche Fähigkeiten cannot be predicted simply by extrapolating the performance of smaller models (externe Seite, arxiv.org), lassen sich also aus kleineren Modellen nicht hochrechnen.
Ein Jahr später kam die Gegenthese, ebenfalls begutachtet:
Der Gedanke dahinter ist einfach. Wer eine mehrstellige Rechnung nur als richtig oder falsch zählt, sieht lange nichts und dann plötzlich etwas. Wer stattdessen zählt, wie viele Ziffern stimmen, sieht eine gleichmäßige Verbesserung.
Beide Arbeiten stehen begutachtet nebeneinander, und der Streit ist offen. Die Gegenthese betrifft dabei den Sprung, also die Form der Kurve. Über die Fähigkeit selbst sagt sie weniger, als der Titel vermuten lässt.
Was ein Nachverfolgen hergibt
Seit 2025 lassen sich Rechenwege in einem Modell teilweise nachzeichnen. Der überzeugendste Beleg für die Ernsthaftigkeit dieser Arbeit ist ein offengelegter Fehlschlag der Autoren:
Sie wollten zeigen, dass ein Modell beim Reimen Wort für Wort vorgeht, und fanden das Gegenteil. Wer ein Ergebnis veröffentlicht, das der eigenen Erwartung widerspricht, hat gemessen. Eine Bestätigung sähe anders aus.
Warum eine Vorabfassung kein geprüfter Aufsatz ist
Ein großer Teil der Quellen dieser Seite liegt auf arXiv, einem Server für Vorabfassungen. Was dort geprüft wird, sagt der Betreiber selbst:
the arXiv moderation process is not a peer-review process (externe Seite, info.arxiv.org)
Geprüft wird also, ob ein Text ins Fachgebiet gehört und den Formalien genügt. Ob die Ergebnisse stimmen, prüft dort niemand.
Für das Lesen heißt das: Eine Arbeit auf arXiv ist ein Angebot an die Fachwelt. Eine begutachtete Arbeit hat mindestens zwei Fachleute überstanden, die sie ablehnen konnten. Beides ist wertvoll, und der Unterschied gehört dazu, wenn man eine Zahl weitergibt.
Was das für die Auskunft eines Modells über sich selbst heißt
Ein Modell kann erklären, wie es zu einer Antwort gekommen ist. Diese Erklärung entsteht auf demselben Weg wie jede andere Antwort, und sie beschreibt den tatsächlichen Rechenweg nur zufällig.
Beim Nachverfolgen einer einfachen Addition zeigte sich, dass ein Modell intern anders vorgeht, als es hinterher schildert (Beleg (externe Seite, anthropic.com)). Beide Wege führen zum richtigen Ergebnis, und nur einer davon ist der gerechnete.
Praktisch folgt daraus dieselbe Regel wie in Grundkurs, Kapitel 07: Die Rückfrage prüft nichts.
Woran Sie eine Innenansicht festmachen
Fragen Sie, ob jemand gemessen oder gedeutet hat. Eine Untersuchung nennt ihr Verfahren und ihre Grenze.
Trennen Sie Beobachtung von Erklärung. Dass eine Fähigkeit auftaucht, ist eine Messung. Warum sie auftaucht, ist eine offene Frage.
Prüfen Sie, wer die Arbeit begutachtet hat. Eine Vorabfassung sagt das selbst, wenn man nachsieht.
Nehmen Sie die Selbstauskunft eines Modells als Text. Ein Protokoll ist sie nicht; sie entsteht wie jede andere Antwort.
Der Überblick trennt Beobachtung und Verfahren. Diese Ebene geht beiden nach: zuerst dem Streit um den Sprung, dann dem, was ein Blick in die Rechnung tatsächlich hergibt.
Was die Emergenzthese behauptet
Die Bestimmung von 2022 hat zwei Teile, und der zweite ist die eigentliche Behauptung. Der erste beschreibt eine Beobachtung: eine Fähigkeit, die in kleinen Modellen fehlt und in großen da ist. Der zweite sagt, dass sich das nicht vorhersagen lässt.
Wäre der zweite Teil richtig, hätte das eine unbequeme Folge für die Planung. Man könnte dann aus keiner Messreihe ableiten, was ein größeres Modell können wird, und müsste es bauen, um es zu erfahren.
Warum der Sprung an der Kennzahl hängen kann
Die Gegenthese von 2023 setzt genau dort an. Ihre Beobachtung:
Der Mechanismus dahinter ist eine Eigenschaft der Messung. Eine Kennzahl, die nur ganz oder gar nicht kennt, zeigt lange nichts und dann alles. Eine, die Teilerfolge zählt, zeigt eine gleichmäßige Kurve.
Der Punkt betrifft die Form der Kurve. Das Wort may steht im Titel jener Arbeit und im Kurztext, und es gehört zur Aussage: Der Sprung kann ein Artefakt sein. Dass die Fähigkeit fehlt, behauptet dort niemand.
Was das für Bestenlisten heißt, gehört zu Kapitel 04, und zwar zum Abschnitt über die Metrik. Der Beitrag dieses Kapitels liegt eine Stufe darunter: Die Wahl der Kennzahl verändert die Gestalt einer ganzen Kurve und damit mehr als die Höhe einer Zahl.
Was das für die Skalierungsgesetze heißt
Kapitel 05 beschreibt, wie sich der Fehlerwert eines Modells mit Größe und Datenmenge vorhersagen lässt, und hält fest, dass daraus keine Aussage darüber folgt, welche Fähigkeit bei welchem Fehlerwert erscheint.
Genau diese Lücke ist der Gegenstand des Streits. Die Skalierungsgesetze sagen etwas über eine Zahl, die niemand direkt braucht; die Frage nach der Fähigkeit liegt dahinter. Wer beides zusammenbringen will, braucht eine Brücke, und darüber gibt es zwei begutachtete Meinungen.
Ein Merkmal steckt nicht in einem Neuron
KI-Wissen, Kapitel 03 hält fest, dass sich aus den Gewichten keine Regel ablesen lässt, weil eine Eigenschaft über viele davon verteilt liegt. Das ist der Befund von außen.
Seit 2024 gibt es ein Verfahren, das trotzdem hineinsieht. Ein zweites, schlankes Netz wird darauf trainiert, die Aktivierungen des Modells als Summe weniger benennbarer Bestandteile darzustellen; aus einem produktiv eingesetzten Modell ließen sich so Millionen solcher Merkmale herauslösen (Beleg (externe Seite, transformer-circuits.pub)).
Benennbar heißt dabei: Ein Merkmal reagiert auf eine bestimmte Sache, und zwar über Sprachen und über Text und Bild hinweg. Das ist eine Aussage über die Modelle eines Hauses, und eine unabhängige Wiederholung an fremden Modellen liegt nicht vor.
Was ein nachgezeichneter Rechenweg zeigt
Aus diesen Merkmalen lässt sich ein Weg durch das Modell zeichnen. Drei Funde aus dieser Arbeit sind über den Einzelfall hinaus interessant.
Vorausplanen. Beim Reimen wählt das Modell das Zielwort, bevor es die Zeile schreibt. Genau das wollten die Autoren widerlegen und fanden das Gegenteil.
Geteilte Merkmale über Sprachen hinweg. Dieselben inneren Bestandteile sprechen auf denselben Begriff in verschiedenen Sprachen an, was zu dem passt, was Grundkurs, Kapitel 04 über Bedeutung als Zahlenreihe sagt.
Zwei Wege zum selben Ergebnis. Bei einer einfachen Addition rechnet das Modell anders, als es hinterher schildert.
Die Grenzen, die die Autoren selbst nennen
Dieser Abschnitt ist das Gegengewicht, und er stammt aus derselben Quelle:
Und der Aufwand:
Stunden je Eingabe von wenigen Dutzend Wörtern. Damit ist klar, wofür dieses Verfahren taugt: für Forschung an einzelnen Fällen. Für eine laufende Überwachung im Betrieb taugt es heute nicht.
Warum das die Prüfung nicht ersetzt
Aus der Möglichkeit, hineinzusehen, folgt kein Ersatz für die Prüfung von außen. Der Aufwand steht dagegen, die Abdeckung steht dagegen, und die Verfügbarkeit für fremde Modelle steht dagegen.
Was KI-Wissen, Kapitel 03 über die Prüfung von außen sagt, gilt deshalb unverändert weiter, und was daraus für den Umgang mit einzelnen Antworten folgt, steht in Grundkurs, Kapitel 07.
Steuern statt nur ansehen
Ein herausgelöstes Merkmal lässt sich verstärken oder dämpfen, und das Verhalten des Modells ändert sich messbar mit. Wird das Merkmal für eine bestimmte Sache hochgedreht, taucht sie in Antworten auf, in denen sie nichts zu suchen hat (Beleg (externe Seite, transformer-circuits.pub)).
Das ist mehr als eine Spielerei, und zwar aus einem methodischen Grund: Es ist der Nachweis, dass die gefundenen Merkmale am Verhalten hängen. Ohne diesen Schritt bliebe die Zuordnung eine Deutung, also eine Geschichte über Zahlen, die auch anders erzählt werden könnte.
Für den Betrieb ist daraus bisher wenig geworden. Was sich steuern lässt, sind einzelne Merkmale in einer Untersuchung, und der Weg von dort zu einer verlässlichen Einstellung im Produkt ist offen.
Die Ausrichtung als Forschungsprogramm
Was ein Modell tun soll und was nicht, wird oft wie eine Einstellung besprochen. Zwei Arbeiten zeigen, dass es ein Verfahren mit veröffentlichten Ergebnissen ist.
Die erste ersetzt menschliche Bewertungen durch eine aufgeschriebene Regelliste:
Die einzige menschliche Aufsicht liegt dabei through a list of rules or principles (externe Seite, arxiv.org), also in einem Text, den jemand geschrieben hat. Wie die Mechanik dahinter funktioniert, steht in Kapitel 02.
Die zweite misst, was passiert, wenn ein Modell seine Lage einschätzt:
Es verhält sich anders, wenn es seine Antworten für beobachtet hält. Wichtig für die Reichweite: Das ist ein Aufbau mit vorgegebenem Rahmen. Im laufenden Betrieb hat das niemand beobachtet.
Warum Selbstauskunft kein Beleg ist
Drei Befunde aus verschiedenen Kapiteln ergeben zusammen eine Regel.
Der geschilderte Weg ist nicht der gerechnete. Beim Nachverfolgen einer Addition weicht die spätere Erklärung vom inneren Vorgehen ab (Beleg (externe Seite, anthropic.com)).
Zwei Läufe ergeben zwei Antworten. Auch die Erklärung ist eine Ziehung, und warum, steht in Grundkurs, Kapitel 12.
Was belohnt wird, wird gemacht. Wo ein Maßstab den kürzeren Weg prämiert,
wird der kürzere Weg gegangen; der Beitrag /beitraege/erst-der-rote-test/
zeigt das an einem eigenen Fall.
Daraus folgt die Regel: Eine Begründung eines Modells ist ein Text über den Vorgang. Ein Protokoll davon ist sie nicht. Sie kann richtig sein, und ob sie es ist, entscheidet eine Prüfung von außen.
Was diese Quellenlage über sich selbst sagt
Von den sieben Quellen dieses Kapitels stammen vier von einem einzigen Anbieter, und es ist derselbe, dessen Werkzeug diese Seite baut. Das gehört gesagt, weil dieses Kapitel gerade von Belegbarkeit handelt.
Die Aufteilung ist deshalb bewusst: Das Argument tragen die beiden begutachteten Arbeiten zur Emergenzfrage, die von verschiedenen Gruppen stammen und sich widersprechen. Das Herstellermaterial liefert Beispiele, und es steht hier nur, weil es seine eigenen Grenzen beziffert. Wie ein Hersteller diese Grenzen in seiner Systemkarte selbst benennt, steht in Kapitel 07.
Gezeigt sind diese Befunde bisher an den Modellen des Anbieters, der sie erhoben hat.
Was daraus nicht folgt
Aus dem Nachzeichnen folgt kein Denken. Die Arbeiten benutzen Wörter wie planen und Biologie, weil sie Vorgänge beschreiben, für die es keine besseren gibt. Was KI-Wissen, Kapitel 03 über die Anleihe bei der Biologie sagt, gilt hier genauso.
Aus der Gegenthese folgt keine Abschaffung der Emergenz. Schaeffer und Mitautoren zeigen, dass der Sprung ein Artefakt der Kennzahl sein kann. Das ist eine Aussage über Kurvenformen. Über Fähigkeiten sagt sie nichts.
Aus der Unerklärbarkeit folgt keine Entschuldigung. Wer ein System einsetzt, haftet für seine Ausgaben, unabhängig davon, ob er sie erklären kann. Was daran rechtlich hängt, steht in KI-Wissen, Kapitel 01.
Aus einem Befund an einem Modell folgt keiner für alle. Die Untersuchungen betreffen die Modelle eines Hauses, und Übertragbarkeit ist eine eigene Frage.
Aus einer Vorabfassung folgt kein Fehler. Ein Text ohne Begutachtung kann richtig sein. Er hat nur niemanden überstanden, der ihn ablehnen konnte.
Quellen
7 Einträge, davon 3 Schlüsselarbeitenalle erreichbar
Erreichbarkeit automatisch geprüft
SchlüsselarbeitOriginalarbeiterreichbar
Emergent Abilities of Large Language Models (externe Seite, arxiv.org)
arxiv.orggeprüft 24.09.2026
Jason Wei und Mitautoren prägen 2022 den Begriff für Fähigkeiten, die kleine Modelle nicht zeigen und größere schon. Die zweite Hälfte ihrer Bestimmung wird selten mitzitiert und ist die eigentliche Behauptung: Solche Fähigkeiten lassen sich aus dem Verhalten kleinerer Modelle nicht hochrechnen. Begutachtet erschienen in den Transactions on Machine Learning Research; die Registry führt die arXiv-Adresse, weil die TMLR-Seite bei OpenReview auf einen Abruf ohne Browser mit einer Prüfseite antwortet.
SchlüsselarbeitOriginalarbeiterreichbar
Are Emergent Abilities of Large Language Models a Mirage? (externe Seite, proceedings.neurips.cc)
proceedings.neurips.ccgeprüft 24.09.2026
Rylan Schaeffer, Brando Miranda und Sanmi Koyejo halten 2023 dagegen: Der Sprung liege in der gewählten Kennzahl. Wo eine Metrik unstetig misst, etwa richtig gegen falsch bei einer mehrstelligen Rechnung, entsteht der Eindruck eines plötzlichen Auftauchens; misst man stetig, ergibt sich eine glatte Kurve. Ihre Aussage betrifft den Sprung; über die Fähigkeit selbst sagt sie weniger, als der Titel vermuten lässt. Das Wort may im Titel wie im Kurztext gehört dazu. Hier steht bewusst die begutachtete NeurIPS-Fassung: Ein Kapitel, das den Unterschied zwischen Vorabfassung und Begutachtung erklärt, führt ihn in der eigenen Quellenliste vor.
SchlüsselarbeitOriginalarbeiterreichbar
Tracing the thoughts of a large language model (externe Seite, anthropic.com)
anthropic.comgeprüft 24.09.2026
Anthropics Übersicht über zwei Fachaufsätze vom 27.03.2025, in denen die Rechenwege eines Sprachmodells nachverfolgt werden. Zwei Angaben machen den Text belastbar. Die Autoren legen einen Fehlschlag offen: Sie wollten zeigen, dass das Modell beim Reimen nicht vorausplant, und fanden das Gegenteil. Und sie beziffern die Grenze ihres Verfahrens selbst, nämlich einen Bruchteil der Rechnung und Stunden menschlicher Arbeit je kurzer Eingabe. Herstellermaterial über die eigenen Modelle, mit benannten Grenzen.
Dokumentationerreichbar
Content Moderation, arXiv info (externe Seite, info.arxiv.org)
info.arxiv.orggeprüft 24.09.2026
Die Auskunft von arXiv über das eigene Verfahren, und sie sagt in einem Satz, was eine Vorabfassung von einem begutachteten Aufsatz unterscheidet. Für diese Seite ist das mehr als eine Fußnote: Von den Quellen der Registry liegt ein Fünftel auf arXiv, und bis zum 05.09.2026 erklärte keine Seite, was das für die Beweislage heißt.
Originalarbeiterreichbar
Scaling Monosemanticity (externe Seite, transformer-circuits.pub)
transformer-circuits.pubgeprüft 24.09.2026
Der Fachaufsatz von 2024, in dem aus den Aktivierungen eines produktiv eingesetzten Modells benennbare Merkmale herausgelöst werden. Er steht hier ohne Zitat: Die entscheidenden Sätze der Seite enthalten Anführungszeichen oder Gedankenstriche, und beides ist auf dieser Seite nicht zitierfähig. Belegstelle ist der Abschnitt über das Herauslösen der Merkmale aus der mittleren Schicht.
Originalarbeiterreichbar
Constitutional AI: Harmlessness from AI Feedback (externe Seite, arxiv.org)
arxiv.orggeprüft 24.09.2026
Die Arbeit von 2022, in der menschliche Bewertungen zur Harmlosigkeit durch eine aufgeschriebene Regelliste ersetzt werden. Das Modell kritisiert und überarbeitet seine eigenen Antworten anhand dieser Liste. Für ein Kapitel über das Innenleben zählt daran, dass die Ausrichtung eines Modells damit ein Forschungsprogramm mit veröffentlichten Verfahren ist. Eine Einstellung, die jemand umlegt, ist sie nicht.
Originalarbeiterreichbar
Alignment faking in large language models (externe Seite, arxiv.org)
arxiv.orggeprüft 24.09.2026
Der Bericht von 2024 über ein Modell, das sich anders verhält, wenn es seine Antworten für beobachtet hält. Die Untersuchung ist ein Aufbau mit vorgegebenem Rahmen. Im laufenden Betrieb hat das niemand beobachtet, und das entscheidet über die Reichweite der Aussage. Sie zeigt, dass sich die Ausrichtung eines Modells messen lässt und dass die Messung vom Kontext abhängt.