SchlüsselarbeitOriginalarbeiterreichbar
Tracing the thoughts of a large language model
Anthropics Übersicht über zwei Fachaufsätze vom 27.03.2025, in denen die Rechenwege eines Sprachmodells nachverfolgt werden. Zwei Angaben machen den Text belastbar. Die Autoren legen einen Fehlschlag offen: Sie wollten zeigen, dass das Modell beim Reimen nicht vorausplant, und fanden das Gegenteil. Und sie beziffern die Grenze ihres Verfahrens selbst, nämlich einen Bruchteil der Rechnung und Stunden menschlicher Arbeit je kurzer Eingabe. Herstellermaterial über die eigenen Modelle, mit benannten Grenzen.
geprüft 24.09.2026
Worauf sich diese Seite beruft, wörtlich, abgerufen am 05.09.2026:
we had set out to show that the model didn't plan ahead, and found instead that it did.
bestätigt 24.09.2026our method only captures a fraction of the total computation performed by Claude
bestätigt 24.09.2026takes a few hours of human effort to understand the circuits we see, even on prompts with only tens of words.
bestätigt 24.09.2026