GrundlagenBeurteilen und EinordnenKapitel 07von 8 im Pfad
Die Systemkarte lesen
Jede Ankündigung eines neuen Modells hat ein zweites Dokument im Schlepptau. Es heißt System Card, ist bei den großen Häusern inzwischen länger als manches Buch, und die meisten kennen daraus nur die Balken, die die Ankündigung übernommen hat. Dieses Kapitel sagt, was darin steht, wer es schreibt, und was davon für eine eigene Entscheidung übrig bleibt.
Zwei Wörter, eine Grenze
Der ältere Begriff ist Model Card. Er stammt aus einer Arbeit von 2018, und deren Vorschlag war bescheiden:
Ein kurzes Begleitblatt also: was das Modell kann, gemessen an verschiedenen Gruppen, und wofür es gedacht ist.
System Card ist jünger und kommt von den Häusern, die ihre Modelle selbst betreiben. Wo die Grenze verläuft, zeigt OpenAI an sich selbst: Die offenen Gewichte gpt-oss bekamen eine Model Card (externe Seite, openai.com), das selbst betriebene GPT-6 Astra eine System Card (externe Seite, deploymentsafety.openai.com). Wer die Auslieferung aus der Hand gibt, beschreibt das Modell. Wer sie behält, beschreibt das System samt den Schutzschichten, die im Betrieb greifen. Dieses Kapitel handelt von der zweiten Form. Welches Haus welche Karten führt und wo sie liegen, steht im Modellkarten-Verzeichnis.
seitlich verschiebbar
eigene Darstellung, Stand 20.09.2026
Was in einer Systemkarte steht
Anthropic beschreibt den Zweck in einem Satz:
Darin stecken vier Teile, und sie stehen bei allen drei großen Häusern in ähnlicher Reihenfolge.
Erstens, was das Modell ist und woraus es entstand. Dieser Teil ist oft der kürzeste. Zur Herkunft der Trainingsdaten braucht die Astra-Karte einen Satz; was die Häuser dazu sagen und wie sich das verändert hat, steht in Grundkurs, Kapitel 08.
Zweitens, was es kann. Tabellen mit Testergebnissen, meist gegen den Vorgänger. Woraus eine solche Zahl entsteht und was sie über die eigene Arbeit sagt, steht in Kapitel 04.
Drittens, was es anrichten könnte. Das ist der Teil, der eine Systemkarte von einem Datenblatt unterscheidet. Jedes der drei Häuser hat sich einen eigenen Rahmen gegeben, der benennt, welche Fähigkeiten als gefährlich gelten und ab welcher Schwelle Schutzmaßnahmen stehen müssen, bevor ausgeliefert wird. Bei OpenAI sind das drei Kategorien und zwei Stufen:
GPT-6 Astra ist das erste Modell, bei dem eine dieser Stufen an der oberen Kante steht:
Viertens, wer von außen draufgesehen hat. Die Karte nennt Stellen außerhalb des Hauses, die das Modell vor der Veröffentlichung geprüft haben, mit ihren Befunden und deren Grenzen. Bei Astra sind es fünf benannte und vier ungenannte.
Wer sie schreibt
Der Anbieter, über sich selbst. Das steht so in jeder Karte, und die Häuser ziehen daraus selbst die Grenze. OpenAI sagt über die eigenen Messungen:
Anthropic sagt über die eigenen Schwellen, sie hätten sich als weit mehrdeutiger erwiesen als erwartet, und begründet damit den Umbau seines Rahmens im Februar 2026 (Beleg (externe Seite, anthropic.com)).
Gemessen ist also die Zahl. Ob eine Schwelle überschritten ist, bleibt ein Urteil, und das Urteil fällt das Haus, dessen Modell es betrifft.
Was Sie daraus mitnehmen
Welche Schutzschichten im Betrieb stehen. Das sagt allein die Systemkarte, und sie sagt es je Fassung. Anthropic liefert dasselbe Modell in zwei Konfigurationen aus: Claude Fable 5.1 für alle, mit Schutzschichten, die bestimmte Aufgaben in Biologie und Cybersicherheit blockieren, und Claude Mythos 5.1 mit durchlässigeren Schutzschichten für geprüfte Abnehmer (Beleg (externe Seite, anthropic.com), Zusammenfassung). Wer nur den Modellnamen kennt, weiß noch nicht, welche der beiden er bekommt.
Welche Messwerte Ihre Frage treffen. Für einen Büroarbeitsplatz zählen Halluzinationsrate, Verweigerungsquote und der Widerstand gegen eingeschleuste Anweisungen mehr als ein Test zur Biologie. Die Karten von OpenAI und Anthropic messen alle drei. Wie man die Halluzinationszahlen zweier Häuser nebeneinanderlegt, steht in Grundkurs, Kapitel 07.
Datum und Änderungsverlauf. Eine Karte beschreibt den geprüften Stand. Die Astra-Karte hat seit dem sechsten Tag nach Erscheinen einen Änderungsverlauf, der einen Abschnitt zur Ausrichtung nachträglich präzisiert (Beleg (externe Seite, deploymentsafety.openai.com)). Wer die Karte vom Erscheinungstag gelesen hat, hat einen anderen Text gelesen.
Was sie nicht hergibt
Eine unabhängige Bestätigung. Die externen Prüfer wählt das Haus aus, und den Zugang räumt es ein. Bei Astra hatte eine Prüfstelle drei Tage. Was die Prüfer selbst über die Reichweite ihrer Befunde sagen, steht auf der zweiten Ebene.
Eine Aussage über das Modell nach dem Prüftag. Geprüft wird ein Stand vor der Veröffentlichung. Was danach im Betrieb verändert wird, steht in der Karte erst, wenn jemand sie ergänzt.
Schutzschichten bei offenen Gewichten. Wer ein Modell herunterlädt, bekommt die Gewichte. Die Model Card beschreibt, was in der Datei steckt; die Schutzschicht bringt der Betreiber mit, siehe Kapitel 01 und Conversational AI, Kapitel 07.
Fünf Fragen an jede Karte
- Welche Fassung beschreibt sie, und welche bekomme ich?
- Gegen welchen Rahmen misst sie, und welche Stufe hat das Haus festgestellt?
- Wer hat von außen geprüft, wie lange, und mit welchem Zugang?
- Welche Messwerte treffen meine Aufgabe, und wie wurden sie erhoben?
- Wann wurde sie zuletzt geändert?
Wer eine Karte gelesen hat, kennt eine Bauform. Die drei großen Häuser haben drei, und die Rahmenwerke dahinter sind verwandt, ohne gleich zu sein. Diese Ebene legt sie nebeneinander und sieht dann auf die, die von außen prüfen.
Drei Häuser, drei Bauformen
OpenAI veröffentlicht je Modell eine System Card auf einer eigenen Übersichtsseite, dem Deployment Safety Hub, als Webseite mit Änderungsverlauf und einem PDF daneben (Beleg (externe Seite, deploymentsafety.openai.com)). Der Abschnitt zur Vorsorge, Preparedness genannt, steht in der Karte selbst.
Anthropic veröffentlicht je Modell eine System Card als PDF; die zu Fable 5.1 und Mythos 5.1 hat 212 Seiten (Beleg (externe Seite, anthropic.com)). Die Übersicht darüber reicht bis zum Juli 2023 zurück (Beleg (externe Seite, anthropic.com)). Seit Februar 2026 kommt ein zweites Dokument dazu, der Risk Report, alle drei bis sechs Monate und losgelöst vom einzelnen Modell (Beleg (externe Seite, anthropic.com), Fassung 3.4, Abschnitt 3.1).
Google hält die Modellkarte kurz und legt die Gefahrenprüfung in einen eigenen Bericht:
Die Karte zu Gemini 3.1 Pro verweist für die Tiefe also auf den Bericht zur Basisfassung, so wie sie es für die Trainingsdaten tut (Grundkurs, Kapitel 08).
Meta veröffentlicht zum Flaggschiff Muse Spark einen Sicherheitsbericht; Aufbau, Kontextfenster und Herkunft des Materials stehen darin nicht (Beleg (externe Seite, ai.meta.com)).
Und die offenen Gewichte? In den Karten zu DeepSeek, Qwen, GLM, Kimi und Olmo stand am 06.09.2026 keine durchgeführte Sicherheitsprüfung. Das Verzeichnis hält das je Anbieter fest, mit dem Datum der Erhebung.
Die drei Rahmenwerke
Alle drei sind freiwillig, und das erste hat die beiden anderen ausgelöst:
OpenAI, Preparedness Framework, in der Fassung vom April 2025. Drei verfolgte Kategorien:
Zwei Stufen, High und Critical, und je Stufe eine Folge:
Bei Critical gilt dasselbe schon während der Entwicklung (Beleg (externe Seite, openai.com)). Astra steht in seiner Karte auf allen drei Skalen, mit drei verschiedenen Ergebnissen:
Anthropic, Responsible Scaling Policy.
Die ersten Fassungen kannten Sicherheitsstufen, AI Safety Levels, jede mit einer Liste geforderter Schutzmaßnahmen. Die dritte Stufe ist seit dem Frühjahr 2025 in Kraft:
Im Februar 2026 kam ein Neuaufbau:
Version 3.0 is a comprehensive rewrite of the RSP. (externe Seite, anthropic.com)
Die Stufen sind seither ein Etikett für vorhandene Schutzmaßnahmen; für künftige Fähigkeiten verlangt die Richtlinie ein Argument statt einer Liste (Beleg (externe Seite, anthropic.com), Fassung 3.4, Anhang B). An die Stelle der Leiter treten Schwellen je Bedrohung. Die Karte zu Fable 5.1 stuft das Modell bei chemischen und biologischen Waffen auf CB-1 ein, also als Hilfe für jemanden mit Grundkenntnissen bei einer bekannten Waffe, und unterhalb von CB-2, dem Ersatz seltener Fachleute für eine neue (Beleg (externe Seite, anthropic.com), Zusammenfassung). Dazu kommen die Berichte:
Der Grund für den Umbau steht in der Ankündigung:
Google, Frontier Safety Framework. Gebaut um Fähigkeitsschwellen, die Critical Capability Levels heißen:
Die Karte zu Gemini 3.1 Pro nennt fünf Bereiche:
Und vor einem Start, bei dem eine Schwelle erreicht ist, eine Begründung, die Safety Case heißt:
Was eine Stufe bedeutet
Eine Stufe ist eine Auslösebedingung: Ab hier müssen bestimmte Schutzmaßnahmen stehen, bevor das Modell ausgeliefert wird. Über die Gefahr im Betrieb sagt sie erst zusammen mit diesen Maßnahmen etwas. Bei Astra heißt das verschärfte Schutzmaßnahmen auch für den Betrieb im eigenen Haus:
Bei Anthropic sind es die zwei Konfigurationen aus der ersten Ebene: dasselbe Modell, einmal mit Schutzschichten für alle und einmal mit durchlässigeren für geprüfte Abnehmer. Die Stufe steht am Modell, die Schutzschicht am Produkt.
Die Prüfung von außen
Die Astra-Karte nennt fünf Stellen beim Namen, und sie sind von dreierlei Art. Eine ist staatlich:
Zwei sind Forschungsstellen mit je einem Thema. Apollo Research prüft auf Täuschung:
METR prüft, was ein Modell selbständig zustande bringt, und hat den Ansatz der Skalierungsrichtlinien einst mit entworfen, den es heute bei den Häusern prüft (Beleg (externe Seite, metr.org)); die Karte zu Fable 5.1 nennt METR als externen Prüfer für die Selbstverbesserung (Beleg (externe Seite, anthropic.com), Zusammenfassung). Die übrigen sind Firmen, SecureBio für Biologie, Irregular für Cyber, Gray Swan für eingeschleuste Anweisungen, dazu:
Was sie bekommen, sagt die Karte ebenfalls:
Was sie selbst einschränken, steht in der Karte unter der Überschrift Limitations, und das ist die Stelle, die man zuerst liest. Apollo maß, wie oft Astra im Denkprotokoll äußert, geprüft zu werden:
Die Folgerung zieht Apollo selbst:
Die staatliche Stelle sagt dasselbe über ihre eigenen Aufbauten, die sie um einen Vorfall vom Juli herum gebaut hatte, bei dem ein Agent in ihrem eigenen Test ein Open-Source-Projekt angriff (Beleg (externe Seite, aisi.gov.uk)):
Wer sie auswählt, ist das Haus. Anthropic hat dafür seit Fassung 3 Kriterien aufgeschrieben: Der Prüfer darf kein finanzielles Interesse am Unternehmen haben, und sein Geschäft darf nicht allein davon abhängen, dass die Häuser ihn weiter beauftragen (Beleg (externe Seite, anthropic.com), Fassung 3.4, Abschnitt 3.6.1). Die Richtlinie nennt das Verfahren selbst ein Experiment, weil es dafür noch keine eingeführten Einrichtungen gibt.
Was das Gesetz verlangt, und was die Karte gibt
Die KI-Verordnung kennt die Sache unter anderem Namen. Anbieter eines Modells mit allgemeinem Verwendungszweck
Für Modelle mit systemischem Risiko kommt die Prüfung dazu:
Der Unterschied liegt im Adressaten. Die Dokumentation nach Artikel 53 geht auf Anfrage an die Behörde. Die Systemkarte ist freiwillig und öffentlich, und Anthropic schreibt selbst, dass Gesetze in Kalifornien und New York sowie der Verhaltenskodex zur KI-Verordnung inzwischen verlangen, solche Rahmen zu veröffentlichen (Beleg (externe Seite, anthropic.com)). Welche Pflichten die Verordnung an ein Modell knüpft und was der Verhaltenskodex dabei abkürzt, steht in KI-Wissen, Kapitel 12.
Die Reihenfolge beim Lesen
Wer eine Karte für eine Entscheidung liest, liest sie von hinten nach vorn: zuerst die Stellen, die sagen, was die Zahlen davor wert sind.
Änderungsverlauf und Datum. OpenAI führt ihn am Kopf der Karte. Sechs Tage nach Erscheinen stand dort:
Ein Abschnitt, der eine Woche nach Erscheinen präzisiert wird, war in der ersten Fassung unpräzise. Das spricht für die Karte: Wer nachträglich präzisiert, hat den Fehler selbst gefunden und aufgeschrieben.
Die Fassung, die man bekommt. Zwei Fälle. Bei Anthropic sind Fable 5.1 und Mythos 5.1 dasselbe Modell mit verschiedenen Schutzschichten, und die Karte beschreibt beide (Beleg (externe Seite, anthropic.com), Zusammenfassung). Bei OpenAI beschreiben manche Zahlen eine Fassung, die niemand außerhalb des Hauses bekommt:
Eine Zahl aus dem Gefahrenabschnitt kann also an einem Modell ohne Verweigerungstraining gemessen sein. Sie sagt etwas über die Fähigkeit, die im Modell steckt, und wenig über das, was ein Kunde davon zu sehen bekommt.
Schutzschichten und ihre Fehlalarme. Eine Schutzschicht, die blockiert, blockiert auch Erlaubtes. Anthropic schreibt in der Karte zu Fable 5.1, man habe wegen der gewachsenen Cyberfähigkeiten einen weiteren Sicherheitsabstand gewählt, die Klassifikatoren würden deshalb weiterhin manche harmlose oder grenzwertige Anfrage blockieren, seltener als bei Fable 5 zum Start und häufiger als bei Opus 5 (Beleg (externe Seite, anthropic.com), Zusammenfassung). Für einen Betrieb, der Sicherheitsquellcode prüft, ist das die Zahl, die zählt, und sie steht als Vergleich dreier Fassungen da statt als Prozentwert.
Die Messwerte, die die Aufgabe treffen, und ihre Erhebung. Dazu der nächste Abschnitt.
Die Grenzen, die die Prüfer selbst ziehen. Jeder externe Befund in der Astra-Karte endet mit einem Absatz Limitations. Wer nur die Zahl darüber liest, liest die Hälfte.
Zwei Häuser, zwei Zählweisen
Beide Häuser messen Halluzination, und beide Zahlen sind sauber erhoben. Sie zählen verschiedene Dinge. OpenAI misst an Gesprächen, die Nutzer als fehlerhaft gemeldet haben:
Und sagt dazu, was das für die Zahl heißt:
Anthropic misst an Wissensfragen ohne Nachschlagen und zählt das Enthalten mit: Für Mythos 5.1 steht in der Karte, es enthalte sich seltener als der Vorgänger und gebe dadurch mehr richtige und mehr falsche Antworten (Beleg (externe Seite, anthropic.com), Zusammenfassung); die Zahlen zu Opus 5 stehen in Abschnitt 6.5 seiner Karte (Beleg (externe Seite, anthropic.com)). Eine Rate aus gemeldeten Fehlern und eine Rate aus einem Fragenkatalog mit Enthaltung lassen sich nicht in eine Tabelle stellen. Welche Kennzahl was zählt, steht in Grundkurs, Kapitel 07, und warum eine Erhebung ihre Zählweise mitbringt, in Kapitel 04.
Dasselbe gilt für den Vergleich mit dem Vorgänger in derselben Karte:
Ein Balken für GPT-5.6 Sol in der Astra-Karte kann also ein anderes Sol beschreiben als der Balken in der Sol-Karte.
Was sich nach dem Erscheinen ändert
Eine Karte beschreibt den geprüften Stand vor der Veröffentlichung. Danach wird das System weiterentwickelt, und die Häuser haben dafür drei Formen gefunden. OpenAI ergänzt: Als GPT-4o im März 2025 Bilder erzeugen lernte, bekam die Karte einen Nachtrag statt einer neuen Fassung (Beleg (externe Seite, openai.com)), und die Astra-Karte bekommt ihren Änderungsverlauf. Anthropic trennt: Der Risk Report erscheint alle drei bis sechs Monate und deckt alle ausgelieferten Modelle, unabhängig davon, ob eines neu ist (Beleg (externe Seite, anthropic.com), Fassung 3.4, Abschnitt 3.1). Google gibt jeder Ableitung eine eigene kurze Karte und lässt den Bericht beim Basismodell.
Für den Leser heißt das: Das Datum der Karte ist der Prüftag, und das Datum des Modells, das man heute benutzt, ist ein anderes.
Die Selbstauskunft, ohne Zynismus
Der Anbieter misst, der Anbieter urteilt, der Anbieter wählt die Prüfer und bestimmt, was in der öffentlichen Fassung geschwärzt wird. Das ist die Lage, und es ist zugleich die beste Auskunft, die es über diese Systeme gibt: Wer sonst könnte 212 Seiten über ein Modell schreiben, das er selbst trainiert hat?
Anthropic hat für die eigenen Risk Reports eine Begutachtung von außen angelegt, mit Prüfern, die ohne finanzielles Interesse am Haus sein müssen, die Vorabfassung ungeschwärzt bekommen und ihre Stellungnahme selbst veröffentlichen (Beleg (externe Seite, anthropic.com), Fassung 3.4, Abschnitt 3.6). Die Richtlinie nennt das ein Experiment, weil es dafür keine eingeführten Einrichtungen gibt. Was daraus wird, entscheidet sich an den ersten Stellungnahmen, und die sind ein Grund, die Übersichtsseite der Richtlinie mit ihrem Änderungsverlauf im Blick zu behalten.
Bis dahin gilt, was die Karten selbst sagen: Die Messungen sind eine untere Schranke, die Schwellen sind mehrdeutig, und ein Prüfer mit drei Tagen Zugang schreibt selbst, dass seine niedrigen Fehlerraten wenig beweisen. Wer das alles gelesen hat, weiß mehr über das Modell als jeder, der nur die Ankündigung kennt.
Offene Gewichte
Für ein heruntergeladenes Modell gibt es diese Auskunft nicht in derselben Form. Die Model Card beschreibt, was in der Datei steckt: Aufbau, Größe, Lizenz, manchmal die Trainingsdaten. Die Schutzschicht bringt der Betreiber mit, und die hat wiederum ihre eigene Karte, so wie Llama Guard (externe Seite, huggingface.co) eine hat. Wie eine solche Schicht gebaut wird, steht in Conversational AI, Kapitel 07; was der Betrieb im eigenen Haus sonst noch verlangt, in Kapitel 01.
Wie diese Seite die Karten benutzt
Drei Stellen. Der Kasten „Modelle im Einsatz“ über jedem Werkstattbericht nennt je Modell die Fassung und zeigt auf dessen Karte; der Name wird dafür am Quelltext des Aufbaus gegengelesen. Das Verzeichnis hält je Anbieter vier Merkmale mit dem Datum der Erhebung. Und der tägliche Prüflauf ruft jede hinterlegte Kartenadresse ab und meldet, wenn ein Zitat daraus verschwindet, was bei einer Karte mit Änderungsverlauf der Normalfall werden kann.
Fünf der zwanzig Quellen dieses Kapitels stammen von Anthropic, dem Anbieter des Werkzeugs, das diese Seite baut, und zwei seiner Modelle arbeiten in der Werkstatt hinter dieser Seite. Das Argument des Kapitels stützt sich deshalb auf die Stellen, an denen die Häuser über sich selbst dasselbe sagen: OpenAI über die untere Schranke, Anthropic über die mehrdeutigen Schwellen, die Prüfer beider über die Reichweite ihrer Befunde.
Quellen
20 Einträge, davon 1 Schlüsselarbeitalle erreichbar
Erreichbarkeit automatisch geprüft
SchlüsselarbeitOriginalarbeiterreichbar
Model Cards for Model Reporting (externe Seite, arxiv.org)
arxiv.orggeprüft 24.09.2026
Die Arbeit von Margaret Mitchell und acht weiteren, die den Begriff Model Card eingeführt hat, eingereicht am 05.10.2018. Sie schlägt vor, jedes veröffentlichte Modell mit einer kurzen Dokumentation seiner Leistungsmerkmale auszuliefern, aufgeschlüsselt nach Gruppen. Das Wort System Card gibt es dort noch nicht; es ist acht Jahre jünger und stammt von den Anbietern selbst, die ihre Modelle als Dienst betreiben.
Dokumentationerreichbar
OpenAI, gpt-oss-120b und gpt-oss-20b Model Card (externe Seite, openai.com)
openai.comgeprüft 24.09.2026
OpenAIs Begleitdokument zu seinen offenen Gewichten vom 05.08.2025. Es heißt Model Card, während dasselbe Haus seine geschlossenen Modelle mit einer System Card ausliefert. Damit belegt ein einziger Anbieter die Grenze zwischen beiden Wörtern: Wo er die Auslieferung aus der Hand gibt, beschreibt er das Modell, wo er sie behält, das System samt seiner Schutzschichten.
Dokumentationerreichbar
Anthropic, Model system cards (externe Seite, anthropic.com)
anthropic.comgeprüft 24.09.2026
Anthropics Übersicht der eigenen System Cards, geführt als Tabelle aus Modell, Datum und Dokument. Sie reicht zurück bis Claude 2 im Juli 2023 und ist damit das älteste durchgehend gepflegte Kartenverzeichnis der hier geführten Häuser.
Dokumentationerreichbar
OpenAI, Our updated Preparedness Framework (externe Seite, openai.com)
openai.comgeprüft 24.09.2026
OpenAIs Ankündigung der zweiten Fassung seines Vorsorgerahmens vom 15.04.2025, mit Verweis auf das vollständige Dokument als PDF. Sie nennt die drei verfolgten Kategorien (Biologie und Chemie, Cybersicherheit, Selbstverbesserung), die zwei Stufen High und Critical und je Stufe die Folge: Bei High müssen Schutzmaßnahmen vor der Auslieferung stehen, bei Critical schon während der Entwicklung. Die GPT-6-Astra-Karte vom September 2026 misst weiterhin gegen diese Fassung.
Dokumentationerreichbar
OpenAI, GPT-6 Astra System Card (externe Seite, deploymentsafety.openai.com)
deploymentsafety.openai.comgeprüft 24.09.2026
OpenAIs jüngste System Card, veröffentlicht am 03.09.2026. Sie führt eigene Abschnitte zu Umgehungsversuchen, biologischen und chemischen Fähigkeiten, Cybersicherheit und der Einstufung nach dem Preparedness-Rahmen und benennt zwei externe Prüfer. Zur Herkunft der Trainingsdaten sagt sie nichts Nachprüfbares mehr: Der zuständige Abschnitt spricht von vielfältigen Datensätzen und einer Filterung, ohne eine Quelle zu nennen. Die GPT-5 System Card nannte an derselben Stelle noch drei.
Ankündigung des Herstellerserreichbar
Anthropic, Responsible Scaling Policy: Version 3.0 (externe Seite, anthropic.com)
anthropic.comgeprüft 24.09.2026
Anthropics Ankündigung der dritten Fassung vom 24.02.2026, mit einer Bilanz der eigenen Theorie nach zweieinhalb Jahren. Was gewirkt hat: ASL-3 im Mai 2025 aktiviert, OpenAI und Google DeepMind zogen binnen Monaten mit ähnlichen Rahmen nach. Was scheiterte: Die vorab gesetzten Fähigkeitsschwellen erwiesen sich als weit mehrdeutiger als erwartet, die Wissenschaft der Modellbewertung reiche für eindeutige Antworten nicht aus. Beleg dafür, dass ein Haus die Grenzen seiner eigenen Einstufung selbst benennt.
Dokumentationerreichbar
Anthropic, System Card Claude Fable 5.1 und Mythos 5.1 (externe Seite, anthropic.com)
anthropic.comgeprüft 24.09.2026
Anthropics jüngste System Card, im Dokument auf den 01.09.2026 datiert, 212 Seiten. Sie führt Kapitel zu den Prüfungen nach der eigenen Skalierungsrichtlinie, zu chemischen und biologischen Fähigkeiten, zu Cyber und zu externem Red Teaming samt der Nennung eines unabhängigen Prüfers. Zur Herkunft der Trainingsdaten nennt sie drei Gruppen und dazu den eigenen Sammler samt dessen Verhalten gegenüber der robots.txt.
Dokumentationerreichbar
OpenAI, Deployment Safety Hub (externe Seite, deploymentsafety.openai.com)
deploymentsafety.openai.comgeprüft 24.09.2026
Die Übersichtsseite, auf der OpenAI seine System Cards und Sicherheitsberichte sammelt. Jeder Eintrag steht mit seinem Datum da, am 06.09.2026 standen acht davon sichtbar auf der Seite, der älteste vom 23.04.2026, dazu ein Verweis auf weitere.
Dokumentationerreichbar
Anthropic, Responsible Scaling Policy (externe Seite, anthropic.com)
anthropic.comgeprüft 24.09.2026
Die Übersichtsseite zu Anthropics Skalierungsrichtlinie mit allen Fassungen seit September 2023 und einem Änderungsverlauf; die aktuelle Fassung 3.4 vom 08.07.2026 liegt als PDF dahinter. Fassung 3.0 vom 24.02.2026 ist ein Neuaufbau: Risk Reports alle drei bis sechs Monate unabhängig vom Modellrelease (Abschnitt 3.1), eine externe Begutachtung mit Kriterien für die Unabhängigkeit der Prüfer (Abschnitt 3.6), und die Sicherheitsstufen ASL nur noch als Bezeichnung für vorhandene Schutzmaßnahmen (Anhang B).
Originalarbeiterreichbar
Google DeepMind, Gemini 3.1 Pro Model Card (externe Seite, deepmind.google)
deepmind.googlegeprüft 24.09.2026
Googles Karte zum Pro-Modell vom 19.02.2026. Sie nennt fünf Arten von Sicherheitsevaluierungen, darunter menschliches Red Teaming und die Bewertung nach dem Frontier-Safety-Rahmen. Zur Herkunft der Trainingsdaten verweist sie auf die Karte von Gemini 3 Pro, auf dem dieses Modell aufbaut. Dasselbe tut die jüngere Karte zu Gemini 3.8 Flash: Google führt die Angabe an einer Stelle und zeigt von den Ableitungen dorthin.
Dokumentationerreichbar
Meta, Muse Spark Safety and Preparedness Report (externe Seite, ai.meta.com)
ai.meta.comgeprüft 24.09.2026
Was Meta zum Flaggschiff veröffentlicht, statt einer Modellkarte. Der Bericht ist auf den 26. Mai 2026 datiert und legt die Prüfungen zu chemischen, biologischen und Cyber-Risiken sowie zum Kontrollverlust offen, samt der Feststellung, dass die chemisch-biologischen Fähigkeiten vor den Schutzmaßnahmen als hohes Risiko eingestuft wurden. Zur Herkunft des Trainingsmaterials sagt er nichts.
Ankündigung des Herstellerserreichbar
Google DeepMind, Strengthening our Frontier Safety Framework (externe Seite, deepmind.google)
deepmind.googlegeprüft 24.09.2026
Googles Ankündigung der dritten Fassung seines Rahmens vom 22.09.2025, mit einem Nachtrag zur Fassung 3.1 vom 17.04.2026. Sie definiert die Fähigkeitsschwellen (Critical Capability Levels) als Stufen, ab denen ein Modell ohne Gegenmaßnahmen ein erhöhtes Risiko schwerer Schäden bedeuten kann, und nennt den Safety Case, der vor einem Start geprüft wird, sobald eine solche Schwelle erreicht ist. Das vollständige Rahmenwerk liegt als PDF dahinter.
Dokumentationerreichbar
AI Security Institute, About (externe Seite, aisi.gov.uk)
aisi.gov.ukgeprüft 24.09.2026
Die Selbstbeschreibung der britischen Prüfstelle, einer Forschungseinrichtung im Ministerium für Wissenschaft, Innovation und Technologie. Sie nennt als eine ihrer Aufgaben, führende KI-Systeme vor der Veröffentlichung zu testen. In den Systemkarten von OpenAI erscheint sie unter dem Kürzel UK AISI als externe Prüfstelle für Ausrichtung und Überwachbarkeit.
Dokumentationerreichbar
Apollo Research, About (externe Seite, apolloresearch.ai)
apolloresearch.aigeprüft 24.09.2026
Die Selbstbeschreibung der Prüfstelle Apollo Research, deren Gegenstand die Täuschung durch Modelle ist (scheming). Die Seite nennt die Zusammenarbeit mit OpenAI seit dem Test von o1 vor dessen Veröffentlichung im Jahr 2024. In der GPT-6-Astra-Karte steht Apollo als externer Prüfer mit drei Tagen Zugang.
Dokumentationerreichbar
METR, About (externe Seite, metr.org)
metr.orggeprüft 24.09.2026
Die Selbstbeschreibung der Prüfstelle METR (Model Evaluation and Threat Research). Sie bewertet Modelle daraufhin, was diese selbständig zustande bringen, und nennt als eigene Leistung, den Ansatz der Skalierungsrichtlinien einst als Prototyp entwickelt zu haben, den inzwischen neun Anbieter übernommen hätten. Das gehört in jeden Satz, in dem METR als externer Prüfer eines dieser Anbieter auftritt.
Originalarbeiterreichbar
Incident Report: unsanctioned agent behaviour during cyber testing (externe Seite, aisi.gov.uk)
aisi.gov.ukgeprüft 24.09.2026
Beleg zu „Bei einem staatlichen Sicherheitstest täuschen Agenten echte Menschen, ohne dass jemand sie dazu aufgefordert hat“, eingetragen vom News-Lauf am 2026-08-07.
Originalarbeiterreichbar
Verordnung (EU) 2024/1689 über künstliche Intelligenz (externe Seite, eur-lex.europa.eu)
eur-lex.europa.eugeprüft 24.09.2026
Der Rechtstext selbst, veröffentlicht am 12.07.2024 und in Kraft getreten am 01.08.2024. Er ordnet Anwendungen nach Risiko und legt die Pflichten je Stufe fest. Die Anwendbarkeit beginnt gestaffelt, nicht mit dem Inkrafttreten. Die Adresse zeigt seit dem 29.07.2026 auf die deutsche Fassung: Die Zitate unten stehen im Text so, wie er hier zitiert wird, und die Fassung ohne Sprachangabe liefert die englische.
Dokumentationerreichbar
System Card: Claude Opus 5 (externe Seite, anthropic.com)
anthropic.comgeprüft 24.09.2026
Anthropics Begleitdokument zum Modell, 24.07.2026. Abschnitt 6.5 misst Ehrlichkeit und Halluzination und hält fest, dass dieses Modell bei elf Prozent höherer Genauigkeit zugleich sechs Prozent häufiger falsche Tatsachen behauptet als sein Vorgänger. Der Abschnitt davor benennt außerdem eine eigene Fehlerart für erfundene Angaben über vorliegende Dateien, Tool-Ausgaben und frühere Gesprächsbeiträge.
Originalarbeiterreichbar
Addendum to GPT-4o System Card: 4o image generation (externe Seite, openai.com)
openai.comgeprüft 24.09.2026
OpenAIs Ergänzung zur Modellkarte von GPT-4o vom 25.03.2025, mit der die Bilderzeugung im Modell selbst eingeführt wurde. Sie ist der Beleg dafür, dass hinter einem erzeugten Bild bei OpenAI kein Diffusionsmodell rechnet: Abschnitt 2.1 der Druckfassung sagt, anders als DALL-E, das als Diffusionsmodell arbeite, sei die 4o-Bilderzeugung ein autoregressives Modell, das nativ in ChatGPT eingebettet ist. Dieser Satz steht nur im PDF, weshalb er hier nicht als Zitat geführt wird; die Seite selbst nennt die Einbettung in das Modell und die Fähigkeit, Text in Bilder zu setzen. Die GPT-Image-Modelle der Schnittstelle sind die Fortführung dieser Linie.
Dokumentationerreichbar
Meta, Llama Guard, Modellkarte (externe Seite, huggingface.co)
huggingface.cogeprüft 24.09.2026
Die Modellkarte zu einem Sprachmodell, dessen einzige Aufgabe die Einstufung von Eingaben und Antworten ist. Sie legt die Mechanik offen: Das Modell liefert eine Wahrscheinlichkeit, und wer es einsetzt, wählt selbst die Schwelle, ab der etwas als unsicher gilt. Die Gewichte stehen hinter einer Anmeldung. Der Kartentext selbst wird frei ausgeliefert.