BeiträgeFachartikel

Derselbe Prompt, sieben Modelle, zwei Richtungen

Eine verbreitete Regel sagt, man solle im Prompt nennen, was zu tun ist, statt was zu lassen. Eine eigene Messung über sieben Modelle zeigt, dass dieselbe Umformulierung die einen verbessert und die anderen verschlechtert.

FachartikelStand Lesezeit 6 min

Es gibt eine Prompt-Regel, die in Anleitungen immer wieder auftaucht: Schreib, was das Modell tun soll, statt aufzuzählen, was es lassen soll. Aus „Verwende kein Markdown“ wird „Antworte in zusammenhängenden Absätzen“.

Die Regel klingt plausibel, sie hat einen ordentlichen Beleg, und die naheliegende Verallgemeinerung daraus ist trotzdem falsch. Ich habe sie gemessen.

Woher die Regel kommt

Sie steht wörtlich im Prompt-Leitfaden von Anthropic:

Tell Claude what to do instead of what not to do (externe Seite, platform.claude.com)

Zwei Dinge sind daran wichtig, und beide gehen beim Zitieren gern verloren.

Erstens der Abschnitt. Der Satz steht unter der Überschrift Control the format of responses. Es geht um die Form der Ausgabe, nicht um inhaltliche Vorgaben. Das mitgelieferte Beispiel ist entsprechend: Statt „Do not use markdown in your response“ solle man in zusammenhängenden Absätzen antworten lassen (externe Seite, platform.claude.com).

Zweitens die Beispiele weiter unten. Auf derselben Seite steht ein empfohlener Prompt zur Steuerung der Formatierung, und der arbeitet durchgehend mit Verneinungen. Er enthält eine Anweisung in Großbuchstaben, keine Aufzählungszeichen zu verwenden, dazu die Wendung

NEVER output a series of overly short bullet points. (externe Seite, platform.claude.com)

Ein Widerspruch ist das nicht. Es ist eine Verfeinerung, die man sehen muss: Jede Verneinung in diesem Beispiel steht neben einer Handlung. Auf das Verbot der Aufzählung folgt unmittelbar, was stattdessen zu tun ist, nämlich die Punkte in Sätze einzuarbeiten (externe Seite, platform.claude.com).

Bei OpenAI findet sich zu dieser Frage nichts. Der Leitfaden zum Stand GPT-5.6 (externe Seite, developers.openai.com) behandelt schlankere Prompts, Grenzen der Selbständigkeit und die Länge der Antwort. Zur Verneinung steht dort keine Zeile, Stand 31.07.2026.

Was ich gemessen habe

Für meine Diktier-App glättet ein kleines Sprachmodell das Transkript. Der Systemprompt dafür ist streng gehalten und enthält eine Verneinung:

Du bist ein Diktat-Korrektor. Glätte grammatisch, normalisiere Zahlen/Satzzeichen, ändere keinen Inhalt.

Nach der Regel oben müsste sich das verbessern lassen. Ich habe eine zweite Fassung gebaut, die ohne Verbot auskommt und stattdessen mit zwei Listen arbeitet, einer für das Erlaubte und einer für das Untersagte, dazu die Anweisung, im Zweifel den Rohtext zu erhalten. Der eigentliche Anlass war sogar ein Zugewinn: Die zweite Fassung erlaubt ausdrücklich, ein akustisch verstümmeltes Fachwort zu rekonstruieren, was die strenge Fassung mit ihrem „ändere keinen Inhalt“ formal ausschließt.

Beide Fassungen liefen am 19.04.2026 gegen dieselben sieben Modelle und dieselben 25 Diktatschnipsel, auf demselben Rechner.

Das Ergebnis geht in beide Richtungen

Gemessen wurden zwei Größen: eine Qualitätszahl gegen eine feste Vergleichsgröße, bei der höher besser ist, und der Anteil der Läufe mit erfundenem Inhalt.

ModellQualität strengQualität mit ListenErfundenes strengmit Listen
Qwen3-4B1,4251,3294 %4 %
Qwen 2.5 3B1,0000,81012 %8 %
Phi-3.5 Mini1,2300,45120 %28 %
Llama 3.2 3B0,0000,37626 %24 %
Ministral 3 3B0,0000,41630 %24 %
Apple Foundation Models0,0000,00024 %52 %

Quelle: eigene Messung vom 19.04.2026, 25 Diktatschnipsel je Lauf, MacBook Pro M4 Max. Zwei der Läufe brachen ganz ab und fehlen deshalb in der Tabelle, zwei weitere erreichten 23 der 25 Schnipsel und stehen mit dieser Einschränkung darin: Llama und Ministral unter der strengen Fassung.

Das ist eine eigene Messreihe, keine Spalte einer größeren. Am selben Tag lief der Hauptvergleich derselben Modelle, und er steht im Werkstattbericht zur eigenen Diktier-App. Bei Llama und Ministral kommt er auf andere Anteile erfundener Inhalte, 28 statt 26 und 64 statt 30 Prozent. Zwei Läufe desselben Tages, zwei Ergebnisse.

Die Umformulierung wirkt, und sie wirkt gegenläufig. Die beiden Modelle, die unter der strengen Fassung gar nichts Brauchbares lieferten, kommen mit den Listen auf einen messbaren Wert. Das beste Modell im Feld verliert. Bei Phi bricht die Qualität auf ein Drittel ein. Und bei Apple Foundation Models verdoppelt sich der Anteil erfundener Inhalte von 24 auf 52 Prozent.

Wer nur ein Modell gemessen hätte, wäre je nach Wahl mit vier verschiedenen Schlussfolgerungen nach Hause gegangen.

Warum die freundlichere Fassung kippt

Der interessante Teil steht in den Ausgaben statt in der Tabelle. Ein Schnipsel lautet „Bitte den Absatz formatieren“. Unter der strengen Fassung lassen die Modelle ihn weitgehend stehen, was richtig ist: Es ist diktierter Text, den niemand als Anweisung gemeint hat.

Unter der Listen-Fassung antworten dieselben Modelle mit einer Rückfrage.

Bitte geben Sie den Absatz an, den Sie formatieren möchten.

Sie haben den Absatz nicht angegeben. Bitte fügen Sie den zu formatierenden Text ein.

Das ist kein Zufallstreffer, es passiert reihenweise, quer durch die Familien. Und es hat einen Grund, der die Regel von oben erklärt statt sie zu widerlegen: Die strenge Fassung besteht aus Imperativen. Glätte, normalisiere, korrigiere, antworte ausschließlich mit dem geglätteten Text. Die Listen-Fassung besteht aus Kategorien. Erlaubt ist dies, verboten ist jenes.

Eine Kategorienliste sagt, was gelten soll. Sie sagt nicht, was zu tun ist. Fällt der Imperativ weg, fällt das Modell bei einer mehrdeutigen Eingabe in das zurück, was es am häufigsten gesehen hat, und das ist ein Gespräch.

Damit passt der Befund zum Beispielprompt des Herstellers: Dort steht die Verneinung neben einer Handlung. Meine schlechtere Fassung hatte die Verneinung ohne Handlung. Der Gegensatz, auf den es ankommt, verläuft nicht zwischen positiver und negativer Formulierung.

Ein zweiter Durchgang, derselbe Befund

Die ausdrückliche Erlaubnis, ein verstümmeltes Fachwort zu rekonstruieren, war der Anlass für den ganzen Versuch. Sie hat sich als eigener Schaden erwiesen: Das beste Modell erzeugte damit einen Fehler, den es vorher nicht machte, und ersetzte ein korrekt erkanntes Wort durch einen Begriff aus dem hinterlegten Wörterbuch. Wer die Tür einen Spalt öffnet, muss damit rechnen, dass jemand hindurchgeht.

Eine spätere Ablation an einem einzelnen Modell hat den Punkt noch schärfer gezeigt. Verglichen wurden dort vier Fassungen, die sich in Struktur und im Ort des hinterlegten Wörterbuchs unterschieden. Zwei Ergebnisse davon:

  • Dieselbe strukturreiche Fassung erfand in 24 Prozent der Läufe etwas, mit Wörterbuch und ohne. Der Inhalt war also unschuldig, die Struktur war der Treiber.
  • Dasselbe Wörterbuch, nur an einer anderen Stelle des Prompts eingesetzt, brachte 84 Prozent. Das Modell begann, über die Wortliste zu schreiben, statt sie zu benutzen.

Quelle: eigene Messung, ausgewertet am 02.05.2026, Median über die Läufe.

Was ich daraus mitnehme

Eine Verneinung braucht eine Handlung daneben. „Ändere keinen Inhalt“ funktioniert, weil davor drei Imperative stehen. Allein steht sie als Kategorie im Raum, und Kategorien beantworten die Frage nicht, was zu tun ist.

Eine Regel gilt dort, wo sie gemessen wurde. Die Empfehlung aus dem Leitfaden steht im Abschnitt über die Ausgabeform und ist dort belegt. Auf eine inhaltliche Beschränkung übertragen, hat sie bei meinen sieben Modellen in beide Richtungen gewirkt.

Der Prompt gehört zum Modell, nicht zur Aufgabe. Wer das Modell wechselt und den Prompt behält, übernimmt damit eine ungeprüfte Annahme. Bei sieben Modellen und einer einzigen Umformulierung lagen zwischen bester und schlechtester Wirkung mehr als zwei Drittel der Qualitätszahl. Was das für die Regeldateien eines ganzen Aufbaus heißt, zeigt Neues Modell, alte Anweisungen am Wechsel auf Claude Opus 5.5.

Für die App bedeutete das: Die strenge Fassung bleibt. Die freundlichere ist nicht schlechter formuliert, sie passt nur zu weniger Modellen. Mehr über das Projekt und die übrigen Messungen steht im Werkstattbericht.

Quellen

2 Einträgealle erreichbar

Erreichbarkeit automatisch geprüft

  • Dokumentationerreichbar

    Anthropic, Prompting best practices (externe Seite, platform.claude.com)

    platform.claude.comgeprüft 24.09.2026

    Der Prompt-Leitfaden des Herstellers. Er enthält die Regel, man solle sagen, was zu tun ist, statt was zu lassen, allerdings ausdrücklich im Abschnitt zur Steuerung der Ausgabeform und mit einem Formatierungsbeispiel. Die Beispielprompts weiter unten auf derselben Seite mischen dann Handlungsanweisung und Verneinung. Abgerufen am 31.07.2026.

  • Dokumentationerreichbar

    OpenAI, Model guidance für GPT-5.6 (externe Seite, developers.openai.com)

    developers.openai.comgeprüft 24.09.2026

    Der Leitfaden zum Stand GPT-5.6, Entwicklerfassung vom 09.07.2026. Wiederholte Anweisungen und Beispiele wieder herausnehmen, Tool-Beschreibungen vereinfachen. Bei pauschalen Kürzungsanweisungen wie „Be concise“ ist zu prüfen, ob sie noch etwas leisten, weil das Modell von sich aus knapper antwortet. Er hängt an beide Empfehlungen eine Bedingung: behalten, was eine Produktanforderung festhält oder eine gemessene Lücke schließt.

Zurück zu allen Beiträgen

Tippen Sie los.

↑↓ auswählenEnter öffnenDie Suche läuft im Browser. Nichts wird übertragen.