Tiefe
Gleiches Kapitel, drei Tiefen. Die Wahl gilt überall und bleibt gespeichert.

GrundlagenBeurteilen und EinordnenKapitel 02von 8 im Pfad

Ein Modell auf eigene Daten abstimmen

Tiefe 1: Überblick · Lesezeit 8 Min. · Stand

In Grundkurs, Kapitel 08 steht, auf welchen drei Wegen Neues zu einem Modell kommt, und der Abschnitt endet mit einem Satz, der etwas offenlässt: Alle drei enden im Kontext, keiner erreicht die Gewichte. Hier geht es um die Verfahren, die genau das tun.

Bis in die Gewichte

Ein Modell ist eine Datei voller Zahlen. Was Sie ihm im Gespräch sagen, ändert daran nichts, es steht nur für die Dauer dieser einen Anfrage daneben. Es gibt allerdings einen Weg, die Datei selbst anzufassen: Man lässt das Modell weitere Beispiele durchrechnen, und danach stehen andere Zahlen darin.

Das ist keine Kleinigkeit im Betrieb, und es ist die einzige Art von Änderung, die bleibt. Ein so behandeltes Modell antwortet in jedem neuen Gespräch anders, ohne dass jemand etwas dazuschreiben muss.

Drei Wege enden im Kontext und gelten für eine Anfrage. Ein vierter erreicht die Gewichtsdatei und bleibt. Links vier Eingänge untereinander. Prompt, Unterlagen und Nachschlagen führen in einen gemeinsamen Kasten mit der Aufschrift Kontext, der nach der Anfrage geleert wird. Der vierte, Beispiele, läuft als einziger über eine gestrichelte Grenze hinweg zu einem Kasten mit der Aufschrift Gewichte. Über diesem Pfeil steht Training, darunter der Hinweis auf die laufenden Kosten der Bereitstellung. WAS SIE HINEINGEBEN Prompt Unterlagen Nachschlagen Kontext der Anfrage danach leer Beispiele Training GILT EINE ANFRAGE BLEIBT WAS DAS MODELL IST Gewichte eine zweite Datei das Modell, wie es geliefert wurde Die Bereitstellung der zweiten Datei kostet, auch an Tagen ohne Anfrage.

seitlich verschiebbar

Der eine Weg, der die Gewichtsdatei erreicht, und was er dafür verlangt.

eigene Darstellung, Stand 06.08.2026

Drei Verfahren, ein Gedanke

Fine-Tuning. Das Modell trainiert weiter, mit Ihren Beispielen. Am Ende liegt eine zweite, vollständige Modelldatei da, die Ihnen gehört.

LoRA. Die Gewichte bleiben, wie sie sind, und daneben entsteht eine kleine Zusatzdatei. Sie wirkt beim Antworten mit, und weil sie klein ist, ist der Vorgang erheblich billiger (externe Seite, arxiv.org) als der erste. Fast alles, was heute als Abstimmung angeboten wird, arbeitet darunter so.

Distillation. Ein großes Modell erzeugt die Antworten, ein kleines lernt, sie nachzumachen. Der Gedanke ist von 2015 und stammt aus einer Arbeit, die zeigte, dass sich das Können mehrerer Modelle in ein einzelnes übertragen (externe Seite, arxiv.org) lässt. Am Ende steht ein kleineres Modell, das eine Sache gut kann.

Allen dreien gemeinsam: Am Ende liegt eine Datei da, die es vorher nicht gab, und für die jemand aufkommt.

Wofür sich das eignet

OpenAI zählt für das gebräuchlichste Verfahren vier Fälle auf: einordnen in Kategorien, übersetzen mit festem Ton, Ausgaben in einem verlangten Format, und Anweisungen, die das Modell sonst überliest. Alle vier haben dasselbe Muster. Es geht darum, wie geantwortet wird.

Der häufigste Wunsch dahinter geht damit gerade nicht in Erfüllung. Wer möchte, dass ein Modell die eigenen Unterlagen kennt, sucht etwas anderes: Das Wissen über eine Sache gehört zu den Wegen, die in Grundkurs, Kapitel 08 beschrieben sind. Eine Abstimmung bringt einem Modell den Hausstil bei, keine Hausakten.

Drei billigere Antworten stehen davor

Bevor die Frage nach der Abstimmung überhaupt sinnvoll ist, sind drei andere zu beantworten, und alle drei sind an einem Nachmittag erledigt:

Der Prompt. Steht in Grundkurs, Kapitel 06, und die dortigen Beispiele lösen einen guten Teil dessen, wofür früher trainiert wurde.

Die Unterlagen mitgeben. Was ins Fenster passt, muss nirgends gelernt werden. Grenzen und Fallstricke stehen in Grundkurs, Kapitel 05.

Nachschlagen lassen. Die Anwendung sucht die passenden Stellen heraus und legt sie dazu. Wie das funktioniert, steht in Grundkurs, Kapitel 04.

Der Unterschied liegt in der Umkehrbarkeit. Ein Prompt ist in Minuten geändert. Eine abgestimmte Fassung ist eine Anschaffung.

Die Rechnung läuft, während nichts passiert

Zwei Posten. Der erste ist das Training, und er fällt einmal an. Der zweite ist die Bereitstellung, und der überrascht die meisten: Microsoft berechnet dafür 1,70 Dollar je Stunde (externe Seite, learn.microsoft.com), Mistral verlangte zwei Dollar Ablage je Modell und Monat (externe Seite, docs.mistral.ai). Diese Beträge laufen weiter, solange das Modell bereitsteht, an Wochenenden und in der Urlaubswoche.

Bei einem gerechneten Beispiel des Anbieters selbst macht die reine Bereitschaft 86 Prozent der Monatsrechnung aus. Der Weg dorthin steht in Ebene 3, und wer die Zahl auf den eigenen Fall übertragen will, findet dort auch die Formel.

Zwei Anbieter haben aufgehört

Das Deutlichste zur Nutzenfrage kommt vom Markt. OpenAI schreibt auf die eigene Seite:

OpenAI is winding down the fine-tuning platform. (externe Seite, developers.openai.com)

In Mistrals Anleitung steht der Vermerk, dass die Funktion abgekündigt ist und nicht mehr gepflegt wird (externe Seite, docs.mistral.ai). Beides abgerufen am 06.08.2026. Bei Microsoft, Google und AWS ist das Angebot weiterhin buchbar.

Warum die beiden ausgestiegen sind, sagen sie nicht, und hier wird nicht geraten. Als Auskunft für die eigene Planung reicht die Tatsache: Ein Verfahren, bei dem zwei große Anbieter das Selbstbedienungsangebot einstellen, ist kein naheliegender erster Schritt.

Wann es sich trotzdem lohnt

Drei Anlässe, bei denen das Rechnen anfängt:

Dieselbe enge Aufgabe, sehr oft. Millionen gleichartige Vorgänge, bei denen jede eingesparte Zeile Prompt bei jedem einzelnen zählt.

Ein Prompt, der nur über seine Länge funktioniert. Wenn zwei Seiten Anweisung nötig sind, damit das Ergebnis stimmt, zahlen Sie diese zwei Seiten bei jeder Anfrage.

Eine Ausgabeform, die kein Beispiel zuverlässig erzwingt. Der Fall, den OpenAI selbst nennt, und der einzige der drei, bei dem es oft ohne Rechnung klar ist.

Quellen

14 Einträge, davon 4 Schlüsselarbeitenalle erreichbar

Erreichbarkeit automatisch geprüft

  • SchlüsselarbeitDokumentationerreichbar

    Microsoft, Fine-tuning cost management (externe Seite, learn.microsoft.com)

    learn.microsoft.comgeprüft 24.09.2026

    Die ergiebigste Quelle zur Kostenseite des Fine-Tunings, weil ein Anbieter hier seine eigene Rechnung offenlegt. Sie trennt den einmaligen Trainingspreis von den laufenden Kosten, nennt den Stundensatz für die Bereitstellung und rechnet einen Monat vollständig durch: 1.224 Dollar Bereitstellung und 198 Dollar Nutzung ergeben 1.422 Dollar, abgerufen am 06.08.2026. Microsoft schreibt selbst dazu, dass diese Beträge Beispielwerte sind.

  • SchlüsselarbeitOriginalarbeiterreichbar

    Distilling the Knowledge in a Neural Network (externe Seite, arxiv.org)

    arxiv.orggeprüft 24.09.2026

    Hinton, Vinyals und Dean beschreiben am 09.03.2015 den Gedanken, das Können mehrerer großer Modelle in ein einzelnes kleines zu übertragen. Der Begriff Distillation stammt von hier. Was Anbieter heute als Verfahren verkaufen, ist die Anwendung dieser Arbeit auf Sprachmodelle.

    Archivfassung (externe Seite, web.archive.org)

  • SchlüsselarbeitOriginalarbeiterreichbar

    LoRA: Low-Rank Adaptation of Large Language Models (externe Seite, arxiv.org)

    arxiv.orggeprüft 24.09.2026

    Hu und sieben Mitautoren stellen am 17.06.2021 das Verfahren vor, mit dem sich ein Modell anpassen lässt, ohne seine Gewichte anzufassen. Trainiert werden kleine Zusatzmatrizen, das Modell selbst bleibt eingefroren. Das ist der Grund, warum die Anpassung großer Modelle heute auf gewöhnlicher Hardware stattfindet, und die Grundlage aller sparsamen Verfahren, die seither dazugekommen sind.

    Archivfassung (externe Seite, web.archive.org)

  • SchlüsselarbeitOriginalarbeiterreichbar

    Training language models to follow instructions with human feedback (externe Seite, arxiv.org)

    arxiv.orggeprüft 24.09.2026

    Ouyang und Mitautoren zeigen am 04.03.2022, dass ein deutlich kleineres, mit menschlicher Rückmeldung nachtrainiertes Modell hilfreicher antwortet als ein sehr viel größeres ohne. Das ist der Schritt, der aus einem Textfortsetzer einen Assistenten macht, und die Voraussetzung für ChatGPT acht Monate später.

  • Dokumentationerreichbar

    OpenAI, Model optimization (externe Seite, developers.openai.com)

    developers.openai.comgeprüft 24.09.2026

    OpenAIs Übersicht der Anpassungsverfahren. Sie beschreibt vier davon mit ihren Anwendungsfällen und bringt zugleich die Ankündigung, dass die Plattform dafür abgewickelt wird. Beides steht auf derselben Seite, und die Anwendungsfälle sind deshalb weiterhin die Auskunft des Anbieters darüber, wofür sich das Verfahren eignet.

  • Dokumentationerreichbar

    Mistral, Fine-tuning (Deprecated) (externe Seite, docs.mistral.ai)

    docs.mistral.aigeprüft 24.09.2026

    Mistrals Anleitung zum Fine-Tuning, mit dem Hinweis auf ihre eigene Abschaltung obenauf. Sie ist damit der zweite belegte Rückzug eines Anbieters und nennt zugleich die kleinsten Beträge des ganzen Themas: vier Dollar Mindestgebühr je Trainingslauf und zwei Dollar Ablage je Modell und Monat.

  • Originalarbeiterreichbar

    Improving Language Understanding by Generative Pre-Training (externe Seite, openai.com)

    openai.comgeprüft 24.09.2026

    GPT-1, vorgestellt am 11.06.2018. Führt das Muster ein, das bis heute gilt: erst ein Modell auf sehr viel unbeschriftetem Text vortrainieren, dann für einzelne Aufgaben nachjustieren. Das G in GPT steht für generative, das P für pre-trained, das T für Transformer.

  • Originalarbeiterreichbar

    Parameter-Efficient Transfer Learning for NLP (externe Seite, arxiv.org)

    arxiv.orggeprüft 24.09.2026

    Houlsby und Mitautoren zeigen am 02.02.2019, dass sich ein Modell über kleine eingeschobene Bausteine an eine Aufgabe anpassen lässt, während der Rest unverändert bleibt. Die Arbeit steht zwei Jahre vor LoRA und liefert den Begriff Adapter. Ihr gemessener Abstand zum vollen Fine-Tuning ist die erste Zahl, die belegt, dass ein sparsames Verfahren genügt.

    Archivfassung (externe Seite, web.archive.org)

  • Originalarbeiterreichbar

    QLoRA: Efficient Finetuning of Quantized LLMs (externe Seite, arxiv.org)

    arxiv.orggeprüft 24.09.2026

    Dettmers und Mitautoren verbinden am 23.05.2023 die grobe Speicherung der Gewichte mit dem Verfahren von LoRA. Damit passt die Anpassung eines sehr großen Modells auf eine einzelne Grafikkarte. Die Arbeit liefert die einzige Größenordnung des Themas, die sich auf eigene Hardware beziehen lässt.

    Archivfassung (externe Seite, web.archive.org)

  • Dokumentationerreichbar

    OpenAI, Deprecations (externe Seite, developers.openai.com)

    developers.openai.comgeprüft 24.09.2026

    Die Liste, in der OpenAI seine Abkündigungen datiert. Der Eintrag vom 07.05.2026 wickelt das Fine-Tuning in drei Schritten ab und nennt für jeden das Datum. Er regelt außerdem, was mit bereits abgestimmten Modellen geschieht, und knüpft deren Ende an das Ende ihres Grundmodells.

  • Dokumentationerreichbar

    Google, Vertex AI, Preise für generative KI (externe Seite, cloud.google.com)

    cloud.google.comgeprüft 24.09.2026

    Googles Preisverzeichnis, und der zweite Anbieter, der den Trainingspreis öffentlich beziffert. Für Gemini 2.0 Flash stehen dort 3 Dollar je Million Trainings-Token, für die Lite-Variante 1 Dollar, abgerufen am 06.08.2026. Die Angaben stehen in Preistabellen und lassen sich deshalb nicht als Satz zitieren. Zum Betrieb eines abgestimmten Modells führt die Seite an zwei Stellen einander widersprechende Angaben, weshalb hier nur der Trainingspreis belegt wird.

  • Dokumentationerreichbar

    AWS, Customize a model with distillation in Amazon Bedrock (externe Seite, docs.aws.amazon.com)

    docs.aws.amazon.comgeprüft 24.09.2026

    Die Dokumentation, in der ein großer Anbieter Distillation als buchbares Verfahren beschreibt und dabei den Ablauf ausschreibt: Ein großes Modell erzeugt die Antworten, ein kleines wird darauf abgestimmt. Sie nennt die Zusage, dass allein der Kunde an das Ergebnis kommt, und den Posten, den man dabei leicht übersieht, nämlich die Abrechnung der Aufrufe beim großen Modell.

  • Dokumentationerreichbar

    Microsoft, Data, privacy, and security for Foundry Models sold by Azure (externe Seite, learn.microsoft.com)

    learn.microsoft.comgeprüft 24.09.2026

    Die Seite, die den Unterschied zwischen Modell und Betreiber greifbar macht: Dieselben Modelle laufen bei Microsoft, und der Hersteller sieht dabei nichts. Sie nennt außerdem die Angabe, an der die Regionswahl praktisch scheitert, nämlich den Bereitstellungstyp, und die Auskunft darüber, wer die Eingaben bei der Missbrauchserkennung zu sehen bekommt.

  • Originalarbeiterreichbar

    DistilBERT, a distilled version of BERT: smaller, faster, cheaper and lighter (externe Seite, arxiv.org)

    arxiv.orggeprüft 24.09.2026

    Sanh und Mitautoren führen am 02.10.2019 vor, was Distillation an einem echten Sprachmodell leistet, und beziffern alle drei Seiten: Größe, erhaltenes Können und Tempo. Es ist die einzige Wirkungsangabe des Themas, die aus einer offengelegten Messung stammt. Die Anbieter beziffern allein ihre Preise.

    Archivfassung (externe Seite, web.archive.org)

Tippen Sie los.

↑↓ auswählenEnter öffnenDie Suche läuft im Browser. Nichts wird übertragen.