GrundlagenKI-WissenKapitel 04von 14 im Pfad
Mustererkennung und Klassifikation
Kapitel 02 sagt, woher die Bewertung kommt, an der ein Verfahren sein Verhalten ausrichtet. Dieses Kapitel sagt, welche Form die Aufgabe hat, die dabei gelöst wird, und woran man misst, ob sie gelöst ist.
Die häufigste Form ist das Einordnen. Eine Nachricht ist Werbung oder keine, ein Gewebeschnitt ist auffällig oder unauffällig, ein Bauteil ist in Ordnung oder Ausschuss. Der Fachausdruck dafür ist Klassifikation, und darunter steckt mehr Handarbeit, als das Wort vermuten lässt.
Eine Klasse ist eine Entscheidung, die jemand vorgegeben hat
Ein einordnendes Verfahren wählt aus einer Liste. Diese Liste hat ein Mensch aufgeschrieben, bevor irgendein Training begann, und was darin fehlt, kann später nicht herauskommen.
Wie weitreichend diese Entscheidung ist, sieht man an einem Datensatz, an dem die Bilderkennung seit 2014 gemessen wird. Seine Verfasser beschreiben die Auswahl so:
Die Zahl 91 ist das Ergebnis einer Besprechung. Der Maßstab dafür steht im Satz daneben: Was ein vierjähriges Kind benennen kann. Ein Verfahren, das darauf trainiert wurde, kennt Zebras und Toaster und hat für einen Rollstuhl kein Wort.
Daraus folgt die erste Frage an jedes System dieser Art: Wer hat die Liste gemacht, und wofür?
Merkmale, und wer sie aussucht
Ein Verfahren sieht nie auf das ganze Bild oder den ganzen Text. Es sieht auf Größen, die daraus berechnet wurden. Diese Größen heißen Merkmale.
Bis etwa 2012 hat ein Mensch sie sich ausgedacht: Kanten, Ecken, Farbverteilungen, die Häufigkeit bestimmter Wörter. Das war die eigentliche Arbeit im Fach, und wer die richtigen Merkmale fand, gewann. Die Verfahren selbst waren austauschbar.
Eines davon, die Stützvektormaschine von 1995, geht einen Umweg über einen Raum mit sehr vielen Größen, weil sich dort eine gerade Trennfläche legen lässt, wo im Ursprungsraum keine hinpasst:
Was seit 2012 anders läuft, steht in Kapitel 03. Der Merkmalsentwurf ist seither in die ersten Schichten des Netzes gewandert.
Am Ende steht eine Wahrscheinlichkeit
Ein einordnendes Verfahren gibt selten ein Urteil aus. Es gibt eine Zahl aus, meistens zwischen null und eins, und die sagt, wie sicher es sich ist. Aus dieser Zahl wird ein Urteil erst durch eine Schwelle, und die legt wieder ein Mensch fest.
Wer die Schwelle bei 0,5 lässt, hat sie trotzdem gewählt. Wer sie auf 0,9 schiebt, bekommt weniger falschen Alarm und übersieht mehr Fälle. Derselbe Handgriff kommt im Betrieb von Sprachmodellen wieder vor, dort an der Grenze zwischen durchgelassen und geblockt; das steht in Conversational AI, Kapitel 07.
Zwei Arten, danebenzuliegen
Ein Verfahren kann auf zwei Weisen irren, und die beiden kosten verschieden viel. Es kann Alarm schlagen, wo nichts ist. Und es kann etwas übersehen.
Die Dokumentation der meistgenutzten Programmbibliothek für dieses Fach beschreibt die beiden zugehörigen Masszahlen in einem Satz:
Die erste Zahl heißt Precision und misst, wie verlässlich ein Alarm ist. Die zweite heißt Recall und misst, wie vollständig die Fälle gefunden werden. Beide lassen sich gegeneinander verschieben, und zwar immer gegeneinander: Wer die eine hebt, senkt die andere.
Welche der beiden Richtungen schwerer wiegt, entscheidet der Einsatzort. Bei einer Vorsorgeuntersuchung ist ein übersehener Fall schlimmer als ein Fehlalarm. Bei einem Filter, der Nachrichten wegwirft, ist es umgekehrt.
Wo dieselbe Aufgabe ohne Etiketten läuft
Nicht jede Einordnung braucht eine vorgegebene Liste. Beim Gruppieren bekommt ein Verfahren nur die Daten und die Vorgabe, wie viele Häufungen es suchen soll. Was die gefundenen Gruppen bedeuten, sagt danach ein Mensch. Auf Zahlenreihen aus Texten läuft dasselbe Verfahren, und wie diese Reihen entstehen, steht in Grundkurs, Kapitel 04.
Der Sonderfall dabei ist die Suche nach dem Ungewöhnlichen. Von der gesuchten Klasse gibt es dort keine Beispiele, weil ein Maschinenschaden selten ist und ein Betrugsversuch neu aussieht. Solche Verfahren lernen deshalb, wie normal aussieht, und melden alles, was weit davon abliegt.
Woran Sie eine Einordnung festmachen
Vier Fragen reichen, um ein System dieser Art einzuschätzen, und alle vier lassen sich ohne Fachkenntnis stellen.
Wer hat die Klassen festgelegt? Die Liste ist eine Entscheidung, und sie stammt von Menschen mit einem Zweck.
Worauf sieht das Verfahren? Wenn niemand die Merkmale benennen kann, bleibt auch offen, warum ein einzelner Fall gerade so einsortiert wurde.
Wo liegt die Schwelle, und wer hat sie gesetzt? Zwischen der Zahl und dem Urteil steht immer eine Festlegung.
Welche der beiden Fehlerrichtungen kostet hier mehr? Wer das nicht beantworten kann, kann die Schwelle nicht sinnvoll setzen.
Das Gesetz stellt an einer Stelle dieselbe Frage. Die KI-Verordnung stuft Anwendungen nach ihrem Einsatzzweck ein, und Systeme, die über Menschen urteilen, stehen dort in der oberen Stufe. Welche das sind und was daraus folgt, steht in Tiefe 3 dieses Kapitels.
Tiefe 1 hat die Aufgabe beschrieben. Hier stehen die Verfahren, die sie lösen, und die Zahlen, an denen sich messen lässt, wie gut das gelingt.
Zwei davon nennt Kapitel 01 in einem Nebensatz, ohne sie zu erklären. Das wird hier nachgeholt, denn beide arbeiten bis heute in Anlagen, die niemand ein KI-System nennen würde.
Der Entscheidungsbaum, und warum er sich vorlesen lässt
Ein Entscheidungsbaum ist eine Kette von Fragen mit je zwei Ausgängen. Liegt der Messwert über 40? Dann nach rechts. Ist das Bauteil älter als zwei Jahre? Dann nach links. Am Ende jedes Astes steht eine Klasse.
Das Verfahren sucht diese Fragen selbst. Es probiert für jedes Merkmal jede mögliche Grenze durch und nimmt die, die die Beispiele am saubersten in zwei Häufungen zerlegt. Danach wiederholt es das in beiden Hälften.
Die Eigenschaft, die den Baum am Leben hält, ist die Lesbarkeit seines Weges. Wer wissen will, warum ein Fall so einsortiert wurde, liest die Fragen von der Wurzel bis zum Blatt und hat die Begründung in fünf Zeilen. In einem neuronalen Netz steckt dieselbe Entscheidung in Millionen von Zahlen, aus denen sich keine Regel ablesen lässt; warum das so ist, steht in Kapitel 03.
Vom einen Baum zum Wald
Ein einzelner Baum merkt sich zu leicht die Beispiele, aus denen er gebaut wurde. Leo Breiman hat 2001 den Ausweg beschrieben, der bis heute das Standardverfahren für Daten in Zeilen und Spalten ist:
Hunderte Bäume also, jeder auf einer zufälligen Auswahl der Beispiele und der Merkmale gewachsen, und am Ende wird abgestimmt. Dass das funktioniert, hängt an zwei Größen zugleich:
Starke Bäume allein genügen also nicht. Sie müssen sich auch voneinander unterscheiden, sonst irren alle gemeinsam. Genau dafür bekommt jeder Baum nur einen Teil der Merkmale zu sehen.
Der Wald behält dabei eine Eigenschaft, die dem Netz fehlt:
Internal estimates are also used to measure variable importance. (externe Seite, link.springer.com)
Das Verfahren beziffert selbst, welche Merkmale zählen. Was es aufgibt, ist die Vorlesbarkeit des einzelnen Weges: Bei fünfhundert Bäumen liest niemand mehr mit.
Die Stützvektormaschine zieht eine Trennfläche
Der zweite Klassiker geht anders vor. Er sucht eine Fläche zwischen den beiden Gruppen, und zwar die mit dem größten Abstand zu den nächstgelegenen Beispielen.
Der Trick der Arbeit von 1995 steckt darin, wo diese Fläche liegt:
In this feature space a linear decision surface is constructed. (externe Seite, link.springer.com)
Gemeint ist ein Raum mit sehr vielen Größen, in den die Daten vorher übersetzt wurden. Dort passt eine gerade Fläche zwischen Gruppen, die sich im ursprünglichen Raum verschlungen umeinanderlegen.
Woran sich die Arbeit selbst gemessen hat, ist heute die erstaunlichere Angabe:
Handschriftenerkennung war 1995 die Aufgabe, an der sich ein Verfahren beweisen musste. Wie es dort weiterging, steht in Kapitel 05.
Wo die Regression aufhört und die Klassifikation anfängt
Die Aufgabe hat zwei Grundformen, und der Unterschied liegt in der Antwort. Eine Klassifikation wählt aus einer endlichen Liste. Eine Regression sagt eine Zahl auf einer durchgehenden Skala voraus, etwa den Preis eines Hauses oder die Restlaufzeit eines Bauteils.
Dasselbe Verfahren bedient oft beide Formen. Ein Entscheidungsbaum kann in seinen Blättern eine Klasse führen oder einen Mittelwert, und Breimans Arbeit sagt in ihrem letzten Satz, dass die Idee des Waldes für beides gilt.
Ein Hinweis zum Wort: In der Softwareentwicklung meint Regression etwas anderes, nämlich einen Test, der vorher durchlief und jetzt fällt. Auf dieser Seite kommt es überwiegend in dieser zweiten Bedeutung vor, etwa in Conversational AI, Kapitel 10.
Die Vierfeldertafel
Bei zwei Klassen gibt es vier mögliche Ausgänge, und alle vier zusammen ergeben das Bild. Die übliche Darstellung dafür heißt Konfusionsmatrix:
Die Zeilen sind also die Wahrheit, die Spalten das Urteil. Auf der Diagonale stehen die Treffer, daneben die beiden Fehlerarten: Alarm ohne Anlass und übersehener Fall.
Aus diesen vier Zahlen entstehen die beiden Kennzahlen aus Tiefe 1. Precision rechnet innerhalb der Alarme, Recall innerhalb der tatsächlichen Fälle. Der Nenner ist der ganze Unterschied.
Dieselbe Größe begegnet in diesem Bestand noch einmal unter anderem Namen: Bei der Suche in einer Wissensbasis misst Recall@k, wie oft die richtige Stelle unter den ersten k Treffern war. Die Rechnung dahinter steht in Agenten und Harness, Kapitel 03.
Warum die Genauigkeit bei seltenen Fällen lügt
Die einfachste Kennzahl ist der Anteil der richtigen Urteile. Sie versagt genau dort, wo es interessant wird.
Angenommen, von tausend Bauteilen sind zehn defekt. Ein Verfahren, das ausnahmslos „in Ordnung“ antwortet, urteilt bei 990 von 1000 Fällen richtig und kommt damit auf 99 Prozent. Es findet null der zehn Fehler, für die es gebaut wurde. Die Zahl 99 ist echt, und sie misst hier die Verteilung der Daten statt der Leistung des Verfahrens.
Die Programmbibliothek hält für diesen Fall eine eigene Kennzahl bereit:
Sie mittelt über die Klassen statt über die Fälle, womit die zehn Defekte genauso viel wiegen wie die 990 heilen Teile. In der Beispielrechnung fällt der Wert damit von 99 auf 50 Prozent.
Wer eine Prozentzahl liest, fragt deshalb zuerst nach der Verteilung. Dieselbe Frage in anderer Gestalt stellt Beurteilen und Einordnen, Kapitel 04 an Sprachmodelle.
Die Anomalie ist die Klasse ohne Beispiele
Eine Aufgabe fällt aus dem Rahmen: die Suche nach dem Ungewöhnlichen. Ein Maschinenschaden ist selten, ein Einbruchsversuch sieht jedes Mal anders aus, und ein Betrugsmuster ändert sich, sobald es erkannt wird. Beispiele der gesuchten Klasse gibt es also kaum, und die vorhandenen taugen als Vorlage für den nächsten Fall wenig.
Solche Verfahren lernen deshalb den Normalfall und melden, was weit davon abliegt. Das hat eine bekannte Schwäche: Was während des Trainings schon im Normalbetrieb steckte, gilt für immer als normal.
Ein solcher Wächter läuft auch in der Werkzeugkette, mit der diese Seite gebaut wird. Im Auto-Modus von Claude Code urteilt ein eigenes Modell über jede Handlung, bevor sie läuft, und dieses Modell heißt dort Klassifikator; die gemessenen Zahlen dazu stehen in Vibe-Coding / Agentic Engineering, Kapitel 08.
Was daraus für die Praxis folgt
Die Wahl des Verfahrens ist die kleinste der Entscheidungen. Bei Daten in Zeilen und Spalten liegen Wald und Netz oft nah beieinander, und die Arbeit steckt davor: in der Klassenliste, in den Merkmalen, in der Frage, welche Fehlerrichtung teurer ist.
Welche Kennzahl gilt, entscheidet die Aufgabe. Wer sich eine einzelne Prozentzahl vorlegen lässt, hat drei Rückfragen: Wie ist die Verteilung, welche der vier Felder stecken darin, und wo liegt die Schwelle.
Drei Sachen entscheiden über ein einordnendes System, und keine davon steht im Verfahren: die Merkmale, die Schwelle und der Einsatzort. Diese Ebene nimmt sie der Reihe nach.
Der Merkmalsentwurf war die eigentliche Arbeit
Kapitel 03 beschreibt in einem Satz, was vor 2012 galt: Einem Verfahren wurde vorgegeben, worauf es achten soll, also Kanten, Ecken, Farbhistogramme. Der Fachausdruck dafür ist Merkmalsentwurf, und er beschreibt den Löwenanteil der damaligen Arbeit.
Wie diese Arbeit aussah, lässt sich an einer Aufgabe zeigen. Wer 1995 Ziffern auf Formularen lesen wollte, entschied, ob die Zahl der Löcher in einer Ziffer ein Merkmal ist, ob die Krümmung an bestimmten Stellen eines ist, ob die Verteilung der schwarzen Bildpunkte über acht Zeilen eines ist. Jede dieser Entscheidungen war eine Vermutung darüber, woran ein Mensch eine Sechs von einer Acht unterscheidet.
Zwei Eigenschaften folgen daraus, und beide gelten für die klassischen Verfahren bis heute. Sie kommen mit wenigen Beispielen aus, weil das Vorwissen schon in den Merkmalen steckt. Und sie erklären ihre Urteile, weil die Merkmale Namen haben.
Die Etiketten dagegen kosteten damals wie heute Menschenarbeit. Woher sie kommen und was das für die Daten bedeutet, steht in Kapitel 02.
Eine Schwelle ist eine Entscheidung über zwei Kosten
Zwischen der Zahl und dem Urteil steht eine Grenze, und ihre Lage lässt sich nicht aus den Daten ableiten. Sie folgt aus der Frage, was ein übersehener Fall kostet und was ein Fehlalarm kostet.
Bei ungleich verteilten Klassen wird daraus eine Rechnung mit vier Posten. Wer bei den tausend Bauteilen aus Tiefe 2 die Schwelle senkt, findet mehr der zehn Defekte und schickt dafür heile Teile in die Nachprüfung. Ob sich das lohnt, hängt an den Kosten beider Vorgänge, und die stehen in keiner Kennzahl.
Eine Arbeit von 2016 hat gezeigt, dass diese Entscheidung auch zwischen Gruppen verteilt. Sie schlägt einen Maßstab dafür vor, wann ein Verfahren eine Gruppe benachteiligt:
Der Kern des Vorschlags liegt darin, wohin die Last einer schlechten Einordnung fällt:
Vorgeführt wird das an Bonitätsbewertungen:
We illustrate our notion using a case study of FICO credit scores. (externe Seite, arxiv.org)
Eine einzige Schwelle für alle wirkt bei verschiedenen Gruppen verschieden, sobald sich die zugrunde liegenden Verteilungen unterscheiden. Die Arbeit ist von 2016 und beschreibt eine Anpassung an einer fertigen Vorhersage; die Diskussion darüber, welcher Maßstab der richtige ist, läuft weiter.
Wo die Klassifikation im Gesetz auftaucht
Die KI-Verordnung ordnet Anwendungen nach Risiko, und der Anhang III führt die Fälle der oberen Stufe einzeln auf. Bemerkenswert daran ist die Ebene, auf der er das tut: Er benennt Aufgabenformen. Ob dahinter ein Entscheidungsbaum steht oder ein Netz mit hundert Schichten, spielt für die Einstufung keine Rolle.
Zwei der aufgeführten Fälle sind klassische Einordnungen. Der erste betrifft die Arbeitswelt:
Der zweite betrifft das Geld:
Beide Male geht es um eine Sortierung von Menschen in zwei Gruppen, und beide Male steckt die Entscheidung in einer Schwelle. Die Ausnahme im zweiten Zitat ist dabei aufschlussreich: Dieselbe Rechnung fällt je nach Zweck in eine andere Stufe.
Artikel 6 lässt eine Rückausnahme zu, wenn die Anwendung eng zugeschnitten ist. Die erste der dort genannten Bedingungen lautet:
Wer sich darauf beruft, muss die Einschätzung dokumentieren. Was das Gesetz überhaupt als KI-System bestimmt, steht in Kapitel 01, samt der Anwendbarkeit, die seit dem 02.02.2025 gilt. Wie die vier Stufen zueinander stehen, steht in Kapitel 12.
Warum das einfache Verfahren nicht verschwunden ist
Bei Bildern und Texten haben tiefe Netze das Feld übernommen. Bei Daten in Zeilen und Spalten, also der häufigsten Form in Unternehmen, sieht die Lage anders aus. Eine Erhebung von 2022 formuliert das im ersten Satz ihres Abstracts:
Gemessen wurde breit angelegt:
Das Ergebnis:
Der Satz geht im Original mit einer Größenangabe weiter, die in einer Formelschreibweise steht: rund 10.000 Beispiele. Für größere Datenmengen gilt die Aussage also nicht ohne Weiteres, und die Arbeit sagt das selbst.
Der Gedanke dahinter kehrt in diesem Pfad eine Größenklasse höher wieder. Auch bei Sprachmodellen gewinnt selten das größte Modell, sondern das passende; Kapitel 10 rechnet das durch.
Was daraus nicht folgt
Die klassischen Verfahren sind deshalb nicht die besseren. Sie sind die besseren für eine bestimmte Form von Daten, in einer bestimmten Größenordnung, gemessen an 45 Datensätzen. Wer daraus eine allgemeine Rangfolge macht, hat denselben Fehler gemacht wie jemand, der aus einem Bilderfolg auf alle Aufgaben schließt.
Eine Vierfeldertafel macht ein System nicht gerecht. Sie zeigt die Fehler, die im Testmaterial vorkommen, und das Testmaterial stammt aus derselben Welt wie die Trainingsdaten. Was dort systematisch fehlt, fehlt auch in der Messung.
Eine Schwelle lässt sich nicht objektiv bestimmen. Es gibt keine Rechnung, die aus den Daten allein hervorbringt, wie viele Fehlalarme ein übersehener Fall wert ist. Diese Zahl kommt von außen, und wer sie setzt, entscheidet mit.
Quellen
7 Einträgealle erreichbar
Erreichbarkeit automatisch geprüft
Datenerreichbar
Microsoft COCO: Common Objects in Context (externe Seite, arxiv.org)
arxiv.orggeprüft 24.09.2026
Der Datensatz, an dem die Suche nach Dingen im Bild seit 2014 gemessen wird. Er legt zugleich das Messverfahren fest, weil jedes Ding einzeln umrandet und flächengenau markiert ist. Die Schreibweise 91 objects types stammt aus dem Original.
Originalarbeiterreichbar
Support-Vector Networks (externe Seite, link.springer.com)
link.springer.comgeprüft 24.09.2026
Corinna Cortes und Vladimir Vapnik stellen 1995 das Verfahren vor, das zwei Gruppen durch eine Fläche in einem hochdimensionalen Merkmalsraum trennt. Die Arbeit misst sich selbst an einer Erhebung zur maschinellen Zeichenerkennung und stellt sich damit neben die klassischen Lernverfahren ihrer Zeit. Der erste Satz des Abstracts ist auf der Seite nicht zitierfähig, weil zwischen Artikel und Begriff das Leerzeichen fehlt.
Dokumentationerreichbar
scikit-learn, Metrics and scoring (externe Seite, scikit-learn.org)
scikit-learn.orggeprüft 24.09.2026
Die Dokumentation der meistgenutzten Programmbibliothek für klassisches maschinelles Lernen. Sie definiert die Maßzahlen einer Einordnung im Wortlaut, von der Vierfeldertafel über Genauigkeit und Vollständigkeit bis zu der Kennzahl, die bei ungleich verteilten Klassen an die Stelle der einfachen Trefferquote tritt.
Originalarbeiterreichbar
Random Forests (externe Seite, link.springer.com)
link.springer.comgeprüft 24.09.2026
Leo Breiman beschreibt 2001, wie viele einzelne Entscheidungsbäume zu einem Verfahren zusammengefasst werden, das genauer urteilt als jeder von ihnen. Die Arbeit nennt die beiden Größen, an denen der Fehler hängt, und einen Nebeneffekt, der das Verfahren bis heute im Einsatz hält: Es beziffert selbst, welche Merkmale zählen. Der Satz zum Vergleich mit Adaboost ist wegen der Zeichen darin nicht zitierfähig.
Originalarbeiterreichbar
Equality of Opportunity in Supervised Learning (externe Seite, arxiv.org)
arxiv.orggeprüft 24.09.2026
Hardt, Price und Srebro schlagen 2016 einen Maßstab dafür vor, wann ein einordnendes Verfahren eine Gruppe benachteiligt, und zeigen an Kreditwürdigkeitsdaten, wie sich eine fertige Vorhersage nachträglich daran ausrichten lässt. Im Abstract fehlt an einer Stelle ein Leerzeichen zwischen zwei Wörtern, weshalb der Satz zur Oblivious-Eigenschaft nicht zitierfähig ist.
Originalarbeiterreichbar
Verordnung (EU) 2024/1689 über künstliche Intelligenz (externe Seite, eur-lex.europa.eu)
eur-lex.europa.eugeprüft 24.09.2026
Der Rechtstext selbst, veröffentlicht am 12.07.2024 und in Kraft getreten am 01.08.2024. Er ordnet Anwendungen nach Risiko und legt die Pflichten je Stufe fest. Die Anwendbarkeit beginnt gestaffelt, nicht mit dem Inkrafttreten. Die Adresse zeigt seit dem 29.07.2026 auf die deutsche Fassung: Die Zitate unten stehen im Text so, wie er hier zitiert wird, und die Fassung ohne Sprachangabe liefert die englische.
Originalarbeiterreichbar
Why do tree-based models still outperform deep learning on tabular data? (externe Seite, arxiv.org)
arxiv.orggeprüft 24.09.2026
Grinsztajn, Oyallon und Varoquaux messen 2022 an 45 Datensätzen, wie sich Verfahren auf der Grundlage von Entscheidungsbäumen gegen neuronale Netze schlagen, wenn die Daten in Zeilen und Spalten vorliegen. Die Angabe zur Datenmenge steht im Abstract in einer Formelschreibweise und ist deshalb nur bis dahin zitierfähig; sie lautet rund 10.000 Beispiele.