GrundlagenKI-WissenKapitel 05von 14 im Pfad
Computer Vision
Kapitel 03 endet mit einem Hinweis: Wie weit die Fähigkeit eines tiefen Netzes, seine Merkmale selbst herzustellen, in ein eigenes Fach reicht, gehört in ein Kapitel über Computer Vision. Dieses hier ist es.
Das Fach ist älter als die Sprachmodelle und arbeitet an einer anderen Frage. Es geht darum, aus Bildpunkten Aussagen zu machen, die sich nachrechnen lassen: Koordinaten, Klassen, Flächen, Zahlen.
Vier Aufgaben, und sie liefern verschiedene Antworten
Im Alltag heißt alles Bilderkennung. Im Fach sind es vier Aufgaben mit vier verschiedenen Antwortformen, und wer sie verwechselt, kauft das Falsche.
Einordnen. Die Frage lautet, was auf dem Bild zu sehen ist, die Antwort ist eine Klasse für das ganze Bild. Diese Aufgabe stand am Anfang des Fachs.
Finden. Die Frage lautet, wo etwas ist, die Antwort ist ein Rechteck mit vier Zahlen und einer Klasse daran. Für jedes Ding im Bild eines.
Zerlegen. Die Frage geht bildpunktgenau, die Antwort weist jedem einzelnen Bildpunkt eine Klasse zu. Damit lässt sich eine Fläche ausmessen statt nur umranden.
Wiedererkennen. Die Frage lautet, ob zwei Aufnahmen dasselbe zeigen, die Antwort ist ein Abstand zwischen zwei Zahlenreihen. Wie solche Reihen entstehen, steht in Grundkurs, Kapitel 04.
Ein Sprachmodell mit Bildeingang beantwortet die erste Frage in Prosa und die anderen drei gar nicht. Was es stattdessen kann und was es kostet, steht in Grundkurs, Kapitel 13.
Kanten, Ecken, Farbhistogramme
Vor 2012 schrieb ein Mensch auf, worauf ein Verfahren achten soll. Wie weit man damit kam, zeigt die Arbeit, mit der Gesichter erstmals in Echtzeit gefunden wurden:
Der Aufbau bestand aus Hell-Dunkel-Vergleichen zwischen benachbarten Bildbereichen, aus denen ein einordnendes Verfahren die wenigen aussagekräftigen auswählte:
Was das Verfahren tat, war schnell genug für die Technik seiner Zeit:
Drei Angaben gehören hier auseinandergehalten. Der Vortrag stammt von 2001, die zitierte Zeitschriftenfassung von 2004, und die 15 Bilder je Sekunde beziehen sich auf einen Schreibtischrechner jener Zeit. Dieses Verfahren steckte jahrelang in Digitalkameras, die beim Auslösen einen Rahmen um Gesichter legten.
Ein Kasten um ein Ding
Die zweite Aufgabe hat eine eigene Antwortform, und an ihr hängt der Umbruch von 2016. Bis dahin liefen einordnende Verfahren über viele Bildausschnitte nacheinander. Dann kam ein Aufbau, der das Bild einmal ansieht:
Das Ergebnis war ein Sprung bei der Geschwindigkeit:
Ein solcher Kasten behauptet zweierlei: dass dort etwas ist, und dass es zu einer bestimmten Klasse gehört. Beide Behauptungen können einzeln falsch sein, und das Verfahren gibt für beide eine Zahl aus. Welche Fragen daran hängen, steht in Kapitel 04.
Wo Gesichtserkennung anfängt und wo sie aufhört
Ein Wort deckt hier drei verschiedene Sachen ab, und die Unterschiede entscheiden über die Rechtslage.
Ist ein Gesicht im Bild? Das ist die Aufgabe von Viola und Jones, sie kommt ohne jeden Personenbezug aus, und sie steckt in jeder Kamera-App.
Zeigen diese beiden Aufnahmen dieselbe Person? Ein Vergleich von zwei Bildern gegeneinander. So entsperrt ein Telefon.
Wer ist die Person? Ein Vergleich gegen eine Datenbank mit vielen Einträgen. Die Zahl der möglichen Verwechslungen wächst hier mit der Größe der Datenbank, und nur diese dritte Form meint das Gesetz.
Was das Gesetz an dieser Stelle verbietet
Die KI-Verordnung untersagt in Artikel 5 bestimmte Verwendungen ganz. Drei davon betreffen dieses Fach.
Das Sammeln von Gesichtern aus öffentlich zugänglichen Quellen:
Das Ableiten von Gefühlen an zwei bestimmten Orten:
Und die dritte der oben genannten Formen, allerdings mit Ausnahmen:
Der Nachsatz zählt. Es folgt eine Liste eng gefasster Fälle, darunter die Suche nach vermissten Personen. Was das Gesetz überhaupt als KI-System bestimmt und seit wann diese Teile anwendbar sind, steht in Kapitel 01.
Woran Sie ein Bilderkennungssystem festmachen
Welche der vier Aufgaben löst es? Die Antwortform sagt es: Prosa, Klasse, Rechteck oder Abstand.
Woran wurde es gemessen? Ein Datensatz legt die Klassenliste fest, und damit auch, was das System gar nicht kennen kann. Die 91 Kategorien des gebräuchlichsten Datensatzes stammen aus einer Besprechung (Beleg (externe Seite, arxiv.org)).
Passt die Aufnahmesituation? Kamera, Auflösung und Beleuchtung wirken hier so stark wie bei einem Sprachmodell der Wortlaut der Anweisung.
Tiefe 1 hat vier Aufgaben getrennt. Hier steht, wie sie gemessen werden, woher die Aufgaben überhaupt stammen, und an welcher Stelle die Zahlen aus einer Erhebung im Betrieb ihre Gültigkeit verlieren.
Ein Bild misst sich schlecht in Prozent
Bei der Einordnung eines ganzen Bildes lässt sich abzählen, wie oft die Klasse stimmt. Beim Finden eines Dings im Bild geht das nicht mehr, denn ein Kasten kann fast richtig liegen.
Das Fach löst das über die Überlappung. Verglichen wird die gemeinsame Fläche von vorhergesagtem und hinterlegtem Rechteck, geteilt durch die Fläche, die beide zusammen bedecken. Ab einem festgelegten Anteil gilt der Fund als Treffer, darunter als Fehler.
Damit hängt jede Erkennungszahl an einer Festlegung, die außerhalb des Verfahrens getroffen wurde. Wer den geforderten Anteil senkt, bekommt bessere Zahlen und ungenauere Kästen. Dieselbe Abhängigkeit einer Kennzahl von ihrem Messprotokoll beschreibt Beurteilen und Einordnen, Kapitel 04 für Sprachmodelle.
Der Datensatz ist das Fach
Woran gemessen wird, hat für dieses Fach mehr entschieden als die Verfahren selbst. Der Datensatz von 2014, an dem die Objekterkennung bis heute gemessen wird, hat sein Messverfahren gleich mitgebracht:
Jedes einzelne Ding ist also flächengenau umrandet, was Kästen und Flächen zugleich messbar macht. Der Umfang dieser Handarbeit steht daneben:
With a total of 2.5 million labeled instances in 328k images (externe Seite, arxiv.org)
Zweieinhalb Millionen von Hand markierte Dinge. Wie diese Etikettierarbeit aussieht und warum sie den Engpass bildet, steht in Kapitel 02.
Ein Datensatz legt damit dreierlei fest: welche Klassen es gibt, wie genau markiert wird, und woran ein neues Verfahren gemessen werden muss, um vergleichbar zu sein. Ein Fach, das sich zehn Jahre an derselben Sammlung misst, richtet sich nach ihr aus.
Zwei Wege, ein Ding zu finden
Der ältere Weg geht in zwei Schritten. Ein erster Teil schlägt Bildbereiche vor, in denen etwas sein könnte, ein zweiter ordnet jeden Vorschlag ein. Das ist genau, weil der zweite Teil sich auf einen Ausschnitt konzentriert, und langsam, weil er oft läuft.
Der jüngere Weg macht beides in einem Durchgang, und die Arbeit von 2016 benennt den Unterschied im Ergebnis so:
Der Satz ist eine Abwägung zwischen zwei Fehlerarten, und damit dieselbe Entscheidung, die Kapitel 04 an der Schwelle beschreibt. Ungenauere Kästen gegen weniger Fehlalarme. Für eine Sortieranlage, die auf jeden Alarm anhält, wiegt die zweite Eigenschaft schwer. Für eine Vermessung wiegt die erste schwerer.
Segmentierung, eine Klasse je Bildpunkt
Die dritte Aufgabe verlangt eine Aussage über jeden einzelnen Bildpunkt. Damit lassen sich Flächen ausmessen, Ränder verfolgen und Dinge freistellen, die kein Rechteck sauber fasst.
Wie groß der Aufwand dahinter ist, zeigt die Sammlung, die Meta 2023 dafür angelegt hat:
Eine Milliarde markierter Flächen. Erzeugt wurden sie in einer Schleife, in der das entstehende Modell den Menschen die Arbeit vorbereitete. Das Modell selbst nimmt dabei eine Angabe entgegen, wo es hinsehen soll:
Ein Klick, ein Kasten oder ein grober Umriss genügen als Hinweis. Damit ist die Segmentierung von einer Aufgabe mit fester Klassenliste zu einer geworden, die im Betrieb gesteuert wird.
Die Zeichenerkennung ist ein offener Fall
Text aus einem Bild zu lesen gilt als gelöst, solange es um gedruckte Zeilen in guter Aufnahme geht. Daneben liegt der Alltag: Handschrift, Durchschläge, Formulare mit Kästchen, Tabellen ohne Linien, Stempel über Text.
Gemessen wird meistens die Zeichenfehlerrate, und die hat denselben Konstruktionsfehler wie die Wortfehlerrate bei der Spracherkennung. Sie mittelt über alles und verschweigt damit, wo die Fehler sitzen. Eine Rechnung, bei der neun von zehn Zeichen stimmen, klingt brauchbar und wird unbrauchbar, sobald der Fehler regelmäßig in der Kontonummer landet. Denselben Befund für gesprochene Sprache führt Conversational AI, Kapitel 02 aus.
Bei Tabellen kommt eine zweite Frage dazu, die keine Fehlerrate misst: Ob die erkannte Zelle in der richtigen Spalte gelandet ist. Ein Verfahren kann jedes Zeichen richtig lesen und die Struktur trotzdem verlieren.
Wo die Zahl aus dem Labor nicht gilt
Eine Erhebung von 2018 hat drei im Handel erhältliche Systeme zur Geschlechtsbestimmung aus Gesichtsbildern gemessen. Der Befund fiel deutlich aus:
Der Vergleichswert steht im nächsten Satz:
The maximum error rate for lighter-skinned males is 0.8%. (externe Seite, proceedings.mlr.press)
Zwischen 0,8 und 34,7 Prozent liegt der Faktor 43. Eine mittlere Fehlerrate über alle Gruppen hätte diesen Abstand vollständig verdeckt, und genau das ist der Punkt der Arbeit.
Die Ursache lag zu einem Teil in den Sammlungen, an denen bis dahin gemessen wurde:
Damit schließt sich der Kreis zum Abschnitt über die Datensätze. Ein Maßstab, der eine Gruppe kaum enthält, misst für diese Gruppe nichts, und die Gesamtzahl darüber sieht trotzdem gut aus.
Wo das Sprachmodell dieselbe Frage anders beantwortet
Ein Sprachmodell mit Bildeingang beantwortet die Frage nach dem Bildinhalt in Prosa. Das ist bequem, deckt viele Fälle ab und braucht kein eigenes Training. Für die drei anderen Aufgaben liefert es keine verwertbare Antwortform: Es nennt keine Koordinaten, die man weiterverarbeiten kann, und keinen Abstand, den man gegen eine Schwelle halten kann.
Was es stattdessen tut, wie es Bilder abrechnet und wo die Anbieter selbst Grenzen dokumentieren, steht in Grundkurs, Kapitel 13. Die Trennlinie zwischen den beiden Welten steht bereits in Kapitel 01: Ein Sprachmodell mit Bildeingang beschreibt, was zu sehen ist, und misst dabei nichts.
Für die Praxis heißt das, die Frage vor der Werkzeugwahl zu stellen. Wer eine Beschreibung braucht, nimmt das Sprachmodell. Wer eine Zahl braucht, die in eine Datenbank geht, nimmt ein Verfahren aus diesem Kapitel.
Was daraus für die Praxis folgt
Die Antwortform entscheidet über das Werkzeug, und sie steht am Anfang jeder Anforderung. Klasse, Rechteck, Fläche, Abstand oder Prosa.
Die Messzahl gehört zum Messprotokoll. Wer eine Erkennungsrate vorgelegt bekommt, fragt nach der geforderten Überlappung, nach dem Datensatz und nach der Verteilung darin.
Und die Aufnahmesituation gehört zur Anforderung. Ein System, das an gut ausgeleuchteten Bildern gemessen wurde, hat für den Nachtbetrieb an einer Werkhalle keine Aussage.
Drei Sachen entscheiden über ein Bilderkennungssystem im Betrieb, und alle drei liegen außerhalb des Modells: die Markierung, an der es gemessen wurde, die Kamera, die es füttert, und der Zweck, für den es läuft.
Was ein Kasten behauptet und was er verschweigt
Eine Markierung sieht nach einer Tatsache aus. Sie ist das Ergebnis von Entscheidungen, die jemand beim Anlegen des Datensatzes getroffen hat, und die wenigsten davon sind aufgeschrieben.
Wo endet ein Fahrrad, dessen Vorderrad hinter einem Auto steht? Bekommt es einen Kasten über die sichtbaren Teile oder über die vermutete volle Ausdehnung? Zählt eine Person auf einem Plakat als Person? Ist eine Menschenmenge ein Objekt oder sechzig? Jede dieser Fragen hat eine Antwort bekommen, und jedes daran gemessene Verfahren hat diese Antwort gelernt.
Die Klassenliste ist die sichtbarste dieser Entscheidungen. Der Maßstab, nach dem sie beim gebräuchlichsten Datensatz zusammengestellt wurde, steht in dessen Abstract:
Für die Katze und den Toaster taugt das. Für einen Betrieb, der Schweißnähte prüft, sagt es nichts, und der braucht eine eigene Sammlung samt eigener Antworten auf die Fragen oben. Was daran hängt, beschreibt Kapitel 04 an der Klassenliste allgemein.
Die flächengenaue Markierung verschiebt das Problem nur. Sie ist genauer und verlangt dieselben Entscheidungen an jedem Rand.
Warum eine Erkennungszahl selten vergleichbar ist
Wer zwei Systeme an ihren veröffentlichten Zahlen vergleicht, vergleicht in den meisten Fällen zwei Messprotokolle. Vier Festlegungen stecken in einer solchen Zahl, und keine davon steht üblicherweise daneben.
Die geforderte Überlappung. Ab welchem Anteil gilt ein Kasten als Treffer. Übliche Werte liegen bei der Hälfte oder darüber, und ein Wechsel verschiebt das Ergebnis erheblich.
Die Mittelung über die Klassen. Wird über alle Klassen gleich gewichtet oder über alle Fälle? Bei einem Datensatz mit vielen Autos und wenigen Fahrrädern liegen die beiden Rechnungen weit auseinander. Denselben Unterschied beschreibt Kapitel 04 an der ausgeglichenen Genauigkeit.
Die Größenklassen. Kleine Dinge im Bild werden schlechter gefunden als große. Ein Protokoll, das kleine ausschließt, bekommt bessere Zahlen.
Der Testteil des Datensatzes. Wer auf einer anderen Aufteilung misst, misst etwas anderes.
Eine Erkennungszahl ohne diese vier Angaben ist damit ungefähr so aussagekräftig wie eine Benchmark-Zahl ohne den Aufgabensatz dahinter, und dazu steht das Nötige in Beurteilen und Einordnen, Kapitel 04.
Die Kamera ist Teil des Modells
Kapitel 02 beschreibt die verschobene Lage als eine der drei Arten, auf die ein Modell danebenliegt: Die neuen Fälle sehen anders aus als die alten. In diesem Fach hat dieser Befund eine physikalische Ursache, und das macht ihn planbar.
Sensor, Auflösung, Brennweite, Belichtungszeit und Kompression verändern das Bild, bevor es das Modell erreicht. Zwei Aufnahmen desselben Werkstücks von zwei Kameras sind für ein Verfahren zwei verschiedene Eingaben. Ein Kamerawechsel im Betrieb wirkt deshalb wie ein Wechsel der Datengrundlage, mit dem Unterschied, dass ihn niemand als solchen einträgt.
Am schlechtesten sichtbar ist die Kompression. Ein Bild, das mehrfach über Kanäle mit automatischer Verkleinerung gelaufen ist, trägt Artefakte, die im Trainingsmaterial fehlten. Bei kleinen Dingen im Bild fällt genau die Information weg, an der das Verfahren sie erkannt hat.
Daraus folgt eine Anforderung, die in kein Datenblatt passt: Die Aufnahmesituation gehört mit in die Abnahme, und zwar die des Betriebs und nicht die des Herstellers.
Wo die biometrische Identifikation rechtlich sitzt
Die KI-Verordnung behandelt dieselbe Technik je nach Betriebsart verschieden, und die Grenze verläuft entlang der Unterscheidung aus Tiefe 1.
Der Vergleich gegen ein einzelnes hinterlegtes Bild steht ausdrücklich außerhalb der oberen Risikostufe. Anhang III sagt das in einem eigenen Satz:
Das ist die Telefonentsperrung. Der Vergleich gegen eine Datenbank dagegen steht in derselben Nummer als Hochrisiko-Anwendung, und in Echtzeit im öffentlichen Raum zu Strafverfolgungszwecken ist er nach Artikel 5 untersagt, mit einer Liste eng gefasster Ausnahmen.
Drei Stufen für eine Technik also, und was zählt, sind Betriebsart und Zweck: Vergleich gegen ein Bild, Vergleich gegen eine Datenbank, Vergleich gegen eine Datenbank in Echtzeit durch die Strafverfolgung. Wer eine Anlage plant, ordnet sie an diesen drei Fragen ein, bevor er über Verfahren spricht.
Die Emotionserkennung führt Anhang III als eigenen Punkt, und für zwei Orte verbietet Artikel 5 sie ganz. Beide Stellen stehen in Tiefe 1 im Wortlaut.
Was daraus nicht folgt
Eine Fehlerquote gilt nicht für alle Gruppen. Der gemessene Abstand von 0,8 zu 34,7 Prozent zwischen zwei Gruppen (Erhebung von 2018 (externe Seite, proceedings.mlr.press)) verschwindet in jeder Gesamtzahl. Wer eine einzelne Prozentangabe bekommt, hat noch keine Aussage über den eigenen Anwendungsfall.
Ein leistungsfähiges Modell macht die Markierung nicht überflüssig. Auch das Verfahren, das eine Milliarde Flächen gelernt hat, arbeitet auf Zuruf: Es bekommt einen Hinweis, wo es hinsehen soll (Beleg (externe Seite, arxiv.org)). Welche Klasse die gefundene Fläche hat, sagt weiterhin jemand anders.
Aus einer Verbotsnorm folgt keine Erlaubnis für den Rest. Artikel 5 nennt die untersagten Verwendungen, und was dort fehlt, kann trotzdem in der oberen Risikostufe stehen oder an anderen Gesetzen scheitern.
Quellen
6 Einträge, davon 1 Schlüsselarbeitalle erreichbar
Erreichbarkeit automatisch geprüft
SchlüsselarbeitOriginalarbeiterreichbar
proceedings.mlr.pressgeprüft 24.09.2026
Joy Buolamwini und Timnit Gebru messen 2018 drei im Handel erhältliche Systeme zur Geschlechtsbestimmung aus Gesichtsbildern und finden Fehlerquoten, die je nach Gruppe um mehr als das Vierzigfache auseinandergehen. Die Arbeit misst zuerst die Datensätze selbst und legt einen eigenen an, der nach Hautton und Geschlecht ausgeglichen ist. Die Zahlen sind festgeschrieben und veralten deshalb nicht wie eine laufende Auswertung.
Originalarbeiterreichbar
Robust Real-Time Face Detection (externe Seite, link.springer.com)
link.springer.comgeprüft 24.09.2026
Paul Viola und Michael Jones beschreiben das Verfahren, mit dem Gesichter erstmals in Echtzeit auf gewöhnlicher Rechentechnik gefunden wurden. Drei Angaben gehören auseinandergehalten: Der Vortrag stammt von der CVPR 2001, diese ausgearbeitete Zeitschriftenfassung erschien 2004, und die genannten 15 Bilder je Sekunde beziehen sich auf einen Schreibtischrechner jener Zeit. Zwei Begriffe des Abstracts stehen in typografischen Anführungszeichen und sind deshalb nicht zitierfähig.
Originalarbeiterreichbar
You Only Look Once: Unified, Real-Time Object Detection (externe Seite, arxiv.org)
arxiv.orggeprüft 24.09.2026
Redmon, Divvala, Girshick und Farhadi fassen die Suche nach Dingen im Bild in einem einzigen Durchlauf zusammen, statt einen einordnenden Schritt über viele Ausschnitte zu wiederholen. Die Fassung auf arXiv stammt vom 08.06.2015, die hier zitierte Überarbeitung vom 09.05.2016; als Arbeit bekannt ist sie über die CVPR 2016. Der Satz zum Vergleich der beiden Fehlerrichtungen ist der für die Praxis wichtigste.
Originalarbeiterreichbar
Verordnung (EU) 2024/1689 über künstliche Intelligenz (externe Seite, eur-lex.europa.eu)
eur-lex.europa.eugeprüft 24.09.2026
Der Rechtstext selbst, veröffentlicht am 12.07.2024 und in Kraft getreten am 01.08.2024. Er ordnet Anwendungen nach Risiko und legt die Pflichten je Stufe fest. Die Anwendbarkeit beginnt gestaffelt, nicht mit dem Inkrafttreten. Die Adresse zeigt seit dem 29.07.2026 auf die deutsche Fassung: Die Zitate unten stehen im Text so, wie er hier zitiert wird, und die Fassung ohne Sprachangabe liefert die englische.
Datenerreichbar
Microsoft COCO: Common Objects in Context (externe Seite, arxiv.org)
arxiv.orggeprüft 24.09.2026
Der Datensatz, an dem die Suche nach Dingen im Bild seit 2014 gemessen wird. Er legt zugleich das Messverfahren fest, weil jedes Ding einzeln umrandet und flächengenau markiert ist. Die Schreibweise 91 objects types stammt aus dem Original.
Originalarbeiterreichbar
Segment Anything (externe Seite, arxiv.org)
arxiv.orggeprüft 24.09.2026
Metas Arbeit von 2023 zur flächengenauen Zerlegung eines Bildes. Sie ist der Beleg dafür, wie groß die Etikettierarbeit in diesem Fach ist: eine Milliarde markierter Flächen auf elf Millionen Bildern. Der Satz zur Leistung ohne eigenes Training enthält zwei Bindestriche und ist deshalb nicht zitierfähig.