Tiefe
Gleiches Kapitel, drei Tiefen. Die Wahl gilt überall und bleibt gespeichert.

GrundlagenKI-WissenKapitel 05von 14 im Pfad

Computer Vision

Tiefe 1: Überblick · Lesezeit 8 Min. · Stand

Kapitel 03 endet mit einem Hinweis: Wie weit die Fähigkeit eines tiefen Netzes, seine Merkmale selbst herzustellen, in ein eigenes Fach reicht, gehört in ein Kapitel über Computer Vision. Dieses hier ist es.

Das Fach ist älter als die Sprachmodelle und arbeitet an einer anderen Frage. Es geht darum, aus Bildpunkten Aussagen zu machen, die sich nachrechnen lassen: Koordinaten, Klassen, Flächen, Zahlen.

Vier Aufgaben, und sie liefern verschiedene Antworten

Im Alltag heißt alles Bilderkennung. Im Fach sind es vier Aufgaben mit vier verschiedenen Antwortformen, und wer sie verwechselt, kauft das Falsche.

Einordnen. Die Frage lautet, was auf dem Bild zu sehen ist, die Antwort ist eine Klasse für das ganze Bild. Diese Aufgabe stand am Anfang des Fachs.

Finden. Die Frage lautet, wo etwas ist, die Antwort ist ein Rechteck mit vier Zahlen und einer Klasse daran. Für jedes Ding im Bild eines.

Zerlegen. Die Frage geht bildpunktgenau, die Antwort weist jedem einzelnen Bildpunkt eine Klasse zu. Damit lässt sich eine Fläche ausmessen statt nur umranden.

Wiedererkennen. Die Frage lautet, ob zwei Aufnahmen dasselbe zeigen, die Antwort ist ein Abstand zwischen zwei Zahlenreihen. Wie solche Reihen entstehen, steht in Grundkurs, Kapitel 04.

Ein Sprachmodell mit Bildeingang beantwortet die erste Frage in Prosa und die anderen drei gar nicht. Was es stattdessen kann und was es kostet, steht in Grundkurs, Kapitel 13.

Kanten, Ecken, Farbhistogramme

Vor 2012 schrieb ein Mensch auf, worauf ein Verfahren achten soll. Wie weit man damit kam, zeigt die Arbeit, mit der Gesichter erstmals in Echtzeit gefunden wurden:

This paper describes a face detection framework that is capable of processing images extremely rapidly while achieving high detection rates. (externe Seite, link.springer.com)

Der Aufbau bestand aus Hell-Dunkel-Vergleichen zwischen benachbarten Bildbereichen, aus denen ein einordnendes Verfahren die wenigen aussagekräftigen auswählte:

The second is a simple and efficient classifier which is built using the AdaBoost learning algorithm (externe Seite, link.springer.com)

Was das Verfahren tat, war schnell genug für die Technik seiner Zeit:

Implemented on a conventional desktop, face detection proceeds at 15 frames per second. (externe Seite, link.springer.com)

Drei Angaben gehören hier auseinandergehalten. Der Vortrag stammt von 2001, die zitierte Zeitschriftenfassung von 2004, und die 15 Bilder je Sekunde beziehen sich auf einen Schreibtischrechner jener Zeit. Dieses Verfahren steckte jahrelang in Digitalkameras, die beim Auslösen einen Rahmen um Gesichter legten.

Ein Kasten um ein Ding

Die zweite Aufgabe hat eine eigene Antwortform, und an ihr hängt der Umbruch von 2016. Bis dahin liefen einordnende Verfahren über viele Bildausschnitte nacheinander. Dann kam ein Aufbau, der das Bild einmal ansieht:

A single neural network predicts bounding boxes and class probabilities directly from full images in one evaluation. (externe Seite, arxiv.org)

Das Ergebnis war ein Sprung bei der Geschwindigkeit:

Our base YOLO model processes images in real-time at 45 frames per second. (externe Seite, arxiv.org)

Ein solcher Kasten behauptet zweierlei: dass dort etwas ist, und dass es zu einer bestimmten Klasse gehört. Beide Behauptungen können einzeln falsch sein, und das Verfahren gibt für beide eine Zahl aus. Welche Fragen daran hängen, steht in Kapitel 04.

Wo Gesichtserkennung anfängt und wo sie aufhört

Ein Wort deckt hier drei verschiedene Sachen ab, und die Unterschiede entscheiden über die Rechtslage.

Ist ein Gesicht im Bild? Das ist die Aufgabe von Viola und Jones, sie kommt ohne jeden Personenbezug aus, und sie steckt in jeder Kamera-App.

Zeigen diese beiden Aufnahmen dieselbe Person? Ein Vergleich von zwei Bildern gegeneinander. So entsperrt ein Telefon.

Wer ist die Person? Ein Vergleich gegen eine Datenbank mit vielen Einträgen. Die Zahl der möglichen Verwechslungen wächst hier mit der Größe der Datenbank, und nur diese dritte Form meint das Gesetz.

Was das Gesetz an dieser Stelle verbietet

Die KI-Verordnung untersagt in Artikel 5 bestimmte Verwendungen ganz. Drei davon betreffen dieses Fach.

Das Sammeln von Gesichtern aus öffentlich zugänglichen Quellen:

die Verwendung von KI-Systemen, die Datenbanken zur Gesichtserkennung durch das ungezielte Auslesen von Gesichtsbildern aus dem Internet oder von Überwachungsaufnahmen erstellen oder erweitern (externe Seite, eur-lex.europa.eu)

Das Ableiten von Gefühlen an zwei bestimmten Orten:

die Verwendung von KI-Systemen zur Ableitung von Emotionen einer natürlichen Person am Arbeitsplatz und in Bildungseinrichtungen (externe Seite, eur-lex.europa.eu)

Und die dritte der oben genannten Formen, allerdings mit Ausnahmen:

die Verwendung biometrischer Echtzeit-Fernidentifizierungssysteme in öffentlich zugänglichen Räumen zu Strafverfolgungszwecken, außer wenn und insoweit dies im Hinblick auf eines der folgenden Ziele unbedingt erforderlich ist (externe Seite, eur-lex.europa.eu)

Der Nachsatz zählt. Es folgt eine Liste eng gefasster Fälle, darunter die Suche nach vermissten Personen. Was das Gesetz überhaupt als KI-System bestimmt und seit wann diese Teile anwendbar sind, steht in Kapitel 01.

Woran Sie ein Bilderkennungssystem festmachen

Welche der vier Aufgaben löst es? Die Antwortform sagt es: Prosa, Klasse, Rechteck oder Abstand.

Woran wurde es gemessen? Ein Datensatz legt die Klassenliste fest, und damit auch, was das System gar nicht kennen kann. Die 91 Kategorien des gebräuchlichsten Datensatzes stammen aus einer Besprechung (Beleg (externe Seite, arxiv.org)).

Passt die Aufnahmesituation? Kamera, Auflösung und Beleuchtung wirken hier so stark wie bei einem Sprachmodell der Wortlaut der Anweisung.

Quellen

6 Einträge, davon 1 Schlüsselarbeitalle erreichbar

Erreichbarkeit automatisch geprüft

  • SchlüsselarbeitOriginalarbeiterreichbar

    Gender Shades: Intersectional Accuracy Disparities in Commercial Gender Classification (externe Seite, proceedings.mlr.press)

    proceedings.mlr.pressgeprüft 24.09.2026

    Joy Buolamwini und Timnit Gebru messen 2018 drei im Handel erhältliche Systeme zur Geschlechtsbestimmung aus Gesichtsbildern und finden Fehlerquoten, die je nach Gruppe um mehr als das Vierzigfache auseinandergehen. Die Arbeit misst zuerst die Datensätze selbst und legt einen eigenen an, der nach Hautton und Geschlecht ausgeglichen ist. Die Zahlen sind festgeschrieben und veralten deshalb nicht wie eine laufende Auswertung.

  • Originalarbeiterreichbar

    Robust Real-Time Face Detection (externe Seite, link.springer.com)

    link.springer.comgeprüft 24.09.2026

    Paul Viola und Michael Jones beschreiben das Verfahren, mit dem Gesichter erstmals in Echtzeit auf gewöhnlicher Rechentechnik gefunden wurden. Drei Angaben gehören auseinandergehalten: Der Vortrag stammt von der CVPR 2001, diese ausgearbeitete Zeitschriftenfassung erschien 2004, und die genannten 15 Bilder je Sekunde beziehen sich auf einen Schreibtischrechner jener Zeit. Zwei Begriffe des Abstracts stehen in typografischen Anführungszeichen und sind deshalb nicht zitierfähig.

  • Originalarbeiterreichbar

    You Only Look Once: Unified, Real-Time Object Detection (externe Seite, arxiv.org)

    arxiv.orggeprüft 24.09.2026

    Redmon, Divvala, Girshick und Farhadi fassen die Suche nach Dingen im Bild in einem einzigen Durchlauf zusammen, statt einen einordnenden Schritt über viele Ausschnitte zu wiederholen. Die Fassung auf arXiv stammt vom 08.06.2015, die hier zitierte Überarbeitung vom 09.05.2016; als Arbeit bekannt ist sie über die CVPR 2016. Der Satz zum Vergleich der beiden Fehlerrichtungen ist der für die Praxis wichtigste.

  • Originalarbeiterreichbar

    Verordnung (EU) 2024/1689 über künstliche Intelligenz (externe Seite, eur-lex.europa.eu)

    eur-lex.europa.eugeprüft 24.09.2026

    Der Rechtstext selbst, veröffentlicht am 12.07.2024 und in Kraft getreten am 01.08.2024. Er ordnet Anwendungen nach Risiko und legt die Pflichten je Stufe fest. Die Anwendbarkeit beginnt gestaffelt, nicht mit dem Inkrafttreten. Die Adresse zeigt seit dem 29.07.2026 auf die deutsche Fassung: Die Zitate unten stehen im Text so, wie er hier zitiert wird, und die Fassung ohne Sprachangabe liefert die englische.

  • Datenerreichbar

    Microsoft COCO: Common Objects in Context (externe Seite, arxiv.org)

    arxiv.orggeprüft 24.09.2026

    Der Datensatz, an dem die Suche nach Dingen im Bild seit 2014 gemessen wird. Er legt zugleich das Messverfahren fest, weil jedes Ding einzeln umrandet und flächengenau markiert ist. Die Schreibweise 91 objects types stammt aus dem Original.

  • Originalarbeiterreichbar

    Segment Anything (externe Seite, arxiv.org)

    arxiv.orggeprüft 24.09.2026

    Metas Arbeit von 2023 zur flächengenauen Zerlegung eines Bildes. Sie ist der Beleg dafür, wie groß die Etikettierarbeit in diesem Fach ist: eine Milliarde markierter Flächen auf elf Millionen Bildern. Der Satz zur Leistung ohne eigenes Training enthält zwei Bindestriche und ist deshalb nicht zitierfähig.

Tippen Sie los.

↑↓ auswählenEnter öffnenDie Suche läuft im Browser. Nichts wird übertragen.