Tiefe
Gleiches Kapitel, drei Tiefen. Die Wahl gilt überall und bleibt gespeichert.

GrundlagenKI-WissenKapitel 03von 14 im Pfad

Neuronale Netze und Deep Learning

Tiefe 1: Überblick · Lesezeit 8 Min. · Stand

Kapitel 02 sagt, dass ein Verfahren sein Verhalten aus Beispielen zieht. Dieses Kapitel sagt, worin dieses Verhalten dann steckt.

Was in einem Netz geschieht

Ein neuronales Netz ist eine Anordnung sehr einfacher Rechenschritte in Schichten. Jeder Punkt einer Schicht nimmt Zahlen von der Schicht davor entgegen, multipliziert jede mit einem eigenen Wert, zählt alles zusammen und gibt das Ergebnis weiter.

Ein neuronales Netz aus drei Schichten. Ein einzelner Punkt wandert auf einer markierten Route vom Eingang zur Ausgabe. Drei Schichten nebeneinander: links drei Neuronen als Kreise, in der Mitte vier, rechts zwei. Jedes Neuron ist mit jedem der nächsten Schicht verbunden. Drei dieser Linien sind kräftiger gezeichnet und stehen für ein stärkeres Gewicht. An einer davon steht die Zahl 0,6, eine blasse Verbindung daneben die Zahl -0,2. Eine gestrichelte Linie markiert einen Weg vom mittleren Eingangsneuron über die versteckte Schicht zur unteren Ausgabe, auf ihr wandert ein Punkt entlang. EINGANG VERSTECKTE SCHICHT AUSGABE 0,6 -0,2 Der Punkt zeigt, wie ein Signal die Schichten durchläuft. Linienstärke steht für die Stärke der gelernten Gewichte.

seitlich verschiebbar

Drei Schichten, wie ein Schulbuch sie zeichnet. Ein Sprachmodell hat Milliarden solcher Verbindungen, und die beiden Zahlen hier sind erfunden.

eigene Darstellung, Stand 09/2026

Diese Werte an den Verbindungen heißen Gewichte, und sie sind das Ergebnis des Trainings. Am Anfang stehen sie auf Zufallszahlen, danach werden sie milliardenfach nachgestellt.

Damit ist die wichtigste Eigenschaft benannt: Was ein Netz kann, steht nirgends als Regel geschrieben. Es steckt in diesen Zahlen. Man kann sie auslesen und ausdrucken, und man kann ihnen nicht ansehen, wofür sie stehen. Warum das Folgen bis in den Alltag hat, steht in Grundkurs, Kapitel 07.

Warum die Anleihe bei der Biologie in die Irre führt

Der Name stammt aus der Absicht, das Gehirn nachzubauen. Das Nobelkomitee formuliert es 2024 vorsichtig:

This technology was originally inspired by the structure of the brain. (externe Seite, nobelprize.org)

Inspiriert, und damit hört die Ähnlichkeit weitgehend auf. Ein Punkt in einem Netz rechnet eine Multiplikation und eine Summe. Eine Nervenzelle ist eine lebende Zelle mit Stoffwechsel, chemischen Botenstoffen und einem Verhalten über die Zeit. Vom Netz auf das Gehirn zu schließen oder umgekehrt, überdehnt den Vergleich.

Das Nobelkomitee benennt an derselben Stelle, wie eng der Alltagsgebrauch des Wortes KI geworden ist:

When we talk about artificial intelligence, we often mean machine learning using artificial neural networks. (externe Seite, nobelprize.org)

Was daneben noch KI heißt, steht in Kapitel 01.

Was das Wort tief beziffert

Deep Learning heißt: viele Schichten hintereinander. Eine Zahl dafür hat sich nie eingebürgert, und sie hat sich mit den Jahren verschoben.

Das Netz, das 2012 den Umschwung brachte, hatte acht Schichten mit Gewichten, fünf mit Faltung und drei voll verbundene. Drei Jahre später waren es 152, und die Arbeit dazu benennt genau das als ihren Gegenstand:

On the ImageNet dataset we evaluate residual nets with a depth of up to 152 layers (externe Seite, arxiv.org)

Der Zuwachs an Tiefe war dabei kein Selbstläufer. Der erste Satz derselben Arbeit lautet:

Deeper neural networks are more difficult to train. (externe Seite, arxiv.org)

Warum Tiefe hilft und warum sie schwierig ist, steht in Tiefe 2.

2012, der Punkt an dem es umschlug

Neuronale Netze gab es seit Jahrzehnten, und sie galten lange als Nebenweg. Brauchbar wurden sie in dem Moment, als genug Rechenleistung und genug Beispiele zusammenkamen. Das Netz, an dem sich das zeigte, klassifizierte 1,2 Millionen Bilder in tausend Klassen (externe Seite, papers.nips.cc) und senkte die Fehlerquote im Wettbewerb von 2012 auf 15,3 Prozent, während der Zweitplatzierte bei 26,2 lag.

Interessanter für die Nachwelt sind zwei andere Angaben aus derselben Arbeit. Das Netz hatte 60 Millionen Parameter und 650.000 Neuronen. Und trainiert wurde es auf zwei Grafikkarten, mit einer Umsetzung, die eigens dafür geschrieben war.

Grafikkarten wurden damit zum Forschungswerkzeug. Alles, was danach kam, steht auf dieser Entscheidung, und wie schnell es danach ging, steht in Beurteilen und Einordnen, Kapitel 05.

Vom Netz zum Sprachmodell

Ein Sprachmodell ist ein neuronales Netz einer bestimmten Bauform. Die Bauform heißt Transformer, sie stammt von 2017, und was sie beigetragen hat, steht in Grundkurs, Kapitel 02.

Die Zahl, die überall genannt wird, ist die Zahl der Parameter, und die Gewichte sind der größte Teil davon. AlexNet hatte 60 Millionen, heutige Sprachmodelle haben Milliarden bis Billionen. Was diese Zahl sagt und was sie verschweigt, steht in Kapitel 10.

Woran Sie es festmachen

Gewichte sind Zahlen ohne Beschriftung. Wer nach einer Regel im Modell sucht, sucht etwas, das dort nicht abgelegt ist.

Tiefe ist eine Bauentscheidung. Mehr Schichten helfen, solange sich das Netz trainieren lässt, und genau dort liegt die Schwierigkeit.

Die Bauform folgt dem Gegenstand. Für Bilder, für Folgen und für Sprache haben sich verschiedene Anordnungen durchgesetzt. Welche, steht in Tiefe 2.

Die Parameterzahl beschreibt die Größe. Wie viel Speicher daraus folgt, rechnet Beurteilen und Einordnen, Kapitel 01 vor. Über das Können sagt sie wenig.

Quellen

9 Einträge, davon 2 Schlüsselarbeitenalle erreichbar

Erreichbarkeit automatisch geprüft

  • SchlüsselarbeitOriginalarbeiterreichbar

    Neural Machine Translation by Jointly Learning to Align and Translate (externe Seite, arxiv.org)

    arxiv.orggeprüft 24.09.2026

    Bahdanau, Cho und Bengio reichen am 01.09.2014 die Arbeit ein, in der der Mechanismus der Aufmerksamkeit seine Form bekommt. Die damals übliche Bauform presste den ganzen Ausgangssatz in einen Vektor fester Länge; die Arbeit vermutet darin den Engpass und lässt das Modell bei jedem Zielwort selbst suchen, welche Stellen der Eingabe dafür zählen. Im Kurztext heißt der Mechanismus weiches Suchen, das Wort Aufmerksamkeit setzte sich erst später durch. Drei Jahre vor dem Transformer, der allein darauf aufbaut.

  • SchlüsselarbeitOriginalarbeiterreichbar

    Attention Is All You Need (externe Seite, arxiv.org)

    arxiv.orggeprüft 24.09.2026

    Die Arbeit, mit der alles anfing. Vaswani und sieben Mitautoren stellen am 12.06.2017 die Transformer-Architektur vor und zeigen, dass ein Netz allein über den Mechanismus der Aufmerksamkeit auskommt, ohne die bis dahin übliche schrittweise Verarbeitung. Erst dadurch ließen sich Modelle sinnvoll auf viele Rechenkerne verteilen. Jedes GPT, jedes Claude und jedes Gemini steht auf dieser Arbeit. Abschnitt 3.2.3 hält die Einschränkung fest, die für alle fortsetzenden Modelle gilt: „self-attention layers in the decoder allow each position in the decoder to attend to all positions in the decoder up to and including that position“, dazu die Begründung „We need to prevent leftward information flow in the decoder to preserve the auto-regressive property“. Beide Stellen stehen im Volltext und sind deshalb ohne hinterlegtes Zitat, der Prüflauf liest die Abstract-Seite.

    Archivfassung (externe Seite, web.archive.org)

  • Originalarbeiterreichbar

    ImageNet Classification with Deep Convolutional Neural Networks (externe Seite, papers.nips.cc)

    papers.nips.ccgeprüft 24.09.2026

    Krizhevsky, Sutskever und Hinton stellen bei NeurIPS 2012 ein Faltungsnetz vor, das den ImageNet-Wettbewerb gewinnt und die Fehlerquote so deutlich senkt, dass die bis dahin übliche Bauweise aufgegeben wurde. Ab hier wird Rechenleistung zum Forschungsmittel. Die Angaben zur Bauform stehen in der Druckfassung, Abschnitt 3.5: acht Schichten mit Gewichten, davon fünf Faltungsschichten und drei voll verbundene, 60 Millionen Parameter und 650.000 Neuronen. Der Sieg beim Wettbewerb 2012 mit 15,3 Prozent Fehlerquote gegen 26,2 Prozent des Zweitplatzierten steht am Ende des Kurztextes, das Verfahren gegen das Auswendiglernen heißt dort Dropout.

  • Originalarbeiterreichbar

    Deep Residual Learning for Image Recognition (externe Seite, arxiv.org)

    arxiv.orggeprüft 24.09.2026

    He, Zhang, Ren und Sun reichen am 10.12.2015 die Arbeit ein, die Tiefe als eigenes Problem behandelt. Sie beginnt mit dem Befund, dass tiefere Netze schwerer zu trainieren sind, und stellt einen Umbau vor, bei dem jede Schicht die Abweichung von ihrer Eingabe lernt statt einer eigenständigen Funktion. Damit wurden Netze mit 152 Schichten rechenbar, achtmal so tief wie die vorher übliche Bauform. Der Beleg dafür, dass das Wort tief in Deep Learning eine Zahl hat, die sich über die Jahre verschoben hat.

  • Originalarbeiterreichbar

    The Nobel Prize in Physics 2024, press release (externe Seite, nobelprize.org)

    nobelprize.orggeprüft 24.09.2026

    Die Bekanntgabe vom 08.10.2024 für John Hopfield und Geoffrey Hinton, für Arbeiten, die das maschinelle Lernen mit künstlichen neuronalen Netzen ermöglichten. Einen Tag später ging der Chemiepreis unter anderem an Demis Hassabis und John Jumper für AlphaFold.

  • Originalarbeiterreichbar

    BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding (externe Seite, arxiv.org)

    arxiv.orggeprüft 24.09.2026

    Die Gegenrichtung zu GPT, aus demselben Baustein gebaut. BERT liest einen Satz von beiden Seiten und erzeugt daraus eine Darstellung, statt Text fortzusetzen. Ein großer Teil der Embedding-Modelle, die heute eine Suche in eigenen Dokumenten möglich machen, ist so gebaut.

  • Originalarbeiterreichbar

    Improving Language Understanding by Generative Pre-Training (externe Seite, openai.com)

    openai.comgeprüft 24.09.2026

    GPT-1, vorgestellt am 11.06.2018. Führt das Muster ein, das bis heute gilt: erst ein Modell auf sehr viel unbeschriftetem Text vortrainieren, dann für einzelne Aufgaben nachjustieren. Das G in GPT steht für generative, das P für pre-trained, das T für Transformer.

  • Ankündigung des Herstellerserreichbar

    AlphaFold: a solution to a 50-year-old grand challenge in biology (externe Seite, deepmind.google)

    deepmind.googlegeprüft 24.09.2026

    Die Ankündigung zum Abschneiden bei CASP14 im November 2020, dem Wettbewerb, in dem Vorhersagen zur Faltung von Eiweißen gegen gemessene Strukturen antreten. Der Beleg dafür, dass derselbe Mechanismus der Aufmerksamkeit auch Fragen außerhalb der Sprache beantwortet. Die Ankündigung beschreibt das System als aufmerksamkeitsbasiertes neuronales Netz, gebaut für diese eine Aufgabe.

  • Originalarbeiterreichbar

    Learning Transferable Visual Models From Natural Language Supervision (externe Seite, arxiv.org)

    arxiv.orggeprüft 24.09.2026

    CLIP, eingereicht am 26.02.2021. Der Beleg dafür, dass Bild und Text lange vor den heutigen multimodalen Modellen in einem gemeinsamen Raum lagen: Ein Bild- und ein Textnetz werden gleichzeitig darauf trainiert, dass zusammengehörige Paare denselben Platz bekommen. Abschnitt 2.3 sagt es wörtlich: „CLIP learns a multi-modal embedding space by jointly training an image encoder and text encoder to maximize the cosine similarity of the image and text embeddings“. Diese Stelle steht im Volltext und ist deshalb ohne hinterlegtes Zitat, der Prüflauf liest die Abstract-Seite.

Tippen Sie los.

↑↓ auswählenEnter öffnenDie Suche läuft im Browser. Nichts wird übertragen.