Tiefe
Gleiches Kapitel, drei Tiefen. Die Wahl gilt überall und bleibt gespeichert.

GrundlagenKI-WissenKapitel 14von 14 im Pfad

Physical AI

Tiefe 1: Überblick · Lesezeit 8 Min. · Stand

Alles, was auf dieser Seite bisher vorkam, spielt sich auf einem Bildschirm ab. Ein Modell bekommt Text, Bilder oder Ton und gibt Text, Bilder oder Ton zurück. Physical AI meint den Fall, in dem am Ausgang eine Bewegung steht.

Ein Greifarm, der ein Reagenzglas umsetzt. Ein Fahrzeug, das bremst. Ein Laufroboter, der eine Kiste hebt. Der Unterschied zum Chatfenster liegt darin, dass ein Fehler hier etwas anfasst.

Wo der Begriff herkommt

Populär gemacht hat ihn NVIDIA, und die knappste Bestimmung steht in einer Ankündigung vom Januar 2026:

models that understand the real world, reason and plan actions (externe Seite, nvidianews.nvidia.com)

Drei Teile also: die Welt verstehen, überlegen, Handlungen planen. Derselbe Text schiebt einen Vergleich hinterher, den man im Ohr behalten sollte, weil er von einem Hersteller stammt, der die Rechenkarten dazu verkauft:

The ChatGPT moment for robotics is here. (externe Seite, nvidianews.nvidia.com)

Auf Deutsch schreibt dasselbe Haus physische KI (externe Seite, blogs.nvidia.de), in Überschrift und Einleitung. In der Wirtschaftspresse lesen Sie beides.

Warum Bewegung schwerer ist als Text

Die Fähigkeiten von Sprachmodellen wachsen mit der Menge an Text, die es im Netz gibt. Für Bewegung gibt es diesen Vorrat nicht. Physical Intelligence, eine Firma, die genau daran arbeitet, sagt es so:

There is no such treasure trove of robot data, so to enable a robot to learn a new skill, large amounts of data need to be collected with that particular robot and for that particular application. (externe Seite, pi.website)

Jede Fähigkeit muss also mit genau diesem Roboter und für genau diese Aufgabe erhoben werden. Wer eine Million Beispiele braucht und sie einzeln von Hand aufnehmen muss, kommt nicht weit.

Dazu kommt eine Umkehrung, die seit den achtziger Jahren bekannt ist und die dieselbe Firma auf ihren Fall münzt:

folding a shirt or cleaning up a table requires solving some of the most difficult engineering problems ever conceived (externe Seite, pi.website)

Schach und Proteinfaltung gelten als gelöst. Ein Hemd zusammenlegen gilt als schwer. Was ein Kind nebenbei kann, ist für eine Maschine die härtere Aufgabe.

Die Bauform hat einen Namen

Was heute gebaut wird, heißt Vision-Language-Action-Modell, kurz VLA. Google DeepMind beschreibt es in einem Satz:

Our most advanced vision-language-action model (VLA) that converts vision and language input into motor control, enabling a robot to take action (externe Seite, deepmind.google)

Hinein gehen also Kamerabilder und ein Satz in normaler Sprache. Heraus kommen Steuerbefehle für Gelenke und Greifer. Es ist derselbe Aufbau wie bei einem Sprachmodell mit Bildeingang aus Grundkurs, Kapitel 13, mit einer weiteren Ausgabeform hinten dran.

Ein Beispiel dieser Bauform steht schon in diesem Pfad: Das Robotermodell von Generalist AI in Kapitel 01 nimmt Video, Ton und Gelenkstellungen entgegen und gibt hundert Steuerbefehle je Sekunde aus.

Wo geübt wird, wenn die Welt zu teuer ist

Aus dem Datenproblem folgt die zweite Hälfte des Gebiets. Wenn echte Versuche zu teuer sind, wird woanders geübt: in einer Simulation oder in einem Modell, das die Umgebung selbst vorhersagt. Wie das geht und wo es aufhört, steht in Kapitel 09.

Für dieses Kapitel reicht die Aufgabenteilung: Ein Weltmodell sagt vorher, was passieren würde. Ein VLA-Modell entscheidet, was zu tun ist. Geübt wird in einer Nachbildung, gehandelt wird mit dem Modell.

Wo solche Systeme heute wirklich arbeiten

Die sichtbaren Beispiele sind Laufroboter auf Messeständen. Die Belege, die sich heute nachlesen lassen, kommen aus Laboren und Fertigungsbetrieben, und die Aufgabe dort ist unspektakulär: Geräte verschiedener Hersteller sprechen verschiedene Sprachen, und jemand muss übersetzen.

Anthropic hat dafür im August 2026 einen offenen Standard geöffnet, den Model Hardware Standard. Er gibt Agenten einen einheitlichen Zugang zu Mikroskopen, Pipettierrobotern und Greifarmen:

MHS reduces this integration work to hours or minutes. (externe Seite, anthropic.com)

Vorher dauerte dasselbe Wochen bis Monate. Was hier gebaut wird, ist die physische Entsprechung zu dem, was das Model Context Protocol für Software tut, und das steht in Grundkurs, Kapitel 09.

Was die Anbieter selbst einschränken

Der klarste Satz über die Grenze dieser Systeme stammt vom Anbieter, dessen Modell darin steckt:

As a large language model, Claude learns about the physical world through text and images, meaning its spatial and physical reasoning have limitations that still require expert oversight. (externe Seite, anthropic.com)

Ein Modell, das die Welt aus Text und Bildern kennt, hat sie nie angefasst. Bei Genentech hielt Claude eine Schaumbildung in einer Probe für einen Softwarefehler und wiederholte den Vorgang, was den Schaum vermehrte. Ein Mensch musste erklären, dass hier die Physik im Weg stand.

Woran Sie ein solches System festmachen

Fragen Sie, was am Ausgang steht. Kommt dort Text heraus, den ein Programm danach in Bewegung übersetzt, oder Steuerbefehle direkt aus dem Modell? Das ist der Unterschied zwischen einem Sprachmodell mit Roboteranschluss und einem VLA-Modell.

Fragen Sie, wo die Trainingsdaten herkommen. Aufgenommene Bewegung, Video aus dem Netz oder Simulation. Jede der drei Quellen hat eine andere Lücke zur Wirklichkeit.

Fragen Sie, wer gemessen hat. In diesem Gebiet stammen fast alle Zahlen vom Hersteller selbst, und unabhängige Wiederholungen sind die Ausnahme.

Und fragen Sie nach dem Menschen daneben. Solange die Anbieter Fachaufsicht verlangen, ist ein solches System ein Werkzeug mit Bediener.

Quellen

10 Einträge, davon 1 Schlüsselarbeitalle erreichbar

Erreichbarkeit automatisch geprüft

  • SchlüsselarbeitOriginalarbeiterreichbar

    π0: A Vision-Language-Action Flow Model for General Robot Control (externe Seite, arxiv.org)

    arxiv.orggeprüft 24.09.2026

    Black und 23 Mitautoren stellen am 31.10.2024 ein Grundmodell für Roboter vor, das über mehrere Bauformen hinweg dieselbe Steuerung fährt, von Einzelarm bis mobiler Greifer. Erschienen bei der Konferenz Robotics: Science and Systems 2025 und damit begutachtet, was in diesem Gebiet die Ausnahme ist. Beschreibt das Verfahren, ein vortrainiertes Bild-Sprach-Modell um einen fortlaufenden Bewegungsausgang zu erweitern.

  • Ankündigung des Herstellerserreichbar

    NVIDIA Releases New Physical AI Models as Global Partners Unveil Next-Generation Robots (externe Seite, nvidianews.nvidia.com)

    nvidianews.nvidia.comgeprüft 24.09.2026

    NVIDIAs CES-Ankündigung vom 05.01.2026 bestimmt den Begriff in einem Halbsatz und nennt dazu, wer darauf baut: Boston Dynamics, Caterpillar, Franka Robotics, LG Electronics, NEURA Robotics. Vorgestellt werden Cosmos, das VLA-Modell GR00T N1.6, der Prüfstand Isaac Lab-Arena und das Jetson-T4000-Modul. Eine Herstellerankündigung, und derselbe Hersteller verkauft die Rechenkarten dazu.

  • Ankündigung des Herstellerserreichbar

    π0: Our First Generalist Policy (externe Seite, pi.website)

    pi.websitegeprüft 24.09.2026

    Der Begleittext von Physical Intelligence zur Arbeit, und die deutlichste Beschreibung des Datenproblems der Robotik: Für Sprache liegt das Netz bereit, für Bewegung gibt es nichts Vergleichbares. Nennt acht Roboterbauformen im Training, bis zu 50 Steuerbefehle je Sekunde und ein Ausgangsmodell mit 3 Milliarden Parametern. Die Vergleichswerte gegen OpenVLA und Octo hat das Haus selbst erhoben.

  • Dokumentationerreichbar

    Google DeepMind, Gemini Robotics (externe Seite, deepmind.google)

    deepmind.googlegeprüft 24.09.2026

    Die Modellseite von Google DeepMind, laufend überschrieben und ohne Datum je Fassung. Sie erklärt die Bauform Vision-Language-Action in einem Satz und trennt sie vom Modell für räumliches Denken. Ohne hinterlegtes Zitat wäre ein Verweis darauf eine Aussage über den heutigen Stand.

  • Ankündigung des Herstellerserreichbar

    Previewing the Model Hardware Standard (externe Seite, anthropic.com)

    anthropic.comgeprüft 24.09.2026

    Anthropic-Ankündigung des Model Hardware Standard, Beleg für Funktionsweise und Einsatzbereiche der Laborgeräte-Steuerung.

  • Ankündigung des Herstellerserreichbar

    NVIDIA und weltweit führende Robotik-Unternehmen bringen physische KI in die reale Welt (externe Seite, blogs.nvidia.de)

    blogs.nvidia.degeprüft 24.09.2026

    Die deutsche Fassung der GTC-Ankündigung vom 17.03.2026, und hier der Beleg für ein Wort: NVIDIA schreibt in Überschrift und Einleitung „physische KI“ und benutzt „physikalisch“ nur für die Genauigkeit einer Simulation. Dazu die Namen der Industrieroboter-Hersteller, die Omniverse und Isaac in ihre Werkzeuge einbauen, darunter KUKA, ABB, FANUC und YASKAWA.

  • Ankündigung des Herstellerserreichbar

    Gemini Robotics brings AI into the physical world (externe Seite, deepmind.google)

    deepmind.googlegeprüft 24.09.2026

    Google DeepMind stellt am 12.03.2025 zwei Modelle vor und führt dabei die Bauform Vision-Language-Action als eigene Kategorie ein: ein Sprachmodell, das Bewegung als zusätzliche Ausgabeform bekommt. Nennt Apptronik als Partner für humanoide Roboter, den Datensatz ASIMOV für Sicherheitsmessungen und eine Verdopplung auf einem Verallgemeinerungs-Maßstab. Diese Zahl stammt aus dem eigenen technischen Bericht.

  • Ankündigung des Herstellerserreichbar

    NVIDIA Launches Cosmos 3, the Open Frontier Foundation Model for Physical AI (externe Seite, nvidianews.nvidia.com)

    nvidianews.nvidia.comgeprüft 24.09.2026

    Cosmos 3, vorgestellt am 31.05.2026 auf der GTC Taipei. Die Ankündigung benennt das Grundproblem des Gebiets in einem Satz, nämlich verallgemeinern mit wenig Trainingsmaterial, und beschreibt, wozu ein Weltmodell darin dient. Die Rangplätze auf den genannten Ranglisten und die Zeitersparnis von Monaten auf Tage sind Eigenangaben ohne unabhängige Nachmessung.

  • Originalarbeiterreichbar

    A Survey: Learning Embodied Intelligence from Physical Simulators and World Models (externe Seite, arxiv.org)

    arxiv.orggeprüft 24.09.2026

    Eine Übersichtsarbeit von 18 Autoren, eingereicht am 01.07.2025 und zuletzt am 03.09.2025 überarbeitet. Sie ordnet das Gebiet nach den zwei Grundlagen, auf denen es steht: der Simulator außen, das Weltmodell innen. Ein Preprint ohne Begutachtung, brauchbar für die Einordnung des Feldes und nicht als Messung.

  • Originalarbeiterreichbar

    Verordnung (EU) 2023/1230 über Maschinen (externe Seite, eur-lex.europa.eu)

    eur-lex.europa.eugeprüft 24.09.2026

    Die Maschinenverordnung löst die Maschinenrichtlinie von 2006 ab und gilt ab dem 14.01.2027. Neben der KI-Verordnung ist sie das zweite Gesetz, das eine lernende Maschine trifft: Anhang I führt Sicherheitsbauteile mit selbstentwickelndem Verhalten als eigene Klasse, die Risikobeurteilung muss die Lernphase abdecken, und ein Erwägungsgrund grenzt fest programmierte Software davon ab. Der vielfach genannte 20.01.2027 kommt im Verordnungstext nicht vor.

Tippen Sie los.

↑↓ auswählenEnter öffnenDie Suche läuft im Browser. Nichts wird übertragen.