NachschlagenQuellenregister

Originalarbeiterreichbar

V-JEPA 2: Self-Supervised Video Models Enable Understanding, Prediction and Planning

arxiv.org (externe Seite)

Assran und Mitautoren zeigen am 11.06.2025 den dritten Weg zu einem Weltmodell: aus einer Million Stunden Netzvideo, ergänzt um weniger als 62 Stunden Robotermaterial. Spielumgebungen und erzeugtes Video kommen dabei nicht vor. Das Ergebnis steuert Greifarme in zwei fremden Laboren ohne Training vor Ort. Die Zahlen stammen von den Autoren, eine unabhängige Wiederholung liegt nicht vor.

geprüft 24.09.2026

Worauf sich diese Seite beruft, wörtlich, abgerufen am 05.09.2026:

  • A major challenge for modern AI is to learn to understand the world and learn to act largely by observation.bestätigt 24.09.2026
  • on a video and image dataset comprising over 1 million hours of internet video.bestätigt 24.09.2026
  • using less than 62 hours of unlabeled robot videos from the Droid dataset.bestätigt 24.09.2026
  • We deploy V-JEPA 2-AC zero-shot on Franka arms in two different labs and enable picking and placing of objects using planning with image goals.bestätigt 24.09.2026

09 Weltmodelle

Alle Quellen

Tippen Sie los.

↑↓ auswählenEnter öffnenDie Suche läuft im Browser. Nichts wird übertragen.