Originalarbeiterreichbar
Gemini Embedding 2: A Native Multimodal Embedding Model from Gemini
Die technische Arbeit zum ersten Embedding-Modell, das Text, Bild, Ton und Video in denselben Zahlenraum legt, eingereicht am 26.05.2026. Beschreibt das kontrastive Training über mehrere Stufen und die Messungen für die Suche innerhalb und über Medienarten hinweg.
geprüft 24.09.2026
Worauf sich diese Seite beruft, wörtlich, abgerufen am 28.07.2026:
a native multimodal embedding model that allows embedding video, audio, image, and text modalities in a unified representation space
bestätigt 24.09.2026
CLIP im GlossarContrastive Learning im Glossar04 Embedding, Bedeutung als Zahlenreihe