Originalarbeiterreichbar
Learning Transferable Visual Models From Natural Language Supervision
CLIP, eingereicht am 26.02.2021. Der Beleg dafür, dass Bild und Text lange vor den heutigen multimodalen Modellen in einem gemeinsamen Raum lagen: Ein Bild- und ein Textnetz werden gleichzeitig darauf trainiert, dass zusammengehörige Paare denselben Platz bekommen. Abschnitt 2.3 sagt es wörtlich: „CLIP learns a multi-modal embedding space by jointly training an image encoder and text encoder to maximize the cosine similarity of the image and text embeddings“. Diese Stelle steht im Volltext und ist deshalb ohne hinterlegtes Zitat, der Prüflauf liest die Abstract-Seite.
geprüft 24.09.2026
Worauf sich diese Seite beruft, wörtlich, abgerufen am 06.08.2026:
the simple pre-training task of predicting which caption goes with which image
bestätigt 24.09.2026a dataset of 400 million (image, text) pairs collected from the internet
bestätigt 24.09.2026
KI-GeschichteCLIP im Glossar01 Die Spielarten der KI02 Maschinelles Lernen03 Neuronale Netze und Deep Learning04 Embedding, Bedeutung als Zahlenreihe