Originalarbeiterreichbar
Simple and Controllable Music Generation
Jade Copet und Mitautoren stellen im Juni 2023 MusicGen vor, das Verfahren hinter der Musikerzeugung aus einem Textauftrag. Es fällt aus der Reihe der übrigen Medienmodelle: Wo Bild und Video über Diffusion entstehen, arbeitet dieses Modell wie ein Sprachmodell über Token, nur dass die Token verdichtete Musik bezeichnen statt Wortteile. Der zweite Punkt der Arbeit ist die Vereinfachung, denn frühere Systeme brauchten mehrere hintereinandergeschaltete Modelle.
geprüft 24.09.2026
Worauf sich diese Seite beruft, wörtlich, abgerufen am 05.09.2026:
We introduce MusicGen, a single Language Model (LM) that operates over several streams of compressed discrete music representation, i.e., tokens.
bestätigt 24.09.2026eliminates the need for cascading several models
bestätigt 24.09.2026