Originalarbeiterreichbar
Textbooks Are All You Need
Gunasekar und Mitautoren bei Microsoft zeigen am 20.06.2023, dass sortierte Trainingsdaten einen Teil der Modellgröße ersetzen. Ihr Modell mit 1,3 Milliarden Parametern entstand in vier Tagen auf acht Rechenkarten und erreicht 50,6 Prozent auf HumanEval. Die Arbeit misst allein Code, also eine eng umrissene Aufgabe, und ein Teil ihrer Trainingsdaten stammt aus einem größeren Modell. Beides gehört zu jeder Übertragung auf andere Gebiete dazu.
geprüft 24.09.2026
Worauf sich diese Seite beruft, wörtlich, abgerufen am 04.09.2026:
phi-1 is a Transformer-based model with 1.3B parameters, trained for 4 days on 8 A100s
bestätigt 24.09.2026Despite this small scale, phi-1 attains pass@1 accuracy 50.6% on HumanEval and 55.5% on MBPP
bestätigt 24.09.2026