NachschlagenQuellenregister

SchlüsselarbeitOriginalarbeiterreichbar

Evaluating Large Language Models Trained on Code

arxiv.org (externe Seite)

Die Arbeit von 2021, die HumanEval einführt und damit den anderen Zuschnitt der Code-Messung: eine Funktion mit Beschreibung, entschieden über die Frage, ob sie das Richtige tut. Zwei Zahlen daraus sind bis heute nützlich als Ausgangswert, nämlich 28,8 Prozent im ersten Anlauf und 70,2 Prozent bei hundert Versuchen je Aufgabe. Die zweite Zahl sagt zugleich, was ein einzelner Anlauf wert ist.

geprüft 24.09.2026

Worauf sich diese Seite beruft, wörtlich, abgerufen am 05.09.2026:

  • a new evaluation set we release to measure functional correctness for synthesizing programs from docstringsbestätigt 24.09.2026
  • our model solves 28.8% of the problems, while GPT-3 solves 0% and GPT-J solves 11.4%.bestätigt 24.09.2026
  • we find that repeated sampling from the model is a surprisingly effective strategy for producing working solutions to difficult prompts.bestätigt 24.09.2026

15 Wofür man ein Sprachmodell benutzt

Alle Quellen

Tippen Sie los.

↑↓ auswählenEnter öffnenDie Suche läuft im Browser. Nichts wird übertragen.