Tiefe
Gleiches Kapitel, drei Tiefen. Die Wahl gilt überall und bleibt gespeichert.

GrundlagenVibe-Coding / Agentic EngineeringKapitel 11von 13 im Pfad

Codequalität und Refactoring

Tiefe 1: Überblick · Lesezeit 9 Min. · Stand

Eine Runde endet gut. Der Test läuft grün, der Vorgang ist geschlossen, die Änderung liegt im Zweig. Ungemessen bleibt dabei, in welchem Zustand der Rest des Programms zurückbleibt.

Für diesen Zustand gibt es Zahlen. GitClear wertet Änderungen an Programmcode aus und hat für die Jahre 2023 bis 2026 mehrere Kennzahlen nebeneinandergelegt.

623 million analyzed changes from 2023-2026 (externe Seite, gitclear.com)

Vier Kennzahlen, eine Richtung

Gemessen wirdAusgangswert2026
Doppelte Blöcke je Million geänderter Zeilen40,3 (2023)73,0
Verschobener Code, Anteil der geänderten Zeilen21 % (2022)3,8 %
Methodenaufrufe je tausend geänderter Zeilen343 (2023)223
Änderungen an über ein Jahr altem Code1,7 % (2023)0,46 %

Quelle: GitClear (externe Seite, gitclear.com), Stand der Erhebung Sommer 2026. Die Werte von 2026 sind Zwischenstände des laufenden Jahres.

Ein doppelter Block ist eine Stelle, die es schon einmal gibt: fünf oder mehr aufeinanderfolgende Zeilen, die anderswo gleich stehen. Ihre Zahl hat sich binnen drei Jahren fast verdoppelt, und das ist die Kennzahl mit den handfestesten Folgen. Wer eine der Kopien ändert, muss die anderen finden.

A duplicated block imposes a propagation tax (externe Seite, gitclear.com)

Verschobener Code ist die Gegenkennzahl. Wer zwei ähnliche Stellen zu einer Funktion zusammenzieht, verschiebt Zeilen, statt neue zu schreiben. Ihr Anteil liegt bei weniger als einem Fünftel des Werts von 2022.

Die dritte Zeile misst, wie stark neuer Code an den Bestand anschließt, die vierte, wie oft jemand ältere Stellen überhaupt noch anfasst.

That maintenance work is increasingly not happening. (externe Seite, gitclear.com)

Was Agenten beim Umbauen wirklich tun

Die naheliegende Erklärung wäre, dass Agenten nie aufräumen. Sie stimmt nicht. Eine Erhebung an 15.451 Umbauten in offenen Java-Projekten misst das Gegenteil:

with agents explicitly targeting refactoring in 26.1% of commits (externe Seite, arxiv.org)

Mehr als jeder vierte Commit zielt ausdrücklich auf einen Umbau, und die Messung findet dabei echte Verbesserungen an Klassengröße und Komplexität, klein, aber statistisch belastbar. Der Unterschied steckt in der Art der Eingriffe:

agentic efforts are dominated by low-level, consistency-oriented edits (externe Seite, arxiv.org)

Variablentypen anpassen, Parameter umbenennen, Variablen umbenennen. Was dabei ausbleibt, benennt dieselbe Arbeit:

reflecting a preference for localized improvements over the high-level design changes common in human refactoring (externe Seite, arxiv.org)

Damit passen beide Erhebungen zusammen. Die einzelne Stelle wird sauberer, während der Bauplan liegen bleibt. Zwei gleiche Blöcke zu einer Funktion zusammenzuziehen ist genau so ein Eingriff am Bauplan.

Innerhalb einer Runde ist alles in Ordnung. Über viele Runden hinweg verdoppelt sich die Zahl der doppelten Blöcke. Oben eine einzelne Runde mit grünem Zeichen, unten dieselbe Kennzahl über drei Jahre. EINE RUNDE Test grün Vorgang geschlossen Änderung im Zweig alles in Ordnung ÜBER DREI JAHRE: DOPPELTE BLÖCKE JE MILLION ZEILEN 40,3 73,0 2023 2026 Gestrichelt: die Erhebung nennt zwei Jahreswerte, den Weg dazwischen nicht.

seitlich verschiebbar

Innerhalb einer Runde ist alles grün. Die Kennzahlen, die sich verschlechtern, werden erst über viele Runden hinweg sichtbar.

eigene Darstellung nach GitClear und der Erhebung zum agentischen Refactoring, Stand 03.09.2026

Warum der Aufräumschritt ausfällt

Ein Agent bekommt einen Auftrag und schließt ihn ab. Kein Teil dieses Auftrags lautet, den Bestand kleiner zu machen. Wer den Umbau will, beauftragt ihn gesondert.

Bei OpenAI war diese Arbeit vorher fest eingeplant. Ein Team, das fünf Monate lang ein Produkt ohne handgeschriebene Zeile gebaut hat, beschreibt den Vorher- Zustand so:

Our team used to spend every Friday (20% of the week) cleaning up (externe Seite, openai.com)

Ein Fünftel der Arbeitswoche, als fester Termin. Fällt ein solcher Termin weg, ohne dass ihn etwas ersetzt, verschwindet die Arbeit selbst.

Drei Handgriffe

Der Umbau bekommt einen eigenen Auftrag. Er entsteht selten nebenbei, weil die Runde vorher endet. Ein eigener Durchgang mit dem ausdrücklichen Ziel, doppelte Stellen zusammenzuziehen, ist etwas anderes als der Zusatz „und räum bitte auf“.

Die Prüfung zählt, statt zu fragen. Ein Werkzeug, das doppelte Blöcke oder die Größe einer Datei misst, gibt eine Zahl zurück, die sich mit der von letzter Woche vergleichen lässt. Wie ein solcher Riegel gebaut wird, steht in Kapitel 07.

Der Umbau läuft getrennt von der Aufgabe. Ein Zweig, der eine Funktion ergänzt und gleichzeitig vier Dateien umsortiert, lässt sich nicht mehr beurteilen. Wie sich beides trennen lässt, steht in Kapitel 04.

Die Ebene darunter nimmt die vier Kennzahlen einzeln und zeigt, was sich davon im eigenen Projekt messen lässt.

Quellen

6 Einträge, davon 3 Schlüsselarbeitenalle erreichbar

Erreichbarkeit automatisch geprüft

  • SchlüsselarbeitOriginalarbeiterreichbar

    GitClear, The Maintainability Gap: AI Code Quality in 2026 (externe Seite, gitclear.com)

    gitclear.comgeprüft 24.09.2026

    Die Erhebung, die den Verfall der Wartbarkeit beziffert: 623 Millionen Änderungen aus den Jahren 2023 bis 2026, gemessen an mehreren Signalen, die alle in dieselbe Richtung zeigen. Doppelte Blöcke steigen um 81 Prozent, verschobener Code fällt von 21 auf 3,8 Prozent der geänderten Zeilen, die Verbindung neuen Codes zum Bestand sinkt um 35 Prozent, und die Pflege über ein Jahr alter Stellen geht um 74 Prozent zurück. Zur Einordnung gehört, dass GitClear Kennzahlen dieser Art als Produkt verkauft.

  • SchlüsselarbeitOriginalarbeiterreichbar

    Agentic Refactoring: An Empirical Study of AI Coding Agents (externe Seite, arxiv.org)

    arxiv.orggeprüft 24.09.2026

    Die große Erhebung dazu, wie Agenten umbauen: 15.451 Refactorings aus 12.256 Pull Requests offener Java-Projekte, erschienen am 06.11.2025. Der Befund geht in beide Richtungen. Agenten bauen öfter um als vermutet, in 26,1 Prozent ihrer Commits, und die Messung findet kleine, statistisch belastbare Verbesserungen an Klassengröße und Komplexität. Was sie dabei tun, bleibt flach: Variablentypen ändern, Parameter und Variablen umbenennen. Die Eingriffe am Entwurf, die menschliche Umbauten kennzeichnen, fehlen.

  • SchlüsselarbeitOriginalarbeiterreichbar

    To What Extent Does Agent-generated Code Require Maintenance? An Empirical Study (externe Seite, arxiv.org)

    arxiv.orggeprüft 24.09.2026

    Die Anschlussfrage an das Schreiben, nämlich was danach mit dem Code geschieht. Über 1.000 Dateien und rund 3.200 Änderungen aus 100 verbreiteten Projekten, erschienen am 07.05.2026. Von Agenten geschriebene Dateien werden seltener gepflegt als von Menschen geschriebene, die häufigste Änderung daran ist eine Erweiterung, während menschlicher Code vor allem Fehlerkorrekturen bekommt. Die Pflege selbst übernehmen zum größten Teil Menschen.

  • Originalarbeiterreichbar

    OpenAI, Harness engineering: leveraging Codex in an agent-first world (externe Seite, openai.com)

    openai.comgeprüft 24.09.2026

    Ryan Lopopolo berichtet am 11. Februar 2026 über ein Team, das fünf Monate lang ein Produkt gebaut hat, ohne eine Zeile von Hand zu schreiben. Der Wert des Berichts liegt in den Nebenwirkungen, die er offenlegt: Der Agent wiederholt vorhandene Muster einschließlich der schlechten, das Team verbrachte einen Tag der Woche mit Aufräumen, bis es die Regeln maschinell verankerte. Auch das Datum zählt, denn der Begriff Harness stand sechs Tage vorher zum ersten Mal geschrieben.

  • Originalarbeiterreichbar

    Anthropic, claude-code-security-review (externe Seite, github.com)

    github.comgeprüft 24.09.2026

    Anthropics eigene GitHub-Aktion, die jeden Pull Request von Claude auf Schwachstellen ansehen lässt. Aufschlussreich ist der Satz über sie selbst: Nach Angabe des Herstellers ist sie gegen Prompt Injection ungehärtet und soll nur auf vertrauenswürdige Pull Requests angewendet werden. Die Vorzüge gegenüber musterbasierten Werkzeugen stehen daneben als Aufzählung ohne Messung.

  • Originalarbeiterreichbar

    Anthropic, Automated Security Reviews in Claude Code (externe Seite, support.claude.com)

    support.claude.comgeprüft 24.09.2026

    Die Anleitung zum Befehl /security-review und zur zugehörigen GitHub-Aktion. Sie beschreibt, was der Lauf tut, und benennt seine Grenze: Solche Prüfungen ergänzen die vorhandene Sicherheitspraxis und die Durchsicht durch Menschen.

Tippen Sie los.

↑↓ auswählenEnter öffnenDie Suche läuft im Browser. Nichts wird übertragen.