CodeMidas baut 5.545 Trainingsaufgaben aus Quellcode
21. September 2026
CodeMidas erzeugt ausführbare Lernaufgaben direkt aus 3.185 Codebasen. Die Autoren melden Zuwächse von 8,5 bis 17 Prozent auf drei Coding-Benchmarks — mit wichtigen offenen Fragen.
Worum es geht
Ein am 21. September 2026 veröffentlichtes Paper stellt CodeMidas vor: eine Pipeline, die aus vorhandenem Quellcode ausführbare Trainingsumgebungen für Coding-Agenten erzeugt. Das Ergebnis umfasst laut den Autoren 5.545 Aufgaben aus 3.185 Open-Source-Codebasen, verteilt auf 23 Programmiersprachen und 15 technische Bereiche.
Das ist relevant, weil bisherige Datensätze für Software-Agenten oft auf gut dokumentierte Issues und die dazugehörigen Commits angewiesen sind. Viele echte Projekte besitzen diese saubere Verbindung nicht. CodeMidas versucht, stattdessen die bereits implementierte Funktionalität im Code als Ausgangspunkt zu nutzen.
Was CodeMidas tatsächlich macht
Die Pipeline lässt Agenten eine Codebasis erkunden und daraus eine überprüfbare Verhaltensbeschreibung ableiten. Anschließend erzeugen sie Tests, die gegen den ursprünglichen Code ausgeführt werden. Weitere Lösungsläufe prüfen, ob eine Aufgabe tatsächlich lösbar ist und ob die Tests brauchbar zwischen funktionierenden und fehlerhaften Lösungen unterscheiden.
Mit den gefilterten Aufgaben trainierten die Forscher MiMo-V2.5 per Group Relative Policy Optimization. Das Paper meldet Verbesserungen auf fünf Benchmarks. Besonders genannt werden 11,7 Prozent bei DeepSWE, 17 Prozent bei ProgramBench und 8,5 Prozent bei Terminal-Bench v2.1. Diese Angaben sind relative Leistungszuwächse aus dem Paper; absolute Ausgangswerte und praktische Kosten entscheiden mit darüber, wie groß der Nutzen tatsächlich ist.
Warum das wichtig ist
Gute Aufgaben sind ein Engpass beim Training von Coding-Agenten. Issues und Commits bilden nur einen Ausschnitt der Softwareentwicklung ab und bevorzugen Projekte mit sorgfältiger Dokumentation. Wenn vorhandener Code selbst zur Quelle ausführbarer Aufgaben wird, wächst der mögliche Trainingsbestand erheblich.
Der Ansatz kann außerdem vielfältigere Fähigkeiten erfassen: das Erkunden unbekannter Repositories, das Ableiten von Verhalten, das Schreiben von Tests und die Selbstprüfung einer Lösung. Für Entwickler ist dabei nicht nur der gemeldete Benchmarkgewinn interessant. Entscheidend ist die Idee, dass Trainingsaufgaben durch Ausführung überprüfbar bleiben, statt allein von Textbeschreibungen oder Modellbewertungen abzuhängen.
Einfach erklärt
Statt einem Lehrling nur alte Reparaturzettel zu geben, lässt CodeMidas ihn funktionierende Maschinen untersuchen. Er soll herausfinden, was eine Maschine tut, einen Prüfstand dafür bauen und anschließend eine Reparaturaufgabe formulieren. Erst wenn mehrere Probeläufe zeigen, dass der Prüfstand echte Fehler erkennt, kommt die Aufgabe in den Unterricht.
Praktisches Beispiel
Angenommen, eine Bibliothek enthält 400 Funktionen, aber nur 25 gut beschriebene Issues. CodeMidas könnte eine Funktion zur Datumsvalidierung ausführen, gültige und ungültige Eingaben ableiten und daraus Tests erstellen. Ein Trainingsagent erhält dann eine veränderte Version mit einem Fehler bei Schaltjahren und muss sie reparieren.
Wenn wiederholte Lösungsläufe zeigen, dass korrekte Reparaturen den Test bestehen und oberflächliche Änderungen scheitern, bleibt die Aufgabe im Datensatz. Auf diese Weise könnten aus einem schlecht dokumentierten Repository mehr prüfbare Übungen entstehen als aus seiner Issue-Historie allein.
Einordnung und Grenzen
Erstens stammen die Leistungszahlen von den Autoren und brauchen unabhängige Replikation. Relative Zuwächse ohne vollständigen Blick auf Ausgangswerte, Streuung und Rechenbudget können eindrucksvoller wirken, als sie im Betrieb sind. Zweitens veröffentlicht der Abstract keine klare Lizenz oder vollständige Freigabeplanung für den erzeugten Datensatz. Das begrenzt die sofortige Nachnutzung.
Drittens ist vorhandener Code nicht automatisch korrekt oder sicher. Eine Pipeline kann veraltetes Verhalten, versteckte Fehler oder schlechte Entwurfsmuster in Aufgaben verwandeln. Hinzu kommen Kosten: Mehrere Agentenläufe zur Erkundung, Testerzeugung und Filterung verbrauchen Rechenleistung. CodeMidas zeigt deshalb einen vielversprechenden Weg zur Datenerzeugung, aber noch keinen belegten Ersatz für menschlich kuratierte Aufgaben und reale Softwaretests.
SEO- und GEO-Schlüsselbegriffe
CodeMidas, Coding-Agenten, Reinforcement Learning, MiMo-V2.5, DeepSWE, ProgramBench, Terminal-Bench, ausführbare Tests, Trainingsdaten, Open-Source-Code, Softwareentwicklung
💡 Im Klartext
CodeMidas macht aus vorhandenem Quellcode automatisch überprüfbare Übungen für Coding-Agenten. Die ersten Benchmarkwerte sind positiv, doch Datensatzfreigabe, Kosten und unabhängige Bestätigung bleiben offen.
Wichtigste Erkenntnisse
- →CodeMidas erzeugte 5.545 Aufgaben aus 3.185 Open-Source-Codebasen.
- →Die Codebasen decken 23 Programmiersprachen und 15 technische Bereiche ab.
- →Das Paper meldet Zuwächse von 11,7 Prozent bei DeepSWE, 17 Prozent bei ProgramBench und 8,5 Prozent bei Terminal-Bench v2.1.
- →Ausführbare Tests und wiederholte Lösungsläufe filtern ungeeignete Aufgaben.
- →Unabhängige Replikation, Lizenz und Rechenkosten bleiben offene Punkte.
Häufige Fragen
Was ist CodeMidas?
CodeMidas ist eine Forschungspipeline, die aus vorhandenem Quellcode ausführbare Trainingsaufgaben für Coding-Agenten erzeugt.
Sind die Benchmarkzuwächse unabhängig bestätigt?
Nein. Die genannten Werte stammen aus dem neuen Paper und brauchen unabhängige Replikation.
Ist der Datensatz frei verfügbar?
Der Abstract nennt keine klare Lizenz oder vollständige Freigabeplanung für den erzeugten Datensatz.