ByteDance und die Renmin University haben mit iLLaDA ein neues Sprachmodell mit 8 Milliarden Parametern vorgestellt. Laut iLLaDA-Paper arbeitet es mit einem Diffusionsansatz und misst sich in der Basisversion direkt mit Qwen2.5 7B. Text entsteht dabei nicht klassisch Wort für Wort von links nach rechts. Stattdessen startet iLLaDA dem Paper zufolge mit maskierten Tokens und verfeinert sie parallel über mehrere Schritte. Das Modell nutzt so bidirektionalen Kontext und kann Informationen von beiden Seiten eines Satzes gleichzeitig einbeziehen.
iLLaDA-Base im direkten Vergleich mit Qwen2.5 7B
Im Schnitt der Benchmarks kommt iLLaDA-Base laut iLLaDA-Paper auf 63,9 Punkte, Qwen2.5 7B auf 63,3. Der Vorsprung zeigt sich unter anderem in mehreren Wissens- und Reasoning-Tests: Auf MMLU erreicht iLLaDA laut Paper 74,8 statt 71,9 Punkte, auf BBH 71,3 statt 63,9, auf ARC-C 60,8 statt 51,5 und auf GSM8K 81,9 statt 78,9.
Aber eben nicht überall.
Bei Mathematik- und Coding-Aufgaben liegt Qwen2.5 7B laut iLLaDA-Paper teils weiter vorne. Trotzdem machen die Ergebnisse klar, dass ein Diffusionsansatz bei den Grundfähigkeiten nicht automatisch schlechter abschneiden muss.
12 Billionen Token als wichtiger Faktor
Ein wesentlicher Grund für diesen Sprung dürfte laut iLLaDA-Paper die breitere Trainingsbasis sein. iLLaDA wurde demnach von Grund auf mit 12 Billionen Token trainiert, das Vorgängermodell LLaDA mit 2,3 Billionen Token. Anschließend folgte laut Paper noch ein Fine-Tuning über 12 Epochen.
Im Vergleich zu LLaDA nennen die Forscher im iLLaDA-Paper unter anderem ein Plus von 21,6 Punkten auf BBH. Das legt nahe, dass nicht allein das Diffusionsprinzip den Ausschlag gibt, sondern auch das sehr viel umfangreichere Training hinter dem Leistungssprung steckt.
Instruct-Version noch hinter Qwen2.5 7B Instruct
Weniger eindeutig fällt das Bild bei iLLaDA-Instruct aus. Diese Variante bleibt laut iLLaDA-Paper hinter Qwen2.5 7B Instruct zurück, vor allem bei Mathematik und Programmierung. Die Autoren schreiben im Paper, dass Qwen2.5 hier wohl auch von zusätzlicher Ausrichtung durch Verstärkungslernen profitiert, die iLLaDA bisher noch nicht bekommen hat.
Das nimmt der starken Basisversion nichts. Es markiert aber die aktuelle Grenze: Ein gutes Grundmodell ist noch kein fertiges Produkt für den Alltag.
Vergleich mit Dream 7B und DiffusionGemma
iLLaDA schlägt laut iLLaDA-Paper außerdem Dream 7B, ein anderes Diffusions-Sprachmodell. Im Durchschnitt kommt iLLaDA auf 63,9 Punkte, Dream 7B auf 61,4, obwohl Dream auf einem Qwen2.5-Checkpoint basiert. Nur bei einigen Coding-Benchmarks hat Dream laut Paper leichte Vorteile.
Spannend ist auch der Unterschied zu Googles DiffusionGemma. Dort liegt der Schwerpunkt vor allem auf Geschwindigkeit. Berichten zufolge läuft Googles DiffusionGemma etwa viermal schneller, bleibt bei der Qualität aber hinter einem ähnlich großen autoregressiven Gemma-Modell zurück. iLLaDA setzt laut iLLaDA-Paper dagegen stärker auf Qualität und wurde als Dense-Modell mit 8 Milliarden Parametern komplett neu trainiert.
Die Veröffentlichung sendet damit ein ziemlich deutliches Signal: Diffusion ist bei Sprachmodellen längst mehr als nur ein Experiment. Modell und Code stehen bereits auf GitHub bereit. Die größte praktische Hürde bleibt die Inferenz, denn der Ansatz braucht nicht nur einen einzelnen Durchlauf, sondern mehrere Verfeinerungsschritte. Genau an diesem Punkt wird sich zeigen, ob aus dem Forschungserfolg am Ende auch ein breiter Praxiseinsatz wird.