⏳ Curating articles…
Künstliche Intelligenz 4 min read 1h ago

GLM-5.3 jetzt als Open-Weight verfügbar

  • Z.ai hat GLM-5.3 als Open-Weight-Modell freigegeben; alle Verbesserungen gegenüber GLM-5.2 gehen ausschließlich auf Post-Training zurück, das Basismodell ist unverändert.
  • Das Modell beansprucht die Spitzenposition unter Open-Weight-Modellen auf Terminal Bench 3.0 und verdoppelt nach Entwicklerangaben den GLM-5.2-Wert auf Exploitation-Benchmarks.
  • Cyber-Fähigkeiten wuchsen beim Skalieren des Post-Trainings nach eigenen Angaben schneller als erwartet – unabhängige Überprüfungen dieser Behauptung stehen noch aus.
GLM-5.3 jetzt als Open-Weight verfügbar

Das KI-Forschungslabor Z.ai hat sein Sprachmodell GLM-5.3 als Open-Weight-Modell veröffentlicht. Alle Leistungsverbesserungen gegenüber dem Vorgänger GLM-5.2 gehen laut den Entwicklern ausschließlich auf Post-Training zurück – das zugrundeliegende Basismodell ist identisch.

Coding-Leistung: 50 Prozent Steigerung gegenüber GLM-5.2

Z.ai gibt an, GLM-5.3 sei das leistungsfähigste Open-Weight-Modell im Bereich Coding. Auf dem hauseigenen Z.ai Code Bench soll es eine Steigerung von 50 Prozent gegenüber GLM-5.2 erzielen. Auf öffentlichen Benchmarks wie Terminal Bench 3.0 und Agents' Last Exam (ALE-CLI) erreiche das Modell nach Unternehmensangaben den Open-Source-Stand der Technik. Ein direkter Vergleich mit anderen führenden Modellen – darunter Kimi K3, DeepSeek-V4 Pro, Qwen3.8-Max, Claude Opus 4.8 sowie GPT-5.6 – ist in der nachfolgenden Tabelle ablesbar. Auch andere Open-Weight-Ansätze drängen auf Coding-Benchmarks nach vorn.

BenchmarkGLM-5.3GLM-5.2Kimi K3DeepSeek-V4 Pro-0813Qwen3.8-MaxOpus 4.8Fable 5GPT-5.6 Sol
Terminal Bench 2.188,281,088,387,986,685,088,088,8
Terminal Bench 3.028,34,617,421,133,734,6
DeepSWE (v1.1)66,946,267,562,756,658,069,772,7
NL2Repo58,048,958,061,155,969,7
ProgramBench (Almost Solved)19,09,517,510,515,533,023,0
FrontierSWE78,167,566,588,2
SWE-Marathon (v1.1)42,519,448,148,833,142,5
PostTrainBench39,831,732,032,941,836,2
CyberGym84,577,280,083,378,578,183,883,6
ExploitGym (2h / 6h)105 / 13029 / 3936 / 7014 / 2680 / 120181 / 247216 / 293
ExploitBench54,424,432,228,840,078,076,5
Toolathlon Verified73,059,976,574,172,576,274,774,9
AutomationBench (v1.0.6)48,226,246,743,239,841,046,245,8
Agents' Last Exam (ALE-CLI)28,523,827,625,727,025,723,828,6
HLE w/ Tools62,554,759,860,056,257,963,964,5
GDPval-AA v217691508168215901739158817431730

Emergente Cyber-Fähigkeiten: schneller als erwartet

Ein auffälliger Befund der Entwickler betrifft Sicherheits- und Angriffsfähigkeiten: Im Verlauf des Post-Trainings seien Cyber-Kompetenzen schneller gewachsen als vorhergesagt. Auf dem CyberGym-Benchmark zur Schwachstellenerkennung erreiche GLM-5.3 nach eigenen Angaben den aktuellen Stand der Technik. Besonders ausgeprägt seien die Fortschritte bei Exploitation-Benchmarks, wo das Modell gegenüber GLM-5.2 mehr als das Doppelte erziele. Die Entwickler halten dies ausdrücklich für ein emergentes Phänomen des Skalierens, ohne es weiter einzuordnen oder Sicherheitsmaßnahmen zu benennen. Das wachsende Feld der Open-Weight-Modelle bringt derzeit in rascher Folge neue Ansätze hervor.

Advertisement
Ad Unit · 728×90 / Responsive

Deployment und Konfiguration

GLM-5.3 lässt sich über mehrere Inferenz-Frameworks lokal betreiben, darunter SGLang, vLLM, TokenSpeed, Transformers, KTransformers und Unsloth. Für die Ascend-NPU-Plattform werden vLLM-Ascend, xLLM und SGLang unterstützt. Das Modell bietet über den Parameter reasoning_effort drei Denk-Budget-Stufen (low, high, max); die Voreinstellung ist max. Für Chat-Szenarien empfehlen die Entwickler, clear_thinking=true explizit zu übergeben.

Die veröffentlichten Benchmark-Ergebnisse stammen durchgehend aus Messungen unter kontrollierten Bedingungen, die im technischen Bericht des GLM-5-Teams detailliert beschrieben sind. Unabhängige Nachprüfungen durch Dritte lagen zum Zeitpunkt der Veröffentlichung nicht vor. Damit bleibt der Status einiger Leistungsbehauptungen – insbesondere jener zur Cyber-Exploit-Überlegenheit – vorerst unbestätigt.

Themen

KI-BenchmarksKI-CybersicherheitsfähigkeitenOpen-Weight-KI-Modelle

Organisationen

Z.ai

Ereignisse

GLM-5.3-Veröffentlichung
Advertisement
Ad Unit · 300×250 / Responsive

More in Künstliche Intelligenz

Read in another language

← Home