⏳ Curating articles…
Inteligência Artificial 4 min read 1h ago

GLM-5.3 chega como modelo open-weight

  • O GLM-5.3 é lançado como modelo open-weight com melhora de 50% em codificação sobre o GLM-5.2, utilizando a mesma base com ganhos exclusivamente do pós-treinamento.
  • Capacidades cibernéticas ofensivas emergiram durante o escalonamento mais rapidamente do que a equipe esperava, com o modelo mais do que dobrando o desempenho do antecessor em
  • O modelo suporta implantação local via SGLang, vLLM, Transformers e outros frameworks, com janela de contexto de até 1 milhão de tokens.
GLM-5.3 chega como modelo open-weight

O GLM-5.3 foi lançado publicamente como modelo de peso aberto (open-weight), com todos os ganhos de desempenho sobre seu antecessor GLM-5.2 provenientes exclusivamente do pós-treinamento — a base do modelo permanece idêntica. A equipe responsável afirma que o novo modelo é o mais capaz entre os modelos open-weights para tarefas de codificação, com melhora de 50% sobre o GLM-5.2 no benchmark interno Z.ai Code Bench, além de resultados de estado da arte em benchmarks públicos como Terminal Bench 3.0 e Agents' Last Exam.

Capacidade cibernética emergiu mais rápido que o esperado

O aspecto que a própria equipe destaca com mais cautela é o surgimento de capacidades cibernéticas durante o escalonamento do pós-treinamento. Segundo o anúncio, essas capacidades se desenvolveram mais rapidamente do que o esperado. O GLM-5.3 alcança o topo do benchmark CyberGym para descoberta de vulnerabilidades, e seus maiores ganhos estão nas etapas mais avançadas da cadeia de exploração: o modelo mais do que dobrou o desempenho do GLM-5.2 nos benchmarks de exploração. A equipe não detalhou medidas de mitigação adotadas em resposta a esse desenvolvimento.

Desempenho comparativo nos principais benchmarks

BenchmarkGLM-5.3GLM-5.2Kimi K3DeepSeek-V4 ProQwen3.8-MaxOpus 4.8
Terminal Bench 3.028,34,617,421,1
DeepSWE (v1.1)66,946,267,562,756,658,0
FrontierSWE78,167,566,5
SWE-Marathon (v1.1)42,519,448,148,8
CyberGym84,577,280,083,378,578,1
ExploitGym (2h / 6h)105 / 13029 / 3936 / 7014 / 2680 / 120
ExploitBench54,424,432,228,840,0
Agents' Last Exam (ALE-CLI)28,523,827,625,727,025,7
AutomationBench (v1.0.6)48,226,246,743,239,841,0
HLE w/ Tools62,554,759,860,056,257,9

Implantação local e parâmetros de controle

O GLM-5.3 pode ser executado localmente por meio de múltiplos frameworks, incluindo SGLang, vLLM, Transformers, KTransformers e Unsloth, com suporte também à plataforma Ascend NPU. O modelo expõe um parâmetro reasoning_effort com três níveis — low, high e max — sendo max o padrão. Para reprodução de benchmarks e leaderboards, a equipe recomenda manter o nível máximo. O contexto de inferência suporta até 1 milhão de tokens, com saída máxima de 128 mil tokens dependendo da configuração.

Advertisement
Ad Unit · 728×90 / Responsive

O lançamento aberto do GLM-5.3 coloca-o em competição direta com outros modelos de código aberto para agentes de programação, área em crescimento acelerado conforme novos benchmarks de codificação surgem para avaliar capacidades reais em bases de código reais. A emergência não planejada de capacidades ofensivas de cibersegurança, porém, representa uma questão em aberto sobre como a comunidade e desenvolvedores devem calibrar o uso do modelo em ambientes sensíveis.

Temas

Benchmarks de IACapacidades Cibernéticas de IAModelos de IA de Peso Aberto

Organizações

Z.ai

Eventos

Lançamento do GLM-5.3
Advertisement
Ad Unit · 300×250 / Responsive

More in Inteligência Artificial

Read in another language

← Home