OCTO+

Anthropic desenvolve Model 2, mais forte que Mythos 5, mas mantém travado por falta de tes

Model 2 atinge 62,8% no benchmark CoBench, acima dos 50,3% de Mythos 5. Anthropic mantém interno por não ter concluído checagens pré-lançamento.

17 de ago., 11:18 12 fontes · 8 países Modelos Pesquisa
ModelosAnthropic
Sala de servidores com equipamentos de computacao e refrigeração Foto: Christina Morillo / Pexels

Anthropic mantém Model 2 — modelo interno com 62,8% no benchmark CoBench — sem lançar por falta de testes completos. Ele supera Mythos 5 (50,3%) em 449 tarefas reais, mas não chega ao patamar de salto que viu Opus 4.6 para Mythos Preview, segundo relatório de 186 páginas publicado em 14 de agosto.

Desempenho interno

Avaliação de risco sobe de very low para low

Onde a cobertura diverge

Apurado em 12 fontes

Habr (Rússia) · Bright (Países Baixos)

ver as 12 fontes

Continue lendo

Receba sem abrir o site

no e-mail ou no WhatsApp · análises + plantão + resumo semanal · cancele com 1 clique
Pronto. A primeira edição chega no seu e-mail.

Assine GRÁTIS e cancele com 1 CLIQUE quando quiser. ;)