OCTO+

DeepSeek V4.1 Flash supera GPT-6 Astra em design, custando 1,4%

Modelo chinês alcança 81,2 pontos contra 82,7 da OpenAI, com custo de US$ 0,023 por tarefa. Velocidade é o dobro.

11 de set., 16:34 13 fontes · 8 países Modelos Pesquisa
ModelosAnthropicOpenAIDeepSeek
Gráfico comparando desempenho de modelos de IA em benchmark de design Foto: Google DeepMind / Pexels

O modelo V4.1 Flash, da chinesa DeepSeek, marcou 81,2 pontos no benchmark OpenDesign Arena, ante 82,7 do GPT-6 Astra, da OpenAI — diferença de 1,5 ponto. O custo por tarefa, porém, é de US$ 0,023, o equivalente a 1,4% do valor do concorrente, de US$ 1,61, segundo o Digital Today e o Decrypt.

O resultado coloca o V4.1 Flash como o único modelo abaixo do GPT-6 Astra na disputa, superando outros 11 concorrentes, como o Claude Fable 5.1 (80,3 pontos), da Anthropic, e o Grok 4.6. O benchmark avaliou 13 modelos em tarefas de design de interfaces — web apps, dashboards e landing pages — com pontuação que prioriza layout, hierarquia de informações, cores e adequação de estilo.

Custo e velocidade

O tempo médio de processamento do V4.1 Flash foi de 5,3 minutos, contra 11,1 minutos do GPT-6 Astra. O modelo da DeepSeek também levou vantagem sobre o Claude Fable 5.1, que registrou 12,8 minutos e custo de US$ 3,66 por tarefa.

A DeepSeek atribui a eficiência à arquitetura do modelo. O V4.1 Flash é um modelo MoE (mistura de especialistas) com 552 bilhões de parâmetros totais, mas ativa apenas 8 bilhões na entrada e 16 bilhões na saída de cada processamento. A empresa classifica a estrutura como "codificador-decodificador causal".

Limitações do teste

O OpenDesign Arena impõe critérios rigorosos: resultados que geram páginas em branco, erros de layout ou interrupções recebem nota zero, sem reteste. O foco é a capacidade de produzir consistentemente artefatos utilizáveis, e não a performance genérica de raciocínio ou código.

Servidores em data center com luzes azuis
Foto: panumas nikhomkhai / Pexels

Na taxa de entrega sem ajustes adicionais, o V4.1 Flash ficou em 57,7%, próximo aos 60% do GPT-6 Astra e aos 56,7% do Claude Fable 5.1.

Contexto estratégico

A DeepSeek vem adotando uma estratégia de custos reduzidos em comparação com rivais. Em benchmarks anteriores, o V4 Pro ficou cerca de 5% atrás do Claude Fable 5, mantendo vantagem de preço.

A empresa anunciou a abertura de vagas para produto e engenharia em Pequim, com foco em desenvolvimento de ferramentas para código e ambientes de execução para programadores.

Apurado em 13 fontes

디지털투데이 (Digital Today) (Coreia do Sul) · Decrypt (Estados Unidos) · Rivista AI (Itália)

ver as 13 fontes

Continue lendo

Receba sem abrir o site

no e-mail ou no WhatsApp · análises + plantão + resumo semanal · cancele com 1 clique
Pronto. A primeira edição chega no seu e-mail.

Assine GRÁTIS e cancele com 1 CLIQUE quando quiser. ;)