OCTO+

VibeLifeBench avalia persistência de agentes de IA na vida real

Novo benchmark criado pela Xiaohongshu Inc testa agentes de IA em tarefas de longa duração e ambientes dinâmicos que simulam a vida cotidiana.

12 de ago., 09:06 2 fontes · 3 países Pesquisa Pesquisa
Pesquisa
Painel de análise de dados com gráficos complexos em uma tela digital. Foto: AlphaTradeZone / Pexels

A Xiaohongshu Inc apresentou o VibeLifeBench, um novo padrão de avaliação voltado para testar a proatividade e a persistência de agentes baseados em modelos de linguagem (LLMs) em cenários de vida real. O benchmark desafia modelos a gerenciar tarefas de longo prazo, superando limitações de avaliações atuais que focam apenas em solicitações estáticas e imediatas.

O desafio da persistência

Diferente de assistentes que processam comandos curtos, o VibeLifeBench propõe tarefas que se desenrolam ao longo de semanas. Segundo a pesquisa, o cotidiano exige que o agente opere em um ambiente dinâmico, onde mudanças ocorrem mesmo quando não há uma solicitação direta do usuário. A falha recorrente nos modelos atuais, conforme apurado, ocorre porque os agentes limitam-se a responder ao estímulo imediato, ignorando restrições implícitas e a necessidade de planejamento contínuo.

O ambiente de teste é composto por 200 tarefas distribuídas em dez domínios da vida diária, integradas a um ecossistema simulado de 22 serviços. O sistema funciona com um relógio próprio e independente. O agente, para obter sucesso, deve reavaliar o ambiente constantemente para identificar alterações silenciosas e decidir autonomamente o momento de agir, questionar ou aguardar.

Conexões de rede em estilo futurista representando processamento de dados.
Foto: Brett Sayles / Pexels

Desempenho dos modelos atuais

O estudo avaliou sete modelos de fronteira, cujos nomes não foram detalhados no material divulgado. Os resultados indicaram notas baixas para todos os participantes, evidenciando uma lacuna significativa entre a tecnologia atual e a capacidade necessária para a assistência real e prolongada. A avaliação de cada tarefa é realizada por meio de verificações detalhadas que analisam o estado final, a pontualidade das ações e o cumprimento de restrições não declaradas explicitamente.

A Xiaohongshu Inc anunciou a intenção de disponibilizar o framework, o ambiente de simulação e as tarefas como código aberto para a comunidade técnica.

O que ainda não foi divulgado

Apurado em 3 fontes

arXiv — cs.CL (Computation and Language) (—) · arXiv cs.CL — Computation and Language (US) · Hugging Face — Daily Papers (Global)

Continue lendo

Receba sem abrir o site

no e-mail ou no WhatsApp · análises + plantão + resumo semanal · cancele com 1 clique
Pronto. A primeira edição chega no seu e-mail.

Assine GRÁTIS e cancele com 1 CLIQUE quando quiser. ;)