A Xiaohongshu Inc apresentou o VibeLifeBench, um novo padrão de avaliação voltado para testar a proatividade e a persistência de agentes baseados em modelos de linguagem (LLMs) em cenários de vida real. O benchmark desafia modelos a gerenciar tarefas de longo prazo, superando limitações de avaliações atuais que focam apenas em solicitações estáticas e imediatas.
O desafio da persistência
Diferente de assistentes que processam comandos curtos, o VibeLifeBench propõe tarefas que se desenrolam ao longo de semanas. Segundo a pesquisa, o cotidiano exige que o agente opere em um ambiente dinâmico, onde mudanças ocorrem mesmo quando não há uma solicitação direta do usuário. A falha recorrente nos modelos atuais, conforme apurado, ocorre porque os agentes limitam-se a responder ao estímulo imediato, ignorando restrições implícitas e a necessidade de planejamento contínuo.
O ambiente de teste é composto por 200 tarefas distribuídas em dez domínios da vida diária, integradas a um ecossistema simulado de 22 serviços. O sistema funciona com um relógio próprio e independente. O agente, para obter sucesso, deve reavaliar o ambiente constantemente para identificar alterações silenciosas e decidir autonomamente o momento de agir, questionar ou aguardar.

Desempenho dos modelos atuais
O estudo avaliou sete modelos de fronteira, cujos nomes não foram detalhados no material divulgado. Os resultados indicaram notas baixas para todos os participantes, evidenciando uma lacuna significativa entre a tecnologia atual e a capacidade necessária para a assistência real e prolongada. A avaliação de cada tarefa é realizada por meio de verificações detalhadas que analisam o estado final, a pontualidade das ações e o cumprimento de restrições não declaradas explicitamente.
A Xiaohongshu Inc anunciou a intenção de disponibilizar o framework, o ambiente de simulação e as tarefas como código aberto para a comunidade técnica.
O que ainda não foi divulgado
- A lista completa com os nomes dos sete modelos de fronteira testados.
- Detalhes sobre quais são os dez domínios específicos da vida cotidiana utilizados no benchmark.
- A metodologia exata de ponderação utilizada na gradação das tarefas.


