Pesquisadores desenvolveram o V-Mem, um sistema de memória para agentes baseados em LLMs projetado para otimizar a recuperação de informações em contextos multimodais. A solução corrige falhas de busca ao lidar com interações que intercalam texto e imagens, atingindo uma pontuação de 0.82 no benchmark Mem-Gallery.
Funcionamento e técnica
A tecnologia utiliza o roteamento de recuperação baseado na modalidade da consulta. O sistema identifica a natureza da solicitação e do conteúdo necessário, superando dois problemas técnicos principais:
- Lacuna de modalidade: o V-Mem organiza conversas em rodadas, permitindo buscar conteúdos da mesma rodada para evitar comparações diretas entre diferentes tipos de mídia.
- Lacuna de relevância: o sistema utiliza âncoras geradas por LLMs, como legendas hipotéticas ou palavras-chave enriquecidas, que facilitam a localização de evidências que não seriam encontradas por buscas tradicionais.
Desempenho e alcance
Nos testes realizados, o V-Mem superou as alternativas existentes. No benchmark Mem-Gallery, o sistema obteve 0.82 de pontuação, enquanto a segunda melhor solução alcançou 0.56. A vantagem foi mais significativa em perguntas que incluíam imagens, com 0.87 de nota, frente a um máximo de 0.47 entre os modelos testados. No conjunto de dados LoCoMo, o V-Mem marcou 0.69 contra 0.58. A notícia foi identificada em 2 fontes de 1 país.
O que ainda não foi divulgado
- Detalhes sobre a escalabilidade do sistema em ambientes de produção de larga escala.
- Custos computacionais exatos para a geração das âncoras de busca em tempo real.
- Cronograma para eventual integração em produtos comerciais ou bibliotecas de desenvolvimento de agentes.