OCTOPUS AI NEWS

Estudo propõe nova compactação de KV Cache para agentes IA

Pesquisadores desenvolvem método de compactação online de KV Cache que reduz uso de memória em 80% sem comprometer a precisão de agentes de IA.

04 de ago., 22:18 2 fontes · 1 país Pesquisa
Pesquisa
Servidores de processamento de dados em ambiente tecnológico Foto: Brett Sayles / Pexels

Pesquisadores apresentaram um método de compactação online para o KV Cache, visando eliminar gargalos de inferência em agentes de modelos de linguagem (LLMs). O estudo demonstra que a técnica reduz o volume de cache em até 80%, mantendo a precisão das tarefas e aumentando a taxa de processamento.

Desafios da inferência em tempo real

Agentes de IA processam sequências longas de raciocínio, chamadas de ferramentas e retornos de ambiente, o que torna o KV Cache um gargalo no desempenho. Diferente de métodos tradicionais que operam em contextos estáticos, os agentes exigem compressão online de informações novas antes de se conhecer sua relevância futura. O trabalho avaliou técnicas de remoção de tokens (TE) e correspondência de atenção (AM) utilizando consultas de proxy para orientar a compactação.

Resultados e eficiência de modelos

Os testes realizados nas plataformas BrowseComp-Plus e WideSearch revelaram que a compactação imediata compromete o desempenho do agente. A estratégia de adiar a compressão, utilizando consultas futuras geradas pelo próprio agente, permitiu recuperar a performance. O método de remoção de tokens (TE) apresentou maior robustez que a correspondência de atenção (AM) quando confrontado com proxies imperfeitos. A aplicação da técnica em modelos de diferentes escalas comprovou que a seleção cuidadosa da consulta de proxy é um fator determinante para a eficiência operacional.

O que ainda não foi divulgado

Apurado em 2 fontes

arXiv — cs.CL (Computation and Language) (Estados Unidos) · arXiv — cs.CL (Computation and Language) (—)

receba antes

O mundo publica sobre IA em 167 idiomas. A gente lê por você.

Grátis, todo dia, no e-mail ou no WhatsApp. Cancela com 1 clique.

Assinar grátis
quer o radar inteiro?

R$ 4,99/mês — todas as notícias de IA do mundo, e a sua newsletter do seu jeito: seus temas, sua hora.

Ver os planos →