Pesquisadores apresentaram um método de compactação online para o KV Cache, visando eliminar gargalos de inferência em agentes de modelos de linguagem (LLMs). O estudo demonstra que a técnica reduz o volume de cache em até 80%, mantendo a precisão das tarefas e aumentando a taxa de processamento.
Desafios da inferência em tempo real
Agentes de IA processam sequências longas de raciocínio, chamadas de ferramentas e retornos de ambiente, o que torna o KV Cache um gargalo no desempenho. Diferente de métodos tradicionais que operam em contextos estáticos, os agentes exigem compressão online de informações novas antes de se conhecer sua relevância futura. O trabalho avaliou técnicas de remoção de tokens (TE) e correspondência de atenção (AM) utilizando consultas de proxy para orientar a compactação.
Resultados e eficiência de modelos
Os testes realizados nas plataformas BrowseComp-Plus e WideSearch revelaram que a compactação imediata compromete o desempenho do agente. A estratégia de adiar a compressão, utilizando consultas futuras geradas pelo próprio agente, permitiu recuperar a performance. O método de remoção de tokens (TE) apresentou maior robustez que a correspondência de atenção (AM) quando confrontado com proxies imperfeitos. A aplicação da técnica em modelos de diferentes escalas comprovou que a seleção cuidadosa da consulta de proxy é um fator determinante para a eficiência operacional.
O que ainda não foi divulgado
- O código-fonte e as implementações específicas da técnica não foram disponibilizados publicamente no material consultado.
- Não foram detalhados os impactos do uso dessa compactação em arquiteturas de hardware específicas além dos testes realizados nos datasets mencionados.
- A notícia circulou em 2 fontes de 1 país: Estados Unidos.