Pesquisadores apresentaram o Cascade, um sistema de inferência para grandes modelos de linguagem (LLMs) projetado para gerenciar orçamentos de latência. O projeto demonstrou um aumento de até 2,4 vezes na produtividade e uma redução de 40% nas violações de objetivos de nível de serviço (SLO) em comparação com o agendador vLLM padrão.
Gestão dinâmica de orçamentos de latência
O Cascade introduz o conceito de orçamento de latência por requisição, definido como a diferença entre o objetivo de nível de serviço estabelecido e o tempo restante estimado para a conclusão da tarefa. Em sistemas convencionais, requisições sob o mesmo SLO podem apresentar variações significativas em termos de tamanho de entrada, custos de execução e estado de cache KV, o que gera níveis de urgência desiguais. O sistema atua de forma contínua, ajustando esse orçamento com base nas características da requisição, na carga do sistema e na disponibilidade de memória.
Coordenação de agendamento e memória
Diferente de soluções anteriores que priorizam apenas o sequenciamento das tarefas através de prazos, o Cascade integra o agendamento de requisições ao gerenciamento de memória em toda a hierarquia. A prioridade de processamento é dada a requisições com menor orçamento de latência restante. Paralelamente, o gerenciador de memória utiliza o mesmo parâmetro para decidir se o estado do cache KV deve ser retido na memória de alta largura de banda (HBM), restaurado de camadas de memória mais profundas ou recomputado.
O modelo, detalhado em trabalho submetido ao repositório arXiv em 6 de agosto de 2026 por Muhammad Adnan e outros seis pesquisadores, busca direcionar os custos operacionais de movimentação de dados e filas para as requisições que possuem maior capacidade de absorvê-los. O resultado é a manutenção da justiça entre diferentes classes de requisições e a otimização da entrega de respostas dentro dos prazos acordados.


