OCTO+

Cascade: novo sistema otimiza inferência de LLMs

O novo sistema Cascade utiliza orçamentos de latência para melhorar a eficiência de processamento e reduzir violações de SLO em LLMs.

10 de ago., 02:42 2 fontes · 1 país Infra Pesquisa
Infra
Servidores de alto desempenho em um centro de processamento de dados. Foto: panumas nikhomkhai / Pexels

Pesquisadores apresentaram o Cascade, um sistema de inferência para grandes modelos de linguagem (LLMs) projetado para gerenciar orçamentos de latência. O projeto demonstrou um aumento de até 2,4 vezes na produtividade e uma redução de 40% nas violações de objetivos de nível de serviço (SLO) em comparação com o agendador vLLM padrão.

Gestão dinâmica de orçamentos de latência

O Cascade introduz o conceito de orçamento de latência por requisição, definido como a diferença entre o objetivo de nível de serviço estabelecido e o tempo restante estimado para a conclusão da tarefa. Em sistemas convencionais, requisições sob o mesmo SLO podem apresentar variações significativas em termos de tamanho de entrada, custos de execução e estado de cache KV, o que gera níveis de urgência desiguais. O sistema atua de forma contínua, ajustando esse orçamento com base nas características da requisição, na carga do sistema e na disponibilidade de memória.

Coordenação de agendamento e memória

Diferente de soluções anteriores que priorizam apenas o sequenciamento das tarefas através de prazos, o Cascade integra o agendamento de requisições ao gerenciamento de memória em toda a hierarquia. A prioridade de processamento é dada a requisições com menor orçamento de latência restante. Paralelamente, o gerenciador de memória utiliza o mesmo parâmetro para decidir se o estado do cache KV deve ser retido na memória de alta largura de banda (HBM), restaurado de camadas de memória mais profundas ou recomputado.

O modelo, detalhado em trabalho submetido ao repositório arXiv em 6 de agosto de 2026 por Muhammad Adnan e outros seis pesquisadores, busca direcionar os custos operacionais de movimentação de dados e filas para as requisições que possuem maior capacidade de absorvê-los. O resultado é a manutenção da justiça entre diferentes classes de requisições e a otimização da entrega de respostas dentro dos prazos acordados.

Apurado em 2 fontes

arXiv cs.DC — Computação Distribuída · arXiv — cs.LG (Machine Learning) (—)

Continue lendo

Receba sem abrir o site

no e-mail ou no WhatsApp · análises + plantão + resumo semanal · cancele com 1 clique
Pronto. A primeira edição chega no seu e-mail.

Assine GRÁTIS e cancele com 1 CLIQUE quando quiser. ;)