Pesquisadores apresentaram o LazyTrain, uma nova camada de otimização projetada para melhorar o treinamento de grandes modelos de linguagem (LLMs) em hardware com restrições de memória e processamento. O sistema atua como uma camada de agendamento que gerencia o fluxo de dados entre GPU, memória do host, transferência PCIe e armazenamento NVMe para reduzir gargalos no caminho crítico do treinamento.
Metodologia de agendamento
O LazyTrain aborda o desafio do treinamento em sistemas limitados tratando a alocação de recursos como um problema de agendamento de números inteiros mistos. Segundo os autores do estudo publicado no arXiv, a ferramenta otimiza o uso de pontos de verificação (checkpoints), a alocação de ativações e a sobreposição da comunicação entre a CPU, GPU e dispositivos de armazenamento.
Diferente de sistemas anteriores de offloading, que focavam apenas na redução da residência de dados na GPU, o LazyTrain integra um operador híbrido de 8 bits. Esse componente combina estados de otimizador de 8 bits com uma técnica de corte de gradiente rápido. A compressão dos estados do otimizador reduz a demanda por memória, enquanto o corte rápido compensa o overhead gerado pelas atualizações processadas na CPU.

Resultados de desempenho
Os testes realizados com a família de modelos Qwen apresentaram melhorias significativas na eficiência de processamento. Em experimentos utilizando GPUs H800, a solução elevou o throughput de TFLOPS em aproximadamente 1,24 vezes na comparação com métodos convencionais. Em testes práticos com o modelo Qwen3.6-27B no conjunto de dados MetaMathQA, o sistema atingiu 219,95 TFLOPS, alcançando um rendimento de 1361 tokens por segundo com um lote de tamanho 72.
Em hardwares com menor capacidade, como as GPUs RTX 3090, a implementação permitiu um aumento no tamanho máximo do lote, elevando a viabilidade do treinamento em escala local. O código-fonte da tecnologia foi disponibilizado para acesso público conforme detalhado na publicação técnica.
O que ainda não foi divulgado
- O impacto da otimização em arquiteturas de hardware de fabricantes diferentes das testadas (H800 e RTX 3090) não foi detalhado.
- Dados sobre a escalabilidade do LazyTrain em configurações multi-node para modelos ainda maiores permanecem fora do escopo da documentação atual.
- Não foram fornecidas comparações de consumo energético detalhado entre o método proposto e outras técnicas de otimização de memória vigentes.


