OCTO+

LazyTrain otimiza treinamento de LLMs em hardware limitado

Novo sistema de agendamento LazyTrain melhora eficiência no uso de GPUs para treinar modelos de linguagem com recursos reduzidos.

13 de ago., 06:21 1 fonte · 1 país Pesquisa Pesquisa
Pesquisa
Servidores em um data center com luzes indicadoras acesas em ambiente escuro. Foto: Christina Morillo / Pexels

Pesquisadores apresentaram o LazyTrain, uma nova camada de otimização projetada para melhorar o treinamento de grandes modelos de linguagem (LLMs) em hardware com restrições de memória e processamento. O sistema atua como uma camada de agendamento que gerencia o fluxo de dados entre GPU, memória do host, transferência PCIe e armazenamento NVMe para reduzir gargalos no caminho crítico do treinamento.

Metodologia de agendamento

O LazyTrain aborda o desafio do treinamento em sistemas limitados tratando a alocação de recursos como um problema de agendamento de números inteiros mistos. Segundo os autores do estudo publicado no arXiv, a ferramenta otimiza o uso de pontos de verificação (checkpoints), a alocação de ativações e a sobreposição da comunicação entre a CPU, GPU e dispositivos de armazenamento.

Diferente de sistemas anteriores de offloading, que focavam apenas na redução da residência de dados na GPU, o LazyTrain integra um operador híbrido de 8 bits. Esse componente combina estados de otimizador de 8 bits com uma técnica de corte de gradiente rápido. A compressão dos estados do otimizador reduz a demanda por memória, enquanto o corte rápido compensa o overhead gerado pelas atualizações processadas na CPU.

Placas de circuito e componentes internos de computadores de alto desempenho.
Foto: Pixabay / Pexels

Resultados de desempenho

Os testes realizados com a família de modelos Qwen apresentaram melhorias significativas na eficiência de processamento. Em experimentos utilizando GPUs H800, a solução elevou o throughput de TFLOPS em aproximadamente 1,24 vezes na comparação com métodos convencionais. Em testes práticos com o modelo Qwen3.6-27B no conjunto de dados MetaMathQA, o sistema atingiu 219,95 TFLOPS, alcançando um rendimento de 1361 tokens por segundo com um lote de tamanho 72.

Em hardwares com menor capacidade, como as GPUs RTX 3090, a implementação permitiu um aumento no tamanho máximo do lote, elevando a viabilidade do treinamento em escala local. O código-fonte da tecnologia foi disponibilizado para acesso público conforme detalhado na publicação técnica.

O que ainda não foi divulgado

Apurado em 1 fonte

arXiv cs.CL (50)

Continue lendo

Receba sem abrir o site

no e-mail ou no WhatsApp · análises + plantão + resumo semanal · cancele com 1 clique
Pronto. A primeira edição chega no seu e-mail.

Assine GRÁTIS e cancele com 1 CLIQUE quando quiser. ;)