O AdaMTP, um novo paradigma de treinamento para modelos de linguagem, ajusta dinamicamente a predição de múltiplos tokens à previsibilidade do texto. A técnica supera o desempenho e a velocidade de inferência das abordagens convencionais ao evitar sinais de treinamento ruidosos.
Fim da rigidez na predição
Modelos de linguagem utilizam tradicionalmente uma estratégia de predição de múltiplos tokens com horizontes fixos. Essa abordagem falha ao considerar a variação na densidade de informação da linguagem natural e do código, forçando cabeças auxiliares a realizarem predições além de limites semânticos importantes. O resultado é a injeção de sinais conflitantes que degradam as capacidades fundamentais do modelo.
Adaptação baseada em entropia
O AdaMTP utiliza um algoritmo de segmentação baseado em entropia que identifica pontos de incerteza no texto. O sistema particiona as sequências em grupos de tamanho variável e atribui uma profundidade de predição específica para cada token. Uma máscara dinâmica suprime a perda em previsões que cruzam fronteiras semânticas, atenuando gradientes que prejudicam a estrutura base do modelo.
Resultados e validação
A eficácia do método foi comprovada em testes realizados com os modelos Llama-3.1-8B, Qwen-2.5-7B e Gemma-3-12B. Os benchmarks abrangeram geração de código, raciocínio matemático e tarefas gerais. A pesquisa, publicada no repositório arXiv em 2 fontes de 2 países, confirma ganhos consistentes em desempenho e aceleração de inferência.
O que ainda não foi divulgado
Não foram detalhados custos computacionais específicos para a implementação da técnica ou comparativos detalhados de consumo de energia durante o treinamento em comparação aos métodos de predição fixa.