Pesquisadores desenvolveram a Lei de Escala Multimodal orientada por capacidades, um framework que permite prever a precisão de modelos de visão e linguagem (VLMs) antes mesmo do início do treinamento. O método utiliza pontuações de capacidade textual extraídas de LLMs para estimar o desempenho final, eliminando a dependência de tentativas empíricas dispendiosas na escolha de modelos base.
Validação e eficácia do método
O estudo, que contou com cobertura de duas fontes, foi validado a partir do treinamento de mais de 150 VLMs utilizando 34 LLMs distintos, abrangendo sete famílias de modelos diferentes sob condições controladas. A aplicação da nova lei permitiu extrapolar taxas de transferência de modelos menores, de 8B de parâmetros, para estruturas de até 72B. O framework demonstrou alta fidelidade ao prever trajetórias completas de treinamento e a capacidade de generalizar para famílias de modelos que não fizeram parte da amostra inicial.
Insights sobre arquitetura e desempenho
Além da formulação matemática, a pesquisa trouxe conclusões sobre a dinâmica de construção dos modelos:
- Modelos base de linguagem apresentam desempenho superior como alicerces de VLMs em comparação com versões ajustadas por instrução, devido a taxas de absorção mais elevadas e menor decaimento de escala.
- A existência de correlações negativas entre certos benchmarks textuais e o desempenho multimodal sugere comportamentos de otimização excessiva em testes específicos, os chamados benchmark-gaming.
- Cada família de modelos ocupa posições distintas no espaço de transferência e absorção, fator que agora pode ser quantificado para orientar decisões de engenharia.
O que ainda não foi divulgado
Embora os autores tenham disponibilizado o código e os dados do framework, não foram detalhadas limitações específicas de hardware para a implementação do modelo em escala industrial, nem foram comparados os custos computacionais diretos versus a economia gerada pela previsão teórica em cenários de produção comercial.