Pesquisadores introduziram a métrica Inteligência por Watt (IPW) para mensurar a eficiência de modelos de linguagem (LLMs) executados localmente. O indicador avalia a precisão das respostas por unidade de energia consumida, propondo uma alternativa à dependência exclusiva da infraestrutura de nuvem.
Avaliação de desempenho em dispositivos locais
O estudo, publicado no arXiv por pesquisadores liderados por Jon Saad-Falcon, analisa se modelos com até 20 bilhões de parâmetros conseguem absorver a demanda de consultas hoje processadas em data centers. A avaliação utilizou mais de 1 milhão de consultas reais, comparando a precisão local contra modelos de fronteira. Os resultados indicam que os modelos locais atingem êxito em 88,7% das tarefas solicitadas.
Evolução e eficiência comparativa
A análise longitudinal do período entre 2023 e 2025 demonstra um salto de 5,3 vezes no índice de IPW, impulsionado por avanços algorítmicos e melhorias em aceleradores de hardware como o Apple M4 Max. Nesse intervalo, a capacidade de cobertura de consultas processáveis localmente subiu de 23,2% para 71,3%.
O trabalho aponta uma vantagem técnica significativa para o processamento local: aceleradores de hardware dedicados a dispositivos individuais apresentaram um IPW pelo menos 1,4 vez menor do que aceleradores em nuvem executando as mesmas configurações. Isso sugere, segundo os autores, uma margem de otimização para reduzir o gargalo de escala enfrentado pelos provedores de infraestrutura centralizada.
O que ainda não foi divulgado
- Detalhes sobre como o IPW se comportará em arquiteturas de hardware de baixo consumo voltadas especificamente para dispositivos móveis de entrada.
- O impacto da latência em casos de uso específicos que exigem processamento em tempo real contínuo além do formato single-turn analisado.
- A estratégia de implementação técnica para que desenvolvedores de software adotem o IPW como padrão de métrica de desempenho.


