A NVIDIA anunciou o Nemotron 3.5 Lightning, um modelo de linguagem com 30 bilhões de parâmetros projetado para acelerar tarefas executadas por agentes de inteligência artificial. O sistema utiliza uma arquitetura de mistura de especialistas (MoE), ativando cerca de 3 bilhões de parâmetros por token, e foi desenvolvido para operar em fluxos de trabalho que exigem alta velocidade e volume, como chamadas de ferramentas e validação de dados.
Eficiência e arquitetura focada em agentes
O modelo combina camadas de Mamba-2, MoE e mecanismos de atenção com uma janela de contexto de 1 milhão de tokens. Segundo a NVIDIA, a proposta do Nemotron 3.5 Lightning não é substituir modelos de raciocínio complexo, mas sim realizar o trabalho pesado e repetitivo dos agentes com menor latência. Testes indicam que o modelo pode completar tarefas agênticas até 30% mais rápido que modelos concorrentes da mesma categoria, alcançando velocidades de geração de tokens significativamente maiores em ambientes controlados.
O papel da biblioteca NeMo Switchyard
Junto ao modelo, a empresa liberou a biblioteca de código aberto NeMo Switchyard. A ferramenta atua como um roteador inteligente: ela decide, passo a passo, qual modelo deve processar cada etapa de uma tarefa. Conforme apurado pelo The Next Web, a utilização deste roteamento pode reduzir custos operacionais substancialmente ao direcionar apenas as demandas mais complexas para modelos de fronteira, enquanto o Lightning processa a grande maioria das solicitações diárias. O software permite integração com modelos abertos e proprietários sem a necessidade de reescrever aplicações.
O que ainda não foi divulgado
- Resultados de benchmarks de desempenho em hardware de consumo em todos os cenários de uso, dependendo da disponibilidade específica de memória de GPU.
- Detalhamento completo sobre a viabilidade de execução em hardware com limitações rígidas de memória, dado que, apesar de usar 3B ativos, o modelo exige a carga total de 30B parâmetros na memória.
- Datas específicas para o lançamento de futuras iterações do portfólio Nemotron mencionadas em relatos de mercado.


