O Agent Lightning v1.0, introduzido pela Microsoft Research Asia, é um framework de aproximadamente 3.500 linhas de código para treinar agentes de IA com aprendizado por reforço usando o mesmo arnês real empregado na implantação, sem reimplementação do agente no ambiente de treinamento.
Harnessed Agentic RL: o arnês entra direto no treinamento
No paradigma Harnessed Agentic RL, que dá forma ao Agent Lightning v1.0, o arnês de agente usado na produção participa diretamente do treinamento por reforço.
O agente atinge o modelo por meio de um proxy de LLM integrado ao framework, sem tocar no código original do arnês.
Essa troca evita o custo e a imprecisão de reescrever o agente dentro do sistema de treinamento — o que normalmente desvia o modelo treinado do que realmente roda na prática.
Kubernetes na raqueta e eficiência de dados comprovada
O framework pesa cerca de 3.500 linhas, o que não é pouco por acaso: a ideia é manter o sistema leve, legível, modificável.

Rodar agentes como jobs padrão de Kubernetes funciona em clusters auto-gerenciados, nuvem ou infraestrutura local — sem depender de sandboxes pagos.
No teste de codificação, o Qwen3.5-9B subiu de 41,8% para 56,4% de Pass@1 no SWE-bench Verified, um ganho de 14,6 pontos, com cerca de 6.000 amostras de um dataset aberto.
O código do Agent Lightning v1.0 foi disponibilizado como projeto de código aberto.
- Leve: ~3.500 linhas de código.
- Arnês real sem alterações no treinamento.
- Suporte nativo a Kubernetes.
- Eficiência de dados: ~6.000 amostras para ganho de 14,6 pp.


