A Together AI anunciou, em parceria com a IBM Cloud e a NVIDIA, a criação de um cluster dedicado de GPUs B300 para ampliar a capacidade de inferência empresarial de modelos de código aberto. Segundo a CNews, a provedora russa Reg.cloud também lançou serviços de inferência em NVIDIA B300, já utilizados por mais de mil clientes e com mais de 35 modelos disponíveis através de pagamento por token.
Parceria Together AI, IBM e NVIDIA
Segundo a Together AI, o novo cluster é formado exclusivamente por GPUs NVIDIA B300 instalados na IBM Cloud, interligados pela tecnologia Spectrum‑X Ethernet, projetada para cargas de trabalho de inferência de alto throughput. A empresa afirma que opera a camada de inferência, enquanto a IBM fornece a infraestrutura de nuvem e a NVIDIA entrega o silício e o networking. O cluster é descrito como o primeiro grande e dedicado de seu tipo na IBM Cloud, sendo a Together AI o primeiro cliente a rodar nele. O objetivo é suportar uma escala de produção de tokens que acompanhe o crescimento exponencial da demanda, permitindo que empresas rodem modelos abertos com desempenho semelhante ao de soluções fechadas, mas com custos reduzidos e controle soberano dos dados.
Expansão da Reg.cloud na Rússia
A CNews informa que a provedora Reg.cloud ampliou sua GPU‑infrastructure adicionando aceleradores NVIDIA B200 e B300. Os novos recursos são destinados tanto às cargas de trabalho dos clientes quanto ao desenvolvimento da própria plataforma de IA da empresa. Já mais de mil clientes utilizaram o serviço de inferência em B300. Desde agosto de 2026 a Reg.cloud oferece pagamento por token em sua plataforma de IA, que disponibiliza mais de 35 modelos por meio de uma interface única e API. Segundo o diretor de TI da empresa, Yevgeny Martynov, parte dos aceleradores B300 já está em operação dentro do contorno de infraestrutura da Reg.cloud, rodando modelos diretamente sem necessidade de VPN corporativa, com pagamento em rubis e sem envio de dados de consulta a fornecedores estrangeiros de modelos. A empresa pretende continuar expandindo o catálogo de modelos que rodam exclusivamente em sua própria infraestrutura.
Detalhes técnicos dos GPUs B300
Ambas as fontes descrevem o NVIDIA B300 como pertencente à geração Blackwell Ultra. Em configuração HGX, oito accelerators B300 são vinculados, somando mais de 2 TB de memória HBM3E, o que possibilita o alojamento de modelos de grande porte e o atendimento a cargas de inferência pesadas. Além dos B300, a Together AI menciona que instâncias sob demanda de GPUs B200 já estão disponíveis em seus clusters de GPU, oferecendo flexibilidade para diferentes níveis de carga de trabalho. Essas especificações técnicas são citadas como fundamento para suportar a inferência empresarial em escala descrita pelos parceiros.


