A IBM anunciou nesta segunda-feira, 25 de agosto de 2026, o lançamento da família Granite 4.2, uma nova geração de LLMs abertos voltados para raciocínio encadeado e uso de ferramentas em ambiente de agente. Os modelos, disponíveis em versões de 3B, 8B e 30B parâmetros, trazem janela de contexto de até 512 mil tokens e são licenciados sob Apache 2.0, reforçando a aposta em open-source fonte.
O que mudou na linha Granite
O foco do Granite 4.2 é explícito: raciocínio e operações “agentic” — ou seja, LLMs capazes de executar tarefas envolvendo múltiplos passos, decisões condicionais e uso de ferramentas externas. Todos os modelos suportam nativamente tool calling no formato OpenAI function-calling, facilitando a integração em pipelines que já usam endpoints compatíveis, como vLLM. O suporte nativo a agentes permite que os modelos editem e executem código, operem terminais e realizem buscas na web em ambientes sandboxed — especialmente nas versões 8B e 30B, que passam por um estágio extra de reinforcement learning voltado para ações autônomas.
A arquitetura mantém o padrão decoder-only transformer, com atenção Grouped Query Attention (GQA), RoPE expandido (θ = 10 milhões), RMSNorm e ativação SwiGLU. Todos os tamanhos usam embeddings separados de entrada e saída, precisão bfloat16 e sequência máxima de 131.072 tokens durante o treino — mas o contexto efetivo chega a 512K graças a um quinto estágio de pretraining voltado para long-context.
Treinamento e pipeline de qualidade
O treinamento do Granite 4.2 segue cinco fases, começando com pretraining em 15 trilhões de tokens e avançando para blends progressivamente mais curados. O último estágio estende o contexto para 512K tokens. A fine-tuning supervisionada (SFT) utiliza cerca de 7,2 milhões de amostras (100 bilhões de tokens), com 31,6% de dados “agentic” (tarefas com agentes, SWE, tool use, terminal, busca) e 68,4% de dados padrão (instrução, código, matemática, multilinguismo, ciência, segurança).
A IBM implementa múltiplas etapas de controle de qualidade. Todos os dados são normalizados para o formato OpenAI Chat, e amostras passam por julgamento automatizado de LLMs (incluindo GPT-OSS-120B e Gemma 4) para descartar exemplos com alucinações, interações inválidas ou conteúdo de baixa qualidade. Regras heurísticas específicas são aplicadas para remover ruído e garantir coerência, especialmente nas trajetórias agentic.
Modos de raciocínio e uso prático
Um diferencial da linha é o “thinking / non-thinking switch”: o usuário pode escolher entre modo de raciocínio completo, modo direto ou um intermediário de baixo esforço, ajustando o orçamento de raciocínio conforme a complexidade da tarefa. Isso permite reduzir custo computacional em tarefas simples e aumentar a profundidade em prompts mais desafiadores. O suporte nativo a tool calling e agentes torna a família Granite 4.2 especialmente adequada para aplicações autônomas, assistentes corporativos e integração em fluxos de automação.
Por que importa
A Granite 4.2 posiciona a IBM como um dos poucos fornecedores open-source com LLMs de médio porte (3B a 30B) preparados para uso como agentes, com raciocínio encadeado, contexto longo e integração fácil a stacks já compatíveis com OpenAI. Para empresas que buscam soluções auditáveis, com controle sobre dados e licença permissiva, é uma alternativa direta a modelos proprietários e a releases abertos menos maduros. O suporte nativo ao formato de tool use do OpenAI reduz o lock-in e acelera a adoção em ambientes existentes.