A OpenAI apresentou nesta quinta-feira (13) o Ultrafast, novo modo de operação do GPT-5.6 Sol, sua linha de modelos de linguagem mais avançada. Disponível inicialmente em preview restrito via API, o Ultrafast promete até 14 vezes mais velocidade de geração de tokens em comparação ao processamento padrão, atingindo até 750 tokens de saída por segundo graças à infraestrutura da Cerebras.
Foco em missão crítica e resposta em tempo real
Segundo a OpenAI, o Ultrafast foi criado para destravar casos de uso onde cada segundo é decisivo. Entre os cenários destacados estão respostas a incidentes de TI, análise financeira sob condições mutáveis, suporte ao cliente por voz, operações de comércio eletrônico e pesquisa interativa. A proposta é que empresas possam empregar o modelo completo — sem recorrer a versões menores — em fluxos que antes exigiam sacrificar inteligência por latência.
A OpenAI afirma que, com o Ultrafast, tarefas antes restritas a execuções noturnas ou lotes podem ser realizadas de forma iterativa durante o expediente. Isso se aplica tanto a análises de logs e investigação de falhas quanto a experimentação científica e consultas de dados em tempo real.
Parceria técnica com a Cerebras
O salto em velocidade é resultado direto da colaboração com a Cerebras, fornecedora de hardware especializado em IA. O Ultrafast utiliza a infraestrutura da empresa para entregar baixíssima latência, tornando possível a geração de até 750 tokens de saída por segundo no GPT-5.6 Sol. A OpenAI ressalta que, historicamente, velocidade e inteligência exigiram trade-offs — ou seja, para ganhar tempo, era preciso recorrer a modelos menores. Agora, o objetivo é permitir aplicações sensíveis ao tempo sem abrir mão da capacidade intelectual dos modelos topo de linha.
Primeiras impressões e limitações
O preview está restrito a um grupo seleto de clientes, entre eles empresas dos setores financeiro, de suporte e de pesquisa. Relatos iniciais citados pela OpenAI apontam ganhos expressivos em produtividade e novas possibilidades de uso em voice AI e pesquisa financeira. Não foram divulgados preços, limites de contexto ou disponibilidade geral — todos pontos críticos para adoção em larga escala.
A expansão do acesso deve ocorrer conforme a capacidade da infraestrutura aumente. Empresas interessadas podem se inscrever para atualizações, mas ainda não há detalhes sobre critérios ou cronograma de abertura.
Por que importa
A oferta de um modelo topo de linha rodando em tempo quase real elimina uma das principais barreiras para adoção de IA generativa em fluxos de missão crítica. Para empresas brasileiras, a novidade pode acelerar integrações em atendimento, automação de processos e análise de dados — desde que a infraestrutura e o custo sejam compatíveis com a realidade local. O Ultrafast marca um possível novo padrão para aplicações que exigem tanto inteligência quanto resposta imediata, aproximando IA generativa de workloads tradicionalmente dominados por sistemas determinísticos.