A OpenAI anunciou em 22 de setembro de 2026 um novo sistema de caching de prompts para a família GPT-6, com foco em acelerar agentes persistentes e reduzir custos para desenvolvedores que operam aplicações de alto volume.
Caching aprimorado para agentes persistentes
O novo sistema foi projetado para suportar agentes que operam por horas em tarefas longas — como refatoração de grandes bases de código ou produção de documentos extensos. Esses agentes frequentemente fazem múltiplas chamadas à API, reaproveitando instruções, definições de ferramentas e contexto de interações anteriores. O caching de prompts permite que grande parte desse contexto compartilhado seja reutilizado entre requisições, evitando recomputação desnecessária.
Segundo a OpenAI, o sistema atualizado oferece taxas de acerto (cache hit rate) mais altas por padrão. Agora, qualquer prefixo compartilhado e elegível, reutilizado numa janela de 30 minutos, recebe desconto automático: até 90% nos tokens de input cacheados. A empresa cita casos como o do GitHub Copilot, que reduziu em mais de 50% o volume de tokens processados “do zero” em bilhões de requisições, resultando em respostas mais rápidas e custos menores para desenvolvedores fonte.
Ferramentas: monitoramento, diagnóstico e controle granular
Além da infraestrutura aprimorada, a OpenAI lançou um novo Prompt Caching Dashboard para acompanhamento em tempo real do desempenho do cache. Desenvolvedores podem monitorar taxas de acerto, comparar tokens cacheados e não cacheados, e identificar quedas de performance. Para casos de cache miss inesperados, o novo diagnóstico permite comparar requisições e identificar mudanças em modelo, ferramentas, configurações ou input que impediram o reaproveitamento. O relatório detalha o número de tokens afetados, facilitando ajustes para maximizar a eficiência.
Entre os controles avançados, destaca-se a possibilidade de definir explicitamente quais partes do prompt devem ser cacheadas, usando breakpoints. O guia atualizado explica como configurar esses pontos, o tempo de elegibilidade do cache e o impacto de mudanças em ferramentas e instruções. Outra novidade é a capacidade de ajustar o “reasoning effort” (nível de esforço de raciocínio) entre respostas sem invalidar o cache, permitindo otimização de custo para tarefas rotineiras ou mais complexas sem perder contexto reutilizável.
O sistema também recomenda práticas como manter definições de ferramentas estáveis e usar mecanismos como allowed_tools e mensagens de desenvolvedor para preservar o cache mesmo com alterações incrementais no agente. O pré-aquecimento do cache (prewarming) é sugerido para aplicações que precisam de latência mínima, preparando contexto compartilhado logo na inicialização do app.
Impacto prático e depoimentos
Clientes de alto volume confirmaram ganhos substanciais. O CTO da Wordsmith relata redução de custos em 20% após melhorias de poucos pontos percentuais na taxa de acerto do cache, além de alertas automáticos para falhas. O time da Manus elevou o hit rate de 85% para acima de 90% em menos de uma semana, enquanto o Strawberry Browser relatou queda de dois terços nas escritas de cache e redução de 36% nos custos de inferência.
Por que importa
O caching eficiente de prompts se tornou peça-chave para viabilizar agentes que operam de forma contínua e em escala. No contexto brasileiro, onde custos de API ainda são limitadores para startups e times de produto, descontos automáticos e ferramentas de diagnóstico podem destravar novos usos — especialmente em aplicações que dependem de contexto longo ou sessões persistentes. Para equipes técnicas, o controle granular sobre caching e as métricas detalhadas facilitam a otimização de custos sem sacrificar experiência do usuário.
O lançamento reforça a tendência de infraestrutura cada vez mais sofisticada para grandes modelos, reduzindo barreiras para adoção em produção e abrindo espaço para agentes autônomos de ciclo longo.