A OpenAI revelou detalhes inéditos sobre o Habitat, sua plataforma de armazenamento online, que agora sustenta mais de 1 bilhão de usuários semanais e processa 70 milhões de requisições por segundo. O anúncio, publicado em 11 de setembro de 2026, descreve os desafios e soluções adotados para acompanhar o crescimento explosivo dos produtos da empresa, incluindo ChatGPT e Codex.Fonte
De biblioteca Python a serviço distribuído
O Habitat foi lançado originalmente em 2023 como uma biblioteca Python simples, conectando produtos OpenAI a bancos de dados como Azure Cosmos DB. O objetivo era abstrair a complexidade do armazenamento dos engenheiros de produto: operações como roteamento, autorização, encriptação e lookup de schema eram tratadas automaticamente. Essa abordagem facilitou a adoção interna sem exigir migrações forçadas de Postgres ou Cosmos DB.
À medida que a base de usuários cresceu — mais de 10 vezes ao ano por três anos consecutivos —, a solução original atingiu seus limites. O aumento no número de serviços e a necessidade de mudanças de protocolo tornaram a coordenação entre times inviável via biblioteca cliente. Uma simples alteração de roteamento para reduzir o impacto de falhas regionais demandava dias de coordenação manual.
Habitat hoje: escala, resiliência e multi-região
A evolução natural foi transformar o Habitat de uma biblioteca cliente para um serviço dedicado, centralizando o controle sobre deploys, observabilidade e aprimoramentos de plataforma. Hoje, o Habitat opera como um sistema distribuído de grande porte, servindo mais de 500 petabytes de dados através de quase 40 regiões geográficas. O serviço faz interface com múltiplos recursos de armazenamento — Cosmos DB, caches Valkey, blob storage, e integrações com serviços como Databricks, Rockset e Kafka.
A arquitetura atual permite recursos como:
- Multi-tenancy e isolamento de dados.
- Políticas de acesso (ACL) e controle de autorização.
- Residência e compliance de dados (data residency).
- Rate limiting e modelagem de tráfego.
- Camadas de cache e compressão para otimizar performance.
Essas capacidades sustentam uma operação que, segundo a OpenAI, já ultrapassa a marca de 500 PB armazenados e 70 milhões de requisições por segundo.
Por que importa
A escalabilidade do Habitat mostra que o gargalo da IA generativa já não está apenas no modelo, mas também na infraestrutura de dados. Para o mercado brasileiro, a lição é clara: qualquer aplicação que mire milhões de usuários precisa considerar desde cedo estratégias de abstração e serviço para armazenamento — e não confiar apenas em soluções prontas de banco de dados. O movimento da OpenAI antecipa desafios que logo vão atingir empresas locais que buscam expandir produtos baseados em IA.
A segunda parte da série deve detalhar como o Habitat lida com confiabilidade em multi-tenancy e otimização de leitura em escala.