A OpenAI publicou detalhes técnicos sobre a evolução de sua plataforma de armazenamento, Habitat, que atualmente sustenta mais de 1 bilhão de usuários semanais do ChatGPT e outros produtos da empresa. O relato, assinado por membros da equipe de engenharia, expõe como o sistema foi adaptado em ritmo acelerado para lidar com volumes e demandas inéditas.
Habitat: de biblioteca Python a serviço distribuído
O Habitat nasceu em meados de 2024 como uma biblioteca Python simples, conectada diretamente ao banco de dados principal (Azure Cosmos DB). O objetivo era abstrair a complexidade do gerenciamento de dados para engenheiros de produto, permitindo operações básicas de storage sem exposição a detalhes de schema, roteamento, autorização ou serialização.
A adoção interna foi rápida, favorecida pelo design que automatizava tarefas como caching, compressão e criptografia no lado do cliente. Com o tempo, a biblioteca virou peça central para produtos como ChatGPT e Codex, sem que houvesse uma migração forçada a partir de soluções self-service como Postgres ou Cosmos DB.
Crescimento e limites: a transição para serviço
À medida que o número de usuários e serviços cresceu, a abordagem client-side mostrou-se insuficiente. Em meados de 2025, a equipe identificou entraves em protocolos retrocompatíveis e dificuldades para orquestrar mudanças, como a distribuição regional de dados críticos para mitigar falhas. O processo de atualização, que exigia deploys coordenados entre dezenas de equipes, passou a consumir dias.
A resposta foi transformar o Habitat em um serviço distribuído — centralizando lógica de storage, controle de deployments e observabilidade. O resultado é uma arquitetura capaz de processar mais de 70 milhões de requisições por segundo, atendendo a mais de 1 bilhão de pessoas semanalmente e operando sobre 500 petabytes de dados, distribuídos em quase 40 regiões geográficas.
Stack técnica e desafios de escala
Apesar de ser incomum para sistemas de storage em larga escala, o Habitat manteve Python como linguagem principal, exigindo otimizações para garantir performance e confiabilidade. O serviço coordena múltiplos recursos: caches (Valkey), storage blob, streaming (Kafka), camadas de autorização, multi-tenancy e políticas de data residency. O backend segue integrado ao Azure Cosmos DB, mas com abstrações para facilitar futuras migrações ou expansão para outros tipos de storage.
O texto destaca que a principal dificuldade não foi técnica, mas o ritmo do crescimento: a equipe enfrentou picos de 10x de escala ano após ano, obrigando decisões táticas para extrair o máximo da stack existente enquanto investiam em fundações de longo prazo.
Perspectivas
Este é o primeiro post de uma série sobre o scaling do Habitat. A OpenAI promete abordar em mais detalhes, em próxima publicação, tópicos como multi-tenancy, otimização de leitura e a parceria com o Azure Cosmos DB para absorver a demanda massiva.
O relato ilustra a complexidade operacional de sistemas que sustentam produtos globais de IA, e serve como referência para times que enfrentam desafios similares de crescimento acelerado e arquitetura orientada a serviços.