O Hugging Face Hub anunciou, em 6 de agosto de 2026, a integração da Baseten como novo provedor de inferência. Com isso, desenvolvedores podem rodar modelos hospedados ou servidos pela Baseten diretamente das páginas do Hub, sem necessidade de integração manual ou configuração adicional.
Como funciona a integração
A partir de agora, a Baseten aparece como opção de provedor de inferência em modelos compatíveis no Hugging Face Hub. O usuário pode definir suas preferências de provedores e cadastrar suas próprias chaves de API para a Baseten ou usar o roteamento padrão pelo próprio Hugging Face. Nos dois casos, a cobrança é feita de forma direta: quem usa a chave da Baseten paga na própria conta Baseten; quem roteia pelo Hugging Face paga a tarifa padrão do provedor, sem sobrepreço.
A integração já está disponível nos SDKs oficiais (huggingface_hub para Python, @huggingface/inference para JavaScript). Exemplos na documentação mostram como chamar modelos como DeepSeek V4 Flash e GLM-5.2 usando a Baseten, bastando especificar o provedor no nome do modelo.
Catálogo de modelos e limitações iniciais
A Baseten oferece suporte, neste lançamento, a tarefas de conversação e geração de texto. Entre os modelos disponíveis estão LLMs abertos populares, como Kimi K3, DeepSeek V4 Flash e GLM-5.2. A promessa é de expansão do catálogo e de suporte a mais tipos de tarefas em breve, mas, por ora, a cobertura está restrita a texto.
No comparativo com outros provedores já integrados ao Hugging Face — como DeepInfra e Scaleway —, a Baseten ainda tem catálogo menor, mas aposta na experiência simplificada e na infraestrutura serverless para atrair desenvolvedores que buscam baixo atrito e rápida integração.
Para quem faz sentido
A principal vantagem da Baseten no Hugging Face está no onboarding simplificado para quem já utiliza o ecossistema do Hub, especialmente em projetos que demandam prototipação rápida com LLMs abertos. A cobrança transparente (sem markup extra) e o uso nativo em SDKs e Agent Harnesses (como Pi, OpenCode e Hermes Agents) facilitam a adoção, inclusive em ambientes de produção.
Usuários do plano PRO do Hugging Face contam ainda com créditos mensais de inferência, válidos inclusive para modelos servidos pela Baseten. Para equipes que buscam infraestrutura serverless, a novidade reduz a necessidade de orquestração própria e permite comparar múltiplos provedores de inferência sem sair do Hub.
Pontos de atenção
A integração inicial é restrita a tarefas de texto, e o catálogo de modelos ainda não rivaliza com o de alguns concorrentes. Para projetos que dependem de visão computacional, text-to-speech ou outros domínios, será preciso aguardar as próximas fases da integração. O modelo de cobrança, por outro lado, é transparente e não adiciona custos extras além dos praticados pelo provedor.
A chegada da Baseten ao Hugging Face Hub reforça o movimento de abertura e pluralidade na infraestrutura de inferência, dando ao desenvolvedor liberdade para escolher provedores conforme preço, performance ou preferências técnicas.