A equipe da Photoroom publicou em 6 de julho de 2026 um artigo detalhando a estratégia de dados utilizada no treinamento do modelo PRX, seu sistema proprietário para geração e manipulação avançada de imagens. O texto revela os princípios, escolhas técnicas e aprendizados que guiaram a construção do pipeline de dados, reforçando a importância da diversidade e do pragmatismo no pré-treinamento de modelos de visão.
Diversidade como princípio: amplitude antes do refinamento
Segundo a Photoroom, o objetivo na fase de pré-treinamento era montar um dataset amplo e heterogêneo, capaz de expor o modelo à maior variedade possível de conceitos visuais, composições e contextos. O foco, neste estágio, não era obter imagens “perfeitas” ou esteticamente refinadas, mas garantir cobertura de temas, objetos e estilos. O refinamento para gerar imagens mais polidas é reservado para etapas posteriores de fine-tuning, com conjuntos de dados menores e criteriosamente curados. A equipe reforça que filtrar excessivamente por estética na largada pode limitar o repertório do modelo e prejudicar sua generalização.
Montagem pragmática: fontes públicas e internas
O pipeline do PRX combina datasets públicos e internos, priorizando amplitude e aproveitando curadorias já existentes, inclusive filtros de qualidade, deduplicação e remoção de conteúdo sensível. A Photoroom optou por não reconstruir todo o processo de curadoria do zero, mas sim integrar fontes já filtradas sempre que possível. As imagens chegam em diversos formatos, algumas com dados brutos, outras apenas com metadados ou legendas que precisam ser padronizadas.
Legendas longas e precisas: impacto direto na qualidade
Um dos achados práticos do time foi o impacto positivo de legendas extensas e detalhadas para cada imagem. No histórico do PRX, a troca de legendas curtas por longas resultou em melhora significativa na qualidade das amostras geradas. O racional é que descrições fiéis permitem ao modelo aprender atributos condicionais — como presença de texto, logos ou screenshots — que podem ser controlados por prompt, em vez de se tornarem “ruído” imprevisível. Por isso, a filtragem posterior é leve: remove apenas o irrecuperável, sem eliminar imagens apenas “imperfeitas”.
Formatos: Mosaic Data Shards (MDS) e Lance
O pipeline utiliza dois formatos principais. O Mosaic Data Shards (MDS) serve como base para treinamento distribuído por sua flexibilidade, performance e integração com armazenamento em nuvem. Já o Lance é empregado para engenharia de features e curadoria, graças à indexação eficiente e busca vetorial — útil para manipular datasets com bilhões de linhas. Essencialmente, Lance é usado para montagem e filtragem; MDS, para streaming nos jobs de treinamento.
Codificação textual: trade-off entre performance e flexibilidade
Historicamente, o PRX usava um encoder textual baseado em T5Gemma, pré-computando os latents e armazenando-os em MDS. Na versão mais recente, migraram para o encoder Qwen3-VL, optando por calcular os latents em tempo real durante o treinamento. O custo de throughput foi modesto (3–4% de perda), considerado aceitável para um modelo de 7B parâmetros. Em troca, o time ganhou flexibilidade: mudar o encoder não exige reprocessar terabytes de dados, e o dataset fica mais leve para armazenamento local.
Compressão de imagens: JPEG 92 com validação empírica
Todas as imagens foram convertidas para JPEG com qualidade 92, em vez de formatos lossless como PNG. A escolha foi validada empiricamente: a equipe avaliou se recompressões sucessivas degradavam perceptivelmente as imagens e concluiu que, no contexto de datasets reais, o impacto era desprezível. O objetivo era manter o dataset compacto sem sacrificar a utilidade para o modelo.
Por que importa
A abordagem da Photoroom reforça que, para modelos de visão competitivos, diversidade e escala de dados pesam tanto quanto avanços arquiteturais. O pragmatismo na montagem do dataset — aproveitando curadorias existentes e priorizando legendas ricas — acelera ciclos de desenvolvimento e reduz custos operacionais. Para equipes brasileiras de IA, o case serve como referência prática: investir em pipelines flexíveis e em legendas detalhadas pode trazer ganhos de performance sem elevar drasticamente a complexidade técnica ou o orçamento.