O Sentence Transformers, biblioteca popular para geração de embeddings e reranking, recebeu em 18 de agosto de 2026 uma atualização relevante: a versão 6.0 introduz o MultiVectorEncoder, modelo ColBERT-style para buscas com interação tardia. O recurso amplia as opções para quem trabalha com retrieval augmented generation, busca semântica e sistemas de recomendação.
O que muda com MultiVectorEncoder
Modelos de embedding tradicionais comprimem todo um texto em um único vetor fixo. Embora eficiente, essa abordagem perde detalhamento: entidades raras, identificadores exatos ou requisitos múltiplos acabam diluídos. O MultiVectorEncoder, seguindo a linha do ColBERT, preserva um vetor para cada token. Na prática, cada documento vira uma matriz (ex: 9 tokens → 9x128), e a comparação entre consulta e documento é feita token a token, usando o operador MaxSim. Isso permite que cada termo da consulta encontre o melhor correspondente no documento, sem sacrificar precisão em casos de múltiplos requisitos ou buscas sensíveis a detalhes.
A implementação aceita checkpoints do PyLate, ColBERT (Stanford-NLP) e modelos colpali-engine (para busca em documentos visuais). Tudo integrado à API já familiar do Sentence Transformers, facilitando adoção em stacks existentes.
Vantagens e custos
A principal vantagem é o ganho em qualidade de recuperação, especialmente em cenários onde detalhes específicos determinam a relevância do resultado. Exemplo: buscas que exigem múltiplos atributos (“sofá verde com pés de madeira e almofadas arredondadas”) se beneficiam, pois cada requisito pode ser casado individualmente com o documento. Isso também vale para domínios fora do escopo do treinamento original do modelo, onde compressão densa pode falhar.
O custo está no tamanho do índice: manter um vetor por token multiplica o espaço necessário e torna a busca mais custosa computacionalmente. Porém, o modelo ainda permite indexação offline dos documentos, mantendo parte da eficiência dos bi-encoders, sem exigir re-encoding a cada consulta como nos cross-encoders.
Novidades para documentos visuais
O MultiVectorEncoder também habilita busca em documentos visuais, permitindo que consultas em texto sejam comparadas diretamente com imagens de páginas, sem OCR intermediário. Isso é relevante para cenários como busca jurídica ou acadêmica, onde documentos digitalizados são frequentes.
Por que importa
A chegada do MultiVectorEncoder ao Sentence Transformers democratiza o acesso a técnicas de recuperação mais precisas, antes restritas a implementações especializadas. Para equipes brasileiras que já usam a biblioteca em projetos de busca, recomendação ou RAG, a adoção deve ser direta. O suporte nativo a checkpoints ColBERT e PyLate reduz barreiras de integração e abre caminho para experimentos com dados visuais, ampliando o leque de aplicações em português e outros idiomas.