← Voltar aos avanços
Infográfico A4Componente AJaneiro–junho de 2026

Seleção de um modelo para busca semântica multilíngue.

A LA Referencia avaliou diferentes alternativas para representar consultas e metadados por seu significado. A seleção considerou a qualidade da recuperação, mas também a execução local, o tamanho dos vetores e a integração com Solr e VuFind.

Ponto de partida

O que é um modelo de embeddings?

É um modelo que transforma textos em representações numéricas. Essas representações permitem comparar uma consulta com títulos ou resumos por seu significado, mesmo quando não usam as mesmas palavras.

Consulta em espanhol“efectos del cambio climático”
modelo de
embeddings
Representação numérica[0,18 · −0,42 · 0,07 · …]
proximidade de
significado

Isso não traduz o documento. O modelo posiciona textos relacionados em um espaço matemático comum para que possam ser comparados.

Critérios de seleção

A qualidade era um critério, mas não o único.

A alternativa selecionada precisava funcionar em uma infraestrutura regional e poder ser aplicada a uma coleção de milhões de registros.

01

Recuperação entre idiomas

Relacionar consultas e documentos expressos em diferentes línguas, vocabulários e sistemas de escrita.

02

Execução local

Operar com um modelo aberto sem depender obrigatoriamente de serviços comerciais externos.

03

Integração

Incorporar-se à arquitetura existente do Apache Solr, do VuFind e dos processos de indexação.

04

Escala

Manter um tamanho de modelo e uma dimensão vetorial viáveis para gerar, armazenar e consultar milhões de representações.

Alternativas analisadas

De uma exploração ampla a seis referências comparáveis.

A avaliação inicial examinou aproximadamente trinta configurações de diferentes famílias, tamanhos e quantizações. A comparação consolidada reuniu seis modelos com perfis distintos.

≈30configurações iniciais
34idiomas no marco inicial
6referências consolidadas
ModeloParâmetrosDimensãoMRR cross-lingualPapel dentro do processo

Ollama, LM Studio e OpenRouter foram usados como ambientes ou serviços para executar e comparar configurações. Eles não são modelos alternativos nesta tabela.

Como foram avaliados

Dois cenários para responder perguntas diferentes.

Um piloto permitiu observar o funcionamento dentro do VuFind e do Solr. Um corpus controlado permitiu comparar modelos usando os mesmos documentos, consultas e métricas.

A

Piloto aplicado

Índice da LA Referencia no VuFind

Registros
30.063
Idiomas
9
Consultas
36
Temas
4

Comparou busca lexical, semântica e híbrida usando hits@10 e nDCG@10.

B

Comparação controlada

Corpus multilíngue do OpenAlex

Documentos
50.000
Idiomas
10
Consultas de item conhecido
19.200
Consultas temáticas
1.440

Comparou MRR, Recall@1, Recall@10 e nDCG@10 em condições homogêneas.

Resultados do piloto

A representação semântica ampliou a recuperação entre idiomas.

No índice piloto de 30.063 registros, a avaliação verificou quantos documentos relevantes apareciam entre os dez primeiros resultados. Esses números correspondem ao recorte avaliado, não à coleção completa.

Quando as palavras não coincidem

A mudança foi especialmente visível entre diferentes sistemas de escrita.

Para consultas em chinês e japonês, a busca lexical não encontrou documentos relevantes entre os dez primeiros resultados do piloto; a busca semântica recuperou 9,8 e 9,3, respectivamente. Em árabe, a modalidade híbrida chegou a 9,5.

Decisão de implementação

O modelo com a maior pontuação não foi automaticamente o selecionado.

O Qwen3-Embedding obteve a maior qualidade cross-lingual. Para a primeira implementação, também foram considerados o volume dos vetores, o tamanho do modelo e a experiência de integração.

Maior pontuação cross-lingual

Qwen3-Embedding-8B

MRR cross-lingual
0,948
Dimensão
4.096
Parâmetros
8,8 bilhões
Componentes vetoriais
4× BGE-M3

Modelo selecionado · primeiro ano

BGE-M3

MRR cross-lingual
0,801
Recall@10
0,897
Dimensão
1.024
Parâmetros
568 milhões

Uma escolha para começar e continuar medindo.

O BGE-M3 foi selecionado por oferecer uma relação adequada entre recuperação multilíngue, execução local, dimensão vetorial, tamanho do modelo e integração com Solr e VuFind. O Qwen3-Embedding permanece como referência de maior qualidade, e o EmbeddingGemma como alternativa compacta para avaliações posteriores.

Da A4 à Demo A2

O modelo selecionado foi posteriormente aplicado à coleção completa.

O resultado da A4 foi incorporado à Demo A2 de busca semântica multilíngue. Nela, o BGE-M3 foi aplicado à coleção completa disponível da LA Referencia, e a versão beta foi publicada para que os usuários possam explorá-la e enviar comentários sobre os resultados e a experiência de busca.

Como ler as evidências

Metodologia e escopo.

Período da avaliação: janeiro–junho de 2026. O marco inicial incluiu aproximadamente trinta configurações e 34 idiomas; os cenários finais usaram 9 e 10 idiomas, respectivamente.

MRR resume a posição do documento correto; Recall@1 e Recall@10 indicam se ele aparece na primeira posição ou entre as dez primeiras; hits@10 conta documentos relevantes na primeira página; nDCG@10 também considera a qualidade da ordenação.

Relação com A2: a versão beta pública sobre a coleção completa pertence à Demo A2 e mostra a aplicação posterior do modelo selecionado na A4.