Pular para o conteúdo principal

Como funciona a pontuação probabilística

Esta página explica o modelo que o motor de comparação implementa. Você não precisa dela para configurar a comparação no dia a dia — as páginas de tarefa cobrem isso. Você precisa dela ao ajustar limiares, explicar uma decisão a um auditor, ou se convencer de que o motor é fundamentado em vez de um amontoado de heurísticas.

O motor implementa o modelo Fellegi-Sunter de vinculação probabilística de registros, a formulação padrão na literatura de vinculação de registros.

As duas probabilidades

Todo nível de comparação carrega dois números.

SímboloPergunta que respondeEm linguagem simples
mEntre pares que genuinamente são a mesma entidade, com que frequência este nível de concordância ocorre?O quão confiavelmente este campo concorda quando dois registros realmente são o mesmo
uEntre pares que genuinamente não são, com que frequência ele ocorre mesmo assim?Com que frequência este campo concorda por puro acaso

Um atributo é informativo quando esses dois números estão distantes. Data de nascimento concordando exatamente tem m alto — registros correspondentes normalmente a compartilham — e u baixo, porque duas pessoas não relacionadas raramente compartilham aniversário. Sexo concordando também tem m alto, mas u perto de um meio, então quase não move a agulha.

O peso

O peso de cada nível é a razão logarítmica dos dois:

peso = log2(m / u)

Positivo quando a concordância é evidência a favor, negativo quando é evidência contra. O peso composto de um par é a soma sobre todo atributo que contribuiu:

composite_weight = Σ peso_i

Como são logaritmos, somá-los multiplica as razões de verossimilhança subjacentes. Esse é exatamente o ponto: a evidência se acumula.

Lendo a escala

Cada ponto inteiro dobra a força da evidência.

Peso compostoA evidência é…
0Igualmente compatível com correspondência e coincidência
4~16× mais compatível com correspondência
8~256× mais compatível
12~4.000× mais compatível
16~65.000× mais compatível
É por isso que limiares não são percentuais

Limiares são definidos nesta escala logarítmica de evidência, não numa nota de 0 a 1. A maioria das outras plataformas usa uma nota limitada, então o instinto de ler um limiar de 12 como "12%" ou "12 de 100" é forte — e errado. Um limiar de 12 exige evidência cerca de quatro mil vezes mais compatível com uma correspondência do que com uma coincidência.

A confiança reportada

O motor também reporta uma probabilidade posterior, que incorpora o quão comuns correspondências são nos seus dados:

posterior = σ( log2(λ / (1 − λ)) + composite_weight )

onde λ é a probabilidade a priori de que um par candidato aleatório seja uma correspondência, e σ é a função logística.

Limiares são comparados ao peso composto, não à probabilidade posterior. Isso é deliberado. O peso composto é evidência pura; a posterior mistura uma suposição sobre a taxa base dos seus dados. Amarrar limiares à posterior significaria reajustá-los toda vez que o volume mudasse, já que a priori muda junto. Manter limiares em unidades de evidência os torna estáveis.

A posterior é reportada porque é o número a citar para uma pessoa: "estamos 99,4% confiantes" é significativo numa fila de revisão de um jeito que "peso composto 14,2" não é.

Ajuste por frequência

Um u fixo por nível assume que todo valor é igualmente provável, o que é falso. Concordar num sobrenome muito comum é evidência fraca; num raro, forte.

O motor ajusta usando frequências observadas nos seus próprios dados:

u_adjusted = max(u_baseline, observed_frequency)

Um valor raro mantém seu u pequeno e portanto seu peso grande. Um valor comum recebe um u inflado, e seu peso é suprimido em direção a zero. Isso acontece por valor, automaticamente, a partir de um instantâneo de frequências que a plataforma mantém.

O ajuste é deliberadamente conservador — ele apenas aumenta u, então só pode enfraquecer evidência, nunca fabricá-la.

Valores anônimos

Alguns valores não carregam informação identificadora alguma: um nome de preenchimento, uma data padrão, um telefone genérico repetido em milhares de registros. Eles são suprimidos na etapa de blocagem em vez de pontuados, porque de outro modo gerariam conjuntos enormes de candidatos que não compartilham nada significativo.

Um valor é suprimido apenas quando é tanto frequente em termos absolutos quanto uma fração relevante dos dados. Exigir os dois importa: num conjunto pequeno, uma regra apenas relativa suprimiria valores comuns que por acaso aparecem duas vezes.

Salvaguardas no vínculo automático

Duas regras restringem o que pode se consolidar sem uma pessoa:

O limiar de vínculo automático é definido por precisão, não por uma medida balanceada. Uma medida combinada como F1 trata pares de vínculo automático e de revisão manual da mesma forma, então é estruturalmente cega a onde a linha do vínculo automático está — movê-la não a altera. O limiar é portanto definido a partir dos dados rotulados como o ponto acima do qual nenhuma não correspondência conhecida cai.

Um número mínimo de atributos concordantes pode ser exigido. Atributos distintos precisam concordar antes de qualquer vínculo automático, a menos que um identificador determinístico tenha resolvido. Isso é independente de limiar: vale mesmo se um limiar for mal definido, e é a defesa contra uma única concordância casual consolidar dois registros.

O que o motor não faz

  • Não aprende sozinho. Pesos vêm de configuração ou de calibração contra pares rotulados que você fornece.
  • Não usa a posterior para classificar em faixas.
  • Não trata um peso alto num atributo como suficiente, quando uma regra de mínimo de concordância está configurada.

A seguir


Última verificação no commit d3c2586b (2026-08-03)