Pular para o conteúdo principal

Comparação em resumo

Todo o fluxo, de ponta a ponta.

O fluxo

As peças

PeçaDecideConfigurada por
Estratégia de blocagemQuais pares vale compararAtributos mais uma transformação, combinados em chaves
Escada de comparaçãoQuão bem dois valores concordamUma lista ordenada de níveis por atributo
Peso de correspondênciaQuanto essa concordância valeDuas probabilidades por nível, como razão logarítmica
LimiaresConsolidar, revisar ou ignorarDois números na escala de evidência
Regras de sobrevivênciaQual valor vence após a consolidaçãoUma estratégia por atributo

As cinco vivem num perfil de comparação, escopado a um tipo de entidade. Uma organização pode ter vários perfis por tipo com um ativo por vez, o que é o que torna possível implantação gradual e comparação lado a lado.

Um exemplo trabalhado

Tome os registros do CRM e do ERP em o exemplo de referência e pontue-os com o perfil de pessoa do pacote bancário dos EUA, cujo limiar de vínculo automático é 30,0 e cujo piso de revisão manual é 5,0.

Cada peso abaixo é log2(m / u) calculado a partir das probabilidades do próprio perfil. Nada aqui é ilustrativo.

AtributoConcordânciaNívelmuPeso
date_of_birth1979-08-22 nos doisexato0.980.0003+11,674
phone+15553001001 nos doisexato0.800.0001+12,966
address.line112 Old Mill Road / 12 Old Mill Rdexato após padronização0.500.03+4,059
address.postalCode06103 nos doisexato0.550.06+3,196
address.cityHartford nos doisexato0.550.12+2,196
address.countryUS nos doisigual0.920.65+0,501
emaildiferentedivergência0.100.9979−3,319
Subtotal+31,273

Leia o que esses números dizem.

O telefone sustenta o caso — um número compartilhado vale quase 13 pontos porque duas pessoas sem relação compartilharem um é improvável ao extremo. A data de nascimento vale quase tanto. O endereço contribui com quatro parcelas pequenas em vez de uma grande, e address.line1 só concorda porque a padronização expandiu Rd para road antes de qualquer comparação. O e-mail discordante contou contra o par.

Por que os nomes decidem

O subtotal acima já passou do limiar de 30,0 — mas ele omite deliberadamente first_name e last_name, porque se Jon e Jonathan alcançam um degrau aproximado ou caem em divergência é decidido pelo comparador em tempo de execução, não pela leitura do perfil.

Essa omissão é a lição inteira:

Se o nome…ContribuiTotalResultado
cai em mismatch−4,539+26,73revisão manual
alcança um degrau aproximado≥ 0≥ +31,27vínculo automático

Um campo, num par onde seis outros sinais já concordam, move isto entre consolidado automaticamente e uma pessoa decide. Isso não é falha de ajuste — é a faixa de revisão fazendo seu trabalho.

O peso é derivado, nunca configurado

Um perfil declara m e u. O motor calcula log2(m / u) quando o nível é criado. Você não encontrará um campo weight para definir.

Note também que essas probabilidades são prévias — valores iniciais deliberados, baseados na literatura, não medições dos seus dados. O próprio perfil distribuído diz isso, e o ajuste é como elas deixam de ser palpites.

O que você configura, em ordem

  1. Tipo de entidade e atributos — a comparação opera sobre o que você modelou.
  2. Padronização — normalize valores primeiro; o comparador lê formas canônicas.
  3. Estratégias de blocagem — generosas o bastante para que pares verdadeiros sejam sempre propostos.
  4. Escadas de comparação — uma por atributo que carrega identidade.
  5. Pesos — a partir dos seus próprios pares rotulados quando possível.
  6. Limiares — vínculo automático definido por precisão, revisão definida pela capacidade de revisão que você tem.
  7. Regras de sobrevivência — qual origem vence, por atributo.

A seguir


Última verificação no commit d3c2586b (2026-08-03)