Comparação em resumo
Todo o fluxo, de ponta a ponta.
O fluxo
As peças
| Peça | Decide | Configurada por |
|---|---|---|
| Estratégia de blocagem | Quais pares vale comparar | Atributos mais uma transformação, combinados em chaves |
| Escada de comparação | Quão bem dois valores concordam | Uma lista ordenada de níveis por atributo |
| Peso de correspondência | Quanto essa concordância vale | Duas probabilidades por nível, como razão logarítmica |
| Limiares | Consolidar, revisar ou ignorar | Dois números na escala de evidência |
| Regras de sobrevivência | Qual valor vence após a consolidação | Uma estratégia por atributo |
As cinco vivem num perfil de comparação, escopado a um tipo de entidade. Uma organização pode ter vários perfis por tipo com um ativo por vez, o que é o que torna possível implantação gradual e comparação lado a lado.
Um exemplo trabalhado
Tome os registros do CRM e do ERP em o exemplo de referência e pontue-os com o perfil de pessoa do pacote bancário dos EUA, cujo limiar de vínculo automático é 30,0 e cujo piso de revisão manual é 5,0.
Cada peso abaixo é log2(m / u) calculado a partir das probabilidades do próprio
perfil. Nada aqui é ilustrativo.
| Atributo | Concordância | Nível | m | u | Peso |
|---|---|---|---|---|---|
date_of_birth | 1979-08-22 nos dois | exato | 0.98 | 0.0003 | +11,674 |
phone | +15553001001 nos dois | exato | 0.80 | 0.0001 | +12,966 |
address.line1 | 12 Old Mill Road / 12 Old Mill Rd | exato após padronização | 0.50 | 0.03 | +4,059 |
address.postalCode | 06103 nos dois | exato | 0.55 | 0.06 | +3,196 |
address.city | Hartford nos dois | exato | 0.55 | 0.12 | +2,196 |
address.country | US nos dois | igual | 0.92 | 0.65 | +0,501 |
email | diferente | divergência | 0.10 | 0.9979 | −3,319 |
| Subtotal | +31,273 |
Leia o que esses números dizem.
O telefone sustenta o caso — um número compartilhado vale quase 13 pontos
porque duas pessoas sem relação compartilharem um é improvável ao extremo. A data
de nascimento vale quase tanto. O endereço contribui com quatro parcelas pequenas
em vez de uma grande, e address.line1 só concorda porque a padronização expandiu
Rd para road antes de qualquer comparação. O e-mail discordante contou
contra o par.
Por que os nomes decidem
O subtotal acima já passou do limiar de 30,0 — mas ele omite deliberadamente
first_name e last_name, porque se Jon e Jonathan alcançam um degrau
aproximado ou caem em divergência é decidido pelo comparador em tempo de
execução, não pela leitura do perfil.
Essa omissão é a lição inteira:
| Se o nome… | Contribui | Total | Resultado |
|---|---|---|---|
cai em mismatch | −4,539 | +26,73 | revisão manual |
| alcança um degrau aproximado | ≥ 0 | ≥ +31,27 | vínculo automático |
Um campo, num par onde seis outros sinais já concordam, move isto entre consolidado automaticamente e uma pessoa decide. Isso não é falha de ajuste — é a faixa de revisão fazendo seu trabalho.
Um perfil declara m e u. O motor calcula log2(m / u) quando o nível é
criado. Você não encontrará um campo weight para definir.
Note também que essas probabilidades são prévias — valores iniciais deliberados, baseados na literatura, não medições dos seus dados. O próprio perfil distribuído diz isso, e o ajuste é como elas deixam de ser palpites.
O que você configura, em ordem
- Tipo de entidade e atributos — a comparação opera sobre o que você modelou.
- Padronização — normalize valores primeiro; o comparador lê formas canônicas.
- Estratégias de blocagem — generosas o bastante para que pares verdadeiros sejam sempre propostos.
- Escadas de comparação — uma por atributo que carrega identidade.
- Pesos — a partir dos seus próprios pares rotulados quando possível.
- Limiares — vínculo automático definido por precisão, revisão definida pela capacidade de revisão que você tem.
- Regras de sobrevivência — qual origem vence, por atributo.
A seguir
- Crie um perfil de comparação
- Como funciona a pontuação probabilística
- Referência do perfil de comparação
Última verificação no commit d3c2586b (2026-08-03)