Crie um perfil de comparação
Um perfil de comparação é a configuração completa que governa como um tipo de entidade é comparado. Esta página cria um e o ativa.
Antes de começar
- Um tipo de entidade com seus atributos definidos. Veja Modele seus dados.
- Regras de padronização configuradas para os atributos que você vai comparar. O comparador lê valores canônicos, então padronizar primeiro melhora materialmente os resultados.
- Permissões por passo:
match-profile.createpara o perfil,match-profile.blocking-strategy.create,match-profile.comparison-level.createematch-profile.survivorship-rule.createpara suas partes,match-profile.maintainpara construir chaves de bloco e frequências, eentity.matchpara rodar a verificação em modo simulação.
1. Crie o perfil
A aba de visão geral do perfil, onde ele é criado e depois ativado.
Crie o perfil com seus limiares e a probabilidade a priori. Limiares estão na escala logarítmica de evidência — veja como funciona a pontuação probabilística antes de escolhê-los.
Comece deliberadamente conservador. Um perfil que consolida de menos deixa trabalho na fila de revisão; um que consolida demais corrompe registros dourados e exige desfazer.
2. Acrescente estratégias de blocagem
A aba de blocagem. Cada estratégia deriva suas próprias chaves; um registro é candidato se qualquer uma casar.
A blocagem reúne pares candidatos. Cada estratégia deriva uma chave de um ou mais atributos; registros que compartilham uma chave são comparados.
Desenhe para abrangência: um par que nenhuma estratégia propõe nunca poderá corresponder, qualquer que fosse a evidência. Várias estratégias estreitas funcionam melhor que uma ampla — cada uma captura um modo de falha diferente.
| Formato da estratégia | Captura | Perde |
|---|---|---|
| CEP exato mais inicial do sobrenome | Domicílios típicos | Quem mudou de endereço |
| Sobrenome fonético mais ano de nascimento | Variantes de grafia e transcrição | Mudanças de nome |
| Parte local do e-mail | Contatos compartilhados | Registros sem e-mail |
Use várias. A sobreposição é o ponto.
3. Acrescente escadas de comparação
A aba de escadas. Cada degrau carrega seu comparador e duas probabilidades; o peso é derivado delas.
Para cada atributo que carrega identidade, defina uma escada ordenada do mais estrito ao mais tolerante. O motor assume o primeiro nível que se encaixa.
Toda escada precisa terminar num nível abrangente que corresponde a qualquer coisa, que é o que registra uma divergência. Sem ele, uma divergência não contribui nada em vez de contar contra o par.
Marque um nível como determinístico apenas quando a concordância nele sozinha deva resolver uma correspondência — um identificador nacional, um número de passaporte. Níveis determinísticos curto-circuitam a pontuação inteira, então reserve-os para identificadores em que você confia sem corroboração.
4. Acrescente regras de sobrevivência
A aba de sobrevivência, onde se decide o valor vencedor por atributo.
Decida qual valor vence por atributo quando origens discordam. Atributos sem regra recaem no padrão do motor.
Para atributos multivalorados como e-mail ou endereço, a estratégia de agregação preserva todo valor distinto em vez de colapsar num só — normalmente o que você quer para dados de contato.
5. Ative
Ativar desativa qualquer outro perfil do mesmo tipo de entidade, atomicamente. Exatamente um perfil fica ativo por tipo de entidade por vez; dois produziriam resultados não determinísticos.
6. Prepare os dados
Antes de comparar, a plataforma precisa de chaves de bloco computadas e frequências de valor capturadas. Rode a manutenção do perfil para construí-las.
Os dados de frequência são o que alimenta o ajuste que suprime valores comuns, então comparar antes que existam produz resultados sistematicamente piores.
7. Verifique
A aba sandbox. Pontue um par sem gravar nada e leia a contribuição de cada atributo.
Rode uma comparação em modo simulação num registro que você sabe ter uma duplicata. Ela pontua candidatos e devolve os pares que criaria, sem gravar nada.
Verifique que:
- A duplicata conhecida aparece entre os candidatos. Se não, o problema é blocagem — nenhuma mudança de limiar vai ajudar.
- Seu peso composto cai na faixa que você esperava.
- As contribuições por atributo fazem sentido: atributos de alto valor sustentando o peso, valores comuns contribuindo pouco.
Se uma duplicata conhecida está ausente, acrescente uma estratégia de blocagem que a capturaria e rode a manutenção de novo.
A seguir
- Ajuste os limiares contra dados rotulados
- Revise correspondências potenciais
- Referência do perfil de comparação
Última verificação no commit d3c2586b (2026-08-03)