Pular para o conteúdo principal

Crie um perfil de comparação

Um perfil de comparação é a configuração completa que governa como um tipo de entidade é comparado. Esta página cria um e o ativa.

Antes de começar

  • Um tipo de entidade com seus atributos definidos. Veja Modele seus dados.
  • Regras de padronização configuradas para os atributos que você vai comparar. O comparador lê valores canônicos, então padronizar primeiro melhora materialmente os resultados.
  • Permissões por passo: match-profile.create para o perfil, match-profile.blocking-strategy.create, match-profile.comparison-level.create e match-profile.survivorship-rule.create para suas partes, match-profile.maintain para construir chaves de bloco e frequências, e entity.match para rodar a verificação em modo simulação.

1. Crie o perfil

A aba de visão geral do perfil A aba de visão geral do perfil, onde ele é criado e depois ativado.

Crie o perfil com seus limiares e a probabilidade a priori. Limiares estão na escala logarítmica de evidência — veja como funciona a pontuação probabilística antes de escolhê-los.

Comece deliberadamente conservador. Um perfil que consolida de menos deixa trabalho na fila de revisão; um que consolida demais corrompe registros dourados e exige desfazer.

2. Acrescente estratégias de blocagem

A aba Blocagem com as estratégias de coleta de candidatos A aba de blocagem. Cada estratégia deriva suas próprias chaves; um registro é candidato se qualquer uma casar.

A blocagem reúne pares candidatos. Cada estratégia deriva uma chave de um ou mais atributos; registros que compartilham uma chave são comparados.

Desenhe para abrangência: um par que nenhuma estratégia propõe nunca poderá corresponder, qualquer que fosse a evidência. Várias estratégias estreitas funcionam melhor que uma ampla — cada uma captura um modo de falha diferente.

Formato da estratégiaCapturaPerde
CEP exato mais inicial do sobrenomeDomicílios típicosQuem mudou de endereço
Sobrenome fonético mais ano de nascimentoVariantes de grafia e transcriçãoMudanças de nome
Parte local do e-mailContatos compartilhadosRegistros sem e-mail

Use várias. A sobreposição é o ponto.

3. Acrescente escadas de comparação

A aba Escadas com os níveis de comparação por atributo A aba de escadas. Cada degrau carrega seu comparador e duas probabilidades; o peso é derivado delas.

Para cada atributo que carrega identidade, defina uma escada ordenada do mais estrito ao mais tolerante. O motor assume o primeiro nível que se encaixa.

Toda escada precisa terminar num nível abrangente que corresponde a qualquer coisa, que é o que registra uma divergência. Sem ele, uma divergência não contribui nada em vez de contar contra o par.

Marque um nível como determinístico apenas quando a concordância nele sozinha deva resolver uma correspondência — um identificador nacional, um número de passaporte. Níveis determinísticos curto-circuitam a pontuação inteira, então reserve-os para identificadores em que você confia sem corroboração.

4. Acrescente regras de sobrevivência

A aba Sobrevivência com as regras por atributo A aba de sobrevivência, onde se decide o valor vencedor por atributo.

Decida qual valor vence por atributo quando origens discordam. Atributos sem regra recaem no padrão do motor.

Para atributos multivalorados como e-mail ou endereço, a estratégia de agregação preserva todo valor distinto em vez de colapsar num só — normalmente o que você quer para dados de contato.

5. Ative

Ativar desativa qualquer outro perfil do mesmo tipo de entidade, atomicamente. Exatamente um perfil fica ativo por tipo de entidade por vez; dois produziriam resultados não determinísticos.

6. Prepare os dados

Antes de comparar, a plataforma precisa de chaves de bloco computadas e frequências de valor capturadas. Rode a manutenção do perfil para construí-las.

Os dados de frequência são o que alimenta o ajuste que suprime valores comuns, então comparar antes que existam produz resultados sistematicamente piores.

7. Verifique

A aba Sandbox pontuando um par de registros A aba sandbox. Pontue um par sem gravar nada e leia a contribuição de cada atributo.

Rode uma comparação em modo simulação num registro que você sabe ter uma duplicata. Ela pontua candidatos e devolve os pares que criaria, sem gravar nada.

Verifique que:

  • A duplicata conhecida aparece entre os candidatos. Se não, o problema é blocagem — nenhuma mudança de limiar vai ajudar.
  • Seu peso composto cai na faixa que você esperava.
  • As contribuições por atributo fazem sentido: atributos de alto valor sustentando o peso, valores comuns contribuindo pouco.

Se uma duplicata conhecida está ausente, acrescente uma estratégia de blocagem que a capturaria e rode a manutenção de novo.

A seguir


Última verificação no commit d3c2586b (2026-08-03)