Pular para o conteúdo principal

Crie um Perfil de Comparação

Um perfil de comparação é a configuração completa que governa como um tipo de entidade é comparado. Esta página cria um e o ativa.

Antes de começar​

  • Um tipo de entidade com seus atributos definidos. Veja Modele seus dados.
  • Regras de padronização configuradas para os atributos que você vai comparar. O comparador lê valores canônicos, então padronizar primeiro melhora materialmente os resultados.
  • Permissões por passo: match-profile.create para o perfil, match-profile.blocking-strategy.create, match-profile.comparison-level.create e match-profile.survivorship-rule.create para suas partes, match-profile.maintain para construir chaves de bloco e frequências, e entity.match para rodar a verificação em modo simulação.

1. Crie o perfil​

A aba de visão geral do perfil A aba de visão geral do perfil, onde ele é criado e depois ativado.

Crie o perfil com seus limiares e a probabilidade a priori. Limiares estão na escala logarítmica de evidência — veja como funciona a pontuação probabilística antes de escolhê-los.

Comece deliberadamente conservador. Um perfil que consolida de menos deixa trabalho na fila de revisão; um que consolida demais corrompe registros dourados e exige desfazer.

2. Acrescente estratégias de blocagem​

A aba Blocagem com as estratégias de coleta de candidatos A aba de blocagem. Cada estratégia deriva suas próprias chaves; um registro é candidato se qualquer uma casar.

A blocagem reúne pares candidatos. Cada estratégia deriva uma chave de um ou mais atributos; registros que compartilham uma chave são comparados.

Desenhe para abrangência: um par que nenhuma estratégia propõe nunca poderá corresponder, qualquer que fosse a evidência. Várias estratégias estreitas funcionam melhor que uma ampla — cada uma captura um modo de falha diferente.

Formato da estratégiaCapturaPerde
CEP exato mais inicial do sobrenomeDomicílios típicosQuem mudou de endereço
Sobrenome fonético mais ano de nascimentoVariantes de grafia e transcriçãoMudanças de nome
Parte local do e-mailContatos compartilhadosRegistros sem e-mail

Use várias. A sobreposição é o ponto.

3. Acrescente escadas de comparação​

A aba Escadas com os níveis de comparação por atributo A aba de escadas. Cada degrau carrega seu comparador e duas probabilidades; o peso é derivado delas.

Para cada atributo que carrega identidade, defina uma escada ordenada do mais estrito ao mais tolerante. O motor assume o primeiro nível que se encaixa.

Toda escada precisa terminar num nível abrangente que corresponde a qualquer coisa, que é o que registra uma divergência. Sem ele, uma divergência não contribui nada em vez de contar contra o par.

Marque um nível como determinístico apenas quando a concordância nele sozinha deva resolver uma correspondência — um identificador nacional, um número de passaporte. Níveis determinísticos curto-circuitam a pontuação inteira, então reserve-os para identificadores em que você confia sem corroboração.

4. Acrescente regras de sobrevivência​

A aba Sobrevivência com as regras por atributo A aba de sobrevivência, onde se decide o valor vencedor por atributo.

Decida qual valor vence por atributo quando origens discordam. Atributos sem regra recaem no padrão do motor.

Para atributos multivalorados como e-mail ou endereço, a estratégia de agregação preserva todo valor distinto em vez de colapsar num só — normalmente o que você quer para dados de contato.

5. Ative​

Ativar desativa qualquer outro perfil do mesmo tipo de entidade, atomicamente. Exatamente um perfil fica ativo por tipo de entidade por vez; dois produziriam resultados não determinísticos.

6. Prepare os dados​

Antes de comparar, a plataforma precisa de chaves de bloco computadas e frequências de valor capturadas. Rode a manutenção do perfil para construí-las.

Os dados de frequência são o que alimenta o ajuste que suprime valores comuns, então comparar antes que existam produz resultados sistematicamente piores.

7. Verifique​

A aba Sandbox pontuando um par de registros A aba sandbox. Pontue um par sem gravar nada e leia a contribuição de cada atributo.

Rode uma comparação em modo simulação num registro que você sabe ter uma duplicata. Ela pontua candidatos e devolve os pares que criaria, sem gravar nada.

Verifique que:

  • A duplicata conhecida aparece entre os candidatos. Se não, o problema é blocagem — nenhuma mudança de limiar vai ajudar.
  • Seu peso composto cai na faixa que você esperava.
  • As contribuições por atributo fazem sentido: atributos de alto valor sustentando o peso, valores comuns contribuindo pouco.

Se uma duplicata conhecida está ausente, acrescente uma estratégia de blocagem que a capturaria e rode a manutenção de novo.

A seguir​