Pular para o conteúdo principal

Ajuste os limiares

Os dois limiares decidem o que se consolida automaticamente, o que uma pessoa revisa e o que é ignorado. Esta página os define a partir de evidência, não de palpite.

Limiares são unidades logarítmicas de evidência, não uma nota

Eles não estão numa escala de 0 a 1 e não são percentuais. Cada ponto inteiro dobra a força da evidência exigida, então um limiar de 12 pede evidência cerca de quatro mil vezes mais favorável a uma correspondência do que a uma coincidência. A maioria das outras plataformas usa uma nota limitada, o que torna esta a fonte mais comum de má calibração. Veja como funciona a pontuação probabilística.

Antes de começar

  • Um perfil ativo com blocagem e escadas de comparação configuradas.
  • Pares rotulados — pares que você confirmou como correspondência ou não correspondência. Esta é a entrada de que tudo aqui depende; sem ela você está adivinhando.
  • Permissões por passo: match.labeled-pair.create para construir o conjunto rotulado, match.profile.evaluate para avaliar, match.profile.calibrate-weights para calibrar, match.profile.optimize-thresholds para otimizar, e match-profile.update para salvar o resultado. A falta de qualquer uma falha apenas aquele passo.

1. Construa um conjunto rotulado

Rotule a partir dos seus próprios dados, não de exemplos sintéticos. Os pares que importam são os difíceis:

  • Correspondências confirmadas, especialmente as estranhas — uma mudança de nome, um erro de transcrição, um campo ausente.
  • Não correspondências confirmadas que parecem similares — pai e filho no mesmo endereço, duas pessoas com nome comum na mesma cidade. São essas que impedem o limiar de vínculo automático de ficar baixo demais.

Um conjunto rotulado só com casos fáceis produz limiares que falham exatamente nos casos para os quais você construiu o sistema.

2. Avalie o perfil atual

A avaliação pontua cada par rotulado com a configuração ativa e reporta precisão, abrangência e a distribuição de pontuações.

Leia a distribuição, não só os números de manchete: onde as correspondências conhecidas se agrupam, onde as não correspondências se agrupam, e quanto as duas se sobrepõem? A sobreposição é a sua faixa de revisão manual. Se for enorme, nenhum limiar vai salvá-lo — o poder de discriminação precisa vir de blocagem melhor, escadas melhores ou pesos melhores.

3. Calibre os pesos

Em vez de definir as duas probabilidades por nível à mão, ajuste-as a partir do conjunto rotulado: com que frequência cada nível ocorre entre correspondências verdadeiras, e com que frequência entre não correspondências verdadeiras.

A calibração é protegida — um ajuste que reduziria a qualidade medida é reportado e não aplicado. Confie na proteção; uma calibração que degrada resultados normalmente significa que o conjunto rotulado não é representativo, e não que o ajuste está errado.

4. Defina os limiares

A aba Limiares com a distribuição de pontuações A aba de limiares. A distribuição mostra quantos pares caem de cada lado de cada linha.

Os dois são escolhidos por princípios diferentes.

O vínculo automático é definido por precisão. Ele precisa ficar acima de toda não correspondência conhecida, para que nada que os dados rotulados dizem não ser correspondência se consolide sem supervisão. Uma medida balanceada como F1 não ajuda aqui: ela conta pares de vínculo automático e de revisão manual da mesma forma, então é estruturalmente cega a onde a linha do vínculo automático está.

A revisão manual é definida por capacidade. Baixe-a e você captura mais duplicatas verdadeiras mas enfileira mais pares. Esta é uma decisão operacional — defina-a no volume que seus curadores conseguem de fato trabalhar, e revisite conforme a fila drena.

5. Acrescente uma regra de mínimo de concordância

O ajuste de limiares não protege contra um único atributo sustentar uma correspondência inteira sozinho. Exigir concordância em vários atributos distintos antes do vínculo automático é independente de limiar — vale mesmo se um limiar for mal definido depois.

Defina-a em qualquer tipo de entidade com dados de identidade ricos. Registros que genuinamente correspondem quase sempre concordam em mais de uma coisa.

6. Reavalie e verifique

Reexecute a avaliação e confirme que a precisão na faixa de vínculo automático é a que você exige. Depois rode em modo simulação contra registros reais e inspecione as faixas.

Duas verificações de sanidade que valem sempre

O limiar precisa ser alcançável. Se o limiar de vínculo automático exceder o peso total disponível somando todas as suas escadas, nada jamais poderá se consolidar automaticamente e o tipo de entidade silenciosamente nunca vai consolidar. Some o peso máximo de cada escada e deixe folga real — o ajuste por frequência apenas enfraquece evidência, então um limiar que exige concordância perfeita em tudo é inalcançável na prática também.

A faixa de revisão não pode ser vazia. Se o limiar de revisão manual for igual ou superior ao de vínculo automático, não há faixa de revisão, e todo par ou se consolida ou desaparece.

A seguir


Última verificação no commit d3c2586b (2026-08-03)