Avalie um LLM judge (avaliador baseado em LLM) como um instrumento de medição versionado. Defina um critério por vez, ancore a rubrica com exemplos, compare vereditos com casos rotulados, teste vieses de posição e verbosidade, meça discordância, permita abstenção e repita a calibração quando modelo ou prompt mudar. Até existir essa evidência, o avaliador deve aconselhar — não bloquear — um lançamento.
Se um avaliador baseado em LLM é confiável para um critério
Conjunto de discordâncias para calibração
Rótulos humanos justificados e fatias representativas
- 01DefinirUm critério
- 02RotularÂncoras + justificativa
- 03MedirViés + discordância
- 04OperarAbster + monitorar
Critério primeiro
Julgue uma qualidade definida por vez#
Fundamentação (groundedness), conformidade com política e conclusão da tarefa são construtos diferentes. Um prompt holístico de “qualidade” deixa o modelo trocar o critério a cada caso e torna a discordância impossível de diagnosticar.
Dê ao avaliador âncoras observáveis para aprovar, aprovar parcialmente, reprovar e se abster. Peça que identifique evidências antes do veredito e guarde a versão da rubrica com o resultado.
Conjunto de calibração
Compare com rótulos que têm proveniência#
Construa um conjunto compacto de positivos claros, negativos claros, limites difíceis e discordâncias legítimas. Cada rótulo precisa de justificativa escrita e, em critérios de alto risco, revisão por especialista.
Meça o comportamento por classe e a discordância, não apenas uma acurácia agregada. Um avaliador pode parecer forte no total e falhar justamente na fatia rara que mais importa.
Inspecione discordâncias, não só concordância
Quatro casos não formam um estudo de calibração; eles tornam a superfície de erro visível e dão um formato inicial concreto ao fluxo.
{"case_id":"a","human":"PASS","judge":"PASS","slice":"direct"}
{"case_id":"b","human":"HOLD","judge":"PASS","slice":"missing_evidence"}
{"case_id":"c","human":"HOLD","judge":"HOLD","slice":"adversarial"}
{"case_id":"d","human":"PASS","judge":"HOLD","slice":"verbose"}Falha exercitada. Os casos b e d mostram erros opostos. Uma única taxa de concordância esconde qual erro o avaliador comete.
Limite de produção. Use rótulos independentes suficientes para estimar incerteza; este conjunto mínimo é didático, não evidência estatística.
Validação adversarial
Teste os vieses já nomeados pela literatura#
- 01
Posição
Inverta a ordem das alternativas; o veredito não deve seguir a posição.
- 02
Verbosidade
Mantenha o sentido e varie o tamanho; a resposta longa não pode vencer por padrão.
- 03
Autopreferência
Oculte a identidade do modelo e compare famílias diferentes.
- 04
Desvio de critério
Reproduza âncoras durante execuções longas e entre versões da rubrica.
Contrato de incerteza
Torne discordância e abstenção visíveis#
Forçar uma resposta converte falta de evidência em certeza falsa. Dê ao avaliador um caminho de abstenção e mantenha a evidência separada da decisão final de política.
Em controles importantes, use julgamentos independentes ou um júri pequeno e inspecione as divergências. Voto majoritário só ajuda quando os jurados não repetem o mesmo modo de falha.
Controle de mudança
Um modelo novo é um instrumento novo#
Atualização de modelo, edição de prompt, mudança de rubrica e parâmetros de geração podem deslocar a distribuição dos vereditos. Fixe e registre tudo, depois reproduza o conjunto estável antes de promover.
Monitore discordância e erros por fatia após o lançamento. Sinais de produção devem ampliar a calibração, não reescrever rótulos antigos silenciosamente.
Limite de validade
O que um avaliador validado pode — e não pode — fazer#
PODE
- Escalar uma rubrica definida sobre muitos casos
- Expor evidências e discordâncias recorrentes
- Proteger comportamentos conhecidos em regressões
- Priorizar casos para revisão humana
NÃO PODE
- Virar referência verdadeira porque parece confiante
- Generalizar automaticamente além da calibração
- Substituir especialistas em decisões críticas
- Eliminar viés com um truque de prompt
Fontes primárias
Fontes primárias
- G-Eval
Etapas explícitas e formulário estruturado.
- MT-Bench and Chatbot Arena
Vieses de posição, verbosidade e autopreferência.
- Replacing Judges with Juries (PoLL)
Painéis de avaliadores baseados em modelos e agregação.
- Who Validates the Validators?
Desvio de critérios em avaliações feitas por LLMs.
Valide quem avalia