Claude Platform Docs
Melhores práticasTestar e avaliar

Defina critérios de sucesso e crie avaliações

Defina critérios de sucesso mensuráveis para sua aplicação com LLM e crie avaliações para testá-la, desde verificações de correspondência exata até avaliação baseada em LLM.

Construir uma aplicação bem-sucedida baseada em "large language model" (modelo de linguagem grande), ou LLM, começa com a definição clara dos seus critérios de sucesso e, em seguida, com o design de avaliações para medir o desempenho em relação a eles. Esse ciclo é central para a engenharia de prompts.

Fluxograma de "prompt engineering" (engenharia de prompts): casos de teste, prompt preliminar, testes e refinamento iterativos, validação final, lançamento

Defina seus critérios de sucesso

Bons critérios de sucesso são:

  • Específicos: Defina claramente o que você quer alcançar. Em vez de "bom desempenho", especifique "classificação precisa de sentimentos".

  • Mensuráveis: Use métricas quantitativas ou escalas qualitativas bem definidas. Números fornecem clareza e escalabilidade, mas medidas qualitativas podem ser valiosas se aplicadas de forma consistente junto com medidas quantitativas.

    • Até mesmo tópicos "nebulosos", como ética e segurança, podem ser quantificados:
      Critérios de segurança
      RuimSaídas seguras
      BomMenos de 0,1% das saídas em 10.000 testes sinalizadas por toxicidade pelo filtro de conteúdo.

  • Alcançáveis: Baseie suas metas em benchmarks do setor, experimentos anteriores, pesquisas em IA ou conhecimento de especialistas. Suas métricas de sucesso não devem ser irrealistas em relação às capacidades atuais dos modelos de fronteira.

  • Relevantes: Alinhe seus critérios com o propósito da sua aplicação e as necessidades dos usuários. Uma alta precisão de citações pode ser crítica para aplicativos médicos, mas menos importante para chatbots casuais.

Critérios de sucesso comuns

Aqui estão alguns critérios que podem ser importantes para o seu caso de uso. Esta lista não é exaustiva.

A maioria dos casos de uso precisa de avaliação multidimensional ao longo de vários critérios de sucesso.


Crie avaliações

Princípios de design de avaliações

  1. Seja específico à tarefa: Projete avaliações que espelhem a distribuição de tarefas do mundo real. Não se esqueça de considerar os casos extremos!

  2. Automatize quando possível: Estruture as perguntas para permitir avaliação automatizada (por exemplo, múltipla escolha, correspondência de strings, avaliação por código, avaliação por LLM).
  3. Priorize volume em vez de qualidade: Mais perguntas com avaliação automatizada de sinal ligeiramente menor é melhor do que menos perguntas com avaliações de alta qualidade feitas manualmente por humanos.

Exemplos de avaliações


Avalie suas avaliações

Ao decidir qual método usar para pontuar avaliações, escolha o método mais rápido, mais confiável e mais escalável:

  1. Avaliação baseada em código: A mais rápida e confiável, extremamente escalável, mas também carece de nuance para julgamentos mais complexos que exigem menos rigidez baseada em regras.

    • Correspondência exata: output == golden_answer
    • Correspondência de string: key_phrase in output
  2. Avaliação humana: A mais flexível e de alta qualidade, mas lenta e cara. Evite se possível.

  3. Avaliação baseada em LLM: Rápida e flexível, escalável e adequada para julgamentos complexos. Teste para garantir a confiabilidade primeiro e depois escale.

Dicas para avaliação baseada em LLM

  • Tenha rubricas detalhadas e claras: "A resposta deve sempre mencionar 'Acme Inc.' na primeira frase. Caso contrário, a resposta é automaticamente avaliada como 'incorreta'."
  • Empírica ou específica: Por exemplo, instrua o LLM a produzir apenas 'correct' ou 'incorrect', ou a julgar em uma escala de 1–5. Avaliações puramente qualitativas são difíceis de avaliar rapidamente e em escala.
  • Incentive o raciocínio: Peça ao LLM para raciocinar primeiro antes de produzir uma pontuação de avaliação e, em seguida, descarte o raciocínio. Isso aumenta o desempenho da avaliação, particularmente para tarefas que exigem julgamento complexo.

Próximos passos

Faça um brainstorming de critérios de sucesso para o seu caso de uso com o Claude no claude.ai.

Dica: Coloque esta página no chat como orientação para o Claude!

Mais exemplos de código de avaliações pontuadas por humanos, por código e por LLM.

Was this page helpful?