Adiciona avaliação baseada em rubrica a um código de agente existente. Ideal para avaliar agentes, medir sua qualidade ou configurar pontuação LLM-as-a-judge, suportando comparações de agente único e múltiplos sujeitos.
Desenvolvimento#llm#testpor erezweinstein5