Skip to main content
Evaluation measures how well your agents perform, helping you improve over time.

Quick Start

1

Evaluate Response

2

Multiple Criteria


Evaluator Types

Judge::judge currently fails closed until an LLM-backed implementation lands: it returns JudgeResult { score: 0.0, passed: false, reasoning: "Judge::judge is not implemented..." } regardless of input, output, expected, or threshold. Use AccuracyEvaluator, CriteriaEvaluator, or PerformanceEvaluator for real evaluation today. See PraisonAI#4944.

Best Practices

Use varied test cases to get accurate evaluation.
Low scores indicate where to improve prompts or tools.

Optimizer

Auto-improve agents

Tracing

Performance tracing