Skip to main content
Optimize agent outputs using the evaluation system to measure, compare, and improve results.

Quick Start

1

Evaluate Agent Output

2

Criteria-Based Evaluation


User Interaction Flow


AccuracyEvaluator

Compare output against expected results.

Builder Methods

Evaluation


CriteriaEvaluator

Evaluate against custom criteria with weighted scores.

Builder Methods

Example


PerformanceEvaluator

Measure execution performance.

Configuration

Example


Judge

LLM-based evaluation for complex judgments.

Configuration

Example


Optimization Loop Pattern


Best Practices

Use specific, measurable criteria for consistent evaluation.
Start with 0.7-0.8 threshold and adjust based on use case.
Use AccuracyEvaluator + PerformanceEvaluator for complete picture.
Track scores across iterations to identify improvement patterns.

Evaluation

Evaluation system

Agent

Agent API