Skip to content
DocumentationStart buildingSign in
Beta

Evals

Measure model and agent quality.

Open sourceOn-chain settlement

Benchmark, grade, and regression-test models and agents. LLM-as-judge, golden sets, and drift detection with reproducible scorecards anchored on-chain.

LLM-as-judge & golden sets
Regression gates in CI
Drift detection
Anchored scorecards

The AI cloud — one API for every capability. Open models. On-chain.