# Evals — Hanzo Cloud

> Benchmark, grade, and regression-test models and agents. LLM-as-judge, golden sets, and drift detection with reproducible scorecards anchored on-chain.

[Cloud](https://hanzo.ai/products)/Observe

Beta

# Evals

Measure model and agent quality.

Open sourceOn-chain settlement

API

/v1/evals

Benchmark, grade, and regression-test models and agents. LLM-as-judge, golden sets, and drift detection with reproducible scorecards anchored on-chain.

LLM-as-judge & golden sets

Regression gates in CI

Drift detection

Anchored scorecards

The AI cloud — one API for every capability. Open models. On-chain.

[Get started](https://hanzo.ai/signup)[Talk to us](https://hanzo.ai/contact/sales)[Source](https://github.com/hanzoai/o11y)[Docs](https://docs.hanzo.ai/docs/services/evals)
