Quality / Evals
Persisted datasets + rule & LLM-judge scorers → a scorecard per version, and a regression gate that blocks a promote that would make output worse. The loop neither competitor closes.
Eval runs
0
Last pass rate
—
Dataset items
0
Eval spend
£0.00
Weekly revenue digest
prod v1.0.0Datasets (0) · 0 items
No evals yet — run one above. The first run auto-creates a starter dataset, persists the org's scorer set, and scores every item.
Board-pack narrative
prod v1.0.0Datasets (0) · 0 items
No evals yet — run one above. The first run auto-creates a starter dataset, persists the org's scorer set, and scores every item.
Competitor watch → weekly brief
prod v1.0.0Datasets (0) · 0 items
No evals yet — run one above. The first run auto-creates a starter dataset, persists the org's scorer set, and scores every item.
Feedback inbox
👍 0👎 0✏️ 00% dissatisfied
- • No feedback yet — collect reactions to seed the eval set.
No feedback yet — rate an output on any run page and it lands here, one promote away from becoming a regression test.