Shared demo workspace — explore freely; everything resets daily.

Quality / Evals

Persisted datasets + rule & LLM-judge scorers → a scorecard per version, and a regression gate that blocks a promote that would make output worse. The loop neither competitor closes.

Eval runs
0
Last pass rate
Dataset items
0
Eval spend
£0.00
Weekly revenue digest
prod v1.0.0
Datasets (0) · 0 items
No evals yet — run one above. The first run auto-creates a starter dataset, persists the org's scorer set, and scores every item.
Board-pack narrative
prod v1.0.0
Datasets (0) · 0 items
No evals yet — run one above. The first run auto-creates a starter dataset, persists the org's scorer set, and scores every item.
Competitor watch → weekly brief
prod v1.0.0
Datasets (0) · 0 items
No evals yet — run one above. The first run auto-creates a starter dataset, persists the org's scorer set, and scores every item.

Feedback inbox

👍 0👎 0✏️ 00% dissatisfied
  • No feedback yet — collect reactions to seed the eval set.
No feedback yet — rate an output on any run page and it lands here, one promote away from becoming a regression test.