Skip to content

[P2] V1-007: Reproducible benchmarks (BENCH-001 minimal) #270

Description

@mrnicholasbcarter-code

Acceptance criteria

  • BenchmarkRunner runs DIRECT API model vs Verdict route on the same task
  • Reports cost / latency / completion / regression / failover
  • Deterministic when seeded

Refs: evidence/V1_READINESS_AUDIT_2026-08-03.md

Metadata

Metadata

Assignees

No one assigned

    Labels

    area-verificationVerification, evidence, and release qualitypythonPython implementation

    Projects

    No projects

    Milestone

    No milestone

    Relationships

    None yet

    Development

    No branches or pull requests

    Issue actions