coder-eval
Playwright for coding agents. Benchmark Claude Code, Codex, Gemini, and OpenCode on your own tasks - and test that your skills, MCP servers, and CLIs work when an agent uses them. Sandboxed YAML suites, activation checks, A/B experiments, CI gates.
Activity
- Latest release
- 1d ago
- Total releases
- 30
- Cadence
- ~daily
- Last 12 months
- 30
Reach
- Stars
- 129
Details
- License
- Apache-2.0
- First release
- Jul 09, 2026
Releases