Context
The portable result schema (schema v1) already records everything needed for fair comparison. A leaderboard should consume only voluntarily submitted results.
Task
- agenteval arena --submit pushes the portable JSON to a leaderboard endpoint (opt-in, explicit)
- Leaderboard service (separate repo) validates schema + fairness metadata (commit, environment, agent version)
- Never upload private code, prompts, logs, or repo names without explicit consent
- Per-benchmark leaderboards: task pack + repo + agent + model + score
Acceptance criteria
- --submit requires an explicit flag and a LEADERBOARD_URL env var
- Result payload excludes prompts/logs unless --include-artifacts
- Documented submission format matching the portable schema
Context
The portable result schema (schema v1) already records everything needed for fair comparison. A leaderboard should consume only voluntarily submitted results.
Task
Acceptance criteria