公开研究快照(2026-07-28):在线索引见 GitHub Pages,13 小时、22 轮研究的完整中文审计报告见 HTML report。当前严格 survivor 为 0,尚未启动实验;这是一份研究过程与负面知识地图,不是已经验证的科学结论。
这是一个面向多子代理 Codex 的可复用科研操作系统。它的目标不是一次性生成一篇“看起来像论文”的文本,而是持续完成:
- 全文文献与代码检索;
- 提炼可验证的本质 observation;
- 生成并对抗审查多个研究 idea;
- 用低成本实验快速淘汰弱方向;
- 对通过方向进行完整实验、统计审计和论文构建;
- 将事实、失败经验和可复用方法保存给下一次研究运行。
当前默认课题是 Agentic Workflow 与调度,但架构可以通过替换 templates/research-brief.yaml 中的领域定义复用于其他课题。
- 复制
templates/research-brief.yaml,填写研究范围、资源、目标会议和时间预算。 - 克隆仓库后,将仓库根目录作为 Codex 项目目录打开。
- 将
prompts/00-master-orchestrator.md作为首个任务提示,附上填写后的 research brief。 - 允许总控代理并行派遣文献、问题建模、idea、审计和实验子代理。
- 每次运行使用独立目录:
runs/YYYYMMDD-topic-slug/。 - 只把通过 novelty gate、feasibility gate 和 smoke-test gate 的方向提升为论文项目。
AGENTS.md:所有 Codex 代理必须遵循的总规则。docs/architecture.md:系统架构和代理关系。docs/workflow.md:从文献到投稿的完整流程。docs/evaluation-rubric.md:idea、实验和论文的淘汰标准。docs/memory-and-provenance.md:证据图、实验账本和跨运行记忆。docs/agentic-workflow-scheduling.md:当前课题的问题空间和研究切入点。prompts/:各角色可直接复用的 prompts。templates/:每轮研究必须产生的结构化文件。literature/core-reading-list.md:AI Scientist、研究代理和评测基准核心文献。
- “AI reviewer 认为能录用”不等于真实会议录用。
- 新颖性必须通过最近工作逐项对比,而不是依靠模型自评。
- 任何结果都必须能够追溯到代码版本、配置、种子、日志和原始输出。
- 先做最低成本的反证实验,再扩大算力。
- 生成 agent、执行 agent、结果审计 agent 和论文 reviewer 必须相互独立。
- 失败方向也要进入记忆库;不得只记录成功案例。
30 个 observations
→ 15 个结构化 Idea Cards
→ 5 个通过对抗审查
→ 3 个 smoke tests
→ 1 个完整论文方向
该漏斗是参考值,不应为了满足数量而制造低质量条目。