Skip to content

[A2-K]: 王群超 - flashattention - #142

Open
bhuj209 wants to merge 1 commit into
OpenMOSS:mainfrom
bhuj209:a2-k/bhuj209
Open

[A2-K]: 王群超 - flashattention#142
bhuj209 wants to merge 1 commit into
OpenMOSS:mainfrom
bhuj209:a2-k/bhuj209

Conversation

@bhuj209

@bhuj209 bhuj209 commented Jul 28, 2026

Copy link
Copy Markdown
Contributor

PR Checklist

基本信息

  • 同学真名:
  • 作业编号:A0

修改范围

  • 本 PR 只包含我本人本次作业的文件。
  • 我没有修改其他同学、students/_template、公共题面或仓库配置。
  • PR 标题符合 [A编号] 姓名 - 简短说明

公开性与安全

  • 我理解 GitHub 中所有内容均为公开资料。
  • 公开内容不含内部主机名、IP、账号、路径、数据或未公开项目。
  • GitHub 和飞书正文均不包含 Secret、Token、Cookie、密码或私钥。
  • 我检查了 git diff --cached,没有提交大型数据、模型权重、缓存或完整日志。

双层提交

  • README.md 提供可公开、已脱敏的作业报告。
  • README.md 已填写飞书补充文档链接。

A1 额外检查

若本 PR 不是 A1,请将本节标记为不适用。

  • 已提交 README.mdsubmission/cs336_basics/submission/tests/adapters.py
    submission/scripts/logs/
  • 报告文件为 README.md(Markdown)。
  • assignment1-basics 工作仓库位于 SummerQuest 的兄弟目录,且没有被提交到本 PR。
  • 已在 ../assignment1-basics 运行官方测试,并使用同步脚本更新个人提交目录。

A0 额外检查

若本 PR 不是 A0,请将本节标记为不适用。

  • 已完成公开 GitHub profile 和组内飞书 profile。
  • 已在个人服务器实际运行 nvidia-smigpustat 并记录退出码。
  • A0 的组内验收材料已放入 README 链接的飞书补充文档。

A2-P 额外检查

若本 PR 不是 A2-P,请将本节标记为不适用。A2-P 已正式发布,按题面要求提交。

  • 已提交 Markdown README.mdsubmission/profiling/**/*.py、规定的轻量
    results/ 和至少三张被报告引用的裁剪、压缩图片。
  • 已运行 scripts/sync_a2p_submission.pyscripts/validate_repo.py
  • 已使用 nsys 或 torch.profiler 完成两个模型规模 × 三个 context 的六个
    train_step trace。
  • 仓库外源码与资料引用使用固定 commit 的 GitHub HTTPS 绝对 URL,未使用本机或跨仓库相对链接。
  • 未提交 .nsys-rep、snapshot、完整 trace、权重、数据、压缩包、上游代码或依赖环境。
  • results/assets/ 合计不超过 2 MiB,Profile 只保留关键汇总与截图。

A2-K 额外检查

若本 PR 不是 A2-K,请将本节标记为不适用。A2-K 已正式发布,按题面要求提交。

  • 已提交 Markdown README.md、A2-K Python allowlist、全部规定的轻量 results/
    和至少两张被报告引用的压缩图片。
  • 已运行 scripts/sync_a2k_submission.py、官方 GPU tests 和
    scripts/validate_repo.py,且没有把 CUDA skip 写成 pass。
  • 正式矩阵来自单张 RTX 4090 24GB;各脚本独立串行执行,并在首次 CUDA allocation
    前设置 23552 MiB allocator 上限。
  • memory_evidence.json 已记录 allocator limit/fraction、peak allocated/reserved 和
    24 GiB 判定。
  • 仓库外源码与资料引用使用固定 commit 的 GitHub HTTPS 绝对 URL,未使用本机或跨仓库相对链接。
  • 未提交 compile cache、PTX/CUBIN、binary、完整日志/采样、权重、数据、压缩包、上游代码或依赖环境。
  • results/assets/ 合计不超过 2 MiB,关键数字可回到轻量结果与命令。

给助教的说明

<说明未完成项、环境限制或希望重点审核的内容。不要粘贴密钥和内部地址。>

@WillQvQ WillQvQ left a comment

Copy link
Copy Markdown
Contributor

Choose a reason for hiding this comment

The reason will be displayed to describe this comment to others. Learn more.

按当前放宽后的标准复核(缺少飞书文档、内部路径/机器信息、Git 总结细节均不作为否决项),仍有以下阻塞问题需要修正:

  1. 正式矩阵的起始显存证据不可核验。results/run_metadata.json 写的是开跑前仅 5.58 GiB free;而 flash_benchmark.py 实际在全部 benchmark 循环结束后才调用 run_metadata(),因此该值并非开跑前采集。README 又勾选了“开跑前不少于 22 GiB”,三者互相矛盾。请在空闲的单张 4090 上、首次 CUDA allocation 前采集并校验 free memory(至少 22 GiB),按独立进程重新生成正式矩阵及 metadata/memory evidence/报告。

  2. results/correctness.json 实际为 56 项 pass=true、16 项 pass=false,但 README 写成 72/72 passed。请修正实现或采用明确、合理且按 dtype 记录的容差后重新运行,确保 JSON 中包含可审核的 tolerance,报告与原始结果一致;不能把 pass=false 汇总成通过。

  3. PR 标题应严格改为 [A2-K] 王群超 - flashattention(当前 [A2-K]: ... 多了冒号),并请把 PR 描述中的姓名、作业编号和 A2-K checklist 填写正确。

本次已确认:改动仅在本人 A2-K 目录,固定 CSV 组合完整,真实 Triton kernel、6/6 官方测试记录、附件大小和敏感信息检查均无其他阻塞问题。请直接在本 PR 推送修正,不需要另开 PR。

审核者:GPT-5.6 Sol Ultra

Sign up for free to join this conversation on GitHub. Already have an account? Sign in to comment

Labels

None yet

Projects

None yet

Development

Successfully merging this pull request may close these issues.

2 participants