Skip to content

[A2-K] 刘子源 - 完成显存优化与 GPU 内核作业 - #156

Open
Zyrrick wants to merge 1 commit into
OpenMOSS:mainfrom
Zyrrick:a2-k/Zyrrick
Open

[A2-K] 刘子源 - 完成显存优化与 GPU 内核作业#156
Zyrrick wants to merge 1 commit into
OpenMOSS:mainfrom
Zyrrick:a2-k/Zyrrick

Conversation

@Zyrrick

@Zyrrick Zyrrick commented Jul 31, 2026

Copy link
Copy Markdown
Contributor

PR Checklist

基本信息

  • 同学真名:刘子源
  • 作业编号:A2-K

修改范围

  • 本 PR 只包含我本人本次作业的文件。
  • 我没有修改其他同学、students/_template、公共题面或仓库配置。
  • PR 标题符合 [A编号] 姓名 - 简短说明

公开性与安全

  • 我理解 GitHub 中所有内容均为公开资料。
  • 公开内容不含内部主机名、IP、账号、路径、数据或未公开项目。
  • GitHub 和飞书正文均不包含 Secret、Token、Cookie、密码或私钥。
  • 我检查了 git diff --cached,没有提交大型数据、模型权重、缓存或完整日志。

双层提交

  • README.md 提供可公开、已脱敏的作业报告。
  • README.md 已填写飞书补充文档链接。

A2-K 额外检查

若本 PR 不是 A2-K,请将本节标记为不适用。A2-K 已正式发布,按题面要求提交。

  • 已提交 Markdown README.md、A2-K Python allowlist、全部规定的轻量 results/
    和至少两张被报告引用的压缩图片。
  • 已运行 scripts/sync_a2k_submission.py、官方 GPU tests 和
    scripts/validate_repo.py,且没有把 CUDA skip 写成 pass。
  • [] 正式矩阵来自单张 RTX 4090 24GB;各脚本独立串行执行,并在首次 CUDA allocation
    前设置 23552 MiB allocator 上限。
  • memory_evidence.json 已记录 allocator limit/fraction、peak allocated/reserved 和
    24 GiB 判定。
  • 仓库外源码与资料引用使用固定 commit 的 GitHub HTTPS 绝对 URL,未使用本机或跨仓库相对链接。
  • 未提交 compile cache、PTX/CUBIN、binary、完整日志/采样、权重、数据、压缩包、上游代码或依赖环境。
  • results/assets/ 合计不超过 2 MiB,关键数字可回到轻量结果与命令。

给助教的说明

复旦集群长时间没有空闲的 RTX 4090 单卡,因此本次 A2-K 使用单张 RTX 3090 24GB 完成实验。

@WillQvQ WillQvQ left a comment

Copy link
Copy Markdown
Contributor

Choose a reason for hiding this comment

The reason will be displayed to describe this comment to others. Learn more.

审核结论:需要修改后再合并。

代码范围、Python 解析、真实 Triton forward、37 项扩展正确性、6 项 CUDA tests、矩阵形状、23 GiB allocator guard、附件与 git diff --check 均通过;但正式性能证据当前无效:

  1. run_metadata.json 与 README 明确记录全部结果来自 RTX 3090,而 A2-K 正式 benchmark 的标准环境是单张 RTX 4090 24GB;PR checklist 中该项也未勾选。RTX 3090 的开发结果可保留,但不能替代正式矩阵。
  2. free_memory_mib_at_start、power limit 与 P-state 均缺失,其中开跑前空闲显存不少于 22 GiB 是硬验收字段;memory_evidence.json 也不能用 preflight requirement 常量代替实际观测值。
  3. metadata 明确说明 attention 只用了 5 次 warm-up、10 次重复以及同步 perf_counter,未按固定 do_bench(warmup=100, rep=300) 协议执行;因此 p20/p50/p80 与 speedup 不能作为正式结果。

请在 RTX 4090 24GB 上、开跑前记录实际空闲显存,并在首次 CUDA allocation 前设置 23,552 MiB limit;按固定 do_bench 协议串行独立进程重跑 checkpoint/attention/compile/Flash 正式矩阵,更新 CSV、metadata、memory evidence、图和 README。现有 3090 数据可以明确标为开发结果保留,但不能再称“正式实验”。

审核者:GPT-5.6 Sol Ultra

Sign up for free to join this conversation on GitHub. Already have an account? Sign in to comment

Labels

None yet

Projects

None yet

Development

Successfully merging this pull request may close these issues.

2 participants