Skip to content

新增 DDQN 模型实现与训练流程#3228

Merged
donghaiwang merged 23 commits into
OpenHUTB:mainfrom
GODDDDD22311:main
Dec 15, 2025
Merged

新增 DDQN 模型实现与训练流程#3228
donghaiwang merged 23 commits into
OpenHUTB:mainfrom
GODDDDD22311:main

Conversation

@GODDDDD22311

Copy link
Copy Markdown
Contributor

修改概述:

  • 新增 double_dqn.py:实现 Double DQN(DDQN)智能体核心逻辑,包括网络定义、动作选择、经验回放、目标网络更新、模型保存/加载等基础能力。
  • 新增 training_double_dqn.py:提供端到端训练入口脚本,负责环境初始化、训练循环、、指标记录与 checkpoint 落盘,便于本地复现实验与持续迭代。

实现功能

  • DDQN 核心算法能力
    • 使用 Double DQN 目标计算逻辑,降低 Q 值过估计风险。
    • 支持 epsilon-greedy 探索策略与衰减配置。
    • 支持 target network 更新。
  • 训练流程能力
    • 提供可直接运行的训练脚本:创建环境 → 采样交互 → 存储 replay → 批量更新 → 周期性保存模型。
    • 支持保存模型权重与训练中间产物(如 best / last checkpoint),方便后续评估脚本直接加载。
    • 支持常用训练超参集中管理,便于后续调参对比。

经过了什么样的测试?*

  • 启动训练脚本,确认可正常进入训练循环、无导入错误、可正常与环境交互、可生成并保存 checkpoint。
  • 示例命令(按项目实际参数/默认值调整):
    • python training_double_dqn.py

运行效果

捕获

@donghaiwang
donghaiwang merged commit 2da83f8 into OpenHUTB:main Dec 15, 2025
1 check passed
Sign up for free to join this conversation on GitHub. Already have an account? Sign in to comment

Labels

None yet

Projects

None yet

Development

Successfully merging this pull request may close these issues.

2 participants