Skip to content

Minimax Model accuracy alignment#4781

Merged
zhengshengning merged 6 commits into
PaddlePaddle:developfrom
zhengshengning:minimax_model_new_0720
Jul 20, 2026
Merged

Minimax Model accuracy alignment#4781
zhengshengning merged 6 commits into
PaddlePaddle:developfrom
zhengshengning:minimax_model_new_0720

Conversation

@zhengshengning

Copy link
Copy Markdown
Collaborator

Before submitting

  • Lint code. If there are lint issues, please format the code first.
# Install and register `pre-commit` in the project folder
pip install pre-commit && pre-commit install

# Process previous code files separately
pre-commit run --file XXXX.py
  • Add test cases into tests folder. If there are codecov issues, please add tests cases first.

PR types

Bug fixes

PR changes

Models

Description

Minimax Model accuracy alignment

@paddle-bot

paddle-bot Bot commented Jul 20, 2026

Copy link
Copy Markdown

Thanks for your contribution!

risemeup1111

This comment was marked as outdated.

risemeup1111

This comment was marked as outdated.

@Paddle-CI-Bot

Copy link
Copy Markdown

PaddleFormers Log Analysis

Run #29733000933 · Attempt 1

日志分析报告

流水线名称 问题标签 修复建议 日志片段
Integration test (H20, single card) CUDA 设备未正确初始化 与本PR无关,H20 runner GPU 设备未正常挂载,paddle.cuda.get_device_capability()Place(cpu) 上崩溃,CI 维护人员检查 runner GPU 驱动状态,rerun 报错代码
Integration test (H20, multi-card) nvidia-container-cli 初始化超时 与本PR无关,H20 multi-card runner GPU 驱动 RPC 不通导致容器启动失败(exit 125),CI 维护人员检查机器 nvidia-container-runtime 状态,rerun 报错代码

失败的测试case:

Integration test (H20, single card):
  paddlefleet_ops/__init__.py:114 调用 paddle.cuda.get_device_capability() 失败
  ValueError: The device type Place(cpu) is not expected

Integration test (H20, multi-card):
  docker run --gpus all 启动容器失败
  nvidia-container-cli: initialization error: driver rpc error: timed out
  exit code 125

根本原因分析
两个 job 均在同一台机器(yqlcc01-bbc-yqonlinea-com-1567435)上因 GPU 驱动/nvidia-container-runtime 异常导致容器无法正常访问 GPU,与本 PR(minimax_model_new_0720#4781)代码改动无关。

修复建议

  1. CI 维护人员检查 yqlcc01-bbc-yqonlinea-com-1567435 上的 nvidia-container-runtime 状态(systemctl status nvidia-container-toolkitnvidia-smi
  2. 确认 GPU driver RPC 恢复正常后,对两个 job 执行 rerun

🔍 准确性记录:请点击评论底部 😊 图标,选择 👍(准确)或 👎(有误),将自动记录到 CI 监控系统

🔄 每次 Re-run 后自动更新

@zhengshengning
zhengshengning merged commit 427ddca into PaddlePaddle:develop Jul 20, 2026
28 of 33 checks passed
Sign up for free to join this conversation on GitHub. Already have an account? Sign in to comment

Labels

None yet

Projects

None yet

Development

Successfully merging this pull request may close these issues.

4 participants