任务卡 · 田仁德(研一)
角色:RL 训练辅助 + NavRL 协助 直接导师:李婉玉 核心定位:把 RL 训练 Pipeline 跟通,全程陪跑 NavRL
一、你的核心任务
- 学会 ROS Noetic + 强化学习基础
- 跟李婉玉搭训练 Pipeline(wandb、tensorboard、checkpoint 管理)
- NavRL 训练数据收集 + reward 调试
- 训练日志整理、超参搜索、收敛分析
二、必学的基础(W1–W4)
- ROS Noetic 基础(W1–W2,跟贺林青培训)
- 强化学习入门:
- 基本概念:状态、动作、奖励、策略
- PPO 原理(推荐)+ SAC(备选)
- Gym 接口
- Stable-Baselines3 文档过一遍
- wandb 注册并接入小项目
W2 末 ROS 验收 + W4 末 RL 入门考核(能独立跑通 CartPole-PPO)
三、逐周时间线(5/24 起)
| 周 | 日期 | 任务 |
|---|---|---|
| W1 | 5/24–5/30 | ROS Noetic 基础学习;装 PyTorch + Stable-Baselines3 |
| W2 | 5/31–6/06 | ROS 培训作业;RL 基础概念笔记;CartPole-PPO 跑通 |
| W3 | 6/07–6/13 | 跟李婉玉熟悉训练 Pipeline;wandb 接入 |
| W4 | 6/14–6/20 | 简单导航 baseline(2D 网格)训练实验 |
| W5 | 6/21–6/27 | Gazebo + RL wrapper 接入;reward 设计基础 |
| W6 | 6/28–7/04 | 跑训练 Pipeline 标准 demo;整理训练流程文档 |
| W7 | 7/05–7/11 | 训练监控脚本(自动出曲线、对比图) |
| W8 | 7/12–7/18 | 协助 L5 任务层(用脚本生成训练用 goal 序列) |
| W9 | 7/19–7/25 | NavRL 论文阅读启动;准备训练环境 |
| W10 | 7/26–8/01 | NavRL 官方代码学习;跟李婉玉拆解结构 |
| W11 | 8/02–8/08 | NavRL 跑通官方仿真;记录环境依赖 |
| W12 | 8/09–8/15 | NavRL 训练数据收集(仿真环境配置) |
| W13 | 8/16–8/22 | reward 调试 + 训练日志整理 |
| W14 | 8/23–8/29 | NavRL 训练第一轮;监控指标 |
| W15 | 8/30–9/05 | 超参搜索(学习率、batch、γ) |
| W16 | 9/06–9/12 | NavRL 仿真验收支持;评估脚本 |
| W17 | 9/13–9/19 | 训练日志总结报告;NavRL 复盘 |
| W18 | 9/20–9/26 | 三算法对比配合;图表制作 |
| W19 | 9/27–10/01 | 结项配合;训练 Pipeline 文档贡献 |
四、你的关键里程碑
- 📚 W2(6/06):ROS 验收过关
- 🤖 W4(6/20):能独立跑通 CartPole-PPO(RL 入门考核)
- 🧪 W6(7/04):训练 Pipeline 文档完整
- 🎯 W16(9/12):NavRL 仿真成功率 ≥ 80% 评估出报告
- 🏁 W19(10/01):训练 Pipeline 与日志系统交付
五、你的硬约束
- ROS + RL 基础必须 W4 前过关——晚了 NavRL 跟不上
- 训练日志要规范:每次实验有名字、超参、commit hash、评估结果
- 不要一上来就调 NavRL,先把 baseline(PPO 跑 CartPole)走透
六、求助渠道
- ROS 问题 → 高元博、贺林青
- RL 训练不收敛 → 找李婉玉
- GPU 资源问题 → 找李婉玉协调
- 论文看不懂 → 周五论文 reading 会上提