任务卡 · 田仁德(研一)

角色:RL 训练辅助 + NavRL 协助 直接导师:李婉玉 核心定位:把 RL 训练 Pipeline 跟通,全程陪跑 NavRL


一、你的核心任务

  1. 学会 ROS Noetic + 强化学习基础
  2. 跟李婉玉搭训练 Pipeline(wandb、tensorboard、checkpoint 管理)
  3. NavRL 训练数据收集 + reward 调试
  4. 训练日志整理、超参搜索、收敛分析

二、必学的基础(W1–W4)

  • ROS Noetic 基础(W1–W2,跟贺林青培训)
  • 强化学习入门:
    • 基本概念:状态、动作、奖励、策略
    • PPO 原理(推荐)+ SAC(备选)
    • Gym 接口
  • Stable-Baselines3 文档过一遍
  • wandb 注册并接入小项目

W2 末 ROS 验收 + W4 末 RL 入门考核(能独立跑通 CartPole-PPO)


三、逐周时间线(5/24 起)

日期任务
W15/24–5/30ROS Noetic 基础学习;装 PyTorch + Stable-Baselines3
W25/31–6/06ROS 培训作业;RL 基础概念笔记;CartPole-PPO 跑通
W36/07–6/13跟李婉玉熟悉训练 Pipeline;wandb 接入
W46/14–6/20简单导航 baseline(2D 网格)训练实验
W56/21–6/27Gazebo + RL wrapper 接入;reward 设计基础
W66/28–7/04跑训练 Pipeline 标准 demo;整理训练流程文档
W77/05–7/11训练监控脚本(自动出曲线、对比图)
W87/12–7/18协助 L5 任务层(用脚本生成训练用 goal 序列)
W97/19–7/25NavRL 论文阅读启动;准备训练环境
W107/26–8/01NavRL 官方代码学习;跟李婉玉拆解结构
W118/02–8/08NavRL 跑通官方仿真;记录环境依赖
W128/09–8/15NavRL 训练数据收集(仿真环境配置)
W138/16–8/22reward 调试 + 训练日志整理
W148/23–8/29NavRL 训练第一轮;监控指标
W158/30–9/05超参搜索(学习率、batch、γ)
W169/06–9/12NavRL 仿真验收支持;评估脚本
W179/13–9/19训练日志总结报告;NavRL 复盘
W189/20–9/26三算法对比配合;图表制作
W199/27–10/01结项配合;训练 Pipeline 文档贡献

四、你的关键里程碑

  • 📚 W2(6/06):ROS 验收过关
  • 🤖 W4(6/20):能独立跑通 CartPole-PPO(RL 入门考核)
  • 🧪 W6(7/04):训练 Pipeline 文档完整
  • 🎯 W16(9/12):NavRL 仿真成功率 ≥ 80% 评估出报告
  • 🏁 W19(10/01):训练 Pipeline 与日志系统交付

五、你的硬约束

  • ROS + RL 基础必须 W4 前过关——晚了 NavRL 跟不上
  • 训练日志要规范:每次实验有名字、超参、commit hash、评估结果
  • 不要一上来就调 NavRL,先把 baseline(PPO 跑 CartPole)走透

六、求助渠道

  • ROS 问题 → 高元博、贺林青
  • RL 训练不收敛 → 找李婉玉
  • GPU 资源问题 → 找李婉玉协调
  • 论文看不懂 → 周五论文 reading 会上提

七、相关文档