关于我们:
我们正在研发面向真实工业场景的具身智能机器人系统,希望通过强化学习、模仿学习、在线微调等后训练方法,让机器人在真实环境中完成抓取、吸取、插入、放置、按压、对准、装配等操作任务。
机器人交付到客户现场后,任务环境、物体状态、光照条件、硬件误差和操作流程都会发生变化。因此,我们需要一位能够深入真实场景,完成任务搭建、数据采集、模型训练、策略部署、效果测试和问题闭环的真机强化学习工程师。
岗位定位:
1.本岗位面向真实机器人任务的算法交付与工程落地,核心目标是让机器人任务从“能跑通”走向“稳定可交付”。
2.你将基于 HiL-SERL、SAC、模仿学习、人工干预学习、Offline-to-Online RL 等方法,在真实机械臂和末端执行器上完成小模型训练、策略优化、现场适配和任务泛化,并将过程沉淀为可复用的训练流程与交付规范。
3.你需要深入实验现场和客户场景,面对数据不干净、任务复位不稳定、策略效果波动、硬件存在误差、环境经常变化、成功率难以稳定等真实问题,并通过算法、数据、工程调试和实验设计持续提升任务效果。
岗位职责:
- 负责真实机器人操作任务的强化学习与模仿学习落地,包括任务定义、实验流程设计、数据采集、策略训练、模型部署、测试评估和现场问题闭环。
- 基于 HiL-SERL、SAC、BC、DAgger、Residual RL、Offline-to-Online RL 等方法,完成小模型真机训练与策略优化,提升任务成功率和稳定性。
- 参与机器人 RL 训练环境设计,包括观测空间、动作空间、奖励函数、成功条件、安全边界、人工干预机制和实验复位流程。
- 负责真机 rollout 与数据闭环,包括示教数据采集、人工干预数据利用、失败样本收集、训练数据清洗、策略更新和多轮迭代实验。
- 面向客户现场或真实实验环境,适配不同任务、不同物体、不同末端、不同位置和不同场景,提升策略的泛化能力和鲁棒性。
- 分析真机训练和交付过程中的失败案例,定位感知误差、标定偏差、动作异常、奖励不稳定、接触不确定性、末端结构问题、通信延迟和硬件执行误差等问题。
- 建立任务评估与复盘流程,记录成功率、失败类型、训练曲线、Q 值、loss、动作分布、测试视频、环境变量和硬件状态,形成可复现的实验结论。
- 与硬件、控制、感知和软件团队协作,推动末端结构、传感器配置、控制接口、数据采集链路和训练流程的联合优化。
- 沉淀可复用的训练代码、实验脚本、数据规范、测试报告、任务配置和问题排查文档,支撑后续项目交付。