【团队与业务介绍】
我们致力于推动具身智能与视觉-语言-动作(VLA)模型在真实世界的落地。团队拥有丰富的多元业务场景,覆盖工业精密装配、桌面通用操作、柔性物料处理等核心赛道。在这里,你将深度参与 VLA 模型从“真实数据采集 ➔ 算法迭代训练 ➔ 真机落地验证”的采、训、推全链路流程,探索交互式模仿学习与人类反馈强化学习(RLHF)在真实机器人场景中的前沿应用,直击并解决真实业务中的泛化性与稳定性痛点。
【核心职责】
- VLA 模型后训练与微调 (SFT):针对真实业务场景,设计并实现 VLA 模型的多阶段后训练流程。优化数据处理与监督微调(SFT)策略,完成新算法范式的适配与性能验证,输出可复现的基准评测结果。
- 交互式模仿学习与数据工程:调研并复现 DAgger、Recap DAgger 等数据集聚合算法,解决行为克隆的分布偏移问题;主导大规模机器人数据集的采集、清洗、标注与管理,构建高质量的多模态数据 Pipeline。
- 分布式强化学习 (RL) 落地:基于 RLinf 等分布式强化学习后端,搭建 PPO 等策略优化算法的训练管线,打通从 SFT 模型到 RL 后训练(RLHF/RLAIF)的端到端流程,实现真实数据分布对齐。
- 前沿技术探索与真机验证:持续跟踪顶会(CoRL, RSS, ICRA, IROS 等)具身智能后训练最新进展,完成技术调研与算法复现;将前沿算法落地到真实业务场景,并支持高质量 Paper 的发表。