返回职位列表
全职 具身技术平台部 普通岗

算法实习生(具身智能 / VLA 模型后训练与落地)

上海北京 面议 招聘 3 人

岗位职责

【团队与业务介绍】 我们致力于推动具身智能与视觉-语言-动作(VLA)模型在真实世界的落地。团队拥有丰富的多元业务场景,覆盖工业精密装配、桌面通用操作、柔性物料处理等核心赛道。在这里,你将深度参与 VLA 模型从“真实数据采集 ➔ 算法迭代训练 ➔ 真机落地验证”的采、训、推全链路流程,探索交互式模仿学习与人类反馈强化学习(RLHF)在真实机器人场景中的前沿应用,直击并解决真实业务中的泛化性与稳定性痛点。 【核心职责】

  1. VLA 模型后训练与微调 (SFT):针对真实业务场景,设计并实现 VLA 模型的多阶段后训练流程。优化数据处理与监督微调(SFT)策略,完成新算法范式的适配与性能验证,输出可复现的基准评测结果。
  2. 交互式模仿学习与数据工程:调研并复现 DAgger、Recap DAgger 等数据集聚合算法,解决行为克隆的分布偏移问题;主导大规模机器人数据集的采集、清洗、标注与管理,构建高质量的多模态数据 Pipeline。
  3. 分布式强化学习 (RL) 落地:基于 RLinf 等分布式强化学习后端,搭建 PPO 等策略优化算法的训练管线,打通从 SFT 模型到 RL 后训练(RLHF/RLAIF)的端到端流程,实现真实数据分布对齐。
  4. 前沿技术探索与真机验证:持续跟踪顶会(CoRL, RSS, ICRA, IROS 等)具身智能后训练最新进展,完成技术调研与算法复现;将前沿算法落地到真实业务场景,并支持高质量 Paper 的发表。

任职要求

【任职要求】 必备条件:

  1. 学历背景:在读硕士 / 博士研究生,计算机、人工智能、自动化、机器人等相关专业。
  2. 理论基础:扎实的深度学习基础,深入理解 Transformer 架构、多模态融合、模仿学习(IL)与强化学习(RL)基本原理。
  3. 工程能力:熟练使用 Python 与 PyTorch,具备独立完成模型训练、分布式实验与调优的工程能力,拥有良好的 AI Coding 规范。
  4. 综合素质:具备优秀的英文文献阅读能力,逻辑清晰,有较强的问题分析与闭环解决能力。
  5. 实习要求:能保证每周 4 天及以上 实习时间,实习周期不少于 6 个月。

优先条件

  • 【加分项】:
  • 熟悉 StarVLA、LeRobot 等具身智能开源框架,并有实际使用或二次开发经验。
  • 了解 RLinf、DeepSpeed 等分布式训练框架,具备大规模强化学习训练调优经验。
  • 深入理解 DAgger 算法原理,有交互式模仿学习、在线微调相关项目或研究经历。
  • 熟悉 RLHF、DPO、IPO 等偏好优化算法,有大语言模型(LLM)或多模态模型(VLM)后训练经验。
  • 具备 Isaac Sim、MuJoCo 等仿真环境下的机器人操作算法研发经验。
  • 在顶会/顶刊发表过具身智能、机器人学习相关论文,或在相关开源社区有突出贡献。
  • 【你将获得】
  • 全链路实战:深度参与前沿 VLA 后训练技术研发,完整经历从算法设计、大规模训练到真机验证的闭环。
  • 顶尖资源支持:接触大规模算力集群与工业级机器人平台,与顶尖算法团队共事,获得一对一资深导师技术指导。
  • 学术与业务双丰收:算法直接落地真实业务场景解决痛点,团队全力支持并指导优秀成果发表顶会 Paper。
  • 丰厚回报:具有竞争力的实习薪酬与完善的福利体系,表现优异者将获得 高优先级转正机会。

相关岗位

相关职位

RIMBOT logo

RIMBOT

感谢您关注我们的职位机会。我们重视每一位候选人的申请,并将认真审阅您的应聘材料。

© 2026 RIMBOT. 保留所有权利。

Powered by 初一HR