返回职位列表
全职 具身技术平台部 紧急岗

大模型数据工程师

北京上海 面议 招聘 1 人

岗位职责

1.数据管线设计与搭建:围绕具身大模型(VLM / VLA / 世界模型)的训练需求,搭建端到端数据管线(采集 → 清洗 → 标注 → 配比 → 质检 → 训练就绪),保证可扩展、可复现、高吞吐。 2.多源数据融合与治理:对接真机遥操、仿真、互联网视频、轨迹等多源异构数据,统一 schema、做格式归一化、字段对齐与去重脱敏,建立可追溯的数据资产。 3.数据配方与质量体系:配合算法团队设计数据配比(task / embodiment / scene / skill 的采样策略),建设数据质量评估与过滤机制(覆盖率、长尾、污染检测、OOD 过滤等),持续把控训练集/评测集质量。 4.评测与基准建设:构建和维护具身相关评测基准(仿真 + 真机),负责评测数据的版本管理、回灌分析与可视化,支撑算法迭代决策。5.工5.程效率与稳定性:负责大规模数据的存储、索引、加速 IO(webdataset / tfrecord / mcap / parquet 等),优化数据加载链路与训练吞吐,支撑分布式训练下的数据供给。 6.跨团队协作:与算法、仿真、机器人系统团队紧密协作,把数据需求转化为可落地的工程方案,推动数据闭环持续运转。

任职要求

1.本科及以上学历,计算机 / 自动化 / 机器人 / 机器学习等相关专业,2–5 年数据工程或数据相关开发经验。 2.扎实的工程能力:精通 Python,熟悉 SQL / Shell,熟练使用一种以上主流数据工程工具(Airflow / Spark / Ray / Dask / Beam 等)。 3.数据管线搭建经验(核心要求):有大规模数据管线的设计、实现与维护经验,熟悉 ETL / 数据湖 / 数据仓库基本理念,能独立 owner 一条端到端数据链路。 4. 熟悉常见数据存储与序列化格式(Parquet / TFRecord / WebDataset / HDF5 / Protobuf / ROS bag / MCAP 等),理解不同格式在训练场景下的取舍。 5.了解主流深度学习训练框架(PyTorch / Jax)数据加载链路,能配合算法团队优化 DataLoader、采样器、sharding 策略与缓存机制。 6.具备良好的工程素养:版本管理、监控告警、CI/CD、可观测性、文档沉淀,能在多人协作下保证管线稳定迭代。

优先条件

  • 具备机器人真机或仿真数据经验(ROS / Isaac Sim / MuJoCo / 真实遥操 / 闭环采集等)。
  • 有大规模多模态数据(图像 / 视频 / 文本 / 轨迹)处理经验,理解 modality alignment 与 tokenization 流程。
  • 熟悉具身 / 机器人 / 智驾相关公开数据集(Open X-Embodiment、RT-1/RT-2、nuScenes 等),并了解其数据组织方式。
  • 有公开开源贡献(数据工具、数据集、评测榜单、复现报告等)。
  • 了解从数据采集、清洗、配比到评测的完整链路,熟悉训练-推理协同优化。
  • 对数据质量有执念,熟悉数据污染检测、分布分析、long-tail 治理等议题。

相关岗位

相关职位

RIMBOT logo

RIMBOT

感谢您关注我们的职位机会。我们重视每一位候选人的申请,并将认真审阅您的应聘材料。

© 2026 RIMBOT. 保留所有权利。

Powered by 初一HR