岗位职责 • 预训练数据管线建设: 围绕具身大模型(VLM / VLA / 世界模型)的预训练需求,主导端到端数据管线的设计与搭建(采集 → 清洗 → 标注 → 配比 → 质检 → 训练就绪),保证可扩展、可复现、高吞吐。 • 多源数据融合与治理: 对接真机遥操、仿真、互联网视频、轨迹等多源异构数据,推动统一 schema 设计、格式归一化、字段对齐与去重脱敏,建立可追溯、可审计的数据资产管理体系。 • 数据飞轮设计与落地(核心): 规划并落地"部署 → 数据采集 → 清洗入库 → 模型迭代 → 再部署"的数据飞轮闭环。设计真机部署场景下的自动化数据回收方案,打通从客户端/现场数据到训练就绪数据的全链路,建立数据量与应用规模正增长的飞轮机制,将回流数据同时服务于预训练语料扩充与 post-training 数据迭代。 • Post-training 数据支撑: 为 SFT、RL 等 post-training 阶段提供数据管线能力支撑,包括任务导向数据的构建与筛选管线、偏好数据(preference data)与 reward 数据的采集与标注链路、以及 on-policy rollout 数据的自动回收与再利用。 • 数据配方与质量战略: 与算法团队协同,主导数据配比策略(task / embodiment / scene / skill 的采样策略)的制定与迭代,建立数据质量评估与过滤机制(覆盖率、长尾、污染检测、OOD 过滤等),持续把控各训练阶段的训练集与评测集质量。 • 评测体系建设: 构建面向具身场景的评测基准(仿真 + 真机),覆盖基础能力评测与下游任务成功率、泛化性、安全性评测;负责评测数据的版本管理、回灌分析与可视化,支撑算法迭代决策。 • 工程效率与基础设施: 负责大规模数据存储、索引、IO 加速(webdataset / tfrecord / mcap / parquet 等)的技术选型与架构决策,优化数据加载链路与训练吞吐,保障分布式训练场景下的数据供给能力。 • 技术引领与团队协作: 以技术负责人角色带领数据工程团队,亲自参与关键技术决策与核心模块开发;与算法、仿真、机器人系统、产品等团队深度协作,将业务数据需求转化为可落地的工程方案,推动数据闭环持续运转。
职位需求 • 本科及以上学历,计算机 / 自动化 / 机器人 / 机器学习等相关专业,6–10 年数据工程或数据相关开发经验,有技术负责人或 tech lead 经验。 • 扎实的工程能力(核心要求): 精通 Python,熟悉 SQL / Shell,深入掌握至少两种以上主流数据工程框架(Airflow / Spark / Ray / Dask / Beam 等),具备独立设计和落地大规模数据管线的能力。 • 数据管线架构设计经验(核心要求): 有主导设计和落地大规模端到端数据管线的成功经验,熟悉 ETL / 数据湖 / 数据仓库等架构理念,能独立完成从架构设计到上线运维的全流程。 • 理解大模型训练全链路的数据需求: 对预训练数据(大规模多源语料)和 post-training 数据(SFT instruction data、RL preference data 等)的构建方式与差异有实际经验或深入理解,能与算法团队在同一语言下讨论数据需求并快速转化为工程方案。 • 数据飞轮思维与落地能力: 理解"部署-回流-再训练"的数据飞轮逻辑,有设计过自动化数据回收方案的实操经验,或在智驾、机器人、对话系统等领域推动过类似闭环。 • 深入了解常见数据存储与序列化格式(Parquet / TFRecord / WebDataset / HDF5 / Protobuf / ROS bag / MCAP 等)的原理与适用场景,能在不同训练需求下做出合理的技术选型。 • 熟悉主流深度学习训练框架(PyTorch / Jax)的数据加载链路,具备优化 DataLoader、采样器、sharding 策略与缓存机制的经验。 • 优秀的工程素养与领导力: 具备推动版本管理、监控告警、CI/CD、可观测性、文档沉淀等工程规范落地的经验;能在团队中既做技术决策又亲自写代码,善于跨团队沟通与协调。
加分项 • 具备机器人真机或仿真数据相关经验(ROS / Isaac Sim / MuJoCo / 真实遥操 / 闭环采集等),了解机器人数据采集的特殊挑战与部署端数据回流的工程实践。 • 有大规模多模态数据(图像 / 视频 / 文本 / 轨迹)处理经验,理解 modality alignment 与 tokenization 流程。 • 有标注体系搭建经验——包括设计标注规范、管理标注团队(自建或外包)、标注质量控制与效率优化。 • 熟悉具身 / 机器人 / 智驾相关公开数据集(Open X-Embodiment、RT-1/RT-2、nuScenes 等),了解其数据组织方式与使用范式。 • 有公开开源贡献(数据工具、数据集、评测榜单、复现报告等)。 • 对数据质量有极致追求,在数据污染检测、分布分析、long-tail 治理等方面有深入实践。
相关岗位