1.数据管线设计与搭建:围绕具身大模型(VLM / VLA / 世界模型)的训练需求,搭建端到端数据管线(采集 → 清洗 → 标注 → 配比 → 质检 → 训练就绪),保证可扩展、可复现、高吞吐。 2.多源数据融合与治理:对接真机遥操、仿真、互联网视频、轨迹等多源异构数据,统一 schema、做格式归一化、字段对齐与去重脱敏,建立可追溯的数据资产。 3.数据配方与质量体系:配合算法团队设计数据配比(task / embodiment / scene / skill 的采样策略),建设数据质量评估与过滤机制(覆盖率、长尾、污染检测、OOD 过滤等),持续把控训练集/评测集质量。 4.评测与基准建设:构建和维护具身相关评测基准(仿真 + 真机),负责评测数据的版本管理、回灌分析与可视化,支撑算法迭代决策。5.工5.程效率与稳定性:负责大规模数据的存储、索引、加速 IO(webdataset / tfrecord / mcap / parquet 等),优化数据加载链路与训练吞吐,支撑分布式训练下的数据供给。 6.跨团队协作:与算法、仿真、机器人系统团队紧密协作,把数据需求转化为可落地的工程方案,推动数据闭环持续运转。
1.本科及以上学历,计算机 / 自动化 / 机器人 / 机器学习等相关专业,2–5 年数据工程或数据相关开发经验。 2.扎实的工程能力:精通 Python,熟悉 SQL / Shell,熟练使用一种以上主流数据工程工具(Airflow / Spark / Ray / Dask / Beam 等)。 3.数据管线搭建经验(核心要求):有大规模数据管线的设计、实现与维护经验,熟悉 ETL / 数据湖 / 数据仓库基本理念,能独立 owner 一条端到端数据链路。 4. 熟悉常见数据存储与序列化格式(Parquet / TFRecord / WebDataset / HDF5 / Protobuf / ROS bag / MCAP 等),理解不同格式在训练场景下的取舍。 5.了解主流深度学习训练框架(PyTorch / Jax)数据加载链路,能配合算法团队优化 DataLoader、采样器、sharding 策略与缓存机制。 6.具备良好的工程素养:版本管理、监控告警、CI/CD、可观测性、文档沉淀,能在多人协作下保证管线稳定迭代。
相关岗位