• 数据管线开发与维护: 参与具身大模型(VLM / VLA / 世界模型)训练所需的端到端数据管线开发,负责数据采集、清洗、标注、质检等环节的代码实现与性能优化,保障管线的可扩展性与高吞吐。
• 多源数据处理: 参与对接真机遥操、仿真、互联网视频、轨迹等多源异构数据,完成格式归一化、字段对齐与去重脱敏等数据处理任务,协助建设可追溯的数据资产。
• 数据质量与过滤: 协助实现数据质量评估与过滤机制(覆盖率、长尾、污染检测、OOD 过滤等),参与训练集/评测集的质量监控工作。
• 分布式计算框架开发: 参与大规模数据处理中的分布式计算任务开发与优化,使用 Ray / Spark / Dask 等框架实现高效的数据并行处理、任务调度与资源管理。
• 数据存储与IO优化: 参与大规模数据的存储方案实施与 IO 加速优化(webdataset / tfrecord / mcap / parquet 等),协助优化数据加载链路以支撑分布式训练场景下的数据供给。
• 跨团队协作: 与算法、仿真、机器人系统团队紧密配合,将数据需求转化为可执行的工程实现,推动数据闭环的持续迭代。
• 本科及以上在读,计算机 / 自动化 / 机器人 / 机器学习等相关专业,能保证每周 4 天以上、持续 3 个月以上的实习时间。
• 扎实的工程能力(核心要求): 精通 Python,熟悉 SQL / Shell,具备良好的编程习惯与系统设计能力,有独立完成工程项目开发的经验。
• 分布式计算框架经验(核心要求): 有使用或参与开发分布式计算框架的经验(Ray / Spark / Dask / Beam 等),理解分布式任务调度、数据并行、故障恢复等核心概念,能独立完成分布式数据处理任务的开发与调试。
• 数据管线开发经验: 有大规模数据处理或 ETL 流水线开发经验,了解数据湖 / 数据仓库基本理念,能独立承担数据管线中特定环节的设计与实现。
• 熟悉常见数据存储与序列化格式(Parquet / TFRecord / WebDataset / HDF5 / Protobuf 等),理解不同格式的性能特点与适用场景。
• 良好的工程素养: 熟悉版本管理(Git)、基本的测试与 CI/CD 流程,具备良好的文档编写习惯,能在多人协作下高效完成开发任务。 加分项
• 有深度学习模型训练或微调经验(PyTorch / Jax),了解模型训练中的数据加载链路与常见优化手段(DataLoader、采样器、sharding 策略等)。
• 具备机器人真机或仿真数据经验(ROS / Isaac Sim / MuJoCo 等),了解机器人数据采集的基本流程。
• 有多模态数据(图像 / 视频 / 文本 / 轨迹)处理经验,了解 modality alignment 与 tokenization 的基本概念。
• 熟悉具身 / 机器人 / 智驾相关公开数据集(Open X-Embodiment、RT-1/RT-2、nuScenes 等)。 • 有开源项目贡献或数据工程相关工具开发经验。
• 对数据质量有敏锐度,了解数据污染检测、分布分析等基本方法。
相关岗位