具身数据平台使用手册

TRON 2 EDU版2026/9/23

💡 欢迎使用具身数据平台文档!本文档将帮助您快速了解平台功能并掌握使用方法

1 文档导航

栏目 适合人群 阅读时间 内容
快速上手 所有新用户 约5分钟 快速了解平台基本操作,包括登录、界面介绍和不同角色的基本权限说明。建议所有用户首先阅读此章节。
角色工作流程 需要了解具体操作流程的用户 约15-20分钟 详细介绍不同角色在平台中的工作流程和操作步骤。
每个角色都有详细的职责说明、操作步骤和适用场景介绍。
数据功能模块 需要深入了解各功能模块的用户 约20-30分钟 全面介绍平台的数据功能模块,包含详细的功能说明和使用指南。
模型功能模块 需要进行模型训练的用户 约20-30分钟 详细介绍模型训练功能,包括训练任务创建、参数配置、GPU选择等
系统管理模块 需要对数据平台系统进行管理的用户 约10分钟 介绍系统管理中的用户管理功能
扩展插件(待添加) 需要定制化功能的用户 约10-15分钟 介绍平台的插件扩展机制:
- 插件机制:安全可控、内嵌网页、跨域通信
- 开发方式:内置插件、定制开发、自主开发
- 插件管理:创建、激活、使用插件
常见问题 遇到问题的用户 按需查阅 收集了平台使用过程中的常见问题和解决方案,帮助您快速解决遇到的问题。

2 阅读建议

角色 阅读建议
个人开发者/个人研究员 1. 先阅读 快速上手,了解平台基本操作
2. 按项目经理角色,阅读 角色工作流程 中对应的章节
3. 需要深入了解某个功能时,查阅 功能模块
团队开发--项目经理/管理员 1. 完整阅读 角色工作流程,了解所有角色的工作流程
2. 重点学习 功能模块 中的任务管理和用户管理
3. 了解 数据导出数据处理流程
团队开发--开发人员 1. 按项目经理角色,阅读 角色工作流程 中对应的章节
2. 重点关注 模型训练与推理 进行模型开发
团队开发--采集员/标注员/审核员 1. 按各自角色,阅读 角色工作流程 中对应的章节
2. 重点学习 功能模块 中的对应的详细功能

3 快速上手

💡 这部分会告诉你平台怎么用,大概5分钟就能看完。

3.1 开始之前

你需要有:

  • 平台账号和密码
    • 如果您没有账号和密码,请联系对接您的商务人员
  • 知道自己是什么角色
    • 管理员(Admin):所有功能都能用,包括用户管理、权限配置、数据导出
    • 项目经理(Manager):管项目和任务,包括任务创建、分配与管理
    • 采集员(Collector):数据采集与上传
    • 标注员(Annotator):做标注工作
    • 审核员(Auditor):检查标注结果

3.2 怎么开始用

3.2.1 登录

打开浏览器,输入网址https://tron2data.limxdynamics.com/,填用户名密码,点登录就行。

3.2.2 看看界面长什么样

登录后你会看到几个区域:

  • 右上角:修改密码等资料管理功能
  • 左边:系统功能菜单
  • 中间:具体内容

3.2.3 看看项目情况

登录后默认显示首页,这里能看到:

  • 数据量统计
  • 标注进度
  • 任务状态

3.2.4 你能做什么

不同角色权限不一样,在项目流程中的职责也不一样

3.3 接下来干什么

看完这个文档后,建议:

1.熟悉您的角色的详细操作流程
2.熟悉各个功能模块

  • 数据管理:数据集列表、标签管理、数据预览、批量操作
  • 数据上传:多格式文件上传、在线转码、进度监控
  • 采集任务:任务创建、设备分配、进度跟踪
  • 标注任务:任务管理、状态监控、批量操作
  • 字典管理:标签分类、多语言支持、版本控制
  • 数据导出:多格式导出、选择性导出、导出历史
  • 用户管理:用户创建、权限管理、角色控制
    3.熟悉项目开发流程(仅针对项目内的开发周期)

4 角色工作流程

4.1 角色操作指南

角色 适用场景 角色职责 操作权限 主要职责 流程步骤
管理员(Admin) 账号与权限治理、数据交付 负责用户与系统配置;导出可训练数据;把控安全与合规 - 创建和管理用户账号,确保用户信息的安全与有效性
- 分配和调整角色及权限,满足不同用户的需求
- 全面查看和管理所有数据,实时监控平台运行状态
- 导出数据及生成各类报告,支持数据分析与决策
- 处理用户反馈及技术支持请求,提供及时有效的解决方案
- 保障平台的稳定运行与信息安全
- 监督数据质量,及时发现并解决潜在问题
- 制定并执行安全策略,防范各类安全威胁
1. 创建用户与成员
- 在"用户"中创建/导入账号,并分配角色
2. 监督质量与导出数据
- 在"导出"筛选数据并导出 JSON/CSV/HDF5/LeRobot/MCap 等
项目经理(Manager) 快速把一批数据分发给标注员
与审核员并跟踪结果
负责选数、建任务、指派标注/审核、推进进度 - 分配任务给标注员和审核员,优化团队资源配置
- 实时查看任务状态,促进团队沟通与协作
- 审核并批准数据,确保数据质量达标
- 根据实际情况调整资源分配,应对变化与挑战
- 生成进度更新,向相关方汇报情况
- 负责任务的日常管理与推进,制定并执行详细任务计划
- 保证任务按时高质量完成,激励团队成员保持高效工作状态
- 维护数据的准确性与一致性,确保整体质量
- 协调并解决团队内部问题,促进良好合作氛围
- 评估任务风险,制定应急预案,保障任务顺利进行
1. 创建任务(核心流程)
- 打开"数据"页,筛选目标数据并勾选(支持批量选择)
- 点击底部"标注" → 在弹窗中填写任务名、项目、标注员、审核员 → "创建任务"


2. 跟进任务
- 在"标注任务"按状态(待开始/进行中/待检查/检查合格)查看进度
- 点击任务名称进入任务详情页,查看详细信息和各标签页内容
- 必要时在"字典"统一标签口径
3. 批量管理任务
- 在任务列表中多选任务,使用批量删除功能
- 通过任务详情页查看任务的标注数据、批量标注和问题标注
采集员(Collector)
线下/遥操作采集回传与规范化入库 执行采集任务并上传数据;必要时在"上传"完成转码 - 使用采集设备(如传感器、视频设备、遥控机器人等)采集原始数据,确保数据完整与准确
- 查看及设置采集设备,进行必要的设备调整
- 提交采集数据并进行初步整理,确保数据质量达标
- 使用数据采集工具,提升采集效率
- 记录采集过程中的问题与异常,完善采集日志与文档
- 按照项目要求采集数据,确保数据来源真实且具代表性
- 对采集数据进行初步整理与检查,保障数据完整与准确
- 及时报告设备故障或数据异常,协调技术支持进行处理
- 确保采集过程中的数据安全,严格遵守隐私保护政策
- 参与采集流程优化,提升采集效率与数据质量
- 配合标注员与审核员,确保数据质量控制与标准化
- 协助培训新采集员,分享采集经验与技巧
1. 在"采集"查看自己的采集任务,按计划执行并提交数据
2. 使用`逐际动力 数据采集软件`设置自动批量上传采集数据
标注员(Annotator) 日常标注执行;修复审核打回的问题 领取任务,打开数据进行标注,提交后等待审核 - 接收并完成标注任务,专注于数据的准确处理
- 查看个人任务与进度,进行自我管理与时间规划
- 提交标注数据,确保按时高质量交付
- 使用标注工具与资源,提升工作效率与数据质量
- 记录标注过程与问题,完善标注文档
- 按照项目要求进行数据标注,严格遵循标准与格式
- 保证标注数据的准确性与一致性,积极参与质量控制
- 遵守项目时间表,持续优化工作效率
- 参与标注流程优化,提升整体标注效果
- 协助培训新标注员,分享经验与最佳实践
1. 在"标注任务"查看自己的任务并进入任务详情

2. 在任务详情页可以查看:
- 标注数据标签页:查看任务关联的所有数据集
- 批量标注标签页:使用批量标注功能提高效率
- 问题标注标签页:查看被标记为无效的标注
3. 在任务详情里点击"继续标注"打开数据进行标注;完成后提交
审核员(Auditor) 质量把关、问题收敛与口径统一 按任务对标注结果进行审核,通过或打回并给出说明 - 接收并完成审核任务,负责数据的最终质量把控
- 查看和评估标注数据,提出专业反馈与改进建议
- 提交审核结果,确保数据符合质量标准
- 使用审核工具与资源,提高审核效率
- 记录审核过程与结果,完善审核文档
- 严格审核标注数据,发现并纠正潜在错误
- 提出流程与质量改进建议,促进团队专业成长
- 确保数据符合项目标准,为项目成功提供保障
- 参与审核流程优化,持续提升审核效果
- 协助培训新审核员,分享审核经验与技巧
1. 在"标注任务"查看待检查与检查合格分组

2. 进入任务详情页,可以在不同标签页查看:
- 标注数据:查看关联的数据集和标注内容
- 问题标注:查看标记为无效的标注,便于重点审查
3. 抽样或全量检查;通过或打回并备注

4.2 角色权限说明

4.2.1 按角色查看权限

操作 查看项目信息 创建/删除项目 上传数据 修改/删除数据 导出数据 标注数据 创建任务 修改/删除任务 管理用户身份
管理员 ✅ 所有项目 ✅ 所有项目 ✅ 所有项目 ✅ 所有项目 ✅ 所有项目 ✅ 所有项目 ✅ 所有项目 ✅ 所有项目
项目经理 ✅ 所有项目 ✅ 只能创建,只能删除自己的 ✅ 只能上传到自己的项目 ✅ 只能修改/删除自己项目的数据 ✅ 只能导出自己项目的数据 ✅ 只能标注自己项目的数据 ✅ 只能在自己的项目中创建 ✅ 只能修改/删除自己项目的任务

4.2.1.1 管理员权限

管理员拥有最高权限,可以操作系统中的所有内容,没有限制。

  • 能做什么
    • 创建、查看、修改、删除所有项目(包括公开项目和私有项目)
    • 上传、修改、删除所有项目的数据
    • 导出所有项目的数据
    • 标注所有项目的数据
    • 创建、修改、删除所有项目的任务
    • 管理所有用户账号和系统设置
    • 修改项目的公开状态
  • 不能做什么
    • 无限制

4.2.1.2 项目经理权限

项目经理只能操作自己所属的项目,对公开项目只有查看权限。

自己项目的权限

能做什么

项目管理

  • 查看项目信息和成员
  • 更新项目名称、描述等信息
  • 添加或移除项目成员
  • 合并项目数据

数据操作

  • 上传新数据
  • 修改数据信息
  • 删除数据
  • 导出数据
  • 下载数据
  • 标注数据

任务操作

  • 创建任务
  • 修改任务信息(名称、分配等)
  • 删除任务
  • 分配任务给标注员和审核员

不能做什么

  • 修改项目的公开状态(只能管理员操作)

公开项目的权限

能做什么

  • 查看项目信息和成员列表
  • 查看数据列表和详情
  • 查看任务列表和详情
  • 下载数据(用于学习参考)
  • 查看数据标注信息

不能做什么

  • 上传数据
  • 修改或删除数据
  • 导出数据
  • 标注数据
  • 创建任务
  • 修改任务信息(但如果你是任务参与者,可以修改任务状态)
  • 删除任务(只有管理员和任务创建者可以删除)
💡 特殊说明

任务状态修改:如果你是公开项目任务的标注员或审核员,可以修改任务状态:

  • 标注员可以改为"工作中"或"已完成"
  • 审核员可以改为"检查中"、"检查合格"或"需要返工"

但你不能修改任务的其他信息(如名称、分配情况等)。

4.2.2 按项目类型查看权限

操作 查看项目信息 查看数据 上传数据 修改数据 删除数据 导出数据 标注数据 查看任务 创建任务 修改任务 删除任务
自己的项目 ✅ 成员可见 ✅ 成员可见 ✅ 成员可上传 ✅ 成员可修改 ✅ 成员可删除 ✅ 成员可导出 ✅ 成员可标注 ✅ 成员可见 ✅ 成员可创建 ✅ 成员可修改 ✅ 成员可删除
共享项目(公开) ✅ 所有人可见 ✅ 所有人可见 ❌ 仅管理员 ❌ 仅管理员 ❌ 仅管理员 ❌ 仅管理员 ❌ 仅管理员 ✅ 所有人可见 ❌ 仅管理员 ❌ 仅管理员(参与者可改状态) ❌ 仅管理员和创建者

自己的项目

"自己的项目"指你作为成员加入的私有项目。

能做什么

所有成员都能做的

  • 查看项目信息和数据
  • 查看项目内的所有任务
  • 下载数据
  • 如果被分配为标注员或审核员,可以参与任务

项目经理和管理员还能做的

  • 上传、修改、删除数据
  • 导出数据
  • 标注数据
  • 创建、修改、删除任务
  • 管理项目成员

不能做什么

  • 普通成员不能创建任务(需要项目经理或管理员角色)
  • 普通成员不能修改或删除其他人的数据
  • 只有管理员可以修改项目的公开状态

共享项目(公开项目)

"共享项目"是对所有用户开放的公开项目,所有人都可以查看,但只有管理员可以修改。

能做什么

所有用户都能做的

  • 查看项目信息、数据列表和任务列表
  • 查看数据详情和标注信息
  • 下载数据(用于学习参考)
  • 查看任务详情和进度

任务参与者还能做的

  • 标注员可以修改自己任务的状态为"工作中"或"已完成"
  • 审核员可以修改自己任务的状态为"检查中"、"检查合格"或"需要返工"

不能做什么

所有非管理员用户都不能做的

  • 上传数据
  • 修改或删除数据
  • 导出数据
  • 标注数据
  • 创建任务
  • 修改任务信息(除了任务状态)
  • 删除任务(只有管理员和任务创建者可以)

只有管理员能做的

  • 公开项目的所有修改操作(上传、修改、删除数据,创建、修改、删除任务等)

4.3 项目经理操作指南

4.3.1 新建项目

点击“管理--项目--创建项目”

后续您可以在这里查看项目信息、修改项目信息、删除项目

如果需要为您的项目创建角色、分配账号等可点击“管理--用户--创建用户”

4.3.2 新建采集任务

通过"新建任务"窗口,项目经理可快速创建新的数据采集任务,并灵活设置采集要求。

1.打开“新建任务”窗口

在左侧菜单栏选择 采集 页面,点击 “新建任务” 按钮,弹出任务配置窗口。

2.配置任务信息

在弹窗中,依次填写以下任务信息:

信息项 信息介绍 示例
任务名 输入任务名称,用于唯一标识该任务 `演示任务`
数据采集源 从下拉列表中选择数据采集的数据源 `rosa`
采集动作 在“采集动作”下拉框中选择所需操作,支持多选 `pick (A) from (B)`
采集数量 输入本次需采集的数据条目数量 `3`
子采集任务数 设置每个子采集任务包含的数据条目数 `1`
备注(选填) 可在备注栏补充任务说明

3.完成任务创建

确认信息无误后,点击 “确定” 完成任务创建。如需放弃操作,点击 “取消”

4.3.3 新建标注任务

1.选择未分配的数据

在数据列表中,筛选并选择尚未分配任务的数据。

2.创建新任务

点击“创建任务”按钮,填写任务名称、标签等相关信息,确认无误后保存任务。


3.追加数据到已有任务

如需将数据追加至已有任务,点击“添加任务”按钮,选择目标任务后完成追加操作。

4.3.4 数据统计与管理

1.查看数据集

进入数据集管理页面,选择需要操作的数据集。

2.数据集统计信息

在数据集页面,可查看任务数量、标签分布等统计信息,全面了解数据集概况。

3.新建标签

点击“创建标签”按钮,输入标签名称后保存,即可为数据集添加新标签。

4.按任务名称搜索

在搜索框输入任务名称,点击搜索按钮,快速定位目标任务。

5.按标签名称搜索

选择或输入标签名称,筛选包含指定标签的任务。

6.高级搜索与筛选

通过组合多种条件进行高级搜索,实现数据的精准筛选。

4.4 采集员操作指南

采集员是数据采集流程中的核心角色,负责执行具体的机器人操作任务,完成数据采集工作。这部分将详细介绍采集员的工作流程和操作步骤。

4.4.1 工作流程概述

采集员的工作主要分为以下几个阶段:

1.任务接收 - 接收项目经理分配的采集任务
2.任务执行 - 在VR环境中执行采集操作
3.状态管理 - 更新任务状态,配合质量检查

4.4.2 任务接收与管理

1.登录数据平台

访问数据平台网页 https://flow1.telexdata.com,使用采集员账号登录。

2.查看分配的任务

进入"采集任务"页面,可以查看分配给自己的所有任务:

3.任务信息查看

每个任务包含以下信息:

  • 任务名称 - 任务的标识名称
  • 动作集 - 需要执行的具体操作步骤
  • 项目归属 - 任务所属的项目
  • 采集要求 - 数量、时长、场景等具体要求
  • 分配设备 - 用于执行任务的机器人设备
  • 任务状态 - 当前任务的执行状态
    4.任务状态管理

采集员可以执行以下状态转换:

  • 待开始工作中 - 开始执行任务
  • 工作中待检查 - 完成采集,等待质量检查

4.4.3 通过遥操作TRON2进行数据采集

1.连接TRON2机器人

参照[📘 逐际动力 数据采集软件使用手册]产品概述-网络连接方法,进行网络连接

2.访问数据采集软件

参照[📘 逐际动力 数据采集软件使用手册]产品概述-软件访问入口,进入数据采集软件并按身份登录(是否需要登录请参照[📘 逐际动力 数据采集软件使用手册]产品概述-功能边界)

3.检查相机配置

我们在出厂时已经在程序中写入了相机的sn,不需要您配置相机sn。但是如果检查左右腕部相机的画面是相反的需要换过来重新安装

💡 原有相机损坏维修,或者想使用自己的相机,请参考 相机SN配置方法

4.TRON2机器人配置

注意

一定要先调节头部,后进入遥操模式

  • 调节tron2机器人头部位置:将机器人切换到Teleoperator模式,可在数据采集软件页面(10.192.1.2:8080)检查视角是否合适,如果不合适可以访问机器人管理平台limx studio(10.192.1.4)调节头部俯仰到最低,即头部旋转到中间位置(pitch=1.04,yaw=0)。
  • 启动tron2机器人遥操模式,进入准备状态:参照[📘 TRON 2 用户手册]VR设备及遥操作使用说明-遥操作准备+遥操作使用,使机器人处于遥操准备状态
    5.数据采集设置

参照[📘 逐际动力 数据采集软件使用手册]概述页面-数据录制,在数据采集软件进行参数设置

参数 参数填充
文件名 自拟
Dominid 一般填0,多机共用机器人进行操作时可按需分配id号
格式 mcap
topic
推荐勾选以下13个topic
1、/camera/left/color/image_resized/compressed sensor_msgs/msg/CompressedImage 2、/camera/right/color/image_resized/compressed sensor_msgs/msg/CompressedImage 3、/camera/top/color/image_raw/compressed sensor_msgs/msg/CompressedImage 4、/gripper_command sensor_msgs/msg/JointState 5、/gripper_state sensor_msgs/msg/JointState 6、/joint_command sensor_msgs/msg/JointState 7、/joint_states sensor_msgs/msg/JointState 8、/left_arm/ee_pose geometry_msgs/msg/PoseStamped 9、/left_arm/ee_pose_cmd geometry_msgs/msg/PoseStamped 10、/right_arm/ee_pose geometry_msgs/msg/PoseStamped 11、/right_arm/ee_pose_cmd geometry_msgs/msg/PoseStamped 12、/lifter/state 13、/chassis/twist

6.开始采集

在正式开始采集前,还需要检查以下事项

  • 网络连接是否畅通
  • 数据盘可用空间是否足够(录制1条1分钟的数据占用空间大约为800M-1.5G)

录制操作:

1.使机器人双臂进入准备姿态
2.点击数据采集软件中概览-数据录制-开始录制(也可使用vr手柄快捷键,具体请参照📘 TRON 2 用户手册
3.执行数据采集操作
4.使机器人双臂回准备姿态(具体键位请参照📘 TRON 2 用户手册
5.点击数据采集软件中概览-数据录制-结束录制(也可使用vr手柄快捷键,具体请参照📘 TRON 2 用户手册
6.循环录制更多条,直至完成任务
7.数据查验:参照[📘 逐际动力 数据采集软件使用手册]数据页面,进行对数据进行检查、下载、删除等管理

4.4.4 注意事项

1.设备安全
1.操作前确保设备状态正常,避免损坏
2.采集过程中,双手不能交叉
2.数据质量
1.严格按照要求执行,确保采集数据质量
2.采集多条数据过程中,请保持头部相机视角、桌面高度、环境光线一致(为了实现更好的执行效果,在部署推理模型时,请尽量保持同样的状态)

4.4.5 质量检查配合

1.检查流程

  • 完成采集后任务状态变为"待检查"
  • 等待审核员进行质量检查
  • 根据检查结果进行相应处理
    2.不合格处理
  • 如果检查不合格,任务状态变为"检查不合格"
  • 需要重新执行相关操作
  • 完成后重新提交检查
    3.合格确认
  • 检查合格后任务状态变为"检查合格"
  • 最终提交数据到系统
  • 任务完成

通过以上流程,采集员可以高效地完成数据采集任务,为整个数据标注流程提供高质量的数据基础。

4.5 标注员操作指南

4.5.1 登录平台

如未登录,系统将自动跳转至登录页面。请输入您的账号和密码完成登录。

4.5.2 查看标注任务

登录后,点击左侧的“标注列表”以查看分配给您的标注任务,并注意数据的当前状态。

点击 “待开始”,选择并点击准备开始标注的任务

在开始标注前,到页面最下方,将任务状态更新为“工作中”。

4.5.3 开始标注

选择待标注的数据,点击“开始标注”进入标注页面,正式开始数据标注工作。

4.5.4 标注示例说明(叠衣服任务)

如图所示,采集人员双手靠近物体,表示一组动作的开始,此时请按下 Q 键。

当采集人员已将衣服叠整齐,且双臂回归原位,视为该动作的结束,此时请按下 R 键。

按下 R 键后,自动弹出窗口“添加标注”。例如,此段视频为“叠T恤”,标签应为: fold T-Shirt(叠T恤)。

选择“技能”和“对象”后,通过点亮⭐️为本条数据打分,如果本条数据任务执行失败,则直接勾选“失败”。

如对象队列中无对应物品,可自定义添加,需至少包含中英文两种语言。

完整标注一条动作后,如下图所示:

4.5.5 数据检查

标注过程中,需同步检查采集动作、全相机数据完整性及三维动画小人姿态是否正常。如发现异常,左键单击对应自然语言段落,选择相应的异常标签:

  • 基础数据有误:全相机或姿态不合格
  • 无效采集数据:采集动作不合格
  • EE结果异常:末端执行器(夹爪/灵巧手)数据异常
  • 姿态异常数据:采集动作或数据完整性不达标

如果遇到以下问题,标注基础数据有误:

  • 头尾数据曲线有无断开,例如:
  • 夹爪数据是否剧烈波动,例如:

4.5.6 保存标注

点击“保存”按钮,保存当前标注信息。

当任务全部数据标注完成后,请将任务状态更新为“待检查”。任务对应的审查员将对标注数据进行全面审核。

4.6 审核员操作指南

4.6.1 登录平台

如未登录,系统将自动跳转至登录页面。请输入您的账号和密码完成登录。

4.6.2 访问标注列表

在左侧导航栏点击“标注列表”,查看分配给您的审核任务,并关注数据状态。

4.6.3 审核标注数据

对标注员已完成的数据进行全面审核,重点检查自然语言语义及标注轨迹起始帧的节点(需全量检查,极为重要)。

进入任务后,系统会自动开启审核模式。您可调整播放速度和放大检查颗粒度,以便更细致地审核。

请对每一条数据逐项审核。如发现问题,请选择相应的异常标签。

4.6.4 质量评定

审核完成后,请为该数据选择质量标签:

  • 高质量:所有数据均为正常,无异常标注。
  • 低质量:任意一条数据被采集人员标记为异常,且审核无误。

4.6.5 完成任务审核

如需标注员重新标注或修改,请选择“检查不合格”,任务将回退至标注员列表;如无需修改,选择“检查合格”即可完成审核流程。

5 数据功能模块

5.1 概述

💡 平台提供核心的数据管理与标注功能,支持高效的数据处理流程。

5.1.1 核心功能

功能项 访问权限 功能介绍 核心功能 图片示例
数据页面 管理员、项目经理 集中管理与检索数据,支持按名称、标签等条件筛选,支持批量操作。在此勾选数据后,可一键发起"标注"创建任务 - 数据集列表:支持按状态、标签等条件筛选和搜索
- 标签管理:为数据集添加自定义标签,便于分类管理
- 数据预览:支持Mcap格式数据的可视化预览和标记点查看(数据播放)
- 批量操作:支持批量删除、重命名等操作
- 质量检测:本地数据质量检测和验证

数据上传 所有角色 将视频、音频、ROS(BAG/MCAP)及图片上传到平台,支持在线转码为 MCAP,并显示进度与格式校验 - 多格式支持:支持Mcap、Bag、Mp4、音频等ROS标准格式文件
- 视频转换:在线将视频文件转换为Mcap格式,支持自定义质量、帧率和音频设置
- 音频处理:支持音频文件转换为Mcap格式,便于语音数据标注
- 批量上传:支持拖拽上传和批量文件选择
- 进度监控:实时显示上传进度、速度和剩余时间
- 格式验证:自动检测文件格式和完整性

采集任务 管理员、项目经理、采集员、审核员 创建与管理数据采集任务,分配采集员/设备并跟踪执行状态,采集完成的数据自动汇聚到平台。 - 任务创建:支持创建采集任务,设置采集目标、时间要求和设备分配
- 任务分配:将采集任务分配给特定设备或采集员
- 进度跟踪:实时监控采集任务执行状态和完成情况
- 设备管理:支持遥操作设备的任务分配和数据上传配置
- 批量操作:支持批量创建、编辑和删除采集任务

标注任务 管理员、项目经理、标注员、审核员 集中管理所有标注任务,支持按状态分组(待开始、工作中、待检查、检查合格、提交数据),并提供筛选与批量操作。创建任务需在"数据"页面先勾选数据,再点击底部"标注"进行指派。 - 任务管理:创建、分配和跟踪标注任务进度
- 状态监控:实时显示任务状态统计(待分配、进行中、已完成、已审核等)
- 标注检查:审核员可以对标注结果进行审核,通过或打回并给出说明
- 批量操作:支持批量任务状态更新和分配
- 搜索筛选:按状态、创建时间等条件筛选任务
- 权限控制:不同角色可执行不同操作(管理员可删除,项目经理可分配等)

字典管理 管理员、项目经理、标注员、审核员 统一维护技能、对象、目标、状语、标注标签、数据标签等字典,确保不同项目遵循一致的命名与口径,支持多语言与批量操作。 - 标签分类:支持技能、目标、对象等多种标签类型管理
- 多语言支持:支持中文、英文等多语言标签定义
- 层级结构:支持标签的层级分类和排序管理
- 批量操作:支持批量导入、编辑和删除标签
- 使用统计:显示标签在数据集中的使用频率
- 版本控制:支持标签的版本管理和历史记录

数据导出 管理员、项目经理 支持将已标注数据导出为多种格式,便于后续分析与应用。支持标注导出和数据导出。 - 多格式导出:支持JSON、CSV、HDF5等多种导出格式
- 标注导出:导出标注结果,支持按任务、时间等条件筛选
- 数据导出:导出原始数据和标注数据
- 选择性导出:支持按标签、时间等条件选择性导出
- 批量导出:支持大量数据的批量导出操作
- 导出历史:记录和管理所有导出操作历史

用户管理 管理员、项目经理 集中管理用户信息、权限与项目归属,保障权限分配合理与数据安全。 - 用户创建:支持单个和批量创建用户账户
- 权限管理:细粒度的用户权限分配和管理
- 角色控制:支持管理员、项目经理、标注员等多种角色
- 会话管理:监控和管理用户登录会话
- 批量操作:支持CSV批量导入用户信息

5.1.2 技术特性

多语言支持

  • 支持中文、英文、日文等多种语言
  • 完整的国际化框架,所有UI文本支持多语言
  • 用户可自由切换界面语言

权限管理

  • 基于角色的访问控制(RBAC)
  • 细粒度的功能权限控制

实时更新

  • WebSocket实时数据更新
  • 自动刷新和状态同步
  • 实时进度监控和通知

5.2 数据管理

💡 数据格式说明

具身数据平台的设计目标是通用机器人数据管理,以 Robot Operating System (ROS) 为基准统一管理机器人数据。

  1. 数据导入:支持将非ROS标准的数据自动转换为ROS标准格式,进行统一管理。
  2. 数据可视化:内置机器人可视化模型,可以流畅播放三维动画和平面图像等所有格式内容。
  3. 数据导出:支持一键导出标准HDF5/LeRobot数据格式,根据原始数据自适应关节和图像,可以直接投入模型训练。

5.2.1 功能概述

集中管理与检索数据,支持按名称、机器人、标签等条件筛选,支持批量操作(重命名、统计、标注、标签、删除、导入、关联机器人)。在此勾选数据后,可一键发起“标注”创建任务。

5.2.2 适用角色和场景

角色 职责
管理员 作为平台管理员,您可以查看和管理所有项目的数据,监控整体数据质量状况,将数据分配给不同项目,并进行系统维护,清理无效数据,优化存储空间
项目经理 项目经理可以管理负责项目的数据,选择数据创建标注任务,监控数据标注进度,并确保数据标注质量。通过数据管理模块,项目经理能够全面掌控项目的数据状况
标注员 查看与检索数据(权限受限)
审核员 查看与检索数据(权限受限)

5.2.3 主要功能

5.2.3.1 数据浏览与检索

项目筛选

数据管理支持多种项目视图:您可以查看所有项目的数据,选择特定项目查看其数据,访问个人私有数据,或浏览团队共享数据。这种灵活的筛选方式让不同角色的用户都能快速找到所需数据。

高级搜索功能

系统提供强大的搜索能力,支持数据名称的模糊匹配和精确搜索,按数据来源机器人筛选,按标注标签筛选数据,按上传时间筛选,以及按文件格式筛选(MCAP、BAG、视频、音频、图片)。这些搜索条件可以组合使用,帮助您精确定位目标数据。

状态筛选

通过分配状态(已分配/未分配任务)、标注状态(已标注/未标注)、质量状态(高质量/低质量/待审核)等维度,您可以快速筛选出符合特定条件的数据,提高工作效率。

5.2.3.2 数据预览与播放

数据预览

系统提供缩略图显示功能,让您快速浏览数据内容。同时显示文件大小、时长、上传时间等基本信息,以及机器人信息、采集参数等元数据,帮助您全面了解数据特征。

在线播放

支持多种格式的在线播放:视频文件、音频文件,以及MCAP格式的机器人数据可视化播放。播放器提供暂停、快进、慢放、循环播放等控制功能,让您能够灵活地查看和分析数据内容。

5.2.3.3 批量操作功能

数据管理操作

支持丰富的批量操作功能,大大提高数据管理效率:

批量数据管理:

  • 批量重命名:批量修改数据集名称
  • 查看统计信息:批量查看数据集的统计信息(大小、时长、标注数量等)
  • 管理标签:批量添加或删除数据集标签
  • 删除数据:批量删除数据集(软删除,可在回收站恢复)
  • 导入外部数据:批量导入外部数据源
  • 关联机器人:批量将数据集关联到机器人设备

批量标注操作:

  • 创建标注任务:选择多个数据集后,一键创建标注任务
  • 追加到现有任务:将数据集追加到已有的标注任务中
  • 查看标注进度:批量查看数据集的标注完成情况

数据重新上传与恢复:

平台支持智能的数据集恢复功能。当您重新上传之前已删除(软删除)的数据集时:

1.自动检测:系统会自动检测是否存在同名的软删除数据集
2.恢复选项:上传时如果检测到同名软删除数据集,可以选择:
- 恢复现有数据集:恢复软删除的数据集,保留所有历史信息
1.保留原有的标注数据(dataset_markers)
2.保留任务关联(dataset_tasks)
3.保留数据集标签和元数据
4.保留访问和操作日志
- 创建新数据集:忽略软删除的数据集,创建全新的数据集记录
3.无缝恢复:恢复后的数据集立即从回收站移除,恢复正常使用状态

💡 提示

数据集恢复建议:

  • 如果数据曾被误删,建议选择"恢复现有数据集"以保留所有历史信息
  • 如果是全新上传的数据文件,可以选择"创建新数据集"
  • 恢复操作会保留标注、任务关联等所有重要数据

标注相关操作:

选择数据后可以一键创建标注任务,或将数据追加到现有标注任务中。您还可以查看数据的标注结果和标注进度,以及质量统计信息,为标注工作提供全面的支持。

5.2.3.4 数据下载与导出

文件下载

支持下载原始数据文件、转换后的MCAP文件,以及ZIP压缩包形式的批量下载。无论您需要单个文件还是批量数据,都能方便地获取。

数据导出

提供标注结果导出、统计报告导出、元数据导出等功能。导出的数据可以直接用于模型训练、数据分析或其他用途,满足不同场景的需求。

5.2.3.5 数据质量监控

质量指标

系统持续监控标注完成率、质量通过率、标注效率、异常数据等关键指标,帮助您全面了解数据质量状况。

质量分析

通过质量趋势分析、标注员表现对比、问题分析等功能,您可以深入了解数据质量的变化规律,识别改进机会,提升整体标注质量。

5.2.3.6 元数据同步与验证

平台提供了强大的元数据同步功能,确保数据集信息的准确性:

自动元数据提取:

  • 上传成功后,系统会自动提取数据集的元数据
  • 包括文件大小、时长、开始时间、结束时间等信息
  • 对于MCAP格式,会提取完整的消息统计和话题信息

手动同步元数据:

  • 如果元数据不准确或需要更新,可以手动触发元数据同步
  • 系统会重新读取文件并更新元数据信息
  • 支持批量同步多个数据集的元数据

元数据验证:

  • 自动验证文件完整性
  • 检测文件是否损坏或格式错误
  • 对于损坏的文件,会标记为错误状态并记录错误信息

错误处理:

  • 自动检测永久性错误(如文件损坏)和临时错误
  • 永久性错误会直接标记为错误状态,不再重试
  • 临时错误可以手动重试同步
💡 信息

元数据同步说明:

  • 同步过程可能需要一些时间,特别是大文件
  • 同步不会影响已有的标注数据
  • 如果文件损坏,同步会失败并标记错误状态

5.2.3.7 回收站与数据恢复

平台使用软删除机制,删除的数据集会进入回收站,可以恢复:

回收站功能:

  • 集中管理所有已删除的数据集
  • 显示删除时间、删除人等信息
  • 支持按类型、时间等条件筛选
  • 支持搜索已删除的数据集

数据恢复:

  • 可以从回收站恢复误删的数据集
  • 恢复后会保留所有历史信息
  • 支持单个恢复和批量恢复
  • 恢复的数据集自动从回收站移除

永久删除:

  • 管理员可以永久删除回收站中的数据
  • 永久删除后无法恢复,请谨慎操作

任务队列集成:

  • 数据集的元数据同步等操作使用任务队列处理
  • 可以通过任务队列管理功能监控同步进度
  • 支持队列的暂停、恢复、清理等操作(详见任务队列管理说明)

5.3 数据上传

5.3.1 功能概述

💡 提示

数据上传页面:指上传来自外部系统的数据,

数据导入页面:逐际动力数据采集软件自动上传的数据

平台支持多种格式的数据文件上传和在线处理。平台提供智能转码、格式校验、进度监控等功能,确保数据能够顺利进入标注流程。

5.3.2 适用角色

角色 职责
管理员 作为平台管理员,您可以配置云存储和上传参数,管理不同云存储的配置,监控上传状态和存储使用情况,并设置不同用户的上传权限。这些功能确保平台的上传服务稳定可靠
项目经理 项目经理可以为项目上传相关数据,按项目组织上传的数据,确保上传数据的质量,并指导团队成员正确上传数据。通过数据上传模块,项目经理能够有效管理项目的数据资源
采集员 采集员可以上传采集到的原始数据,批量上传采集任务的数据,将采集数据转换为标准格式,并更新采集任务状态。这些功能帮助采集员高效完成数据采集工作
标注员 标注员可以上传需要标注的数据,上传标注参考数据,以及上传标注结果数据。这些功能支持标注员完成各种标注任务

5.3.3 主要功能

5.3.3.1 多格式文件支持

机器人数据格式

平台支持多种机器人数据格式:MCAP文件作为机器人多模态数据的标准格式,推荐用于机器人数据;BAG文件作为ROS机器人数据的标准格式,支持自动转换为MCAP;HDF5文件作为科学计算数据格式,支持机器人状态数据。

媒体文件格式

支持主流的媒体文件格式:视频文件包括MP4、AVI、MOV、MKV等,音频文件包括MP3、WAV、AAC、OGG等,图片文件包括JPG、PNG、BMP、TIFF等。这些格式覆盖了绝大多数数据采集场景。

自动格式转换

系统提供智能的格式转换功能,支持多种格式自动转换为标准的MCAP格式:

视频转MCAP:

  • 支持MP4、AVI、MOV、MKV等主流视频格式
  • 在浏览器中实时转换,无需服务器处理
  • 可配置转换参数:
    • 图像画质:20%、50%、70%、100%(默认70%)
    • 视频帧率:自动、10 FPS、15 FPS、30 FPS(默认自动)
    • 包含音频:可选择是否保留视频中的音频轨道
  • 转换过程显示实时进度
  • 转换后的MCAP文件自动上传

音频转MCAP:

  • 支持MP3、WAV、AAC、OGG等主流音频格式
  • 自动提取音频采样率、声道数等元数据
  • 将音频数据转换为ROS标准的AudioData消息格式
  • 支持多声道音频处理
  • 音频消息频率固定为10Hz,确保与机器人数据同步

BAG转MCAP:

  • 支持ROS1和ROS2的BAG文件格式
  • 自动提取所有话题和消息
  • 保持时间戳和消息结构完整性
  • 转换后的MCAP文件可在平台中正常使用

浏览器兼容性检测:

💡 注意

视频转换功能需要浏览器支持MediaStreamTrackProcessor API,目前只有最新版本的Chrome和Edge浏览器支持此功能。

平台会自动检测浏览器是否支持视频转换:

  • 兼容浏览器:Chrome 94+、Edge 94+(完全支持)
  • 不兼容浏览器:Firefox、Safari等(会显示明确的错误提示)
  • 自动检测:上传视频文件时,系统会自动检测浏览器兼容性
  • 友好提示:不支持时会提示用户使用Chrome或Edge浏览器

如果您的浏览器不支持视频转换,建议:

1.使用最新版本的Chrome或Edge浏览器
2.或者先将视频转换为MCAP格式后再上传
3.联系技术支持获取其他解决方案

5.3.3.2 项目与存储管理

项目选择

系统显示所有可访问的项目,包括个人空间、共享项目、私有项目等不同类型。根据用户权限显示可访问项目,确保数据安全和访问控制。

云存储选择

支持多种云存储服务:腾讯云COS(支持多个地域)、阿里云OSS、华为云OBS、自建MinIO存储等。用户可以在不同存储间切换,选择最适合的存储方案。

5.3.3.3 智能上传功能

拖拽上传

支持文件拖拽到上传区域,可以同时上传多个文件,甚至支持整个文件夹上传。这种直观的上传方式大大提高了用户体验。

进度监控

实时显示每个文件的上传进度,包括当前上传速度、剩余时间等信息。当上传失败时,系统会显示具体的错误原因,帮助用户快速定位问题。

断点续传

当网络中断时,系统会自动恢复上传,确保文件上传完整性。同时具备重复上传检测功能,避免重复上传相同文件,节省时间和带宽。

软删除数据集恢复

平台支持智能的数据集恢复功能。当您重新上传之前已删除(软删除)的数据集时:

  • 自动检测:系统会自动检测是否存在同名的软删除数据集
  • 恢复选项:如果检测到软删除数据集,可以选择:
    • 恢复现有数据集:恢复软删除的数据集,保留原有的标注、任务关联等信息
    • 创建新数据集:忽略软删除的数据集,创建全新的数据集记录
  • 数据保护:恢复操作会保留数据集的所有历史信息,包括:
    • 原有的标注数据
    • 关联的标注任务
    • 数据集标签和元数据
    • 访问和操作日志
💡 提示

数据恢复建议:

  • 如果数据曾被误删,建议选择"恢复现有数据集"以保留历史信息
  • 如果是全新的数据文件,可以选择"创建新数据集"
  • 恢复的数据集会自动从回收站中移除

5.3.3.4 数据预处理

格式校验

系统会自动验证文件格式是否正确,检查文件是否损坏,检测视频/音频编码格式,检查视频分辨率和帧率等。这些校验确保上传的数据符合平台要求。

自动转码

提供智能的转码功能,确保数据在平台中能够正常使用:

视频转码

  • 将视频转换为标准MCAP格式
  • 支持自定义画质和帧率设置
  • 自动处理视频编码格式
  • 保持视频质量的同时优化文件大小

音频转码

  • 将音频转换为MCAP格式的AudioData消息
  • 自动提取音频元数据(采样率、声道数、格式等)
  • 转换为ROS标准消息格式
  • 保持音频质量,支持无损转换

格式标准化

  • 自动将不同来源的数据统一为标准格式
  • 处理编码差异和格式兼容性问题
  • 确保数据在平台中能够正常播放和处理

压缩优化

  • 自动压缩大文件以减少存储空间
  • 在压缩的同时保持数据质量
  • 支持选择压缩级别
  • 优化传输速度

元数据提取

系统会自动提取各种元数据:视频信息(时长、分辨率、帧率等)、音频信息(时长、采样率、声道等)、机器人数据(传感器数据信息)、时间戳(数据采集时间)等。这些元数据为后续的数据管理提供重要信息。

5.3.3.5 上传管理

上传队列

提供完善的上传队列管理功能:管理待上传文件队列,设置文件上传优先级,暂停或恢复上传任务,取消不需要的上传任务。这些功能让用户能够灵活控制上传过程。

历史记录

记录所有上传历史,提供完整的上传任务跟踪和管理功能:

上传记录信息

  • 文件信息:文件名、大小、格式、上传时间
  • 处理状态:待处理、转换中、上传中、已完成、失败
  • 进度信息:实时显示上传和转换进度百分比
  • 结果信息:创建的数据集ID和链接(上传成功后)
  • 错误信息:如果失败,显示详细的错误原因

上传状态跟踪

  • pending(待处理):文件已选择,等待开始处理
  • processing(处理中):正在转换或上传中
  • converting(转换中):视频/音频文件正在转换为MCAP格式
  • uploading(上传中):文件正在上传到云存储
  • completed(已完成):文件上传成功,数据集已创建
  • error(错误):处理过程中出现错误
  • cancelled(已取消): 用户主动取消上传

任务管理

  • 取消上传:可以随时取消正在进行的上传任务
  • 重试上传:失败的任务可以重新尝试上传
  • 查看数据集:上传成功后,可以快速跳转到创建的数据集页面
  • 批量操作:支持批量查看和管理多个上传任务

错误处理

  • 自动显示错误信息,帮助快速定位问题
  • 常见错误提示和处理建议
  • 支持查看详细错误日志
  • 失败任务支持一键重试

5.4 采集任务

5.4.1 功能概述

采集任务管理是具身数据平台的数据源管理模块,提供完整的数据采集任务生命周期管理功能。通过创建和管理数据采集任务,分配采集员和设备,跟踪执行状态,确保采集完成的数据自动汇聚到平台,为后续的标注和分析工作提供高质量的数据基础。

5.4.2 适用角色

角色 职责
管理员 作为平台管理员,您可以制定采集计划,分配人员和设备,跟踪完成情况,监控整体采集工作状态。这些功能确保平台的采集服务高效运行
项目经理 项目经理可以管理项目相关的采集任务,制定采集策略,监控采集进度,确保采集质量。通过采集任务管理,项目经理能够有效控制项目的数据采集工作。
采集员 采集员可以接收任务并按计划进行采集和上传,查看任务详情和要求,报告采集进度和问题。这些功能支持采集员高效完成采集工作。
审核员 审核员可以对采集结果进行抽查或审核,评估采集质量,提供改进建议,确保采集的数据符合要求。这个角色在保证采集质量方面发挥着重要作用。

5.4.3 主要功能

5.4.3.1 任务创建与规划

采集计划制定

支持制定详细的采集计划,包括采集目标、时间安排、地点规划、设备配置等。通过科学的计划制定,确保采集工作有序进行,提高采集效率。

任务模板管理

提供采集任务模板功能,可以创建和保存常用的采集任务模板,包括标准化的采集流程、检查清单、质量要求等。通过模板,快速创建新任务,提高工作效率。

资源分配

支持为采集任务分配采集员和设备,可以根据任务需求和个人技能进行智能匹配。通过合理的资源分配,确保任务能够按时高质量完成。

5.4.3.2 设备管理

设备注册

支持注册和管理各种采集设备,包括机器人、传感器、相机等。设备注册后可以分配给具体的采集任务,实现设备资源的统一管理。

设备状态监控

实时监控设备的工作状态,包括设备位置、电量、存储空间、网络连接等。通过状态监控,及时发现设备问题,确保采集工作顺利进行。

设备维护

提供设备维护管理功能,包括维护计划、故障记录、维修历史等。通过完善的维护管理,确保设备始终处于良好状态。

5.4.3.3 任务执行管理

任务分配

支持将采集任务分配给指定的采集员,可以通过系统通知、邮件等方式提醒采集员接收任务。任务分配过程支持优先级设置和截止时间管理。

进度跟踪

实时跟踪采集任务的执行进度,包括已完成数量、剩余数量、预计完成时间等。通过进度跟踪,及时发现任务执行中的问题,采取相应措施。

质量控制

建立采集质量控制体系,包括采集标准制定、质量检查、问题反馈等。通过质量控制,确保采集数据的质量和一致性。

5.4.3.4 数据汇聚

自动上传

采集完成的数据可以自动上传到平台,支持多种上传方式,包括实时上传、批量上传、定时上传等。自动上传功能大大减少了人工操作,提高了数据汇聚效率。

数据验证

自动验证上传的采集数据,包括格式检查、完整性验证、质量评估等。通过数据验证,确保采集数据的可用性和准确性。

数据分类

支持对采集的数据进行自动分类和标签,包括按项目、类型、时间、地点等维度进行分类。通过数据分类,便于后续的数据管理和使用。

5.5 标注任务

5.5.1 功能概述

集中管理所有标注任务,支持按状态分组(待开始、工作中、待检查、检查合格、提交数据),并提供筛选与批量操作。创建任务需在“数据”页面先勾选数据,再点击底部“标注”进行指派。

5.5.2 适用角色和场景

角色 职责
管理员 作为平台管理员,您可以查看所有任务的整体状况,管理标注员和审核员资源,监控整体标注质量,并配置任务流程和规则。这些功能确保平台的任务管理服务稳定高效。
项目经理 项目经理可以为项目创建标注任务,跟踪项目标注进度,监控标注质量状况,并协调标注员和审核员工作。通过任务管理模块,项目经理能够有效掌控项目的标注工作。
标注员 标注员可以接收分配给自己的任务,执行具体的标注工作,更新任务完成进度,并反馈标注过程中的问题。这些功能支持标注员高效完成标注任务。
审核员 审核员可以审核标注员完成的任务,评估标注质量,向标注员反馈问题,并制定和更新标注标准。这个角色在保证标注质量方面发挥着重要作用。

5.5.3 主要功能

5.5.3.1 任务状态管理

状态分组

系统将任务分为五个主要状态:待开始(已创建但尚未开始的任务)、工作中(正在进行标注的任务)、待检查(已完成标注等待审核的任务)、检查合格(通过审核的标注任务)、提交数据(已提交用于训练的数据)。这种状态分组让您能够清晰地了解每个任务的当前状态。

状态流转

任务在生命周期中会经历以下状态流转:任务创建后进入待开始状态,开始标注后变为工作中,完成标注后进入待检查,审核通过后变为检查合格,审核不通过则回到工作中重新标注,最终数据提交后变为提交数据。这个流程确保了标注工作的有序进行。

5.5.3.2 任务创建与分配

任务创建

创建任务时,您需要在数据页面选择要标注的数据,设置任务名称、描述、优先级,指定标注员和审核员,选择任务所属项目,并设置任务完成时间。这些配置确保任务能够按照预期执行。

批量操作

系统支持丰富的批量操作功能,大大提高任务管理效率:

批量选择:

  • 支持在任务列表中多选任务
  • 可以按状态、项目等条件筛选后进行批量操作
  • 选择后会显示底部操作栏

批量删除:

  • 可以批量删除选中的任务
  • 删除前会显示确认对话框,显示将删除的任务数量
  • 删除操作会同时清理相关的任务关联数据
  • 支持取消操作

批量分配(开发中):

  • 支持批量将任务重新分配给标注员
  • 支持批量修改任务属性
💡 注意

批量删除操作不可恢复,请谨慎操作。删除任务不会删除关联的数据集,只会解除任务与数据集的关联关系。

5.5.3.3 任务详情页

平台为每个标注任务提供了详细的详情页面,方便查看和管理任务的各个方面:

页面结构:

  • 面包屑导航:快速返回任务列表或项目页面
  • 标签页切换:多个功能标签页,组织不同内容
  • 侧边栏:显示任务基本信息和操作按钮
  • 主内容区:根据标签页显示相应内容

功能标签页:

1.标注数据(dataset):默认标签页

  • 显示任务关联的所有数据集列表
  • 可以查看每个数据集的基本信息
  • 支持数据集与任务的关联管理
  • 可以添加或移除数据集
    2.批量标注(repeats):批量标注工作区
  • 批量标注模式,提高标注效率
  • 样本选择器,快速切换数据
  • 标注进度条,显示完成情况
  • 同步元数据提醒
    3.问题标注(invalids):问题标注管理
  • 显示所有标记为无效的标注
  • 可以查看无效原因
  • 支持重新标注或删除无效标注

侧边栏信息:

  • 任务基本信息(名称、状态、创建时间等)
  • 任务相关人员(标注员、审核员)
  • 任务统计(数据集数量、标注数量等)
  • 任务操作(编辑、删除等)

5.5.3.4 进度跟踪与监控

实时进度

系统实时显示任务完成百分比、估算剩余完成时间,以及标注效率趋势分析。这些信息帮助您及时了解任务进展情况,做出相应调整。

任务详情页进度

  • 在任务详情页可以查看详细的进度信息
  • 显示各数据集的标注完成情况
  • 显示标注员的工作进度
  • 实时更新,页面可见性变化时自动刷新

进度报告

提供个人进度(标注员个人工作进度)、团队进度(团队整体工作进度)、质量报告(标注质量分析报告)等多种报告,满足不同层次的管理需求。

5.5.3.5 质量控制体系

审核机制

系统提供多种审核机制:基于规则的自动质量检查、审核员人工质量检查、随机抽样质量检查、对所有标注进行全量审核。这些机制确保标注质量符合要求。

质量指标

通过通过率(一次通过审核的比例)、准确率(标注准确性的统计)、一致性(不同标注员间的一致性)、完整性(标注完整性的检查)等指标,全面评估标注质量。

5.5.3.6 团队协作功能

任务分配

支持智能分配(根据标注员能力和工作负载智能分配)、手动分配(管理员手动分配任务)、重新分配(任务重新分配给其他标注员)、任务转移(任务在不同标注员间转移)等多种分配方式,确保任务能够合理分配。

沟通协作

提供任务评论(在任务中添加评论和反馈)、问题报告(标注员报告遇到的问题)、解决方案(审核员提供解决方案)、经验分享(团队成员分享标注经验)等协作功能,促进团队沟通和知识共享。

5.5.3.7 数据导出与集成

标注结果导出

支持导出为LeRobot、HDF5等标准格式,根据需求自定义导出格式,批量导出多个任务的标注结果,以及只导出新增或修改的标注。这些功能满足不同场景的数据导出需求。

训练数据准备

提供格式转换(转换为模型训练所需格式)、质量验证(验证导出数据的质量)、版本管理(管理不同版本的训练数据)等功能,确保导出的数据能够直接用于模型训练。

5.5.3.8 任务队列管理

平台提供了完善的后台任务队列管理系统,用于管理数据导出、处理等后台任务:

队列功能(管理员权限):

队列控制:

  • 暂停队列:临时暂停队列处理,停止执行新的任务
  • 恢复队列:恢复队列处理,继续执行等待中的任务
  • 队列状态:实时显示队列的暂停/运行状态

队列清理:

  • 清空等待队列:清空所有等待和延迟中的任务(不影响正在执行、已完成、失败的任务)
  • 清理历史任务:清理24小时之前已完成或失败的任务,释放存储空间
  • 批量重试:批量重试所有失败的任务(一次最多处理1000条)

队列监控:

  • 查看队列中的任务数量(等待、进行中、已完成、失败)
  • 查看任务执行日志和错误信息
  • 监控队列处理速度和性能
💡 信息

任务队列说明:

  • 任务队列主要用于后台任务处理,如数据导出、格式转换等
  • 暂停队列不会影响正在执行的任务,只会阻止新任务开始
  • 清理操作会永久删除历史任务记录,请谨慎操作
  • 批量重试可以帮助恢复因临时错误失败的任务

5.5.4 工作流程

💡 数据标注的核心目的是让后续训练的模型能够准确理解每一段动作的含义,从而使机器人能够将人类的自然语言指令正确映射为具体的动作。例如,当收到“收拾餐桌”这样的指令时,机器人能够明确对应的操作步骤和涉及的物品,实现智能化的任务执行

平台支持两种标注方式:

从数据页面选择数据后,可走精细标注或批量标注两条路径,最终保存到服务器。

1.精细标注

  • 您可以采集10分钟甚至更长时间的数据,对这个数据中的每个动作时间段都进行标注。
  • 支持分组,嵌套,重叠标注,既可以标注做了什么动作,也可以标注做了什么事情。
    2.批量标注
  • 您可以采集100条相同动作的数据,并一次性给这些数据都标注相同的自然语言。
  • 支持按时间段自动适应不同时长的任务,例如10%-30%的时间段做什么的标注。

5.5.4.1 数据查看

进入数据页面并点击相应的文件名链接,即可开始数据查看和标注。数据页面展示了所有可用的数据集,您可以通过搜索和筛选功能快速找到需要的数据。

面板

面板(Panel)是数据的渲染单位,相当于一个相机或传感器的视角(Topic)。

每条数据通常包含多个相机视角,即由多个面板组成。您可以灵活调整面板的大小、位置和数量,以最佳形式浏览数据。面板的灵活布局使您能够同时查看不同角度的数据,显著提高标注效率。

更换渲染面板

您可以轻松更换任何面板的显示内容:

1.点击面板右上角的设置按钮

2.从下拉菜单中选择需要的面板类型

这使您能够根据当前任务需求快速切换不同的数据视图。

更改订阅消息

您还可以更改面板显示的数据来源:

1.点击面板左上角的设置按钮
2.在弹出的设置菜单中选择要切换的Topic消息源

这使您能够查看不同的数据流,满足各种标注场景的需求。

5.5.4.2 精细标注

💡 提示

本章节的标注方法适用于包含多个原子动作的分段标注,特别适合一条数据包含多个任务的场景。精细标注允许您在单个数据流中标记多个不同的动作或事件。

开始标注

点击"开始"按钮(或按快捷键 Q)来标记动作或事件的开始时间点。系统会记录当前时间戳作为标注的起始点。

您可以:

  • 自动播放(按空格键)
  • 手动前后跳转(按左右方向键)
  • 控制跳转速度(同时按下 CTRL 加速或 ALT 减速)

这些灵活的播放控制使您能够精确定位到需要标注的时间点。

结束标注

当动作或事件结束时,点击"结束"按钮(或按快捷键 R)来结束当前标注。系统会记录当前时间戳作为标注的结束点,从而确定完整的时间范围。

添加语义信息

标记完时间段后,需要为该标注添加语义信息:

1.填写表单信息
2.选择对应的自然语言描述或添加新的字典项
3.保存信息

详细的语义描述有助于后续的数据训练和分析。

添加标注

完成上述步骤后,点击"添加标注"按钮(或按回车键)将此次标注添加到当前数据的标注列表中。如需标注多个动作,可重复上述步骤。

保存标注

完成所有标注后,点击右上角的黄色上传按钮,将标注保存到服务器。请确保在离开页面前保存您的工作,以防数据丢失。

5.5.4.3 批量标注

💡 提示

此功能允许您将一条数据的标注结果应用到多条同质化相似数据上,显著节省标注时间。

对于单一任务场景(如100条数据均为同一动作),批量标注功能可大幅提高效率。

批量标注流程

1.选择样例数据:从数据列表中批量选择同质化数据

2.创建标注任务:为这些数据创建新的标注任务

3.开始标注:查看并开始执行标注任务

4.完成样例标注:按照精细标注的流程完成一条样例的标注

5.保存样例:保存完成的样例标注

6.选择模板:回到任务页面,选择已标注的样例数据作为模板

7.批量复制:开始批量复制标注到其他数据

8.确认成功:确认复制操作已成功完成

9.查看结果:查看批量标注的最终结果

通过批量标注功能,您可以将标准化的标注快速应用到大量数据上,特别适合处理大规模的同质化数据集,极大提升工作效率。

5.6 字典管理

5.6.1 功能概述

统一维护技能、对象、目标、状语、标注标签、数据标签等字典,确保不同项目遵循一致的命名与口径,支持多语言与批量操作。

5.6.2 适用角色和场景

角色 职责
管理员 作为平台管理员,您可以制定并维护字典标准,管理所有类型的字典内容,配置多语言支持,并监控字典的使用情况。这些功能确保平台的标准化体系稳定运行。
项目经理 项目经理可以管理项目相关的字典内容,确保项目团队使用统一的标注标准,并根据项目需求调整字典配置。通过字典管理,项目经理能够有效控制项目的标注质量。
标注员 标注员可以在标注过程中引用统一的字典,减少标注歧义,提高标注效率。字典为标注员提供了标准化的参考,确保标注结果的一致性和准确性。
审核员 审核员可以基于统一的字典标准进行审核,确保标注结果符合规范要求。字典为审核员提供了明确的审核依据,提高了审核效率和准确性。

5.6.3 主要功能

5.6.3.1 字典类型管理

技能字典

管理所有标注技能的定义和分类,包括技能名称、描述、使用场景、难度等级等信息。通过技能字典,确保团队成员对技能的理解一致,减少标注过程中的歧义。

对象字典

维护标注中涉及的各种对象类型,如物品、人物、场景等。对象字典帮助标注员快速识别和分类不同的标注目标,提高标注效率和准确性。

标签字典

统一管理标注标签和数据标签,包括标签名称、颜色、层级关系等。通过标签字典,确保标签使用的一致性和规范性。

5.6.3.2 多语言支持

国际化管理

支持多种语言的字典管理,包括中文、英文等。管理员可以为不同语言环境配置相应的字典内容,确保国际化项目的顺利进行。

翻译管理

提供字典内容的翻译功能,支持批量翻译和人工校对。通过翻译管理,确保不同语言版本的字典内容准确一致。

5.6.3.3 批量操作功能

批量导入

支持从Excel、CSV等文件批量导入字典数据,大大提高了字典维护效率。导入过程中会自动进行数据验证,确保数据的准确性。

批量编辑

提供批量编辑功能,可以同时修改多个字典项,支持查找替换、批量更新等操作。这些功能让字典维护工作更加高效。

批量导出

支持将字典数据导出为各种格式,便于备份、分享或与其他系统集成。导出的数据保持完整的结构和格式。

5.6.3.4 版本控制

变更历史

记录字典的所有变更历史,包括修改时间、修改人、修改内容等。通过变更历史,可以追踪字典的演进过程。

版本回滚

支持将字典回滚到历史版本,当发现当前版本有问题时,可以快速恢复到之前的稳定版本。

变更审批

提供变更审批流程,重要字典的修改需要经过审批才能生效,确保字典变更的规范性和安全性。

5.7 数据导出

5.7.1 功能概述

数据导出是具身数据平台的重要数据交付模块,提供将已标注数据导出为多种标准格式的功能,包括 JSON、CSV、HDF5、LeRobot、MCap 等。通过灵活的筛选条件、批量导出功能和导出历史管理,确保标注数据能够以最适合的格式交付给下游系统,支持模型训练、数据分析等各种应用场景。

5.7.2 适用角色

角色 职责
管理员 作为平台管理员,您可以对外交付训练数据或下游分析所需数据,管理导出任务,监控导出进度,并控制数据导出权限。这些功能确保平台的数据交付服务安全高效。
项目经理 项目经理可以导出项目相关的数据,为项目交付准备数据,监控数据使用情况,并协调数据导出工作。通过数据导出管理,项目经理能够有效控制项目的数据交付。

5.7.3 主要功能

5.7.3.1 多格式导出支持

  • 标准数据格式

支持导出为多种标准数据格式,包括 JSON(结构化数据)、CSV(表格数据)、HDF5(科学计算数据)、LeRobot(机器人学习数据)、MCap(多模态数据)等。这些格式覆盖了绝大多数下游应用的需求。

  • 自定义格式

支持根据特定需求自定义导出格式,包括字段选择、数据转换、格式配置等。通过自定义格式,可以满足特殊场景的数据导出需求。

  • 格式转换

提供智能的格式转换功能,可以将数据从一种格式转换为另一种格式,确保数据在不同系统间的兼容性。转换过程支持数据验证和质量检查。

5.7.3.2 灵活筛选功能

  • 多维度筛选

支持按项目、时间、标注员、质量等级等多个维度进行数据筛选。通过灵活的筛选条件,可以精确选择需要导出的数据。

  • 高级筛选

提供高级筛选功能,支持复杂的筛选条件组合,包括逻辑运算、范围筛选、模糊匹配等。高级筛选让您能够精确控制导出的数据范围。

  • 预览功能

在导出前提供数据预览功能,可以查看筛选结果,确认导出的数据符合预期。预览功能避免了不必要的导出操作。

5.7.3.3 批量导出管理

  • 批量处理

支持批量导出多个数据集,可以同时处理多个导出任务,大大提高导出效率。批量处理特别适合大量数据的导出场景。

  • 任务队列

提供导出任务队列管理,支持多个导出任务的排队和执行。通过任务队列,可以有序地处理大量导出请求。

  • 进度监控

实时监控导出进度,包括已完成数量、处理速度、预计完成时间等。通过进度监控,可以及时了解导出状态。

  • 导出状态

    • pending(待处理)- 导出任务已创建,等待执行
    • processing(处理中)- 导出任务正在执行中
    • completed(已完成)- 导出任务成功完成,文件已生成
    • failed(失败)- 导出任务执行失败,可以查看错误信息
  • 进度信息

    • 实时显示导出进度百分比
    • 显示已处理数据集数量和总数量
    • 显示预计剩余时间
    • 支持自动刷新进度状态

5.7.3.4 导出历史管理

  • 历史记录

平台完整记录所有导出操作的历史,支持查看和管理所有导出任务:

  • 记录信息:

    • 导出时间 - 创建时间、开始时间、完成时间
    • 导出格式 - 导出数据类型(HDF5、LeRobot、MCAP、JSON、CSV等)
    • 数据量 - 包含的数据集数量和文件大小
    • 操作人 - 执行导出操作的用户信息
    • 导出状态 - 当前导出任务的状态(待处理、处理中、已完成、失败)
    • 文件信息 - 导出文件名称、大小、存储位置
  • 历史记录功能:

    • 支持按时间、格式、状态等条件筛选导出记录
    • 支持搜索特定导出任务
    • 显示导出任务的详细信息,包括包含的数据集列表
    • 支持查看导出任务的错误信息(如失败)
  • MCAP导出历史与进度

MCAP导出功能提供完整的历史记录和实时进度监控:

  • 导出历史列表:

    • 显示所有MCAP导出任务的列表
    • 每个记录显示导出状态、创建时间、包含的数据集数量等信息
    • 支持展开查看详细信息和包含的数据集列表
    • 支持按状态、时间等条件筛选
  • 实时进度跟踪:

    • 状态监控 - 实时更新导出任务状态(pending → processing → completed/failed)
    • 进度显示 - 对于处理中的任务,显示实时进度条
    • 自动刷新 - 系统自动检测任务状态变化并更新显示
    • 错误处理 - 如果任务失败,显示详细错误信息
  • 导出结果:

    • 文件下载 - 导出完成后,可以直接下载生成的MCAP文件
    • 文件信息 - 显示导出文件的大小、压缩格式等信息
    • 存储位置 - 显示文件在云存储中的位置
    • 训练集成 - 导出的MCAP文件可直接用于模型训练
  • HDF5导出功能

HDF5是一种高效的数据存储格式,平台提供了专门的HDF5导出功能:

  • 导出配置:

    • 分组数量(chunk_size) - 设置每个HDF5文件包含的原始文件数量

      • 设置为1表示每个原始文件对应一个HDF5文件(一一对应)
      • 设置更大的值可以将多个文件合并到一个HDF5文件中
      • 建议根据数据量和训练需求设置
    • 数据刷新频率(hz) - 控制每秒数据采集次数,影响文件大小

      • 默认30Hz,适用于大多数场景
      • 可以降低频率以减少文件大小
      • 提高频率可以获得更密集的采样
    • 导出统计:

      • 显示已选择的数据集数量
      • 显示导出配额使用情况
      • 显示导出进度和预计完成时间
    • 导出结果:

      • 导出的HDF5文件按原始文件分组命名(如 chunk_001.hdf5
      • 文件自动压缩为tar.gz格式
      • 支持直接下载或保存到云存储
      • 导出的HDF5文件可直接用于模型训练
💡 提示

MCAP导出建议:

  • 导出大量数据时,建议分批导出以提高成功率
  • 可以通过导出历史查看之前的导出记录
  • 如果导出失败,可以查看错误信息并重新导出
  • 导出的MCAP文件会自动压缩为tar.gz格式以节省空间
💡 信息

HDF5导出详细说明:

  • HDF5文件采用分层结构组织数据,支持多模态数据存储
  • 导出后的HDF5文件包含完整的标注信息(任务描述、动作序列等)
  • 版本管理

支持导出数据的版本管理,可以保存不同版本的导出结果,便于数据回溯和比较。版本管理确保数据的可追溯性。

  • 权限控制

提供细粒度的权限控制,可以设置不同用户对不同数据的导出权限。通过权限控制,确保数据安全,防止未授权导出。

  • 导出配额管理

    • 系统支持导出配额限制,防止资源滥用
    • 显示当前用户的导出配额使用情况
    • 管理员可以配置全局导出配额限制
    • 超出配额时会提示并阻止导出操作

5.7.4 工作流程

下图概括了从已标注数据到模型训练的链路:选择导出格式并配置参数,导出后下载解压,即可用于训练模型。

5.7.4.1 导出为HDF5数据集

💡 HDF5格式

HDF5(Hierarchical Data Format version 5)是一种高效、灵活的数据存储格式,广泛应用于具身智能领域。其分层结构(组和数据集)便于组织和管理多模态复杂数据,支持高效的数据读写和跨平台共享。

平台支持将mcap、bag、hdf5等格式的数据标注后导出为HDF5文件,便于后续模型训练。标注过程将动作与自然语言指令关联,确保VLA模型能够理解并执行语言命令。

1.数据导出

标注完成后,可在导出界面选择所需数据子集进行导出。

  • 分组数量:设置每个HDF5文件包含的原始文件数量。若需一一对应,可设为1。
  • 数据刷新频率:控制每秒数据采集次数,影响文件大小。
    2.查看导出结果

导出后,您可在界面查看结果:

下载后的数据:

3.导出数据结构说明

导出的HDF5文件按原始文件分组命名(如 chunk_001.hdf5),采用树状结构组织数据:

  • 根组(/):顶层目录。
  • 子组:如 /data/meta
    • /data 下按标注任务序列划分为子组(如 episode_001episode_002)。
  • 数据集:如 /data/episode_001
    • 属性值包括
      • task 标注的自然语言(英文)
      • task_zh 标注的自然语言(中文)
      • score 动作质量评分
    • 存储的数据包括
      • action 下发的关节指令 (多维数组)
      • observation.images.* 各个视角的压缩图像 (JPEG)
      • observation.state 传感器的观测值 (多维数组)
      • observation.gripper 夹爪闭合状态的观测值 (多维数组)

示例结构如下:

HDF5 "./chunk_001.hdf5" {
FILE_CONTENTS {
 group      /
 group      /data
 group      /data/episode_001
 dataset    /data/episode_001/action
 dataset    /data/episode_001/observation.gripper
 dataset    /data/episode_001/observation.images.camera_01
 dataset    /data/episode_001/observation.images.camera_02
 dataset    /data/episode_001/observation.images.camera_03
 dataset    /data/episode_001/observation.images.camera_04
 dataset    /data/episode_001/observation.state
 group      /data/episode_002
 dataset    /data/episode_002/action
 dataset    /data/episode_002/observation.gripper
 dataset    /data/episode_002/observation.images.camera_01
 dataset    /data/episode_002/observation.images.camera_02
 dataset    /data/episode_002/observation.images.camera_03
 dataset    /data/episode_002/observation.images.camera_04
 dataset    /data/episode_002/observation.state
 ......
 group      /meta
 }
}

5.7.4.2 导出为LeRobot数据集

💡 LeRobot格式

LeRobot 是 Hugging Face 开源的机器人学习数据标准化框架,专为机器人学习和强化学习场景设计。它提供了统一的数据格式规范,使研究人员能够更便捷地共享、比较和复现机器人学习实验,显著降低了不同研究项目之间的数据格式转换成本。

具身数据平台完全支持 LeRobot 标准格式的数据导出,可直接用于 VLA(Vision-Language-Action)模型的训练流程。导出的数据包含机器人操作的完整多模态信息:视觉感知数据、自然语言指令以及对应的动作序列,形成完整的感知-理解-执行闭环数据映射。

💡 资源使用说明

LeRobot 格式数据导出需要较高的计算资源支持。具身数据平台对每位用户的导出数量进行了合理限制。

1.选择导出数据

数据导出前需要完成标注工作。标注过程将机器人的动作序列与对应的自然语言指令建立精确映射关系,这是训练 VLA 模型的必要前提。通过这种映射,模型能够学习理解语言命令并将其转化为准确的机器人控制动作。

标注完成后,您可以在导出界面查看所有已标注的数据集。系统支持灵活的数据子集选择,您可以根据具体需求选择特定的数据进行导出。

数据集命名支持自定义设置。如果您计划将数据集发布到 Hugging Face 平台,建议采用标准的仓库命名格式(如 myproject/myrepo1),这将为后续的模型分享和协作提供便利。

2.导出配置选项

在导出界面右侧的配置面板中,您可以设置以下导出参数:

数据采样频率:控制数据采样的频率(推荐 10-30 Hz)。频率越低,生成的数据集体积越小,但可能丢失部分细节信息。

图像格式

  • MP4(推荐):压缩图像格式,可节约约 80% 的存储空间,适合大规模数据集导出
  • JPG:原始图像格式,保留完整图像质量,但文件体积较大

严格匹配模型输入输出:启用后系统会自动裁切观测值和指令值,确保一对一对应关系,有助于减少噪声干扰,提升训练数据质量。

自动模糊人脸:启用后系统会自动识别画面中的人脸位置并进行模糊化处理。该功能有助于:

  • 保护个人隐私,符合数据合规要求
  • 适用于包含操作人员画面的数据集
  • 自动处理所有导出图像中的人脸信息
💡 导出效率优化

数据量越大,导出耗时越长。建议根据任务类型进行分类导出,避免一次性处理全部数据。分批导出不仅能提升处理速度,还便于后续的数据管理、版本控制和针对性的模型训练

3.下载与解压导出文件

导出过程的耗时取决于数据规模和当前系统负载,通常需要数十分钟。页面会自动更新进度状态,您可以稍后返回查看处理结果。

导出完成后,在页面右侧的 导出记录 区域可以看到 下载数据 按钮。点击后将获得一个 .tar.gz 格式的压缩文件包。

建议在本地创建一个专用目录(如 ~/Downloads/mylerobot3)来解压文件,避免与其他数据混淆:

解压后的文件严格遵循 LeRobot 数据集的标准格式规范,包含完整的多模态数据:视觉感知数据、机器人状态信息和动作标签等:

4.自定义Topic映射

在导出 LeRobot 数据集时,系统需要将 ROS/ROS2 话题(Topic)映射到 LeRobot 标准格式中的观测值(Observation.state)和动作(action)字段。了解话题映射规则对于正确导出自定义数据集至关重要。

默认Topic映射规则

具身数据平台采用基于话题名称后缀的自动识别机制:

观测值(Observation.state)映射规则:

  • 当话题名称以 /joint_state/joint_states 结尾时,系统会自动将其 position 字段值识别为观测值,并映射到 observation.state 字段
  • 例如:io_teleop/joint_states/arm/joint_state 等话题会被识别为观测值

动作(action)映射规则:

  • 当话题名称以 /joint_cmd/joint_command 结尾时,系统会自动将其 position 字段值识别为动作指令,并映射到 action 字段
  • 例如:io_teleop/joint_cmd/arm/joint_command 等话题会被识别为动作值
💡 话题命名建议

为了确保数据能够正确导出,建议在录制数据时遵循上述命名规范。如果您的机器人系统使用了不同的命名风格,可以联系技术支持团队进行适配

自定义Topic支持

如果您构建了自定义话题,而该话题的命名不符合上述默认规则,您可以通过重命名话题方式处理:

重命名话题:在数据录制阶段,将自定义话题重命名为符合默认规则的名称(如 /joint_states/joint_command

💡 技术说明

当前版本暂不支持在导出界面直接指定自定义话题映射。如果您有特殊需求,建议提前与技术支持团队沟通,我们会在导出前完成相应的配置适配

6 模型功能模块

具身数据平台提供完整的机器人学习模型训练功能,支持从数据预处理到模型部署的端到端工作流。平台集成了多种主流的机器人学习算法,为研究人员和开发者提供高效的模型训练环境。

6.1 产品特色

灵活架构

产品采用分层架构设计,确保系统的可扩展性。训练的算力支持多重选择:

从数据到模型

平台已覆盖了从数据采集,标注,导出,训练微调,模型部署的数据全链路。

6.2 支持的模型类型

平台支持机器人领域的主流学习模型(以下模型,目前只上线了ACT、Pi0、Pi0.5),涵盖多种技术路线:

6.3 训练工作流程

平台提供了产品化的训练流程,无需代码能力,全程通过网页实现从数据准备到模型部署的完整操作链路。你只需要选择数据、选择模型、配置参数,然后点击开始训练。

6.3.1 准备训练数据

训练数据可以来自多个来源:

  • 平台导出数据(推荐):使用平台标注和导出的机器人演示数据
    1.在数据导出页面,选择已标注的数据集
    2.选择 LeRobot 或 HDF5 格式导出
    3.导出完成后,在训练页面选择"平台导出数据"
    4.从导出历史中选择对应的导出记录
  • 外部数据集:通过 URL 链接导入公开数据集
  • 本地数据上传:支持 HDF5、LeRobot 等标准格式
  • HuggingFace 数据集:直接从 HuggingFace Hub 获取公开数据

6.3.2 选择模型和训练资源

计算资源选择

  • 公有云资源 :按需租赁云服务商的算力资源,按实际训练时长计费
    • RunPod:租赁GPU容器进行快速部署,适合临时性训练任务或资源扩展需求
    • 其他云服务商支持(暂未开通)
  • 私有云算力: 仅适用于项目进行私有化部署的情况

GPU选择与监控:

  • 训练前可查看可用GPU列表及实时状态
  • 支持手动选择特定GPU或多GPU并行
  • 实时监控GPU利用率、显存占用、温度等信息
  • 自动优化显存分配,避免资源浪费

训练配额管理

训练配额用于控制资源使用,确保系统资源合理分配。

配额类型:

  • 用户配额:每个用户有独立的训练配额限制
  • 全局配额:系统级别的总配额限制(管理员配置)
  • 配额统计:实时显示已使用配额和剩余配额

配额显示:

  • 训练页面显示当前用户的配额使用情况
  • 显示已使用数量和总配额限制
  • 超出配额时无法创建新的训练任务

配额管理(管理员):管理员可以

  • 查看所有用户的训练配额使用情况
  • 配置全局训练配额限制
  • 调整单个用户的配额

6.3.3 配置参数并开始训练

平台提供了丰富的训练参数配置选项,支持不同模型的特定需求:

参数项 参数含义 设置建议
通用训练参数
batch_size(批次大小) 控制每次训练使用的样本数量
建议范围1-32,根据 GPU 显存调整。较大批次提高训练稳定性但需要更多显存
steps(训练步数) 模型训练的总步数 建议从10000开始,根据验证结果调整
seed(随机种子) 确保训练结果可重现性 建议使用1000、42等固定值
num_workers(数据加载器工作进程数) 加速数据加载 建议设为CPU核心数的1/2到1倍
eval_freq(评估频率) 每多少步进行一次模型评估 建议为总步数的10%
log_freq(日志频率) 每多少步打印一次训练日志 建议10到100步
save_freq(保存频率) 每多少步保存一次检查点 建议为总步数的30%
save_checkpoint(是否保存检查点) 开启后保存模型检查点,便于恢复训练或部署
optimizer_lr(学习率) 控制参数更新幅度 建议范围1e-4到1e-5。过大导致训练不稳定,过小收敛慢。
optimizer_weight_decay(权重衰减) 防止过拟合的正则化参数 建议范围0.0到0.01
optimizer_grad_clip_norm(梯度裁剪阈值) 防止梯度爆炸 建议设置为1.0
scheduler_warmup_steps(学习率预热步数) 训练初期逐步增加学习率 建议为总步数的5-10%
scheduler_decay_steps(学习率衰减步数) 在训练后期降低学习率 建议为总步数的80-90%
模型特定参数:不同模型支持各自的特定参数
ACT模型:
chunk_size(动作块大小) 一次预测的动作序列长度 建议范围10-50
n_obs_steps(观测历史步数) 使用的历史观测帧数 大部分情况使用1
n_action_steps(执行步数) 实际执行的动作步数 通常等于chunk_size
vision_backbone(视觉 backbone) 可选resnet18/34/50/101/152
dim_model(模型维度) Transformer的主要隐藏维度 默认512
n_heads(注意力头数) Multi-head attention的头数 默认8
Diffusion Policy模型
horizon(预测时间跨度) 扩散模型的动作预测长度 建议16
num_inference_steps(推理步数) 采样步数 建议10
SmolVLA/OpenVLA模型
max_input_seq_len(最大输入序列长度) 限制输入token数量 建议256-512
max_decoding_steps(最大解码步数) 生成动作序列的最大迭代次数 建议256
freeze_lm_head(冻结语言模型头部) 微调时建议开启
freeze_vision_encoder(冻结视觉编码器) 微调时建议开启
SAC等强化学习模型:
latent_dim(潜在空间维度) 编码器输出维度 建议256
💡 提示

参数设置建议:

  • 首次训练建议使用默认参数,确保训练正常进行
  • 根据GPU显存大小调整batch_size,避免显存溢出
  • 对于预训练模型微调,建议降低学习率(1e-5)并冻结部分层
  • 定期查看训练日志,根据损失曲线调整学习率

配置完成后,点击"开始训练"即可。

6.3.4 训练执行与监控

6.3.4.1 实时监控

训练启动后,平台提供完整的实时监控功能:

功能类别 功能项 功能介绍
实时监控 训练指标可视化: - 损失函数曲线 - 实时显示训练损失和验证损失,便于判断模型收敛情况
- 验证精度指标 - 显示模型在验证集上的性能表现
- 学习率变化 - 可视化学习率调度策略的执行情况
- 训练进度 - 显示已完成步数、总步数、预计剩余时间等信息
模型输出预览: - 训练过程中定期输出预测样例
- 可视化模型在验证数据上的预测结果
- 便于观察模型学习进展和发现潜在问题
系统日志: - 详细的训练日志记录,包括每个训练步骤的详细信息
- 错误和警告信息实时显示,便于快速定位问题
- 支持日志实时流式传输,可随时查看最新训练状态
资源监控: - GPU利用率、显存占用实时监控
- CPU和内存使用情况跟踪
- 网络IO和磁盘IO监控(如适用)
💡 训练建议
  • 定期检查训练日志,及时发现问题
  • 根据损失曲线调整学习率或停止训练
  • 定期保存检查点,避免训练中断导致数据丢失
  • 使用任务复制功能快速尝试不同的参数组合
  • 一般情况下判断模型是否可以使用的方式是:损失值(Loss)<0.1。

6.3.4.2 检查点管理

同时产品还提供了检查点管理功能。我们建议您定期保存检查点,避免训练中断导致数据丢失。

💡 信息

检查点说明:

  • last:最后一个保存的检查点,通常是最新的模型状态
  • best:在验证集上表现最好的检查点,通常用于生产部署
  • step_xxx:按训练步数保存的检查点,可用于分析训练过程
功能类别 功能项 功能介绍
检查点管理 进程控制: - 暂停训练 - 临时暂停训练任务,保留当前进度
- 恢复训练 - 从暂停点恢复训练,无缝继续
- 停止训练 - 安全停止训练任务,保存当前检查点
- 重启训练 - 重新启动训练任务
检查点管理: - 自动保存 - 根据设置的保存频率自动保存模型检查点
- 检查点列表 - 查看所有保存的检查点,包括训练步数、保存时间等信息
- 检查点下载 - 支持下载检查点文件到本地
- 断点续训 - 从任意检查点恢复训练,支持训练中断后的继续
- 版本回滚 - 可选择历史检查点进行模型回滚
检查点信息: - 检查点名称:自动生成或自定义的检查点名称(如"step_1000"、"last"等)
- 训练步数:该检查点对应的训练步数
- 保存时间:检查点的保存时间戳
- 文件大小:检查点文件的大小
- 性能指标:该检查点在验证集上的性能表现
检查点操作: - 查看详情:查看检查点的详细信息和评估结果
- 下载检查点:下载检查点文件到本地,用于离线部署或进一步分析
- 标记为最佳:将性能最好的检查点标记为最佳模型
- 部署推理:直接从检查点一键部署为推理服务
任务操作: - 参数调整 - 训练过程中可查看和调整部分训练参数(需谨慎使用)
- 任务复制 - 基于成功的训练配置快速创建新任务,复用最佳配置
- 任务删除 - 删除不需要的训练任务,释放存储空间

6.3.4.3 从失败的训练中恢复

至此,您可以利用具身数据平台方便快捷的训练出属于您的专属模型。训练完成的模型检查点可以直接在下一章节进行推理服务部署,实现从训练到应用的全流程闭环。

但是如果训练任务失败,您可以:

1.查看错误信息:在训练详情页面查看详细的错误日志
2.分析失败原因:常见原因包括:
- 显存不足:降低 batch_size 或使用更大的 GPU
- 数据格式错误:检查数据格式是否符合要求
- 参数配置错误:检查参数设置是否合理
3.修改参数:在训练详情页面点击"修改参数",调整配置后重新训练
4.从检查点恢复:如果之前保存了检查点,可以从检查点继续训练

6.3.5 模型评估与导出

训练完成后,平台提供完整的模型评估、导出和部署功能:

功能类别 功能项 功能介绍
模型评估 性能指标: - 自动计算模型在验证集上的各项性能指标
- 支持多种评估指标:准确率、成功率、动作误差等
- 提供模型性能报告和对比分析
模型对比: - 对比不同训练任务的模型性能
- 可视化多个模型指标的对比图表
- 帮助选择最佳性能的模型版本
模型导出 模型导出 训练完成后,可以将模型导出用于:
- 离线部署到机器人本地
- 与其他系统集成
- 模型版本管理和归档

至此,您可以利用具身数据平台方便快捷的训练出属于您的专属模型。

7 系统管理模块

7.1 用户管理

7.1.1 功能概述

用户管理是具身数据平台的核心权限管理模块,提供集中管理账户、角色与项目归属的完整功能。通过支持批量创建、筛选与过期时间设置,实现组织级用户与角色治理,确保平台用户体系的安全性和可管理性,为不同角色提供相应的权限控制和管理功能。

7.1.2 适用角色

角色 职责
管理员 作为平台管理员,您可以进行组织级用户与角色治理,管理所有用户账户,配置系统权限,并监控用户活动。这些功能确保平台的用户管理体系安全高效
项目经理 项目经理可以维护项目成员,分配项目权限,管理项目用户,并协调项目团队。通过用户管理,项目经理能够有效控制项目的用户资源

7.1.3 主要功能

7.1.3.1 用户账户管理

用户创建

支持单个和批量创建用户账户,包括基本信息设置、密码配置、角色分配等。通过标准化的用户创建流程,确保账户信息的完整性和准确性。

用户信息管理

提供用户信息的全面管理功能,包括基本信息修改、联系方式更新、头像设置等。通过信息管理,保持用户数据的时效性和准确性。

账户状态管理

支持用户账户的状态管理,包括激活、禁用、锁定、删除等操作。通过状态管理,确保账户安全,防止未授权访问。

7.1.3.2 角色权限管理

角色定义

支持定义多种用户角色,包括管理员、项目经理、标注员、审核员等。每个角色都有相应的权限配置,确保权限的细粒度控制。

权限分配

为不同角色分配相应的权限,包括功能权限、数据权限、操作权限等。通过权限分配,实现基于角色的访问控制。

权限继承

支持权限的继承机制,子角色可以继承父角色的权限。通过权限继承,简化权限管理,提高管理效率。

7.1.3.3 项目归属管理

项目分配

支持将用户分配到不同的项目,包括项目成员添加、移除、角色调整等。通过项目分配,实现项目级的权限控制。

项目权限

为项目成员设置项目内的权限,包括数据访问权限、操作权限、功能权限等。通过项目权限,确保项目数据的安全。

权限继承

支持项目权限的继承机制,用户可以从项目角色继承相应的权限。通过权限继承,简化项目权限管理。

7.1.3.4 批量操作功能

批量创建

支持批量创建用户,包括从Excel、CSV文件导入用户信息。通过批量创建,大大提高用户管理效率。

批量修改

支持批量修改用户信息,包括角色调整、权限变更、状态更新等。通过批量修改,快速完成大量用户的管理操作。

批量删除

支持批量删除用户,包括用户账户、相关数据、权限记录等。通过批量删除,快速清理不需要的用户数据。

7.1.3.5 时间管理

过期时间设置

支持为用户设置账户过期时间,包括临时账户、试用账户、定期续期等。通过过期时间设置,实现账户的生命周期管理。

自动提醒

提供账户过期提醒功能,包括邮件通知、系统提醒、自动续期等。通过自动提醒,确保用户及时处理账户问题。

过期处理

支持账户过期后的自动处理,包括账户禁用、数据清理、权限回收等。通过过期处理,确保系统安全。

8 常见问题

问题类型 问题 解答
账号与登录 忘记密码怎么办? 请联系管理员在后台重置密码。连续5次输入密码错误,系统会将账号和IP暂时禁止。
可以注册新账号吗? 平台是否开放注册由管理员决定。如需新账号,请联系管理员创建。
登录后看不到某些功能怎么办? 这通常是因为权限不足。请确认您的角色和项目权限,或联系管理员调整权限。
数据管理 如何上传数据? 在"数据上传"页面选择项目与云存储,支持视频、音频、ROS数据等多种格式。
支持哪些数据格式? 支持Mcap、Bag、Mp4、音频等ROS标准格式文件,支持在线转码为Mcap格式。视频和音频文件可以在浏览器中自动转换为MCAP格式。
视频转换功能支持哪些浏览器? 视频转MCAP功能需要浏览器支持MediaStreamTrackProcessor API,目前仅支持最新版本的Chrome(94+)和Edge(94+)浏览器。使用其他浏览器时会有明确提示。
音频文件可以上传吗? 可以。平台支持MP3、WAV、AAC、OGG等音频格式,会自动转换为MCAP格式的AudioData消息,方便用于机器人训练。
数据上传失败怎么办? 检查文件格式是否正确、网络连接是否稳定、云存储配置是否正确。如果上传的是视频文件,请确保使用Chrome或Edge浏览器。失败的任务可以重试上传。
重新上传已删除的数据集会怎样? 系统会自动检测是否存在同名的软删除数据集。如果存在,您可以选择恢复现有数据集(保留所有历史信息)或创建新数据集。
数据标注 如何创建标注任务? 在"数据"页面筛选目标数据并勾选,点击底部"标注"按钮,填写任务信息后创建。
标注任务状态有哪些? 包括:待开始(PENDING)、进行中(IN_PROGRESS)、待检查(PENDING_REVIEW)、检查合格(REVIEWED)、提交数据(SUBMITTED)等状态。
如何查看任务的详细信息? 在任务列表中点击任务名称或ID,进入任务详情页。详情页包含多个标签页:标注数据、批量标注、问题标注,可以全面了解任务情况。
可以批量删除任务吗? 可以。在任务列表中多选任务,点击底部的"批量删除"按钮,确认后即可批量删除选中的任务。删除操作不可恢复,请谨慎操作。
标注数据被审核员打回怎么办? 查看审核员的反馈意见,根据要求修改标注内容后重新提交。可以在任务详情页的"问题标注"标签页查看所有无效标注。
数据导出 如何导出标注数据? 在"数据导出"页面选择要导出的数据,支持JSON、CSV、HDF5、LeRobot、MCAP等多种格式。导出任务会自动加入队列处理,可以在导出历史中查看进度。
HDF5导出如何配置? HDF5导出需要设置两个参数:分组数量(每个HDF5文件包含的原始文件数量)和数据刷新频率(每秒数据采集次数,默认30Hz)。详细说明请参考HDF5导出文档。
如何查看导出进度和历史? 在数据导出页面的"导出历史"区域可以查看所有导出任务的列表和状态。处理中的任务会显示实时进度条,已完成的任务可以下载结果文件。
如何管理标注字典? 在"字典管理"页面可以维护技能、目标、对象等标注标签。
模型训练 如何选择合适的模型? 选择建议:
1. 确定任务类型:是理解指令、模仿学习还是强化学习?
2. 查看模型说明:每个模型都有详细说明,了解适用场景
3. 参考应用案例:查看模型的应用案例,选择最接近你任务的模型
4. 从小规模开始:先用小数据集测试,确认模型效果后再大规模训练
训练需要多长时间? 时间估算:
训练时间取决于:
- 数据量:数据越多,训练时间越长
- 模型复杂度:复杂模型需要更长时间
- 计算资源:GPU 性能越好,训练越快
- 训练步数:步数越多,训练时间越长
一般情况:
- 小数据集(1000 条以下):1-3 小时
- 中等数据集(1000-10000 条):3-12 小时
- 大数据集(10000 条以上):12 小时以上
优化建议:
- 使用多 GPU 并行训练可以显著缩短时间
- 适当降低 batch_size 可以加快单步速度
- 使用更强大的 GPU 可以提升训练速度
如何判断训练是否正常? 正常训练的指标:
- 损失下降:训练损失应该逐渐下降
- 验证指标提升:验证集上的性能应该逐渐提升
- 资源稳定:GPU 利用率应该保持稳定,不会频繁波动
- 无错误日志:日志中不应该有大量错误信息
异常情况:
- 损失不下降:可能是学习率过大或过小,需要调整
- 损失震荡:可能是 batch_size 太小,需要增大
- 显存溢出:需要降低 batch_size 或使用更大的 GPU
- 训练卡住:检查数据加载是否正常,网络是否稳定
训练失败怎么办?
处理步骤:
1. 查看错误日志:在训练详情页面查看详细的错误信息
2. 分析失败原因:根据错误信息判断是数据问题、参数问题还是资源问题
3. 修复问题:根据原因采取相应措施
4. 重新训练:修复后重新创建训练任务
常见错误:
- 显存不足:降低 batch_size 或使用更大的 GPU
- 数据格式错误:检查数据格式是否符合要求
- 参数配置错误:检查参数设置是否合理
- 网络问题:检查网络连接是否稳定
移动端支持 平台支持移动端吗? 平台基于Web技术开发,支持在移动设备浏览器中访问,但建议使用桌面端获得最佳体验。
移动端有哪些功能限制? 移动端主要支持查看和简单操作,复杂的标注任务建议使用桌面端。
使用技巧 如何提高标注效率? - 熟悉快捷键操作
- 使用标注模板
- 批量处理相似数据
- 定期与团队沟通优化流程
如何保证标注质量? - 仔细阅读标注规范
- 使用统一的标注标准
- 定期进行质量检查
- 及时反馈和改进
如何管理大量数据? - 合理使用标签和分类
- 建立清晰的文件命名规范
- 定期整理和归档
- 利用平台的批量操作功能
技术支持 遇到技术问题如何获得帮助? 可以通过以下方式获得帮助:
1. 查看本文档
2. 查看功能模块详细说明
3. 联系管理员
4. 联系技术支持团队