闭环
七个步骤,每个周期一份记录。
每个周期从集群的实际运行开始,到您决定上线的版本结束。Avala 负责其中五个步骤。训练和发布决策由您掌握。
观察
由 Avala 负责
您的机器人录制运行记录。Avala 接入视频和日志,并保留设备、录制和事件上下文。
诊断
由 Avala 负责
Avala 对每条运行记录进行分段,把失败聚类为失败分类体系,并将每个聚类映射到覆盖单元。
评估
由 Avala 负责
当前模型先在未参与训练的真实场景中评分,在任何改动之前测量起点。
采集
由 Avala 负责
采集需求说明转化为采集任务:哪些任务、哪些家庭或工作场所、哪些物体,以及多少个序列。
训练
由您负责
您用自己的代码和算力,在新的数据集版本上训练。Avala 保留从序列到发布版本的完整数据血缘。
验证
由 Avala 负责
Avala 在同一个留出评估组上为新模型评分,并把两个版本并排报告,附带置信区间。
发布
由您负责
模型是否上线由您决定。该决策及其依据会写入记录,供下一个周期使用。
记录
一项能力实验,串联起每个周期。
每个周期都记录为一项能力实验。它写明团队想要改进的内容,并把证据集中在一处,因此任何结果都能追溯到背后的数据和决策。
- 模型版本
- 失败出现时集群正在运行的模型。
- 失败条件
- 出现问题的行为,用失败分类体系中的名称描述。
- 假设
- 团队预期新数据会带来什么改变,在采集开始前写下。
- 覆盖单元
- 新数据必须覆盖的任务、环境和物体。
- 采集任务
- 采集这些序列的采集任务及其验收标准。
- 数据集发布
- 模型训练所用的带版本数据集。
- 评估组
- 用于为两个模型版本评分的留出场景。
- 结果
- 评估测得的结果,附带置信区间。
- 下一轮分配
- 下一轮采集投向哪里,以及原因。
诊断
从运行视频到采集需求说明。
发送失败记录
以 MCAP 文件、ROS bag 或 LeRobot 数据集的形式发送运行视频和日志。Avala 把每个序列拆分为子任务,并找出出错的位置。
查看缺口报告
失败按失败分类体系归类,并映射到覆盖单元。报告显示哪些单元数据不足、哪些失败最频繁,以及哪些从未被您的数据覆盖。
审批需求说明
Avala 提出一份采集需求说明,包括任务、环境、物体、序列数量和验收标准。采集开始前由您的团队审批。
每个序列
每个序列都有两项独立评级。
一段录制在技术上可能完美无缺,却仍然记录了一次失败的任务。Avala 对两者分别评级,因此传感器故障不会掩盖有价值的错误。
技术有效性
- 传感器完整性
- 时间同步
- 标定
- 手部和物体的可见性
- 隐私
- 元数据完整
行为结果
- 专家级成功
- 部分成功
- 失误与恢复
- 人工干预
- 不安全或中止
- 新颖策略
可恢复的失败会被标注,并作为独立的数据通道交付。它们能教会模型如何回到正轨,因此 Avala 会保留它们。
序列元数据
每个序列附带的内容。
- 两项评级的结果标签
- 子任务边界,以及每一步的语言描述
- 质量和速度评级
- 失误与恢复片段
- 采集设备和标定 ID
- 按家庭、物体和操作员划分的泄漏分组
借助泄漏分组,您可以划分训练集和测试集,确保同一个家庭、物体或操作员不会同时出现在两边。
产品
基于您现在就能使用的产品构建。
机器人集群
为每台上报数据的机器人提供设备、录制、事件、规则和告警。
采集任务
定义采集内容,并对照需求说明检查每次提交的采集任务。
质量控制
验收标准、质量目标、共识评分和视频指纹重复检查。
查看器与 4D 重建
通过 MCAP 查看器和高斯泼溅 4D 重建,在场景中检查任意序列。
MCP 服务器和 SDK
用 Python 或 TypeScript,从您的智能体和代码中查询集群录制、采集任务、验收覆盖情况和共识结果。
LeRobot 导出
通过 Python SDK 或命令行,以 LeRobot 格式导出数据集版本,可直接用于您的训练代码。
Avala 的位置
模型归您所有。Avala 运行其下层的基础设施。
Avala 位于基础设施层,就在客户模型的正下方。我们不造机器人,不拥有客户的模型,不卖算力,也不做芯片。我们构建的,是客户自己的模型借以从自己的车队中学习的数据与学习基础设施。