留出
评估场景不进入训练。
专为评估采集
评估场景在真实的家庭和工作场所中采集,遵循与训练数据相同的场景标准。
从不发布用于训练
评估场景,以及其中的家庭、物体和操作员,都不会进入任何训练版本。
带版本的污染检查
每个评估组都有版本号。评分之前,Avala 按泄漏分组和视频指纹,将您的训练版本与评估组进行比对,并把结果记录在报告中。
评分
模型预评分,人工审核。
视觉语言模型预评分
视觉语言模型对照任务的子任务和成功标准,为每个序列评分。
人工审核
经过培训的审核员审核分数。审核员意见不一致时,由共识决定。
评分者间一致性
每份报告都会说明审核员的一致程度,让您看清每个分数有多可靠。
存在传感器故障或缺少标定的序列会被标记为无效,不计入指标,也绝不会被算作模型失败。
报告
每份评估报告衡量的内容。
成功概率
完成任务的序列所占比例。
部分进展
未成功的序列在子任务中推进到了哪一步。
成功用时
成功的序列耗时多久。
相对人类的吞吐量
与执行同一任务的专家相比的任务速度。
干预率
需要人工介入的频率。
失败模式分布
发生了哪些失败,按失败分类体系归类。
恢复率
模型从自身失误中恢复的频率。
置信区间
每项指标都带有区间,因此可以公平比较两个模型版本。
比较
在同一评估组上为两个版本评分。
在同一个留出评估组上运行当前模型和候选模型。报告按指标、按失败模式把两者并排展示,让上线决策建立在可检查的证据之上。