評価
モデルが見たことのない実際の場所で、モデルを測定する。
Avala は実際の家庭や職場で評価用シーンを収集し、それらを学習用に公開することはありません。お客様のモデルがタスクを実行します。視覚言語モデルがすべてのシーケンスを事前にスコアリングし、人がそのスコアを監査します。お客様には信頼区間付きのレポートが届きます。
ホールドアウト
評価用シーンは学習に使いません。
評価のために収集
評価用シーンは、学習データと同じシーン基準のもとで、実際の家庭や職場で収集します。
学習用には公開しない
評価用シーンと、そこに含まれる家庭、物体、オペレーターは、すべての学習用リリースから除外します。
バージョン管理されたコンタミネーションチェック
各評価用コホートにはバージョンがあります。Avala はスコアリングの前に、お客様の学習用リリースをリークグループと動画フィンガープリントでコホートと照合し、その結果をレポートに記録します。
スコアリング
モデルが事前にスコアリングし、人が監査します。
視覚言語モデルによる事前スコア
視覚言語モデルが、タスクのサブタスクと成功基準に照らして各シーケンスをスコアリングします。
人による監査
訓練を受けたレビュアーがスコアを監査します。レビュアーの意見が分かれた場合は、コンセンサスで決定します。
評価者間一致度
各レポートにはレビュアーの一致率を記載するため、各スコアの確かさを確認できます。
センサーの不具合やキャリブレーションの欠落があるシーケンスは無効とし、指標から除外します。モデルの失敗として数えることはありません。
レポート
すべての評価レポートで測定する項目。
成功確率
タスクを完了したシーケンスの割合。
部分的な進捗
成功しなかったシーケンスが、サブタスクのどこまで進んだか。
成功までの時間
成功したシーケンスにかかった時間。
人と比較したスループット
同じタスクを行う熟練者と比較したタスクの速度。
介入率
人が介入する必要があった頻度。
失敗モードの分布
どの失敗が起きたかを、失敗タクソノミーで分類したもの。
リカバリー率
モデルが自らのミスから立て直した頻度。
信頼区間
すべての指標に区間が付くため、2 つのモデルバージョンを公平に比較できます。
比較
同じコホートで 2 つのバージョンを評価する。
現在のモデルと候補モデルを、学習に使わない同じコホートで実行します。レポートでは両者を指標ごと、失敗モードごとに並べて示すため、リリースの判断を検証可能な根拠に基づいて行えます。