AvalaAvala
構築を開始 — デモを予約 / コワーカーになる

評価

モデルが見たことのない実際の場所で、モデルを測定する。

Avala は実際の家庭や職場で評価用シーンを収集し、それらを学習用に公開することはありません。お客様のモデルがタスクを実行します。視覚言語モデルがすべてのシーケンスを事前にスコアリングし、人がそのスコアを監査します。お客様には信頼区間付きのレポートが届きます。

ホールドアウト

評価用シーンは学習に使いません。

  1. 評価のために収集

    評価用シーンは、学習データと同じシーン基準のもとで、実際の家庭や職場で収集します。

  2. 学習用には公開しない

    評価用シーンと、そこに含まれる家庭、物体、オペレーターは、すべての学習用リリースから除外します。

  3. バージョン管理されたコンタミネーションチェック

    各評価用コホートにはバージョンがあります。Avala はスコアリングの前に、お客様の学習用リリースをリークグループと動画フィンガープリントでコホートと照合し、その結果をレポートに記録します。

スコアリング

モデルが事前にスコアリングし、人が監査します。

  1. 視覚言語モデルによる事前スコア

    視覚言語モデルが、タスクのサブタスクと成功基準に照らして各シーケンスをスコアリングします。

  2. 人による監査

    訓練を受けたレビュアーがスコアを監査します。レビュアーの意見が分かれた場合は、コンセンサスで決定します。

  3. 評価者間一致度

    各レポートにはレビュアーの一致率を記載するため、各スコアの確かさを確認できます。

センサーの不具合やキャリブレーションの欠落があるシーケンスは無効とし、指標から除外します。モデルの失敗として数えることはありません。

レポート

すべての評価レポートで測定する項目。

  1. 成功確率

    タスクを完了したシーケンスの割合。

  2. 部分的な進捗

    成功しなかったシーケンスが、サブタスクのどこまで進んだか。

  3. 成功までの時間

    成功したシーケンスにかかった時間。

  4. 人と比較したスループット

    同じタスクを行う熟練者と比較したタスクの速度。

  5. 介入率

    人が介入する必要があった頻度。

  6. 失敗モードの分布

    どの失敗が起きたかを、失敗タクソノミーで分類したもの。

  7. リカバリー率

    モデルが自らのミスから立て直した頻度。

  8. 信頼区間

    すべての指標に区間が付くため、2 つのモデルバージョンを公平に比較できます。

比較

同じコホートで 2 つのバージョンを評価する。

現在のモデルと候補モデルを、学習に使わない同じコホートで実行します。レポートでは両者を指標ごと、失敗モードごとに並べて示すため、リリースの判断を検証可能な根拠に基づいて行えます。

はじめる

最初の評価用コホートを設定する。

モデルが実行するタスクと、稼働する場所を教えてください。学習に使わないコホートと、報告する指標を提案します。