フリートラーニング
フリートで起きたすべての失敗を、モデルが次に必要とするデータに変えます。
Avala は、お客様のモデルを中心としたループを運用します。ロールアウトを取り込み、モデルが失敗する箇所を特定し、そのギャップを埋めるデータを収集し、モデルが見たことのない実環境シーンで次のリリースを評価します。モデルの学習と所有、そしてリリースの時期を決めるのはお客様です。
Physical AGI のための Fleet Learning Infrastructure
ループ
7 つのステップと、サイクルごとに 1 つの記録。
各サイクルは、フリートの実際の動作から始まり、お客様がリリースを決めた時点で終わります。Avala は 5 つのステップを担当します。学習とリリースの判断はお客様が行います。
観測
Avala が担当
ロボットがロールアウトを記録します。Avala は動画とログを、デバイス、記録、イベントのコンテキストとともに取り込みます。
診断
Avala が担当
Avala は各ロールアウトをセグメントに分け、失敗をクラスタリングして失敗タクソノミーに整理し、各クラスタをカバレッジセルに対応付けます。
評価
Avala が担当
現在のモデルを学習に使わない実環境シーンで評価します。何かを変える前に、出発点を測定しておくためです。
収集
Avala が担当
収集ブリーフを収集キャンペーンに落とし込みます。対象のタスク、家庭や職場、物体、そしてシーケンス数を定めます。
学習
お客様が担当
お客様が、自社のコードと計算資源で新しいデータセットリリースを使って学習します。Avala はシーケンスからリリースまでのリネージを保持します。
検証
Avala が担当
Avala は同じ評価用コホートで新しいモデルを評価し、2 つのバージョンを信頼区間付きで並べて報告します。
リリース
お客様が担当
モデルをリリースするかどうかはお客様が決めます。その判断と根拠は、次のサイクルのための記録に残ります。
記録
各サイクルを 1 つにまとめる、ケイパビリティ実験。
すべてのサイクルは 1 つのケイパビリティ実験として記録されます。チームが改善したい点を明記し、根拠を 1 か所にまとめるため、どの結果もその背後にあるデータと判断までさかのぼれます。
- モデルバージョン
- 失敗が起きたときにフリートで稼働していたモデル。
- 失敗条件
- うまくいかなかった挙動。失敗タクソノミーの名称で記述します。
- 仮説
- 新しいデータで何が変わるとチームが考えているか。収集を始める前に記録します。
- カバレッジセル
- 新しいデータがカバーすべきタスク、環境、物体。
- 収集キャンペーン
- シーケンスを収集したキャンペーンと、その受け入れ基準。
- データセットリリース
- モデルの学習に使った、バージョン管理されたデータセット。
- 評価用コホート
- 両方のモデルバージョンの評価に使う、学習に使わないシーン。
- 結果
- 評価で測定した内容と、その信頼区間。
- 次の配分
- 次の収集をどこに向けるか、そしてその理由。
診断
ロールアウト動画から収集ブリーフへ。
失敗データを送る
ロールアウトの動画とログを、MCAP ファイル、ROS bag、LeRobot データセットのいずれかで送ってください。Avala は各シーケンスをサブタスクに分割し、どこで問題が起きたかを特定します。
ギャップレポートを読む
失敗は失敗タクソノミーに分類され、カバレッジセルに対応付けられます。レポートでは、データが手薄なセル、失敗が最も多いセル、お客様のデータが一度もカバーしていないセルがわかります。
ブリーフを承認する
Avala は、タスク、環境、物体、シーケンス数、受け入れ基準を含む収集ブリーフを提案します。収集を始める前に、お客様のチームが承認します。
すべてのシーケンス
すべてのシーケンスに、2 つの独立した評価。
記録が技術的に完璧でも、タスクは失敗していることがあります。Avala はこの 2 つを分けて評価するため、センサーの不具合が有用な失敗例を隠すことはありません。
技術的な妥当性
- センサーの完全性
- 時刻同期
- キャリブレーション
- 手と物体の視認性
- プライバシー
- メタデータの完全性
行動の結果
- 熟練者レベルの成功
- 部分的な成功
- ミスとリカバリー
- 介入
- 危険または中断
- 新しい戦略
リカバリー可能な失敗にはラベルを付け、独立したレーンとして納品します。モデルが立て直す方法を学べるため、Avala はこれらを残します。
シーケンスのメタデータ
各シーケンスに付属するもの。
- 2 つの評価それぞれの結果ラベル
- 各ステップの言語による説明付きのサブタスク境界
- 品質と速度の評価
- ミスとリカバリーのセグメント
- リグとキャリブレーションの ID
- 家庭、物体、オペレーターごとのリークグループ
リークグループを使うと、同じ家庭、物体、オペレーターが学習セットとテストセットの両方に入らないように分割できます。
プロダクト
今日から使えるプロダクトの上に構築。
フリート
データを報告するすべてのロボットのデバイス、記録、イベント、ルール、アラート。
収集キャンペーン
収集する内容を定義し、各提出データをブリーフと照合するキャンペーン。
品質管理
受け入れ基準、品質目標、コンセンサススコアリング、動画フィンガープリントによる重複チェック。
ビューアと 4D 再構成
MCAP ビューアと Gaussian Splatting による 4D 再構成で、任意のシーケンスをそのシーンの中で確認できます。
MCP サーバーと SDK
フリートの記録、収集キャンペーン、受け入れカバレッジ、コンセンサスを、エージェントやコードから Python または TypeScript で照会できます。
LeRobot エクスポート
Python SDK またはコマンドラインから、データセットリリースを LeRobot 形式でエクスポートできます。そのまま学習コードで使えます。
Avala の位置付け
モデルはお客様のもの。その下のインフラを Avala が運用します。
Avala は、お客様のモデルの真下、インフラレイヤーにいます。私たちはロボットを作らず、お客様のモデルを所有せず、計算資源を売らず、チップも作りません。私たちは、お客様自身のモデルが自身のフリートから学ぶためのデータ・学習インフラを作ります。
はじめる
失敗モードを 1 つ持ち込み、ブリーフを持ち帰る。
ワーキングセッションでは、お客様のロールアウトを確認し、最も解決したい失敗を特定し、最初の収集ブリーフと評価用コホートの草案を作成します。