AvalaAvala
Jetzt Loslegen — Demo buchen / Coworker werden

Evaluierung

Messen Sie Ihr Modell an realen Orten, die es nie gesehen hat.

Avala erfasst Evaluierungsszenen in realen Wohnungen und Arbeitsstätten und gibt sie nie für das Training frei. Ihr Modell führt die Aufgaben aus. Ein Vision-Language-Modell bewertet jede Sequenz vor, Menschen prüfen die Bewertungen, und Sie erhalten einen Bericht mit Konfidenzintervallen.

Zurückgehalten

Evaluierungsszenen bleiben vom Training ausgeschlossen.

  1. Für die Evaluierung erfasst

    Evaluierungsszenen werden in realen Wohnungen und Arbeitsstätten nach demselben Szenenstandard erfasst wie Trainingsdaten.

  2. Nie für das Training freigegeben

    Evaluierungsszenen und die darin vorkommenden Wohnungen, Objekte und Bediener werden aus jedem Trainings-Release herausgehalten.

  3. Versionierte Kontaminationsprüfungen

    Jede Evaluierungskohorte hat eine Version. Vor der Bewertung prüft Avala Ihre Trainings-Releases nach Leakage-Gruppe und Video-Fingerprint dagegen und hält das Ergebnis im Bericht fest.

Bewertung

Ein Modell bewertet vor. Menschen prüfen.

  1. Vision-Language-Vorbewertung

    Ein Vision-Language-Modell bewertet jede Sequenz anhand der Teilaufgaben und Erfolgskriterien der Aufgabe.

  2. Menschliches Audit

    Geschulte Prüfer kontrollieren die Bewertungen. Wenn Prüfer uneinig sind, entscheidet der Konsens.

  3. Übereinstimmung zwischen Prüfern

    Jeder Bericht gibt an, wie oft die Prüfer übereinstimmten, damit Sie sehen, wie belastbar jede Bewertung ist.

Eine Sequenz mit Sensorfehler oder fehlender Kalibrierung wird als ungültig markiert und aus den Metriken ausgeschlossen. Sie zählt nie als Modellfehler.

Der Bericht

Was jeder Evaluierungsbericht misst.

  1. Erfolgswahrscheinlichkeit

    Der Anteil der Sequenzen, die die Aufgabe abschließen.

  2. Teilfortschritt

    Wie weit eine erfolglose Sequenz in den Teilaufgaben gekommen ist.

  3. Zeit bis zum Erfolg

    Wie lange erfolgreiche Sequenzen dauern.

  4. Durchsatz im Vergleich zum Menschen

    Die Geschwindigkeit bei der Aufgabe im Vergleich zu erfahrenen Menschen, die dieselbe Aufgabe ausführen.

  5. Eingriffsrate

    Wie oft ein Mensch eingreifen musste.

  6. Verteilung der Fehlermodi

    Welche Fehler auftraten, gruppiert nach der Fehlertaxonomie.

  7. Korrekturrate

    Wie oft sich das Modell von seinem eigenen Fehler erholt hat.

  8. Konfidenzintervalle

    Jede Metrik hat ein Intervall, damit sich zwei Modellversionen fair vergleichen lassen.

Vergleich

Zwei Versionen auf derselben Kohorte bewerten.

Führen Sie das aktuelle Modell und den Kandidaten auf derselben zurückgehaltenen Kohorte aus. Der Bericht stellt beide nebeneinander, Metrik für Metrik und Fehlermodus für Fehlermodus, sodass die Entscheidung zur Auslieferung auf Nachweisen beruht, die Sie selbst prüfen können.

Loslegen

Richten Sie Ihre erste Evaluierungskohorte ein.

Nennen Sie uns die Aufgaben Ihres Modells und wo es arbeiten wird. Wir schlagen eine zurückgehaltene Kohorte und die zu berichtenden Metriken vor.