Evaluierung
Messen Sie Ihr Modell an realen Orten, die es nie gesehen hat.
Avala erfasst Evaluierungsszenen in realen Wohnungen und Arbeitsstätten und gibt sie nie für das Training frei. Ihr Modell führt die Aufgaben aus. Ein Vision-Language-Modell bewertet jede Sequenz vor, Menschen prüfen die Bewertungen, und Sie erhalten einen Bericht mit Konfidenzintervallen.
Zurückgehalten
Evaluierungsszenen bleiben vom Training ausgeschlossen.
Für die Evaluierung erfasst
Evaluierungsszenen werden in realen Wohnungen und Arbeitsstätten nach demselben Szenenstandard erfasst wie Trainingsdaten.
Nie für das Training freigegeben
Evaluierungsszenen und die darin vorkommenden Wohnungen, Objekte und Bediener werden aus jedem Trainings-Release herausgehalten.
Versionierte Kontaminationsprüfungen
Jede Evaluierungskohorte hat eine Version. Vor der Bewertung prüft Avala Ihre Trainings-Releases nach Leakage-Gruppe und Video-Fingerprint dagegen und hält das Ergebnis im Bericht fest.
Bewertung
Ein Modell bewertet vor. Menschen prüfen.
Vision-Language-Vorbewertung
Ein Vision-Language-Modell bewertet jede Sequenz anhand der Teilaufgaben und Erfolgskriterien der Aufgabe.
Menschliches Audit
Geschulte Prüfer kontrollieren die Bewertungen. Wenn Prüfer uneinig sind, entscheidet der Konsens.
Übereinstimmung zwischen Prüfern
Jeder Bericht gibt an, wie oft die Prüfer übereinstimmten, damit Sie sehen, wie belastbar jede Bewertung ist.
Eine Sequenz mit Sensorfehler oder fehlender Kalibrierung wird als ungültig markiert und aus den Metriken ausgeschlossen. Sie zählt nie als Modellfehler.
Der Bericht
Was jeder Evaluierungsbericht misst.
Erfolgswahrscheinlichkeit
Der Anteil der Sequenzen, die die Aufgabe abschließen.
Teilfortschritt
Wie weit eine erfolglose Sequenz in den Teilaufgaben gekommen ist.
Zeit bis zum Erfolg
Wie lange erfolgreiche Sequenzen dauern.
Durchsatz im Vergleich zum Menschen
Die Geschwindigkeit bei der Aufgabe im Vergleich zu erfahrenen Menschen, die dieselbe Aufgabe ausführen.
Eingriffsrate
Wie oft ein Mensch eingreifen musste.
Verteilung der Fehlermodi
Welche Fehler auftraten, gruppiert nach der Fehlertaxonomie.
Korrekturrate
Wie oft sich das Modell von seinem eigenen Fehler erholt hat.
Konfidenzintervalle
Jede Metrik hat ein Intervall, damit sich zwei Modellversionen fair vergleichen lassen.
Vergleich
Zwei Versionen auf derselben Kohorte bewerten.
Führen Sie das aktuelle Modell und den Kandidaten auf derselben zurückgehaltenen Kohorte aus. Der Bericht stellt beide nebeneinander, Metrik für Metrik und Fehlermodus für Fehlermodus, sodass die Entscheidung zur Auslieferung auf Nachweisen beruht, die Sie selbst prüfen können.
Loslegen
Richten Sie Ihre erste Evaluierungskohorte ein.
Nennen Sie uns die Aufgaben Ihres Modells und wo es arbeiten wird. Wir schlagen eine zurückgehaltene Kohorte und die zu berichtenden Metriken vor.