Évaluation
Mesurez votre modèle dans des lieux réels qu’il n’a jamais vus.
Avala capture des scènes d’évaluation dans des logements et des lieux de travail réels et ne les publie jamais pour l’entraînement. Votre modèle exécute les tâches. Un modèle vision-langage pré-note chaque séquence, des personnes auditent les notes, et vous recevez un rapport avec des intervalles de confiance.
Tenues à l’écart
Les scènes d’évaluation restent hors de l’entraînement.
Capturées pour l’évaluation
Les scènes d’évaluation sont capturées dans des logements et des lieux de travail réels selon le même standard de scène que les données d’entraînement.
Jamais publiées pour l’entraînement
Les scènes d’évaluation, ainsi que les logements, objets et opérateurs qu’elles contiennent, sont exclus de chaque version d’entraînement.
Contrôles de contamination versionnés
Chaque cohorte d’évaluation a une version. Avant la notation, Avala vérifie vos versions d’entraînement par rapport à elle, par groupe de fuite et par empreinte vidéo, et consigne le résultat dans le rapport.
Notation
Un modèle pré-note. Des personnes auditent.
Pré-notation vision-langage
Un modèle vision-langage note chaque séquence au regard des sous-tâches et des critères de réussite de la tâche.
Audit humain
Des évaluateurs formés auditent les notes. En cas de désaccord, le consensus tranche.
Accord inter-évaluateurs
Chaque rapport indique à quelle fréquence les évaluateurs étaient d’accord, pour que vous voyiez la solidité de chaque note.
Une séquence avec un défaut de capteur ou un étalonnage manquant est marquée comme invalide et exclue des métriques. Elle ne compte jamais comme un échec du modèle.
Le rapport
Ce que mesure chaque rapport d’évaluation.
Probabilité de réussite
La part des séquences qui accomplissent la tâche.
Progression partielle
Jusqu’où une séquence non réussie est allée dans les sous-tâches.
Temps jusqu’à la réussite
La durée des séquences réussies.
Débit relatif à l’humain
La vitesse d’exécution comparée à celle de personnes expertes effectuant la même tâche.
Taux d’intervention
La fréquence à laquelle une personne a dû intervenir.
Répartition des modes d’échec
Les échecs survenus, regroupés selon la taxonomie des échecs.
Taux de rattrapage
La fréquence à laquelle le modèle s’est rattrapé de sa propre erreur.
Intervalles de confiance
Chaque métrique est assortie d’un intervalle, pour comparer équitablement deux versions du modèle.
Comparer
Évaluez deux versions sur la même cohorte.
Exécutez le modèle actuel et le candidat sur la même cohorte tenue à l’écart. Le rapport les présente côte à côte, métrique par métrique et mode d’échec par mode d’échec, afin que la décision de livrer repose sur des preuves que vous pouvez examiner.
Commencer
Configurez votre première cohorte d’évaluation.
Indiquez-nous les tâches de votre modèle et où il fonctionnera. Nous proposons une cohorte tenue à l’écart et les métriques à inclure dans le rapport.