AvalaAvala
Commencer à Construire — Demander une démo / Devenir Coworker

Évaluation

Mesurez votre modèle dans des lieux réels qu’il n’a jamais vus.

Avala capture des scènes d’évaluation dans des logements et des lieux de travail réels et ne les publie jamais pour l’entraînement. Votre modèle exécute les tâches. Un modèle vision-langage pré-note chaque séquence, des personnes auditent les notes, et vous recevez un rapport avec des intervalles de confiance.

Tenues à l’écart

Les scènes d’évaluation restent hors de l’entraînement.

  1. Capturées pour l’évaluation

    Les scènes d’évaluation sont capturées dans des logements et des lieux de travail réels selon le même standard de scène que les données d’entraînement.

  2. Jamais publiées pour l’entraînement

    Les scènes d’évaluation, ainsi que les logements, objets et opérateurs qu’elles contiennent, sont exclus de chaque version d’entraînement.

  3. Contrôles de contamination versionnés

    Chaque cohorte d’évaluation a une version. Avant la notation, Avala vérifie vos versions d’entraînement par rapport à elle, par groupe de fuite et par empreinte vidéo, et consigne le résultat dans le rapport.

Notation

Un modèle pré-note. Des personnes auditent.

  1. Pré-notation vision-langage

    Un modèle vision-langage note chaque séquence au regard des sous-tâches et des critères de réussite de la tâche.

  2. Audit humain

    Des évaluateurs formés auditent les notes. En cas de désaccord, le consensus tranche.

  3. Accord inter-évaluateurs

    Chaque rapport indique à quelle fréquence les évaluateurs étaient d’accord, pour que vous voyiez la solidité de chaque note.

Une séquence avec un défaut de capteur ou un étalonnage manquant est marquée comme invalide et exclue des métriques. Elle ne compte jamais comme un échec du modèle.

Le rapport

Ce que mesure chaque rapport d’évaluation.

  1. Probabilité de réussite

    La part des séquences qui accomplissent la tâche.

  2. Progression partielle

    Jusqu’où une séquence non réussie est allée dans les sous-tâches.

  3. Temps jusqu’à la réussite

    La durée des séquences réussies.

  4. Débit relatif à l’humain

    La vitesse d’exécution comparée à celle de personnes expertes effectuant la même tâche.

  5. Taux d’intervention

    La fréquence à laquelle une personne a dû intervenir.

  6. Répartition des modes d’échec

    Les échecs survenus, regroupés selon la taxonomie des échecs.

  7. Taux de rattrapage

    La fréquence à laquelle le modèle s’est rattrapé de sa propre erreur.

  8. Intervalles de confiance

    Chaque métrique est assortie d’un intervalle, pour comparer équitablement deux versions du modèle.

Comparer

Évaluez deux versions sur la même cohorte.

Exécutez le modèle actuel et le candidat sur la même cohorte tenue à l’écart. Le rapport les présente côte à côte, métrique par métrique et mode d’échec par mode d’échec, afin que la décision de livrer repose sur des preuves que vous pouvez examiner.

Commencer

Configurez votre première cohorte d’évaluation.

Indiquez-nous les tâches de votre modèle et où il fonctionnera. Nous proposons une cohorte tenue à l’écart et les métriques à inclure dans le rapport.