AvalaAvala
Empezar a Construir — Reservar una demo / Conviértete en Coworker

Evaluación

Mida su modelo en lugares reales que nunca ha visto.

Avala captura escenas de evaluación en hogares y lugares de trabajo reales y nunca las publica para entrenamiento. Su modelo ejecuta las tareas. Un modelo de visión y lenguaje prepuntúa cada secuencia, personas auditan las puntuaciones y usted recibe un informe con intervalos de confianza.

Reservadas

Las escenas de evaluación quedan fuera del entrenamiento.

  1. Capturadas para evaluación

    Las escenas de evaluación se capturan en hogares y lugares de trabajo reales con el mismo estándar de escena que los datos de entrenamiento.

  2. Nunca publicadas para entrenamiento

    Las escenas de evaluación, y los hogares, objetos y operadores que aparecen en ellas, quedan fuera de cada versión de entrenamiento.

  3. Controles de contaminación versionados

    Cada cohorte de evaluación tiene una versión. Antes de puntuar, Avala compara sus versiones de entrenamiento con ella por grupo de fuga y huella de vídeo, y registra el resultado en el informe.

Puntuación

Un modelo prepuntúa. Las personas auditan.

  1. Prepuntuación de visión y lenguaje

    Un modelo de visión y lenguaje puntúa cada secuencia según las subtareas y los criterios de éxito de la tarea.

  2. Auditoría humana

    Revisores formados auditan las puntuaciones. Cuando los revisores discrepan, decide el consenso.

  3. Concordancia entre evaluadores

    Cada informe indica con qué frecuencia coincidieron los revisores, para que vea la solidez de cada puntuación.

Una secuencia con un fallo de sensor o sin calibración se marca como no válida y se excluye de las métricas. Nunca cuenta como un fallo del modelo.

El informe

Lo que mide cada informe de evaluación.

  1. Probabilidad de éxito

    La proporción de secuencias que completan la tarea.

  2. Progreso parcial

    Hasta qué punto de las subtareas llegó una secuencia sin éxito.

  3. Tiempo hasta el éxito

    Cuánto tardan las secuencias con éxito.

  4. Rendimiento relativo al humano

    La velocidad en la tarea comparada con personas expertas que realizan la misma tarea.

  5. Tasa de intervención

    Con qué frecuencia una persona tuvo que intervenir.

  6. Distribución de modos de fallo

    Qué fallos ocurrieron, agrupados según la taxonomía de fallos.

  7. Tasa de recuperación

    Con qué frecuencia el modelo se recuperó de su propio error.

  8. Intervalos de confianza

    Cada métrica incluye un intervalo, para comparar dos versiones del modelo de forma justa.

Comparar

Puntúe dos versiones en la misma cohorte.

Ejecute el modelo actual y el candidato en la misma cohorte reservada. El informe los presenta lado a lado, métrica por métrica y modo de fallo por modo de fallo, para que la decisión de publicar se base en evidencia que usted puede revisar.

Empezar

Configure su primera cohorte de evaluación.

Indíquenos las tareas que ejecuta su modelo y dónde trabajará. Proponemos una cohorte reservada y las métricas que se incluirán en el informe.