Evaluación
Mida su modelo en lugares reales que nunca ha visto.
Avala captura escenas de evaluación en hogares y lugares de trabajo reales y nunca las publica para entrenamiento. Su modelo ejecuta las tareas. Un modelo de visión y lenguaje prepuntúa cada secuencia, personas auditan las puntuaciones y usted recibe un informe con intervalos de confianza.
Reservadas
Las escenas de evaluación quedan fuera del entrenamiento.
Capturadas para evaluación
Las escenas de evaluación se capturan en hogares y lugares de trabajo reales con el mismo estándar de escena que los datos de entrenamiento.
Nunca publicadas para entrenamiento
Las escenas de evaluación, y los hogares, objetos y operadores que aparecen en ellas, quedan fuera de cada versión de entrenamiento.
Controles de contaminación versionados
Cada cohorte de evaluación tiene una versión. Antes de puntuar, Avala compara sus versiones de entrenamiento con ella por grupo de fuga y huella de vídeo, y registra el resultado en el informe.
Puntuación
Un modelo prepuntúa. Las personas auditan.
Prepuntuación de visión y lenguaje
Un modelo de visión y lenguaje puntúa cada secuencia según las subtareas y los criterios de éxito de la tarea.
Auditoría humana
Revisores formados auditan las puntuaciones. Cuando los revisores discrepan, decide el consenso.
Concordancia entre evaluadores
Cada informe indica con qué frecuencia coincidieron los revisores, para que vea la solidez de cada puntuación.
Una secuencia con un fallo de sensor o sin calibración se marca como no válida y se excluye de las métricas. Nunca cuenta como un fallo del modelo.
El informe
Lo que mide cada informe de evaluación.
Probabilidad de éxito
La proporción de secuencias que completan la tarea.
Progreso parcial
Hasta qué punto de las subtareas llegó una secuencia sin éxito.
Tiempo hasta el éxito
Cuánto tardan las secuencias con éxito.
Rendimiento relativo al humano
La velocidad en la tarea comparada con personas expertas que realizan la misma tarea.
Tasa de intervención
Con qué frecuencia una persona tuvo que intervenir.
Distribución de modos de fallo
Qué fallos ocurrieron, agrupados según la taxonomía de fallos.
Tasa de recuperación
Con qué frecuencia el modelo se recuperó de su propio error.
Intervalos de confianza
Cada métrica incluye un intervalo, para comparar dos versiones del modelo de forma justa.
Comparar
Puntúe dos versiones en la misma cohorte.
Ejecute el modelo actual y el candidato en la misma cohorte reservada. El informe los presenta lado a lado, métrica por métrica y modo de fallo por modo de fallo, para que la decisión de publicar se base en evidencia que usted puede revisar.
Empezar
Configure su primera cohorte de evaluación.
Indíquenos las tareas que ejecuta su modelo y dónde trabajará. Proponemos una cohorte reservada y las métricas que se incluirán en el informe.