AvalaAvala
Начать Разработку — Записаться на демо / Стать сотрудником

Оценка

Измеряйте модель в реальных местах, которых она никогда не видела.

Avala снимает сцены для оценки в реальных домах и на рабочих местах и никогда не передаёт их для обучения. Ваша модель выполняет задачи. Визуально-языковая модель предварительно оценивает каждую последовательность, люди проверяют оценки, а вы получаете отчёт с доверительными интервалами.

Отложенные данные

Сцены для оценки не попадают в обучение.

  1. Сняты для оценки

    Сцены для оценки снимаются в реальных домах и на рабочих местах по тому же стандарту сцен, что и данные для обучения.

  2. Никогда не передаются для обучения

    Сцены для оценки, а также дома, объекты и операторы в них, исключены из всех обучающих релизов.

  3. Версионированные проверки на загрязнение

    У каждой когорты для оценки есть версия. Перед оценкой Avala сверяет с ней ваши обучающие релизы по группам утечки и отпечаткам видео и записывает результат в отчёт.

Оценивание

Модель оценивает предварительно. Люди проверяют.

  1. Предварительная визуально-языковая оценка

    Визуально-языковая модель оценивает каждую последовательность по подзадачам и критериям успеха задачи.

  2. Проверка людьми

    Обученные проверяющие проверяют оценки. Если проверяющие расходятся во мнениях, решает консенсус.

  3. Согласованность оценщиков

    В каждом отчёте указано, как часто проверяющие были согласны, поэтому видно, насколько надёжна каждая оценка.

Последовательность со сбоем датчика или без калибровки помечается как недействительная и исключается из метрик. Она никогда не считается сбоем модели.

Отчёт

Что измеряет каждый отчёт об оценке.

  1. Вероятность успеха

    Доля последовательностей, в которых задача выполнена.

  2. Частичный прогресс

    Насколько далеко по подзадачам продвинулась неуспешная последовательность.

  3. Время до успеха

    Сколько времени занимают успешные последовательности.

  4. Производительность относительно человека

    Скорость выполнения задачи по сравнению с опытными людьми, выполняющими ту же задачу.

  5. Частота вмешательств

    Как часто человеку приходилось вмешиваться.

  6. Распределение типов сбоев

    Какие сбои произошли, сгруппированные по таксономии сбоев.

  7. Частота восстановления

    Как часто модель исправляла собственную ошибку.

  8. Доверительные интервалы

    Каждая метрика имеет интервал, поэтому две версии модели можно сравнивать честно.

Сравнение

Оценивайте две версии на одной когорте.

Запустите текущую модель и кандидата на одной и той же отложенной когорте. Отчёт показывает их рядом, метрику за метрикой и тип сбоя за типом сбоя, поэтому решение о выпуске опирается на доказательства, которые можно проверить.

Начало

Настройте первую когорту для оценки.

Расскажите, какие задачи выполняет ваша модель и где она будет работать. Мы предложим отложенную когорту и метрики для отчёта.