평가
모델이 본 적 없는 실제 장소에서 모델을 측정하세요.
Avala는 실제 가정과 작업장에서 평가 장면을 캡처하며, 이를 학습용으로 공개하지 않습니다. 고객의 모델이 작업을 수행합니다. 비전 언어 모델이 모든 시퀀스를 사전 채점하고, 사람이 점수를 감사하며, 고객은 신뢰 구간이 포함된 리포트를 받습니다.
홀드아웃
평가 장면은 학습에 사용하지 않습니다.
평가를 위해 캡처
평가 장면은 학습 데이터와 동일한 장면 기준에 따라 실제 가정과 작업장에서 캡처합니다.
학습용으로 공개하지 않음
평가 장면과 그 안의 가정, 물체, 작업자는 모든 학습용 릴리스에서 제외됩니다.
버전 관리되는 오염 검사
각 평가 코호트에는 버전이 있습니다. 채점 전에 Avala는 누출 그룹과 영상 지문을 기준으로 고객의 학습용 릴리스를 코호트와 대조하고, 그 결과를 리포트에 기록합니다.
채점
모델이 사전 채점하고, 사람이 감사합니다.
비전 언어 모델 사전 채점
비전 언어 모델이 작업의 하위 작업과 성공 기준에 비추어 각 시퀀스의 점수를 매깁니다.
사람 감사
교육받은 검토자가 점수를 감사합니다. 검토자 의견이 다르면 합의로 결정합니다.
평가자 간 일치도
각 리포트에는 검토자들이 얼마나 자주 의견이 일치했는지 표시되므로, 각 점수가 얼마나 확실한지 알 수 있습니다.
센서 결함이 있거나 캘리브레이션이 누락된 시퀀스는 무효로 표시되어 지표에서 제외됩니다. 모델 실패로 집계되지 않습니다.
리포트
모든 평가 리포트가 측정하는 항목.
성공 확률
작업을 완료한 시퀀스의 비율.
부분 진행도
성공하지 못한 시퀀스가 하위 작업 중 어디까지 진행했는지.
성공까지 걸린 시간
성공한 시퀀스에 걸린 시간.
사람 대비 처리량
같은 작업을 하는 숙련자와 비교한 작업 속도.
개입률
사람이 개입해야 했던 빈도.
실패 모드 분포
어떤 실패가 발생했는지를 실패 분류 체계로 묶은 것.
복구율
모델이 자신의 실수에서 복구한 빈도.
신뢰 구간
모든 지표에 구간이 함께 제공되므로 두 모델 버전을 공정하게 비교할 수 있습니다.
비교
같은 코호트에서 두 버전의 점수를 매기세요.
현재 모델과 후보 모델을 같은 홀드아웃 코호트에서 실행합니다. 리포트는 두 모델을 지표별, 실패 모드별로 나란히 보여주므로, 배포 결정은 직접 확인할 수 있는 근거에 기반합니다.