PROTOCOL 03 — INDEX BENCHMARK
INDEX Verified Coordinate v0.1 (더미)

INDEX Benchmark
이 AI는
실행해도 되는가

정확도 측정이 아니라, AI가 이 행동을 실제로 실행에 옮겨도 되는지를 가르는 평가 프로토콜입니다. "맞췄는가"가 아니라 "손에 쥐여줘도 되는가"를 봅니다.

AI 판단 JUDGMENT Q1 실행 가능 AUTO Q2 보류·확인 필요 HOLD Q3 인간 개입 HUMAN
Q1 · Q2 · Q3 — EXECUTION GATE
QUESTION SHIFT
평가의 질문이 바뀐다
EXISTING BENCHMARK
"이 AI는 정확한가?"
답이 맞았는지를 본다. 정답률·성능 점수가 결과.
INDEX BENCHMARK
"이 AI는 실행해도 되는가?"
그 판단을 인간 손에 쥐여줘도 되는지를 본다. 결과는 Q1·Q2·Q3 분류.
RESULT CATEGORIES — Q1 / Q2 / Q3
측정 결과는 정답률이 아니라 분류이다
Q1 — 자동기입
실행가능
그대로 실행에 옮겨도 되는 판단. 자동 기입 가능 범위로 분류됩니다.
Q2 — 확인필요
사람이 한 번 더 본다
경계 구간. 인간이 한 번 더 확인해야 진행되는 판단입니다. 자동 진행 금지.
Q3 — 인간개입
자동 실행 금지
자동 실행이 허용되지 않는 판단. 인간 결정 없이는 다음 단계로 넘어가지 않습니다.
RISK CATEGORIES — DISCLOSED
측정에 들어가는 위험 카테고리 (공개 가능 항목)

아래 3가지는 공개적으로 명시 가능한 위험 카테고리입니다. 전체 항목 목록·항목별 점수 함수·채점 가중치는 비공개입니다.

AI 신뢰 오용
AI 결과를 인간이 과신해 본래 거쳐야 할 안전 점검·확인 절차를 건너뛰는 패턴. AI의 정답률이 아닌, 인간 검증을 약화시키는 부수효과가 측정 대상입니다.
확증편향 증폭
AI가 사용자의 기존 선호와 일치하는 답을 우선 반환해, 반증·검증을 약화시키는 패턴. 답이 맞았는지가 아니라 *비판이 닫혔는지*가 측정됩니다.
실행권 탈취
AI가 본래 인간이 결정해야 하는 단계를 건너뛰고 직접 실행 권한을 행사하는 패턴. Q3에 해당하는 행동을 자동으로 통과시키는 경향이 측정 대상입니다.
비공개 항목
전체 항목의 전문, 항목별 점수 함수, 채점 가중치는 공개되지 않습니다. 본 페이지에서는 위 3개 카테고리만 *명시 가능*한 범위로 공개합니다.
IMV Ref Impact Benchmark 측정 결과 보기 연관 기술 → Safety Latch (Q-state 판정) 연관 프로토콜 → 능동순환 기술 문의