The AI Crash Test: adversarial LLM testing you can audit in the Network tab
개요
AI Crash Test는 LLM의 취약점을 감사 가능한 방식으로 테스트하고 평가하는 브라우저 기반 도구로, 자체 API 키를 사용하여 모델의 응답을 순수 결정론적 술어(predicate)로 평가하며 LLM 판단 없이 결과를 제공합니다.
주요 내용
* 감사 가능한 결정론적 평가: 모든 평가는 모델 응답 문자열에 대한 정확한 일치, 정규 표현식, 숫자 확인, 주입 감지, 거부 규칙 등 결정론적 술어로 이루어지며, LLM이 평가자로 사용되지 않아 결과의 재현성과 투명성을 보장합니다.
* BYOK (Bring Your Own Key) 및 Never-Touches 아키텍처: 사용자는 자신의 API 키를 직접 사용하여 모델을 테스트하며, crashkit 서버는 API 키가 포함되지 않은 응답 데이터만 수신하여 사용자의 키가 서버에 전혀 노출되지 않습니다.
* 오류 검증 및 수정: 초기 테스트에서 약 29%의 취약점을 보고했지만, 결정론적 평가 결과의 실패 사례를 분석하여 평가 코드 자체의 버그(False Positive)를 발견하고 수정했으며, 수정 후 실제 취약점은 0%로 판명되었습니다.
* gradecore 엔진 공유: The AI Crash Test의 평가 엔진인 gradecore는 실시간 모델 드리프트 모니터링 보드에서도 사용되는 동일한 결정론적 엔진으로, 반복 테스트 시 바이트 단위로 동일한 결과를 보장합니다.
* 다양한 공격 벡터: 프롬프트 주입, 도구 남용, 사양 위반, 거부 보정, 비안전 준수, 환각 유도, 일관성 등 7가지 유형의 공격에 대한 8가지 작업을 포함하는 배터리를 사용하여 모델 취약점을 테스트합니다.
* 직접 확인 가능한 투명성: 사용자는 브라우저 개발자 도구의 네트워크 탭을 열어 API 키가 provider 호출에만 사용되고 /api/grade 호출에는 포함되지 않는 것을 직접 확인할 수 있습니다.
시사점
AI Crash Test는 LLM 평가의 신뢰성을 높이기 위해 LLM 기반 평가 대신 감사 가능한 결정론적 평가 방식과 BYOK 아키텍처를 도입하여 투명하고 재현 가능한 테스트 환경을 제공하며, 이는 LLM의 안전성과 신뢰성을 검증하는 데 중요한 실무적 가치를 가집니다.
댓글
GitHub Discussions