Mistral's Shieldstral: 3B open-weights model for multimodal moderation
개요
Mistral AI는 3B 매개변수의 오픈 가중치 멀티모달 안전 분류기인 Shieldstral을 공개했으며, 이는 기존 모델 대비 7배 큰 모델들의 성능을 능가하는 정책 적응형 질의응답 방식으로 콘텐츠 조정을 수행합니다.
주요 내용
- Shieldstral은 3B 매개변수의 오픈 가중치 멀티모달 안전 분류기로, 텍스트 안전성, 거부 탐지, 정책 적응성 및 멀티모달 벤치마크에서 최대 7배 큰 오픈 가드 모델과 동등하거나 그 이상의 성능을 보입니다.
- 기존 가드레일 모델과 달리, Shieldstral은 재학습 없이 추론 시점에 자연어 정책을 받아 텍스트와 이미지 안전성 평가를 통합하며, 정책을 자유 형식의 쿼리로 제공하여 추론 시점에 재조정 가능합니다.
- 콘텐츠 조정을 이진 질의응답 작업으로 프레임워크화하여,
<Instruct>(평가 컨텍스트, 엄격성, 안전하지 않은 콘텐츠 정의),<Query>(단일 예/아니오 질문),<Document>(평가 대상 콘텐츠: 프롬프트, 응답, 프롬프트-응답 쌍, 이미지)로 구성됩니다. - 추론 시 모델은 예/아니오 로짓만 읽어내어 소프트맥스 정규화 후 연속적인 안전성 점수를 제공하며, 이는 임계값 설정이나 신뢰도 기반 순위 지정에 활용될 수 있습니다.
- 3B 모델로 단일 16GB NVIDIA GPU에서 효율적으로 실행 가능하며, Apache 2.0 라이선스로 오픈되어 있습니다.
- 이질적인 데이터셋을 통합하고, 기억이 아닌 차별화를 학습시키며, 이미지 안전성을 강화하고, 상호 보완적인 체크포인트를 결합하는 방식으로 구축되었습니다.
시사점
Shieldstral의 등장은 단일 고정된 분류 체계에 모든 제품을 적용하는 방식에서 벗어나, 상황에 적응하는 콘텐츠 조정으로 나아가는 중요한 발걸음을 제시하며, 멀티링구얼 지원, 장문 콘텐츠 강건성, 광범위한 멀티모달 안전성 분야로의 지속적인 발전을 시사합니다.
원문을 불러오는 중...
댓글
GitHub Discussions