Meet GPT-Red: an LLM super-hacker OpenAI built to make its models safer

개요

OpenAI는 자사의 LLM 모델의 사이버 공격 방어 능력을 향상시키기 위해 'GPT-Red'라는 LLM 슈퍼 해커를 개발했습니다.

주요 내용

* GPT-Red는 인간 테스터가 수행하던 레드팀(Red Teaming) 테스트를 자동화하여 LLM 시스템의 취약점을 공격적으로 발견하는 역할을 합니다.
* LLM의 복잡성이 증가하고 에이전트(Agents)와 같은 새로운 형태로 활용 범위가 넓어짐에 따라, 기존의 인간 중심적인 보안 평가 방식으로는 잠재적 공격 유형을 모두 파악하기 어렵다는 문제점을 해결하기 위해 개발되었습니다.
* GPT-Red 개발을 위해, 연구진은 공격 모델과 방어 모델 간의 '셀프 플레이(Self-play)' 방식을 사용하여, 공격 모델은 지속적으로 새로운 공격 방식을 개발하고 방어 모델은 이에 대한 방어 능력을 강화하는 훈련을 진행했습니다.
* GPT-Red는 웹 브라우징, 이메일, 캘린더 앱, 코드 편집 등 다양한 실제 LLM 적용 시나리오를 모방한 훈련 환경에서 새로운 공격 유형을 발견하고, 특정 시나리오에 가장 효과적인 공격 방식을 탐색하는 데 뛰어난 성능을 보였습니다.
* 특히 GPT-Red는 이전에 알려지지 않았던 '페이크 체인 오브 쏘트(Fake Chain of Thought)'라는 프롬프트 인젝션 공격 유형을 발견했는데, 이는 LLM이 문제 해결 과정에서 자신에게 남기는 메모인 '체인 오브 쏘트'에 가짜 정보를 삽입하여 모델을 속이는 방식입니다.
* OpenAI의 테스트 결과, GPT-Red는 2025년 인간 레드팀이 발견한 취약점보다 더 효과적인 공격을 더 많이 발견했으며, Vendy와 같은 에이전트를 해킹하여 상품 가격을 변경하거나 주문을 취소하는 데 성공했습니다.
* GPT-Red가 발견한 공격에 대해 GPT-5.6 모델은 23% 미만의 낮은 공격 성공률을 보인 반면, 이전 버전인 GPT-5 모델은 90% 이상의 공격 성공률을 보였습니다.
* GPT-Red는 대화형 공격이나 이미지 기반의 프롬프트 인젝션 공격에는 아직 한계가 있으며, 인간 레드팀의 역할을 보완하는 용도로 활용됩니다.

시사점

GPT-Red는 LLM의 보안 테스트 자동화를 통해 모델의 견고성을 획기적으로 강화하고, 잠재적인 사이버 위협에 대한 선제적 대응 능력을 향상시키는 데 기여할 수 있습니다.

원문 읽기 →
원문을 불러오는 중...

댓글

GitHub Discussions