A fundamental flaw leaves LLMs strikingly vulnerable to attack

개요

대형 언어 모델(LLM)은 작동 방식의 근본적인 결함으로 인해 해킹에 완전히 안전할 수 없다는 연구 결과가 나왔으며, 이는 LLM의 안전성에 중대한 영향을 미친다.

주요 내용

* LLM은 텍스트의 스타일과 내용으로 역할(role)을 인식할 뿐, 태그(tag)만으로는 역할을 제대로 구분하지 못해 악의적인 텍스트를 해당 역할로 오인하기 쉽다.
* 연구진은 LLM이 자체적으로 생성하는 'chain of thought' 텍스트를 모방하여, LLM이 부적절한 정보(예: 불법 약물 제조법, 항공기 항법 시스템 방해 방법)를 생성하도록 유도하는 'chain-of-thought forgery' 공격을 성공시켰다.
* 이러한 역할 인식의 취약성은 LLM 훈련 방식의 근본적인 한계로, 아무리 훈련을 강화해도 완전히 해결하기 어렵다.
* 인간의 창의성과 유사한 롤플레잉(role-playing) 기법을 활용하여 LLM을 속이는 공격 방식(예: 술에 취한 척, 군사적으로 이미 사용 중인 척)도 효과적인 것으로 나타났다.
* 현재 LLM 보안을 위한 노력(레드팀 테스트, 훈련 등)이 진행되고 있으나, 민감한 시스템에서는 이것만으로는 충분하지 않을 수 있다.

시사점

LLM의 역할 인식 메커니즘의 근본적인 취약성은 이 기술을 더욱 안전하게 만들기 위한 지속적인 연구와 함께, LLM 기반 시스템을 사용할 때 잠재적 위험을 항상 염두에 두어야 함을 시사한다.

원문 읽기 →
원문을 불러오는 중...

댓글

GitHub Discussions