How AI guardrails are impeding the work of offensive cybersecurity researchers

개요

AI 모델에 적용된 보안 강화 기능(guardrails)이 악의적인 해커를 방지하는 데 목적이 있지만, 역설적으로 합법적인 사이버 보안 연구자 및 네트워크 방어 전문가들의 업무를 저해하고 있다.

주요 내용

  • AI 거대 기업들은 악의적인 해킹 시도를 방지하기 위해 AI 모델에 엄격한 보안 강화 기능(guardrails)을 적용해왔으나, 이는 사이버 보안 연구원들의 취약점 탐색 및 악용 방법 개발 업무를 방해하고 있다.
  • Anthropic의 Mythos 및 Fable 모델에 대한 미국 정부의 수출 통제 조치는 모델 보안 강화 기능을 우회하여 악성 사이버 공격을 수행할 수 있다는 보고에 기인했으며, 이는 AI 모델의 잠재적 악용 가능성에 대한 우려를 반영한다.
  • OpenAI의 Trusted Access for Cyber 프로그램과 Anthropic의 Cyber Verification Program과 같이, AI 기업들은 사이버 보안 연구자들에게 제한된 접근 권한을 부여하는 프로그램을 운영하지만, 이러한 프로그램들조차도 보안 연구원들에게는 번거롭고 업무를 저해하는 요소로 작용한다는 비판이 존재한다.
  • 보안 연구원들은 AI 모델에게 코드의 취약점을 탐색하거나 수정하라는 요청이 방어 메커니즘과 동시에 공격 경로를 제시하는 양면성을 지니고 있음을 지적하며, AI 모델의 보안 강화 기능이 이러한 양가적 특성을 고려하지 않고 일방적으로 작동하는 것에 대한 우려를 표하고 있다.
  • 일부 연구자들은 보안 강화 기능이 없는 오픈 소스 AI 모델이나 로컬 환경에서 실행되는 모델을 대안으로 사용하며, 이는 민감한 취약점 데이터 유출 위험을 줄이기 위한 목적도 포함한다.
  • AI 모델을 공격적인 보안 작업에 직접 사용하지 않고 코드 분석, 역공학, 보조 도구 개발 등 지원 목적으로만 활용하는 연구자들도 있으며, 이들은 AI가 전반적인 작업 속도를 높여 취약점 발견 자체에 더 집중할 수 있게 돕는다고 말한다.
  • 보안 강화 기능의 일관성 부족과 과도한 제약은 연구자들이 핵심 업무 대신 AI 모델과의 "협상"에 많은 시간을 소비하게 만들며, 이는 미국 기반의 AI 시스템으로부터 해외 오픈 소스 모델로의 의존성 이동을 야기할 수 있다.
  • 역공학적 보안 연구자들은 AI 기업들이 고객을 미성숙한 사용자로 취급하며 과도한 통제를 가한다고 비판하며, AI 기업들이 책임감 있는 접근 방식을 제공하고 악용자를 처벌하는 방식의 개선을 촉구한다.

시사점

AI 모델에 적용된 보안 강화 기능은 잠재적 악용을 방지하는 데 기여하지만, 동시에 합법적인 보안 연구 활동을 제약하여 사이버 방어 능력 발전을 저해할 수 있으므로, AI 기업들은 책임감 있는 접근 방식과 투명한 운영을 통해 연구자들의 업무를 지원하는 방안을 모색해야 한다.

원문 읽기 →
원문을 불러오는 중...

댓글

GitHub Discussions