What happened after 2k people tried to hack my AI assistant
개요
hackmyclaw.com에서 2,000명 이상의 사용자가 6,000건 이상의 이메일을 통해 AI 어시스턴트 Fiu의 secrets.env 파일 내용을 유출시키려는 시도를 했으나, 단 한 건의 성공도 없이 모든 시도가 실패했습니다.
주요 내용
* 실험 설정: Fiu는 OpenClaw 기반의 AI 어시스턴트로, secrets.env 파일의 내용을 유출하지 않도록 하는 보안 프롬프트를 적용했습니다. 이메일 수신 시 응답은 비용 문제로 비활성화되었으나, Fiu는 응답할 능력을 가지고 있었습니다.
* 공격 시도: 공격자들은 다양한 주제와 언어를 사용하여 Fiu를 속이려 시도했으며, 일부는 20개의 변형 이메일을 4분 안에 보내거나 "OpenClaw Admin"을 사칭하는 등 정교한 기법을 사용했습니다.
* 문제 발생: Gmail 계정의 대량 이메일 수신과 빠른 API 호출로 인해 Google에서 Fiu의 Gmail 계정이 사기 탐지에 걸려 3일간 정지되었습니다. 또한, API 비용으로 500달러 이상이 발생했습니다. 이메일 처리 시 배치 방식이 실험의 정확성을 떨어뜨려, 각 이메일을 신선한 컨텍스트에서 처리하도록 설정을 변경했습니다.
* 성공 요인: Fiu는 약 500번째 이메일에서 대량의 이메일이 조율된 보안 실험이라는 것을 인지했습니다. 강력한 모델(Claude Opus 4.6)과 명확하고 간결한 보안 프롬프트가 효과적이었습니다.
* 예상치 못한 결과: hackmyclaw.com에 대한 스폰서 문의가 들어왔으며, Corgea, Abnormal AI, 그리고 익명의 기부자가 상금 및 API 비용 지원에 나섰습니다.
* 향후 계획: 무한한 크레딧이 있다면 모든 이메일에 응답하여 공격자의 경계를 테스트하고, 더 취약한 모델들을 테스트하여 프롬프트 주입의 임계점을 파악할 계획입니다.
시사점
이 실험은 프롬프트 주입이 여전히 현실적인 보안 문제이지만, 강력한 모델과 명확한 지시를 통해 상당한 수준의 저항이 가능하다는 것을 보여주며, AI 에이전트의 보안에 대한 낙관적인 전망을 제시합니다.
댓글
GitHub Discussions