Abliteration.ai is making a business out of removing AI guardrails
개요
Abliteration.ai는 AI 모델에서 안전 장치(guardrails)를 제거하여 유해한 작업 수행을 가능하게 하는 서비스를 제공하는 스타트업입니다.
주요 내용
* Abliteration.ai는 Z.ai의 GLM-5.3과 같은 개방형 AI 모델에서 안전 장치를 제거한 버전을 호스팅하며, 사용자는 웹 브라우저나 API를 통해 접근할 수 있습니다.
* 이 서비스의 목표는 "공격적인 사이버 공격, 레드 팀 테스트, 기타 모델들이 거부하는 에이전트 테스트 작업"을 수행하도록 돕는 것입니다.
* 안전 장치 제거는 보안 작업에서 새로운 공격 방어 방법을 이해하고 재현하는 데 필요할 수 있으나, 잠재적으로 위험한 작업도 용이하게 할 수 있습니다.
* Abliteration.ai는 이전에 비공개적인 오픈 소스 커뮤니티 활동이었던 모델 안전 장치 제거를 상업적이고 쉽게 접근 가능한 서비스로 전환했습니다.
* 사용자는 Abliteration.ai의 서비스를 통해 Chrome 비밀번호 탈취 프로그램 작성이나 위험한 병원균 배양 절차 등 유해한 요청을 쉽게 수행할 수 있었습니다.
* Abliteration.ai는 클라우드 제공업체와 여러 계약을 맺고 있으며, 벤처 캐피털 투자를 유치하기 위한 논의 중입니다.
* 비평가들은 안전 장치가 제거된 모델을 대규모로 제공하는 것이 실제적인 피해로 이어질 수 있다고 우려하며, 모델을 "소시오패스"처럼 만들 수 있다고 지적합니다.
* 정부의 개입 가능성으로, Yoon은 공급업체에게 유해 사이버 및 생물 무기 활동 탐지/차단 분류기 실행을 요구하고, GPU 접근 시 고객 신원 확인 및 위험 사용 의심 시 접근 거부를 제안했습니다.
* Abliteration.ai는 사용자가 원하는 안전 장치를 추가할 수 있는 관리 레이어를 제공하며, 일부 기본적인 안전 장치는 자체적으로 갖추고 있습니다.
* 회사는 책임의 경계선을 어디에 둘지에 대한 질문에 대해 아직 명확한 정의를 내리는 과정에 있다고 밝혔습니다.
* Abliteration.ai의 창립자는 검열되지 않은 최첨단 모델에 대한 접근을 민주화하는 것이 방어의 가장 좋은 형태라고 주장하며, 이는 사이버 보안을 가속화할 수 있다고 말합니다.
* Abliteration.ai의 고객은 영국 및 유럽의 초기 단계 레드 팀 스타트업, 금융 기관, 항공사, 중요 인프라 기업 등입니다.
* 다른 사이버 보안 전문가들은 모델을 파인튜닝하는 것이 안전 장치 제거보다 더 효과적이며, 안전 장치 제거가 모델의 지식과 능력을 일부 감소시킬 수 있다고 주장합니다.
* 일부 전문가들은 안전 장치가 제거된 모델이 시스템 스트레스 테스트에 유용할 수 있지만, 아직 프로세스의 일부로 자리 잡지는 못했다고 언급합니다.
* 오픈 소스 커뮤니티의 모델 능력 이해를 높이는 것이 중요하며, 공개적으로 이러한 모델이 공개되면 연구자들이 실제 최전선을 파악하고 잠재적 위험을 이해하는 데 도움이 된다고 합니다.
시사점
AI 안전 장치 제거를 상업화하는 Abliteration.ai의 등장은 AI 모델의 접근성, 윤리적 사용, 잠재적 위험 및 규제에 대한 복잡한 질문을 제기하며, 사이버 보안 방어 및 공격 양상에 대한 새로운 논의를 촉발합니다.
댓글
GitHub Discussions