Show HN: Talos – An AI agent with a permission kernel between model and shell

개요

Talos는 결정론적 보안 커널을 통해 모델과 쉘 사이에 권한 제어 계층을 두어, AI 에이전트가 빌드, 테스트, 브라우징 등의 작업을 수행할 수 있도록 하는 실험적인 AI 에이전트입니다.

주요 내용

* 결정론적 보안 커널 (Deterministic Security Kernel): 모든 도구 호출 전에 실행되며, 각 효과는 개별적으로 승인되고 정확한 인자와 바인딩되어 30초 동안 유효한 단일 사용 토큰으로 제한됩니다.
* 실행 권한 제어: run_shell, delegate_code, delegate_dag와 같은 도구들은 샌드박스 환경에서 실행되거나, 샌드박스가 없을 경우 거부됩니다. 특히 delegate_code는 격리된 Claude 워커에게 코딩 작업을 위임하며, 브라우저 사용 시 동일 샌드박스 내에서 제어합니다.
* 안전한 작업 처리: 파일 작업 시 path floor, hardline, dangerous, effect와 같은 단계를 거치며, policy.py에서 실행되는 Python 스크립트가 이를 결정합니다. 브라우저 내에서 실행되는 쉘은 샌드박스화되고 기록됩니다.
* 명시적인 도구 선언: 23개의 도구가 있으며, 각 도구는 manifest에 효과를 명시해야 합니다. 선언되지 않은 도구는 즉시 거부됩니다. (읽기 15개, 쓰기 5개, 실행 3개)
* 대화 채널: 터미널, Telegram, IMAP 메일, WhatsApp 등 4가지 채널을 지원하며, 모든 연결은 요청(fetch) 방식으로 이루어지고 리스닝 소켓을 열지 않습니다.
* 긴급 인터페이스 및 복구 기능: /stop 명령어로 실행 중인 사고를 중단하고 큐를 비우며, /undo 명령어로 마지막 성공한 파일 변경 사항을 롤백할 수 있습니다.
* 투명한 검증: 설치 과정에서 프리스크립트 체크, 테스트 스위트, 적대적 스위트 실행 결과를 사용자 앞에서 투명하게 보여주며, 모든 주장은 검증 가능합니다.
* 제한 사항: 쉘 실행에는 샌드박스 환경(Linux의 bubblewrap, macOS의 sandbox-exec)이 필요하며, 멀티 테넌트 보안 경계는 제공하지 않습니다. 악의적인 모델 자체를 방어하는 것이 아니라, 오작동하는 모델이나 도구 출력으로 인한 주입을 방어합니다.
* 실행 요구 사항: Python 3.11+와 Claude Code CLI가 필요하며, Raspberry Pi에서도 실행 가능합니다. 설치 후 즉시 실행되지 않으며, TALOS_ALLOWED_PRINCIPALS 변수에 사용자 ID가 명시되어야 시작됩니다.

시사점

Talos는 AI 에이전트의 안전성과 제어 가능성을 극대화하기 위해 보안 커널을 최우선으로 설계함으로써, AI의 잠재력을 안전하게 활용할 수 있는 새로운 접근 방식을 제시합니다.

원문 읽기 →
원문을 불러오는 중...

댓글

GitHub Discussions