I built an autonomous treasury agent, then let a code review bot find every way it could lose money
개요
TrueForge를 기반으로 구축된 자율 재무 관리 에이전트인 TreasuryForge는 실제 승인 게이트와 코드 검토 봇을 통합하여 잠재적인 금전적 손실을 방지하고 안전한 의사 결정 루프를 시연합니다.
주요 내용
* TreasuryForge의 설계: 시장과의 직접적인 경쟁보다는 안전한 의사 결정 루프, 실제 도구 호출, 계산된 위험 점검, 샌드박스화된 스트레스 테스트, 인간 승인 게이트, 사후 감사용 보조 에이전트에 중점을 둡니다.
* TrueForge 사용 이유: TrueForge는 커스텀 오케스트레이션 대신 에이전트가 도구에 접근하고, 코드를 샌드박스에서 실행하며, 인간의 승인을 받는 데 필요한 기본 기능을 제공합니다.
* TreasuryForge의 작동 방식: 에이전트는 포트폴리오 데이터를 읽고, 위험 한도를 확인하며, 거래 제안을 합니다. 모든 거래 실행은 인간의 승인을 거치며, 서버 측에서도 위험을 재계산합니다. 또한, 사후 감사 에이전트가 과거 결정을 검토하고 위험 임계값 조정을 제안합니다.
* 코드 검토 봇(Qodo) 발견 사항:
* 승인 게이트 우회 가능성: 지갑 서버의 취약점 및 인증 없는 재설정 엔드포인트.
* 거래 이중 실행 가능성: 재시도 시 발생할 수 있는 레이스 컨디션.
* 새로운 레이스 컨디션 생성: 비동기 함수 변경으로 인해 발생한 위험 기준선 롤오버 문제.
* 테스트가 실제 레이스를 검증하지 못함: 마이그레이션 레이스 컨디션 테스트 오류.
* 보안 결정의 예외 처리: 인증되지 않은 대시보드 접근에 대한 예외 처리.
* LLM 사용 시 경험: 무료 티어 LLM의 제한 사항(시간당 사용량 제한, 테스트 중 고갈)으로 인해 OpenRouter를 추가 공급자로 통합하고 도구 지원 모델을 선정했습니다.
* 개선이 필요한 부분:
* Daytona 클라우드 샌드박스의 비호환성 (개인 계정).
* 로컬 bubblewrap 샌드박스의 Linux/WSL2 전용 지원.
* 역사적 가격 시리즈 부족으로 인한 제한적인 자체 감사 백테스팅.
* 프론트엔드에 자동화된 테스트 스위트 부재.
시사점
TreasuryForge 프로젝트는 자율 에이전트의 견고성을 보장하기 위해 인간의 감독, 명확한 위험 관리, 그리고 코드 검토 봇과 같은 자동화된 도구를 통합하는 것이 필수적임을 보여줍니다.
댓글
GitHub Discussions