TycoonLE: A Jax reinforcement learning environment for long-horizon planning

개요

TycoonLE은 경제적 근거를 바탕으로 한 장기 계획을 위한 강화학습 환경으로, 물류 경제 시뮬레이션 내에서 에이전트가 자본 할당, 운송 경로 구축, 화물 이동, 부채 관리, 지연 수익 최적화 등을 수행하도록 설계되었습니다.

주요 내용

* 경제 기반 장기 계획 연구: TycoonLE은 에이전트가 복잡한 경제적 요소를 고려하여 장기적인 의사 결정을 내리는 환경을 제공합니다.
* 시뮬레이션 환경: 에이전트는 자본 할당, 운송 경로 구축, 화물 운송, 부채 관리, 지연 수익 최적화 등의 작업을 수행하는 시뮬레이션된 물류 경제에서 활동합니다.
* 연구 초점: 액션 합법성, 후보-프론티어 결정 인터페이스, 자금 조달 시점, 지연 보상, 절차적 변형, 재현 가능한 감사 추적 등을 연구하는 데 중점을 둡니다.
* JAX 호환 인터페이스: 고정된 형태의 인터페이스를 사용하여 에이전트는 유효한 경로, 자금 조달, 대기 후보 중에서 선택하며, 이는 jit, vmap, scan과 같은 JAX 변환과의 호환성을 보장합니다.
* 재현 가능한 UI: 경로 선택, 화물 흐름, 자금 조달 행동, 보상, 점수, 수익 등을 시간 경과에 따라 검사할 수 있는 재현 UI를 제공하여 에이전트의 정책을 검토할 수 있습니다.
* TycoonBench: 에이전트 및 모델 성능 비교를 위한 벤치마크 보고서인 TycoonBench를 제공합니다.
* 설치 및 사용: Python 3.11 또는 3.12 환경에서 설치 및 사용이 가능하며, JAX를 활용한 Quickstart 예제, PPO 훈련 예제, 재현 파일 내보내기 기능 등을 지원합니다.
* 아트워크: OpenGFX의 스프라이트 아트워크를 사용합니다.

시사점

TycoonLE은 복잡한 경제적 상호작용 속에서 장기 계획 능력을 갖춘 강화학습 에이전트를 개발하고 평가하기 위한 혁신적인 프레임워크를 제공하며, 이는 실제 물류 및 경제 시뮬레이션 분야에 적용될 수 있는 가능성을 제시합니다.

원문 읽기 →
원문을 불러오는 중...

댓글

GitHub Discussions