Project HydraFusion: Frontier quality via multi-model orchestration

개요

Project HydraFusion은 여러 제공업체의 모델을 런타임에 오케스트레이션하여 코드 초안 작성, 검토, 수정 또는 더 강력한 모델로의 연쇄 적용을 통해 작업을 완료하는 연구 미리 보기 버전입니다.

주요 내용

* HydraFusion은 단일 모델 사용, 효율적인 모델 초안 작성 후 품질 게이트를 통과하면 수락하거나 더 강력한 모델로 에스컬레이션하는 방식(Cascade), 한 모델이 결과물을 초안 작성하면 다른 모델 패밀리의 독립적인 비판 모델이 검토하고 초안 작성 모델이 수정하는 방식(Critique)의 세 가지 실행 패턴을 선택합니다.
* 각 실행 패턴은 품질 대 비용 트레이드오프를 다르게 해결하며, Single은 속도와 효율성을 유지하고, Cascade는 첫 시도를 효율적인 모델에 맡기면서 강력한 추론 경로를 유지하며, Critique는 독립적인 관점을 추가합니다.
* 3가지 에이전트 코딩 벤치마크(TerminalBench 2.1, DeepSWE, CheckpointBench)에 대한 오프라인 평가에서 HydraFusion은 Claude Opus 5 대비 TerminalBench 2.1에서 4.9%p 향상된 품질을 보이면서도 67% 낮은 추정 비용을 기록했습니다.
* HydraFusion은 완전한 회계, 바운드 실행, 격리된 검토, 안전 장치 적용, 검증된 라우팅의 5가지 운영 원칙을 기반으로 구축되어 저장소 수준 작업에 대한 다중 모델 오케스트레이션을 실현합니다.
* GitHub Copilot CLI에서 연구 미리 보기로 제공되며, 개발자는 HydraFusion을 다른 모델과 동일하게 선택하고 HydraFusion은 성능, 비용, 지연 시간을 균형 있게 맞추는 워크플로를 선택합니다.

시사점

HydraFusion은 개발자가 각 작업에 가장 적합한 모델을 선택하는 것을 넘어, 런타임에 최적의 솔루션 구성을 동적으로 생성하는 차세대 코딩 에이전트의 가능성을 제시합니다.

원문 읽기 →
원문을 불러오는 중...

댓글

GitHub Discussions