🤖
중급 인공지능 📄 논문 ⭐⭐⭐☆☆

OpenForgeRL: 어떤 환경에서든 하네스 기반 AI 에이전트를 훈련시키는 개방형 프레임워크

OpenForgeRL: Train Harness-native Agents in Any Environment

💡 OpenForgeRL은 복잡한 AI 에이전트의 훈련을 쉽게 해주는 오픈소스 프레임워크입니다. 이 프레임워크는 에이전트가 실제 환경에서 작동하는 방식 그대로 훈련 데이터를 수집하고, 대규모 훈련을 가능하게 하여 기존 방식보다 더 효율적이고 강력한 에이전트를 만들 수 있도록 돕습니다.

핵심 요약

  • 무엇을 · 이 연구는 복잡한 추론 하네스(예: Claude Code, Codex)를 사용하는 AI 에이전트를 다양한 환경에서 처음부터 끝까지 훈련시키기 위한 오픈소스 프레임워크인 OpenForgeRL을 제안합니다.
  • 어떻게 · OpenForgeRL은 하네스의 모델 호출을 기록하여 표준 강화 학습(RL) 코드베이스(예: veRL)의 훈련 데이터로 활용하는 경량 프록시와, 각 롤아웃을 원격 컨테이너에서 실행하는 쿠버네티스 오케스트레이터를 사용합니다. 이를 통해 훈련과 추론 과정을 분리하여 어떤 하네스든 어떤 환경에서든 대규모 훈련이 가능하게 합니다.
  • 결과 · OpenForgeRL은 도구/클로 기반 에이전트와 멀티모달 GUI 브라우저/컴퓨터 사용 에이전트 등 다양한 하네스와 환경에서 검증되었습니다. OpenForgeClaw는 ClawEval 및 QwenClawBench에서 높은 성능을 보였고, OpenForgeGUI는 OSWorld-Verified, Online-Mind2Web, WebVoyager에서 우수한 성능을 달성했습니다. 이는 비슷한 크기의 오픈소스 기준선보다 뛰어나며, 일부 GUI 설정에서는 훨씬 큰 모델과 동등하거나 능가하는 결과를 보여주었습니다. 또한, 강화 학습이 에이전트의 신뢰성(자체 검증, 도구 활용, 다단계 계획 완료)을 향상시키지만, 오류 복구와 같은 중요한 능력은 여전히 약하다는 것을 발견했습니다.

왜 중요한가

기존에는 복잡한 추론 하네스를 사용하는 AI 에이전트를 처음부터 끝까지 훈련시키는 것이 어려웠습니다. OpenForgeRL은 이러한 문제를 해결하여 연구자들이 에이전트가 실제로 배포될 하네스와 환경에서 직접 훈련하고 개선할 수 있도록 돕습니다. 이는 AI 에이전트 개발의 효율성과 성능을 크게 향상시킬 수 있습니다.

실생활·산업 영향

이 프레임워크는 실제 환경에서 더 강력하고 신뢰할 수 있는 AI 에이전트를 개발하는 데 기여할 수 있습니다. 예를 들어, 복잡한 도구 사용 에이전트, 웹 브라우징 에이전트, 컴퓨터 사용 에이전트 등의 개발을 가속화하여 다양한 산업 분야에서 AI의 활용도를 높일 수 있습니다.

한계·주의

연구 결과에 따르면, 강화 학습이 에이전트의 신뢰성을 높이지만, 오류 복구와 같은 중요한 능력은 여전히 약점으로 남아있습니다. 또한, 일부 하네스는 다른 하네스보다 학습하기 훨씬 어렵다는 점도 한계로 지적됩니다.

#강화 학습#AI 에이전트#오픈소스 프레임워크
arXiv 원문 보기 → Xiao Yu, Baolin Peng, Ruize Xu 외 · 2026-07-23 · arXiv:2607.21557
이 요약이 유용했나요?

※ 이 요약은 AI 보조로 생성하고 사람이 검수했습니다. 난이도·실생활 영향·톤은 본 사이트의 편집 의견이며, 정확한 내용은 반드시 원문(arXiv)을 확인하세요. 번역은 AI 기반으로 오역 가능성이 있습니다. 출처: arXiv (2607.21557).

← 테크랩 전체 보기