EvoHarness-RL: 장기 지평 LLM 에이전트를 위한 자기 진화 런타임 하네스 학습
목차
개요
EvoHarness-RL은 장기 지평(long-horizon) LLM 에이전트가 외부 하네스(harness) 상태를 스스로 구성하고 사용하는 방법을 학습하도록 만드는 학습 가능한 조정 계층이다. University of Illinois Urbana-Champaign과 Meta AI 연구진이 2026년 8월 arXiv에 공개했다.
기존 에이전트는 메모리, 도구, 상태 추적기, 검증기, 실행 로그 같은 외부 실행 지원 요소를 갖추고 있지만, 그것을 언제 읽고 쓰고 정리할지는 대부분 프롬프트나 휴리스틱, 도메인별 관례로 수동 지정된다. 논문은 이 지점을 하네스 정책 학습(harness policy learning) 문제로 정의한다. 에이전트가 오프라인에서 하네스 정책을 학습한 뒤, 런타임 태스크 실행 중에 외부 하네스 상태를 온라인으로 구성하고 갱신하도록 하는 것이다.
핵심 설계는 이질적인 하네스 컴포넌트를 Belief, Progress, Experience(BPE)라는 세 가지 정책 대면(policy-facing) 상태로 통합하는 것이다. 학습은 두 단계로 이루어진다. 지도 하네스 파인튜닝(supervised harness fine-tuning)이 기본 모델에 하네스 액션 공간과 유용한 외부 상태 구성 방법을 가르치고, 비용 인식 GRPO(cost-aware GRPO)가 상호작용 예산 안에서 언제 외부 상태에 접근할지를 최적화한다.
Qwen3-8B 위에서 ALFWorld에 적용한 결과 seen 스플릿 96.9%, unseen 스플릿 86.6% 성공률을 기록했다. 동일 백본의 ReAct 베이스라인(47.9%) 대비 절대 49.0%p 향상이며, Claude Opus 4.5(96.4%) 수준에 도달한 수치다.
배경과 문제 정의
논문은 에이전트 실행을 뒷받침하는 런타임 계층 전체를 외부 하네스로 정의한다. 프롬프트, 도구, 검색 모듈, 메모리, 상태 추적기, 실행 피드백, 제어 흐름 메커니즘이 모두 여기에 포함된다.
장기 지평 실행에서 에이전트는 세 가지 실패 양상을 반복한다. 환경에서 현재 무엇이 참인지 놓치고, 이미 무엇을 했고 다음에 무엇을 해야 하는지 잊고, 이전 시도에서 재사용할 수 있었던 절차나 실수를 반복해서 재발견한다.
기존 연구는 이 문제를 두 방향에서 다뤘다. 하네스 엔지니어링 계열은 하네스 자체를 최적화한다. Harness-1은 탐색 상태를 환경 측 메모리로 외부화하고, Meta-Harness와 HarnessX는 오프라인 탐색과 트레이스 기반 적응으로 효과적인 하네스 구성을 발견한다. 자기 진화 에이전트 계열은 과거 궤적을 재사용 가능한 메모리, 워크플로, 스킬로 증류한다. Reflexion, Voyager, ReasoningBank, SkillOS 등이 여기 속한다.
그러나 두 계열 모두 하네스를 환경 측 구조물이나 프롬프트 타임 관례로 취급한다. 외부 컴포넌트가 아무리 잘 설계되어도, 그것을 언제 형성하고 접근하고 갱신하고 통합할지를 에이전트의 의사결정 과정 일부로 학습시키지는 않는다. 또한 기존 자기 진화 에이전트는 에피소드 간 스킬 큐레이션과 에피소드 내 실시간 상태 추적을 분리해서 다룬다.
EvoHarness-RL은 하네스 접근을 일급(first-class) 학습 대상 정책 결정으로 취급한다.
방법론
BPE 하네스 추상화
학습 가능한 하네스 인터페이스는 장기 지평 실행을 지원할 만큼 충분한 외부 상태를 노출하면서도, 정책 학습이 가능할 만큼 컴팩트해야 한다. 논문은 매 스텝 t에서 하네스가 다음 상태를 렌더링한다고 정의한다.
1
H_t = ( B_t , P_t , E_t )
각 컴포넌트의 역할은 다음과 같다.
| 컴포넌트 | 역할 | 저장 내용 |
|---|---|---|
| Belief (B_t) | 환경 추정치 | 객체 상태, 위치, 관계 등 상호작용에서 추론한 태스크 관련 사실 |
| Progress (P_t) | 실행 상태 | 서브골-상태 레코드로 표현된 태스크 분해와 실행 진행 상황 |
| Experience (E_t) | 에피소드 간 지식 | 스킬, 실패 양상, 탐색 사전 지식, 상위 수준 전략 |
Belief는 정책이 일시적인 컨텍스트 윈도우 메모리에만 의존하지 않도록 현재 환경에 대한 지속적 추정치를 제공한다. Progress는 무엇을 시도했고 무엇이 남았고 어디서 막혔는지를 외부화하여, 암묵적 추론 트레이스를 검사 가능한 태스크 상태로 바꾼다. Experience는 실행 중 관련 사전 경험을 제공하고 새 통찰을 저장해 이후 통합(consolidation)에 사용한다.
에이전트-하네스 액션 프로토콜
정책이 외부 워크스페이스를 읽고 쓰는 방식은 컴팩트한 메타 액션 집합으로 정의된다.
1
A_bpe = { track , commit , recall , note }
| 액션 | 대상 상태 | 동작 |
|---|---|---|
| track | Belief | 태스크 관련 믿음을 읽음 |
| commit | Progress | 서브골 또는 실행 갱신을 기록 |
| recall | Experience | 재사용 가능한 지식을 검색 |
| note | Experience | 새 통찰을 기록하여 이후 통합 대상으로 버퍼링 |
상호작용 중 정책은 환경 액션과 하네스 액션 양쪽에서 선택한다.
1
2
3
A = A_env ∪ A_bpe
a_t ~ π( · | o_t , H_t , c_t )
스텝 t에서 정책은 환경 관측 o_t, 렌더링된 하네스 상태 H_t, 태스크 컨텍스트 c_t를 받아 액션 a_t를 샘플링한다. 액션이 환경 액션이면 태스크 환경이 진행되고 새 관측이 반환된다. 하네스 액션이면 외부 워크스페이스를 조회하거나 갱신하고 새 하네스 뷰를 반환한다.
여기서 핵심은 두 액션 타입이 동일한 상호작용 예산을 소비한다는 점이다. 따라서 에이전트는 하네스 접근이 그 비용만큼 가치 있는 시점을 학습해야 한다.
ALFWorld 환경 어댑터
BPE는 고정된 내부 스키마가 아니라 기능적 인터페이스다. 환경 어댑터가 도메인별 신호를 일반 BPE 인터페이스에 연결한다. 어댑터는 관측, 액션 결과, 도구 출력, 검증기 피드백을 처리하고 내부 하네스 저장소를 유지하며, 선택된 뷰를 정책에게 렌더링한다. 내부 구현은 도메인별로 유지되고, 학습되는 조정 계층은 공유된다.
ALFWorld 인스턴스화는 다음과 같다.
Belief는 매 환경 스텝 이후 백그라운드에서 갱신되는 내부 월드 상태 저장소로 구현된다. 이 상태는 기본적으로 정책에 완전히 노출되지 않는다. 정책은 특정 객체를 조회하려면 track [object]를, 컴팩트한 전역 요약을 얻으려면 track [world]를 발행한다.
Progress는 커밋된 실행 기록으로 구현된다. ALFWorld에서는 대체로 순차적인 가사 태스크에 충분한 서브골-상태 엔트리의 경계 있는 리스트다. 정책은 commit [subgoal]로 현재 실행 단계를 외부화한다.
Experience는 에피소드 간 스킬 저장소로 구현되며, 일반 스킬, 태스크 특화 스킬, 흔한 실수, 객체-위치 탐색 사전 지식의 네 범주로 구성된다. 두 개의 서로 다른 시간 척도로 진화한다. 에피소드 내에서는 recall [query]가 관련 사전 지식을 검색하고 검색된 엔트리의 사용 횟수를 갱신하며, note [insight]가 새로 관찰된 교훈을 임시 노트 버퍼에 쓴다. 성공한 객체 탐색은 객체-위치 사전 지식을 온라인으로 갱신한다. 병렬 롤아웃 수집 중에는 배치 내에서 메인 스킬 저장소가 고정되고, 노트 버퍼와 완료 궤적 요약이 백그라운드에 누적된다. 에폭 경계에서 통합 모델이 이 증거들을 add, update, remove 연산으로 스킬 저장소에 병합한다.
2단계 학습 파이프라인
첫 단계는 지도 하네스 파인튜닝이다. 동일한 BPE 인터페이스로 수집한 성공 교사 궤적으로 정책을 부트스트랩한다. 매 스텝에서 교사는 태스크 목표, 현재 관측, 허용 환경 액션, 최근 히스토리, 활성 하네스 뷰를 보고 다음 액션 하나를 출력한다. 출력 형식은 think 태그와 action 태그로 구성되며, 액션은 ALFWorld 명령이거나 BPE 하네스 액션이다. 이 다음 액션 시연으로 Qwen3-8B를 파인튜닝하여 태스크 해결 행동과 track, commit, recall, note의 기본 의미론을 함께 가르친다.
두 번째 단계는 비용 인식 GRPO다. SFT 체크포인트에서 초기화하여 궤적 수준 보상으로 최적화한다.
1
2
R(τ) = R_succ(τ) + λ_eff · R_eff(τ) + λ_div(u) · R_div(τ)
- λ_spam · R_spam(τ) - λ_inv · R_inv(τ)
각 항은 태스크 성공, 효율 보너스, 액션 다양성, 스팸 페널티, 형식 페널티에 해당한다.
태스크 완료가 엄격한 게이트키퍼 역할을 한다.
1
2
3
R_succ(τ) = 10 · 1[solved]
R_eff(τ) = max( 0 , 1 - |τ| / T_max )
효율 보너스는 성공한 경우에만 부여되며, 이로써 중복 하네스 질의가 자연스럽게 페널티를 받는다.
정책이 하네스를 아예 무시하거나 무한 반복 루프에 빠지는 붕괴를 막기 위해 시간 의존 어휘 다양성 보너스를 도입한다.
1
2
3
R_div(τ) = |{ verb(a_t) : a_t ∈ τ }| / |τ|
λ_div(u) = ( λ_div^max / 2 ) · ( 1 + cos( π u / U ) )
여기서 u는 현재 RL 에폭, U는 어닐링 지평이다. 이 커리큘럼은 학습 초기에 하네스 액션의 폭넓은 탐색을 장려하고, 이후 완만히 감쇠하여 특화와 효율적 태스크 해결을 유도한다. R_spam과 R_inv는 퇴화된 반복과 잘못된 구문에 고정 페널티를 적용한다.
실험 설정
평가 환경은 ALFWorld다. ALFRED 임베디드 AI 벤치마크와 정렬된 텍스트 기반 게임으로, 에이전트는 텍스트 명령으로 방을 이동하고 객체를 조작해 다단계 가사 태스크를 완료해야 한다. 상태 추적 요구 수준이 서로 다른 여섯 개 태스크 계열을 대상으로 한다.
| 태스크 계열 | 내용 |
|---|---|
| Pick | 단순 집기-놓기 |
| Look | 조명 아래 객체 검사 |
| Clean | 놓기 전 세척 |
| Heat | 놓기 전 가열 |
| Cool | 놓기 전 냉각 |
| Pick2 | 객체 두 개 배치 |
메인 결과는 140개 태스크의 seen 스플릿 성공률로 보고한다.
SFT 데이터는 500개 ALFWorld 학습 게임에서 교사 모델을 동일한 BPE 액션 인터페이스로 실행해 수집했고, 성공 에피소드만 남겼다.
| 항목 | 값 |
|---|---|
| 유지된 궤적 수 | 87 |
| 다음 액션 대화 쌍 | 1,153 |
| 에피소드 평균 턴 수 | 26.5 |
| 태스크 분포 | pick-two 28, pick-place 17, clean 15, heat 11, light 8, cool 8 |
| 교사 하네스 호출 총량 | 405회, 전체 턴의 약 18% |
| 하네스 호출 분포 | commit 202, recall 114, note 55, track 34 |
주요 구현 및 학습 하이퍼파라미터는 다음과 같다.
| 설정 | 값 |
|---|---|
| 학습 대상 정책 모델 | Qwen3-8B |
| 교사 및 통합 모델 | Claude Opus |
| 최대 에피소드 스텝 T_max | 70 |
| Belief 추적기 | 규칙 기반 액션-관측 파서 |
| Belief 엣지 용량 | 48 |
| Progress 상한 | 서브골 8개 |
| recall top-k | 범주당 3 |
| Experience 범주당 용량 | 80 |
| 스킬 축출 정책 | 사용 횟수 기반 LFU |
| RL 알고리즘 | GRPO |
| 그룹 크기 G | 8 |
| 스텝당 프롬프트 수 | 16 |
| 스텝당 궤적 수 | 128 |
| 총 에폭 및 어닐링 지평 U | 150 |
| 옵티마이저 | AdamW |
| 학습률 | 1e-6 |
| KL 계수 β | 0.01 |
| 그래디언트 클리핑 | 1.0 |
| 최대 프롬프트 길이 | 12,288 토큰 |
| 최대 응답 길이 | 512 토큰 |
| 추론 엔진 | vLLM, TP=4 |
| 하드웨어 | NVIDIA H200 8장 |
| 성공 보상 스케일 | 10.0 |
| 효율 가중치 λ_eff | 1.0 |
| 최대 다양성 가중치 | 0.5 |
| 스팸 페널티 가중치 | 0.1 |
| 스팸 페널티 상한 | 10 |
| 무효 액션 페널티 λ_inv | 0.1 |
액션 파싱은 환경 래퍼가 담당한다. action 태그 내부 내용을 추출해 허용 ALFWorld 명령과 일치하면 환경에서 실행하고, 아니면 하네스 액션 패턴과 대조한다. 두 공간 어디에도 속하지 않거나 형식이 잘못된 출력은 실패 피드백을 반환하고 무효 액션 페널티로 집계된다. 베이스 트레이너의 내장 무효 액션 페널티는 비활성화하고 모든 보상 셰이핑을 자체 보상 함수에서 적용한다.
하네스 그라운딩은 가능한 한 경량 결정론적 컴포넌트로 구현했다. Belief 추적기는 LLM 호출 없이 액션-관측 쌍을 파싱하는 규칙 기반 파서다. Progress 추적기는 정책이 commit을 발행할 때만 갱신된다. Experience 저장소는 recall에 키워드 중첩 검색을 사용한다.
주요 결과
메인 결과
ALFWorld seen 스플릿 140개 태스크 성공률이다.
| 방법 | 백본 | Pick | Look | Clean | Heat | Cool | Pick2 | 평균 |
|---|---|---|---|---|---|---|---|---|
| ReAct | Claude Opus 4.5 | 100.0 | 92.3 | 96.3 | 100.0 | 88.0 | 100.0 | 96.4 |
| ReAct + EvoHarness-Base | Claude Opus 4.5 | 100.0 | 100.0 | 100.0 | 93.8 | 96.0 | 100.0 | 98.5 |
| ReAct | GPT-4.1 | 82.9 | 61.5 | 44.4 | 43.8 | 4.0 | 41.7 | 47.9 |
| ReAct + EvoHarness-Base | GPT-4.1 | 82.9 | 61.5 | 63.0 | 75.0 | 72.0 | 62.5 | 70.0 |
| ReAct | GPT-5 | 74.3 | 53.8 | 48.1 | 62.5 | 60.0 | 58.3 | 60.7 |
| ReAct + EvoHarness-Base | GPT-5 | 97.1 | 76.9 | 85.2 | 93.8 | 88.0 | 62.5 | 85.0 |
프롬프트 타임 BPE 하네스만 붙여도 GPT-4.1은 22.1%p, GPT-5는 25.7%p 상승한다. 이미 성능 상한에 근접한 Claude Opus 4.5도 96.4%에서 98.5%로 올라간다.
동일 백본(Qwen3-8B) 오픈소스 소형 모델 비교는 다음과 같다.
| 방법 | 백본 | Pick | Look | Clean | Heat | Cool | Pick2 | 평균 |
|---|---|---|---|---|---|---|---|---|
| ReAct | Qwen3-8B | 78.1 | 46.2 | 33.3 | 37.5 | 29.3 | 47.2 | 47.9 |
| ExpeL | Qwen3-8B | 91.4 | 76.9 | 14.8 | 43.8 | 28.0 | 45.8 | 49.3 |
| ReasoningBank | Qwen3-8B | 83.8 | 48.7 | 49.4 | 39.6 | 41.3 | 54.2 | 55.7 |
| MemP | Qwen3-8B | 80.0 | 43.6 | 24.7 | 33.3 | 38.7 | 48.6 | 49.7 |
| Dynamic Cheatsheet | Qwen3-8B | 88.6 | 53.8 | 29.6 | 37.5 | 20.0 | 66.7 | 52.1 |
| ACE | Qwen3-8B | 85.7 | 38.5 | 29.6 | 37.5 | 36.0 | 58.3 | 51.4 |
| SkillOS-base | Qwen3-8B | 79.0 | 41.0 | 45.7 | 37.5 | 38.7 | 55.6 | 53.1 |
| GRPO | Qwen3-8B | 87.5 | 71.4 | 72.7 | 70.0 | 48.1 | 43.5 | 65.6 |
| SkillOS | Qwen3-8B | 95.2 | 71.8 | 74.1 | 72.9 | 77.3 | 77.8 | 80.2 |
| SkillRL | Qwen2.5-7B | 97.9 | 71.4 | 90.0 | 90.0 | 95.5 | 87.5 | 89.9 |
| EvoHarness-Base | Qwen3-8B | 71.4 | 53.8 | 63.0 | 50.0 | 48.0 | 41.7 | 56.4 |
| EvoHarness-SFT | Qwen3-8B | 80.0 | 53.8 | 88.9 | 75.0 | 40.0 | 62.5 | 68.6 |
| EvoHarness-RL | Qwen3-8B | 100.0 | 92.9 | 95.5 | 100.0 | 92.6 | 100.0 | 96.9 |
EvoHarness-RL은 평균 96.9%로 ReAct 대비 절대 49.0%p 향상을 달성한다. 학습 가능한 강한 에이전트인 SkillOS(80.2%)와 SkillRL(89.9%)도 모두 앞선다. 프롬프트 타임 스캐폴딩 56.4%에서 SFT 68.6%, GRPO 96.9%로 이어지는 진행은 2단계 학습 파이프라인의 기여를 보여준다.
BPE 컴포넌트 제거 실험
고정된 Qwen3-8B의 추론 시점 하네스에서 컴포넌트를 하나씩 제거한 결과다.
| 변형 | 인터페이스 | Pick | Look | Clean | Heat | Cool | Pick2 | 평균 |
|---|---|---|---|---|---|---|---|---|
| EvoHarness-SFT | 전체 BPE, 지도 하네스 정책 | 80.0 | 53.8 | 88.9 | 75.0 | 40.0 | 62.5 | 68.6 |
| EvoHarness-RL | 전체 BPE, SFT 초기화 + GRPO | 100.0 | 92.9 | 95.5 | 100.0 | 92.6 | 100.0 | 96.9 |
| EvoHarness-Base | Belief + Progress + Experience | 71.4 | 53.8 | 63.0 | 50.0 | 48.0 | 41.7 | 56.4 |
| w/o Belief | 객체 및 상태 추적 제거 | 74.3 | 53.8 | 40.7 | 75.0 | 20.0 | 37.5 | 50.0 |
| w/o Progress | 서브골 및 진행 추적 제거 | 68.6 | 53.8 | 44.4 | 68.8 | 32.0 | 37.5 | 50.7 |
| w/o Experience | recall, note, 스킬 뱅크 제거 | 65.7 | 53.8 | 40.7 | 62.5 | 28.0 | 41.7 | 48.6 |
Belief를 제거하면 위치 파악과 상태 검증이 필요한 Clean(63.0에서 40.7)과 Cool(48.0에서 20.0)에서 큰 하락이 발생한다. Progress를 제거하면 종속 서브골이 있는 장기 태스크인 Pick2가 41.7에서 37.5로 떨어진다. Experience를 제거하면 전체 평균이 48.6%로 가장 낮아지고, Heat 같은 복잡한 상태 변경 태스크가 크게 영향받는다. 세 컴포넌트가 개별 메모리 기법이 아니라 통합 상태 인터페이스로 함께 기능한다는 근거다.
미지 환경 일반화
ALFWorld unseen 스플릿 결과다.
| 방법 | 변형 | Pick | Look | Clean | Heat | Cool | Pick2 | 평균 |
|---|---|---|---|---|---|---|---|---|
| ReAct | Qwen3-8B | 66.7 | 50.0 | 48.4 | 47.8 | 52.4 | 29.4 | 50.0 |
| EvoHarness-Base | 프롬프트 타임 하네스 | 83.3 | 38.9 | 87.1 | 91.3 | 90.5 | 58.8 | 77.6 |
| EvoHarness-SFT | 학습된 하네스 호출 | 70.8 | 66.7 | 80.6 | 69.6 | 47.6 | 76.5 | 69.4 |
| EvoHarness-RL | SFT 초기화 + GRPO | 70.8 | 94.4 | 87.1 | 87.0 | 95.2 | 88.2 | 86.6 |
주목할 점은 EvoHarness-SFT가 프롬프트 타임 하네스(77.6%)보다 낮은 69.4%로 떨어진다는 것이다. 논문은 지도 모방이 seen 궤적에서 교사의 하네스 사용 패턴을 배우지만, 새로운 환경에서 접근이 언제 가치 있는지를 최적화하지 않기 때문으로 해석한다. 반면 RL로 최적화한 전체 정책은 86.6%에 도달한다. 비용 인식 GRPO가 하네스 접근을 재보정하여 학습 환경을 암기하는 대신 폭넓게 유용한 전략을 학습한다는 것이다.
하네스 진화 동역학
하네스 어닐링
GRPO 학습 중 명확한 어닐링 패턴이 나타난다. SFT로 초기화된 에이전트는 하네스 호출을 빈번하게 사용하며 시작한다. BPE를 명시적 스캐폴드로 써서 상태를 추적하고 절차를 회상하며 탐색 공간을 좁힌다. RL이 진행되면서 사용량은 빠르게 감소하여 에피소드당 약 1회 호출 수준에서 안정화된다. GRPO가 반복되는 스캐폴드 행동을 정책 안으로 내재화하고, 기대 이익이 스텝 비용을 초과하는 경우에만 하네스 접근을 유지한다는 의미다.
액션별로 보면 감쇠 속도가 균일하지 않다.
| 하네스 액션 | 학습 중 추세 | 해석 |
|---|---|---|
| recall | 가장 오래 유지 | 에피소드 간 경험이 계속 유용한 탐색 사전 지식을 제공 |
| track | 중간 정도로 감소 | 초기 상태 명확화에 유용하나 직접 상호작용 패턴 학습 후 감소 |
| commit | 빠르게 0으로 감쇠 | 안정적 전략 형성 후 중간 계획을 매번 외부화할 필요가 없음 |
| note | 빠르게 0으로 감쇠 | 새 통찰을 자주 쓸 필요가 줄어듦 |
중요한 것은 이 감소가 정책 붕괴가 아니라는 점이다. 하네스 호출이 줄어드는 동안 성공률은 계속 상승한다. 또한 학습 보상 곡선에서 EvoHarness-RL은 표준 GRPO보다 더 빠르게 상승하고 더 높은 안정 지점에 도달한다.
논문은 이 액션 수준 패턴이 환경 의존적이라고 명시한다. ALFWorld는 재사용 가능한 가사 절차와 객체 탐색 사전 지식을 공유하므로 Experience의 가치가 특히 크다. 시각적으로 그라운딩된 임베디드 환경에서는 장면 그래프와 공간 관계 유지를 위해 Belief 의존도가 높아질 수 있다. 소프트웨어 엔지니어링이나 워크플로 환경에서는 서브태스크, 테스트 상태, 의존성 해소, 미완료 브랜치 추적을 위해 Progress가 더 중요해질 수 있다.
경험 저장소 진화
Belief와 Progress가 에피소드 내에서 갱신되는 반면, Experience는 에피소드를 가로질러 누적, 통합, 망각을 통해 재구성된다. 스킬 뱅크는 학습 초기에 일반 전략, 태스크 특화 절차, 흔한 실수, 탐색 우선순위로 빠르게 확장된다. 이후 성장은 선택적으로 바뀐다. 중복 엔트리는 병합되고, 거의 쓰이지 않는 스킬은 축출되며, 자주 회상되는 지식은 보존된다.
일반 스킬 범주는 학습 스텝이 진행되면서 0에서 21, 20을 거쳐 30, 27, 31, 29 수준으로 확장된 뒤 안정화된다. 태스크 특화 스킬은 5에서 8 부근, 흔한 실수는 3에서 5 사이, 탐색 우선순위는 3에서 11 부근에서 각각 수렴한다. 최종 뱅크는 컴팩트하면서도 다양성을 유지한다.
통합은 외부 요약 LLM이 수행한다. 버퍼링된 note는 Experience에 직접 기록되지 않는다. 통합 시점에 요약기가 최근 노트와 기존 스킬 뱅크의 압축 뷰를 받아, 노트별로 add, update, remove, skip 중 하나를 결정한다. 겹치는 경우 add보다 update를 선호하고, 노트가 기존 스킬을 명백히 무효화할 때만 remove를 사용하며, 객체-위치 매핑은 탐색 우선순위로 추출한다.
이 두 동역학은 상보적이다. 정책은 외부 상태를 언제 사용할지 학습하고, 하네스는 어떤 재사용 가능한 경험을 제공할지 진화한다.
정성적 사례 분석
논문은 주전자를 세척해 식탁에 놓는 ALFWorld 태스크를 사례로 제시한다. 결과는 30턴 만에 성공이며, commit에서 recall, act, note로 이어지는 루프를 보여준다.
에이전트는 먼저 commit [find kettle]로 첫 서브골을 등록한다. 이어 recall [how to do clean task]와 recall [where to find kettle]로 절차와 객체 위치 사전 지식을 검색한다. 반환된 힌트는 주전자가 countertop에 있다는 것이었다.
그러나 countertop 1과 countertop 2는 모두 비어 있었다. 에이전트는 같은 위치를 반복 탐색하지 말라는 스킬을 따라 루프에 빠지지 않고, 주전자가 스토브버너에 있는 경우가 많다는 사전 지식으로 전환한다. stoveburner 3에서 주전자를 발견한다.
발견 직후 에이전트는 note [kettle found at stoveburner 3; recalled hint said countertop]을 기록한다. 회상된 힌트를 맹목적으로 따르는 대신 현재 궤적을 교정 증거로 사용한 것이다. 이후 commit [clean kettle with sinkbasin]을 거쳐 세척과 배치를 완료한다.
이 사례는 하네스가 고정된 오라클이 아니라 재사용 가능하되 수정 가능한 경험의 원천으로 사용된다는 점을 보여준다.
한계와 주의사항
논문에는 별도의 Limitations 절이 없으나, 본문과 부록에서 명시한 제약과 주의사항은 다음과 같다.
첫째, 실험 범위가 ALFWorld 단일 환경에 한정된다. 논문이 제시하는 BPE 인터페이스는 일반적이지만, 정량 검증은 텍스트 기반 가사 태스크 여섯 계열에서만 수행되었다. GUI, 코딩, 웹 내비게이션 등 다른 도메인으로의 전이는 실증되지 않았다.
둘째, 학습된 하네스 액션 분포는 보편적이지 않다. 논문은 EvoHarness-RL이 고정된 범용 하네스 액션 분포를 학습하는 것으로 해석되어서는 안 된다고 명시한다. 주어진 환경의 비용 구조와 상태 요구에 따라 BPE 중 어느 부분에 접근할 가치가 있는지를 학습할 뿐이다.
셋째, 지도 파인튜닝만으로는 일반화가 오히려 후퇴할 수 있다. unseen 스플릿에서 EvoHarness-SFT(69.4%)는 프롬프트 타임 하네스(77.6%)보다 낮았다. 교사의 하네스 사용 패턴을 모방하는 것만으로는 새로운 환경에서 접근 시점을 판단하지 못한다.
넷째, 파이프라인이 외부 프론티어 모델에 의존한다. SFT 교사와 경험 저장소 통합 모델 모두 Claude Opus를 사용한다. 정책 자체는 Qwen3-8B이지만, 초기 스킬 뱅크와 에폭 경계 통합 품질은 외부 모델 성능에 좌우된다.
다섯째, 하네스 구현이 경량 결정론적 컴포넌트에 의존한다. Belief 추적기는 규칙 기반 파서이고 Experience 검색은 키워드 중첩 방식이다. 관측이 더 복잡하거나 의미 검색이 필요한 환경에서는 이 구현이 그대로 통하지 않을 수 있다.
여섯째, 용량 제약이 존재한다. Belief 엣지 48개, Progress 서브골 8개, Experience 범주당 80개로 경계가 지정되어 있고 LFU로 축출된다. 더 긴 지평이나 더 복잡한 태스크에서는 이 상한 자체가 병목이 될 수 있다.
결론
EvoHarness-RL은 장기 지평 에이전트가 외부 하네스 상태를 구성하고 사용하는 방법을 학습하는 조정 계층이다. 워크스페이스를 Belief, Progress, Experience로 조직하고 언제 조회, 갱신, 통합할지를 최적화함으로써, 하네스 사용을 수동 프롬프팅 관례에서 학습된 런타임 정책 결정으로 전환한다.
ALFWorld 결과는 비용 인식 에이전트-하네스 조정이 태스크 성공률을 높이고 두 가지 유용한 동역학을 드러낸다는 것을 보여준다. 하네스 어닐링은 학습이 반복되는 하네스 사용 패턴을 모델 정책에 내재화하여 빈번한 호출에서 선택적 외부 상태 접근으로 이동시키는 현상이다. 하네스 진화는 진행 상황 갱신과 경험 통합이 하네스를 컴팩트하고 태스크 적응적인 상태 기반으로 다듬는 현상이다.
이 결과는 장기 지평 에이전트가 단순히 더 강한 도구나 더 큰 메모리를 추가하는 것을 넘어, 외부 하네스 워크스페이스를 구성하고 조정하는 학습 가능한 정책에서 이득을 얻는다는 점을 시사한다.