포스트

Agentic RL에서 추론과 도구 사용은 경쟁한다: 간섭 정량화에서 DART까지

목차

  1. 개요
  2. 배경과 문제 제기
  3. 방법론
  4. 실험 설정
  5. 주요 결과
  6. 한계와 주의사항
  7. 결론
  8. Reference

개요

Agentic Reinforcement Learning(ARL)은 LLM이 추론(reasoning)과 외부 도구 실행(tool-use)을 번갈아 수행하도록 학습시키는 post-training 방식이다. Search-R1을 포함한 대부분의 기존 ARL 방법은 하나의 파라미터 집합으로 두 능력을 동시에 학습시키며, 공동 학습이 전체 에이전트 성능을 향상시킨다고 암묵적으로 가정한다. 이 논문은 그 가정을 실증적으로 검증하고, 두 능력이 실제로는 서로 간섭한다는 것을 보인다.

저자들은 Capability Effect Attribution(CEA)이라는 진단 프레임워크를 도입해 에이전트의 정답률을 개별 능력 효과와 쌍별 상호작용 항으로 분해한다. 분석 결과 추론과 도구 사용 사이의 상호작용 계수가 대부분의 질문에서 음수로 나타났고, 그 원인은 두 토큰 유형의 그래디언트가 거의 직교한다는 데 있었다. 이를 해소하기 위해 제안된 DART(Disentangled Action-Reasoning Tuning)는 사전학습 백본을 동결하고 추론용 LoRA와 도구 사용용 LoRA를 분리해 각 토큰이 자기 어댑터만 갱신하도록 한다. 검색 증강 QA 7종과 NL2SQL 6종, 총 13개 벤치마크에서 DART는 모든 공동 최적화 베이스라인을 상회했고 2-Agent 상한선에 근접했다.

논문 저자는 Renmin University of China와 Bytedance 소속 연구진이며, 코드는 liyu199809/DART로 공개되어 있다.

배경과 문제 제기

Agentic RL의 공유 파라미터 가정

ARL의 목표는 강력한 추론 능력을 유지하면서 외부 도구를 안정적으로 실행하는 모델을 학습시키는 것이다. GRPO 계열을 포함한 대부분의 ARL 패러다임은 단일 목적 함수와 공유 파라미터로 이 두 이질적인 능력을 함께 최적화한다. 이 설계는 도구 실행과 논리적 추론이 같은 파라미터 공간 안에 무리 없이 수용될 수 있다는 가정에 기반한다.

서로 다른 도메인 사이의 최적화 간섭은 선행 연구에서 보고된 바 있다. 그러나 하나의 에이전트 도메인 안에서 이질적인 능력끼리도 간섭하는지는 거의 탐구되지 않았다. 이 논문의 중심 질문이 바로 그것이다.

기존 연구와의 차이

도구 사용 ARL 연구는 창발 행동을 유도하는 보상 설계, 정밀한 action interleaving을 위한 정책 개선, 대규모 궤적 합성 등으로 파이프라인의 여러 구성 요소를 개선해왔다. 그러나 공동 최적화 하에서 추론과 도구 사용이 서로 간섭하는지를 검토한 연구는 없었다.

Multi-LoRA 계열은 MoE 패러다임을 따라 소프트 라우터로 여러 어댑터를 혼합하거나 어댑터를 조합해 도메인 간 일반화를 노린다. 이들은 용량 증대나 다중 도메인 전이가 목적이므로, 단일 도메인 내 이질 능력 간 최적화 간섭을 막는 문제와는 다르다. 게다가 소프트 혼합은 각 토큰의 그래디언트를 모든 어댑터로 흘려보내기 때문에 어댑터 사이의 상호작용이 남는다. DART는 결정론적 하드 라우터를 써서 각 토큰이 정확히 하나의 어댑터만 갱신하게 한다.

방법론

Capability Effect Attribution

CEA는 모델의 기대 정답률을 개별 능력 효과와 쌍별 상호작용 항으로 귀속시키는 진단 프레임워크다. 에이전트의 능력은 세 개의 이진 지시자로 표현된다. base를 x1, tool-use를 x2, reasoning을 x3로 두고, 해당 능력이 존재하면 1, 아니면 0이다. 쌍별 상호작용 지시자 xij는 능력 i와 j가 공동으로 최적화되었을 때 1이 된다.

따라서 각 모델 M은 6차원 이진 벡터를 갖는다.

1
x^M = [x1, x2, x3, x12, x13, x23] ∈ {0, 1}^6

질문 q에 대한 모델 M의 기대 정답률 s는 다음과 같이 표현된다.

1
2
s_q^M = σ(x^M · β_q)
β_q = [β1_q, β2_q, β3_q, β12_q, β13_q, β23_q]

여기서 σ는 sigmoid 함수이고 β는 질문별 주효과와 상호작용 효과다. 상호작용 계수의 부호가 곧 진단 결과가 된다. βij가 양수면 두 능력 사이의 시너지를, 음수면 간섭을 의미한다. 결국 추론과 도구 사용의 간섭 여부는 β23의 부호를 확인하는 문제로 환원된다.

CEA는 샘플 전체에 공유 계수를 적합시키는 예측 회귀와 달리 질문별 귀속을 수행한다. 능력 지시자가 이산적이고 유한하기 때문에 x·β 형태의 내적이 해당 구성들에 대한 임의의 확률 배정을 정확히 표현할 수 있다. 논문은 부록 A에서 임의 함수 f(x1, x2, x3)가 주효과와 2차 상호작용 항으로 정확히 분해되며 3차 항 x1x2x3의 효과가 0에 가깝다는 통계학의 표준 결과를 근거로 든다.

β를 구하기 위해 양변에 logit 변환을 적용하면 선형 시스템이 된다.

1
2
z_q^Mk = log( s_q^Mk / (1 - s_q^Mk) ) = x^Mk · β_q
z_q = X β_q

설계 행렬 X의 k번째 행은 모델 Mk의 지시자 벡터이고, k번째 성분은 해당 모델의 기대 정답률이다. β가 6차원이므로 선형 독립인 6개의 모델 변형만 확보하면 유일하게 결정된다.

통제된 모델 변형 6종 구성

핵심 난점은 데이터, 아키텍처, 하이퍼파라미터를 고정한 채 서로 다른 능력 구성을 실현하는 모델을 만드는 것이다. 저자들의 착안은 서로 다른 능력이 학습 중 서로소인 토큰 부분집합의 그래디언트에 담긴다는 점이다.

역할 기반 라우터 함수는 궤적의 각 토큰을 추론과 도구 사용 중 하나로 배정한다.

1
2
ψ(t) = a,  if c_<t is in a tool-call span
        r,  otherwise

이 배정은 완전히 결정론적이며 <search> 같은 특수 토큰이 도구 호출 구간의 시작을 표시한다.

정책 그래디언트에 이진 마스크를 곱해 토큰별 기여를 게이팅한다.

1
∇J(θ) ≈ E[ Σ_t ∇log π(c_t | c_<t) A(τ) m_t ]

여기서 m_t는 0 또는 1이며, 인덱스는 추론 집합 T_reas와 도구 사용 집합 T_tool로 분할된다.

학습으로 유도되는 모델 4종은 다음과 같다.

모델학습 방식지시자 벡터
MBase사전학습 모델 그대로1, 0, 0, 0, 0, 0
MReas추론 토큰 그래디언트만 유지1, 0, 1, 0, 1, 0
MTool도구 사용 토큰 그래디언트만 유지1, 1, 0, 1, 0, 0
MUnified표준 ARL 목적 함수, 모든 토큰 사용1, 1, 1, 1, 1, 1

단일 능력 모델에서도 유지된 능력의 그래디언트는 여전히 공유 base 파라미터를 갱신하므로 base와 해당 능력은 공동 최적화된 것으로 간주된다. 그래서 x1j 항이 1이 된다.

학습 시점 통제만으로는 6개 중 4개 구성밖에 만들지 못한다. 나머지 2개는 추론 시점 라우팅으로 채운다. 서로 다른 토큰 유형을 별도로 학습된 모델에 보내면 파라미터 수준의 상호작용이 전혀 발생하지 않는다.

모델구성지시자 벡터
HTool추론 토큰은 MBase, 도구 토큰은 MTool1, 1, 0, 0, 0, 0
HReas추론 토큰은 MReas, 도구 토큰은 MBase1, 0, 1, 0, 0, 0

이렇게 6행이 모두 선형 독립인 설계 행렬을 얻어 β의 식별 가능성을 보장한다.

그래디언트 정렬 분석

CEA는 간섭이 어디에 얼마나 존재하는지는 알려주지만 왜 발생하는지는 설명하지 못한다. 저자들은 원인 후보로 그래디언트를 지목하고 토큰 유형별 그래디언트의 각도 정렬을 측정했다.

각 질의마다 현재 정책에서 16개의 rollout을 샘플링하고, 토큰 역할별로 별도의 backward pass를 수행해 그래디언트를 추출한다. 누적 효과를 피하기 위해 pass 사이에 그래디언트를 명시적으로 0으로 초기화한다. 같은 궤적 안에서 서로 다른 유형 사이의 평균 각도를 측정하고, 서로 다른 궤적에서 같은 유형끼리의 평균 각도를 기준선으로 삼는다.

각도는 전체 파라미터에 대해 평탄화한 두 그래디언트 벡터의 코사인 유사도에서 계산한다.

1
2
cos(g1, g2) = (g1 · g2) / (||g1||_2 ||g2||_2)
θ(g1, g2) = arccos( cos(g1, g2) )

측정 결과 같은 유형끼리의 각도는 작았지만, 추론과 도구 사용 사이의 그래디언트는 거의 직교했다. 직교한다는 것은 두 능력이 서로 다른 갱신 방향을 요구한다는 뜻이다. 따라서 두 그래디언트를 평균 내면 어느 쪽에도 최적이 아닌 절충 방향으로 파라미터가 갱신된다.

7B 모델은 3B 모델보다 같은 역할 그래디언트의 분포가 더 분산되어 있었다. 저자들은 파라미터가 많을수록 같은 능력에 대해서도 더 넓은 범위의 그래디언트 방향을 허용하기 때문이라고 해석한다. 다른 학습 스텝에서 반복해도 유사한 패턴이 관측되어, 특정 체크포인트에만 나타나는 현상이 아님을 확인했다.

DART: Disentangled Action-Reasoning Tuning

분석이 시사하는 설계 원칙은 명확하다. 두 능력은 분리된 파라미터 부분공간을 갱신해야 한다. 두 개의 독립 모델을 쓰는 2-Agent 시스템은 이 격리를 달성하지만 시스템 복잡도가 커진다.

DART는 단일 모델 안에서 그래디언트 격리를 달성한다. 사전학습 백본 가중치 W를 동결하고 두 개의 서로소인 LoRA 어댑터를 붙인다. 추론용 어댑터는 {Br, Ar}, 도구 사용용 어댑터는 {Ba, Aa}다. W를 동결하는 것은 필수인데, W도 학습되면 두 어댑터의 그래디언트가 같은 백본으로 흘러 들어가 제거하려던 간섭이 되살아나기 때문이다.

각 디코딩 스텝 t에서 라우터 ψ(t)가 활성 어댑터 u_t를 결정하고 forward pass는 다음과 같이 계산된다.

1
h'_t = W h_t + B_{u_t} A_{u_t} h_t

각 토큰이 자기 능력 유형에 대응하는 어댑터만 활성화하므로 두 파라미터 집합은 독립적으로 갱신된다. 두 어댑터의 교집합이 공집합이고 W가 동결되어 있으므로 두 토큰 유형 모두로부터 그래디언트를 받는 학습 파라미터는 존재하지 않는다.

라우팅 신뢰성을 위해 어휘 사전을 확장해 각 sentinel 토큰을 하나의 원자적 항목으로 만들었다. 모델이 라우팅 신호를 문자 단위로 조립하는 대신 분해 불가능한 단위로 예측하게 하기 위함이다. 라우터를 규칙 기반으로 유지한 것은 라우터 자체에서 추가 학습 신호가 생기지 않게 해서, 이후 실험의 개선분을 순수하게 그래디언트 분리 효과로 귀속시키기 위한 설계다.

W 동결이 표현 용량을 제한한다는 우려에 대해서는 두 가지 근거를 든다. RL 기반 튜닝은 주로 파라미터의 희소한 부분집합만 갱신한다는 최근 연구 결과가 있다. 또한 ARL이 사용하는 결과 기반 보상은 rollout당 최대 1비트의 정보만 전달하므로 스텝당 유효 학습 신호가 극히 희소하며, 이 조건에서는 LoRA 어댑터가 전체 파라미터 RL 튜닝과 대등한 성능을 낸다는 보고가 있다.

실험 설정

학습 알고리즘과 하이퍼파라미터

GRPO 학습은 Verl 구현을 따랐고 백본은 Qwen2.5 계열이다. 검색 증강 QA에서는 E5 retriever와 2018년 Wikipedia dump를 코퍼스로 통합했다. NL2SQL에서는 SkyRL-SQL 학습 세트와 Qwen2.5-7B-Coder를 사용하고 에이전트가 SQLite 실행 엔진을 도구로 호출한다.

항목설정
GPUNVIDIA A800 8장 클러스터
학습 스텝100 optimization steps
learning rate warmup ratio0.1
rollout batch size256
gradient batch size64
temperature1.0
top-p1.0
learning rate1e-6
KL divergence 계수0.001
clipping ratio0.2
최대 action budget B4
검색 시 사용 passage상위 3개

LoRA를 사용하는 모든 변형은 선행 가이드에 따라 learning rate를 10배로 스케일했다. 학습 효율을 위해 gradient checkpointing, FSDP offloading, vLLM 기반 rollout을 활성화했다. 체크포인트는 20스텝마다 저장하고, 학습이 발산하면 보상 곡선 기준 최근 안정 체크포인트를, 그렇지 않으면 최종 체크포인트를 평가에 사용했다.

CEA 실험에서는 모델과 질문 쌍마다 50개의 독립 응답으로 정답률을 추정했다. 6개 변형 모두가 정답을 한 번도 내지 못한 질문은 logit 값이 경계 아티팩트에 지배되므로 수치 안정성을 위해 제외했다. 확장 분석은 각 데이터셋 테스트 세트의 앞 1,000개 샘플로 평가했다.

그래디언트 분석은 FlashAttention2와 gradient checkpointing을 켜고 bfloat16 정밀도로 수행했다. 프롬프트와 응답의 최대 길이는 각각 4096 토큰이다. 그래디언트 기하 구조를 왜곡하지 않기 위해 gradient clipping은 기본적으로 비활성화했다.

데이터셋과 보상 함수

General QA는 NQ, TriviaQA, PopQA로 단일 스텝 사실 질의를 다룬다. Multi-Hop QA는 HotpotQA, 2WikiMultiHopQA, Musique, Bamboogle로 다중 문서 추론을 요구한다. 학습은 NQ와 HotpotQA 스플릿을 병합해 진행하고 7개 벤치마크 전체에서 평가하며 Exact Match(EM)를 보고한다.

NL2SQL 평가는 BIRD-Dev, SPIDER-1.0, SPIDER-DK, SPIDER-Realistic, SPIDER-Syn에서 실행 정확도(EX)로 측정한다.

보상은 중간 보상이나 형식 보상 없이 최종 출력의 정확성만 평가하는 규칙 기반 결과 보상이다.

1
2
3
4
r_qa(x, y) = EM(a_pred, a_gold)

R_sql(x, y) =  1  if match(y, y_g)
              -1  otherwise

NL2SQL의 일치 판정은 SQL 문자열이 아니라 실행 결과 집합을 비교해 결정한다.

토큰 역할은 두 태스크 모두에서 상호 배타적이며 궤적의 모든 비프롬프트 토큰을 덮는다. QA에서는 <think> 블록 내부가 추론 토큰, <search> 블록 내부가 도구 사용 토큰이다. NL2SQL에서는 <think> 블록이 추론 토큰, <sql> 블록이 도구 사용 토큰이다.

비교 대상

공동 최적화 ARL 베이스라인은 Search-R1-GRPO로, 추론과 도구 사용이 모든 학습 파라미터를 공유한다. 소프트 라우팅 Multi-LoRA 베이스라인은 MixLoRA로, 학습된 라우팅으로 여러 LoRA 전문가를 혼합해 능력 간 그래디언트를 부분적으로 섞는다. 그 밖에 Direct Inference, CoT, Rejection Sampling, IRCoT, RAG, SFT, R1 변형들을 비교했다.

모든 방법은 동일한 학습 데이터, 베이스 모델, 프롬프트 템플릿, 도구 인터페이스, RL 하이퍼파라미터를 공유한다. 차이는 오직 능력 분리의 정도와 방식뿐이다.

주요 결과

간섭의 정량적 증거

질문별 상호작용 계수 분포를 보면 base와 개별 능력 사이의 상호작용 계수 β12, β13은 대부분 양수였다. 어느 한 능력만 추가해도 base 모델은 개선된다는 뜻이다. 반면 추론과 도구 사용 사이의 β23은 대부분의 질문에서 음수로 나타났다. 두 능력의 공동 최적화가 음의 상호작용을 유발한다는 직접적인 증거다.

정확도별 분포는 더 구체적인 양상을 보여준다. 간섭은 각 능력 하나만으로도 풀 수 있는 고정확도 질문에 집중되었다. 반대로 시너지는 두 능력을 모두 요구하지만 간섭 때문에 여전히 정확도가 낮은 질문에 집중되었다.

이 분석을 PopQA와 TriviaQA로, 그리고 Qwen2.5-3B, Qwen2.5-7B, Llama3.1-8B로 확장해도 β23은 모든 데이터셋과 모델 조합에서 일관되게 음수가 지배적이었다. 또한 7B 모델의 시너지 그룹이 3B 모델보다 높은 정확도를 보였는데, 이는 더 강한 base 용량을 반영한 결과다. 태스크와 아키텍처를 가로지르는 이 일관성은 CEA가 포착한 간섭이 특정 모델이나 데이터셋의 아티팩트가 아니라 ARL의 일반적 속성임을 시사한다.

Retrieval-Augmented QA 벤치마크

Qwen2.5-3B 백본에서의 General QA 결과다.

MethodNQTriviaQAPopQAGen-Avg
Direct Inference0.1060.2880.1080.167
CoT0.0230.0320.0050.020
IRCoT0.1110.3120.2000.208
RAG0.3480.5440.3870.426
SFT0.2490.2920.1040.215
R1-base0.2260.4550.1730.285
R1-instruct0.2100.4490.1710.277
Rejection Sampling0.2940.4880.3320.371
Search-R1 (3B-Instruct)0.3970.5650.3910.451
MixLoRA (3B-Instruct)0.4310.5780.4190.476
DART (3B-Instruct)0.4510.6020.4760.510
Search-R1 (3B-Base)0.4400.5820.4130.478
MixLoRA (3B-Base)0.4270.5950.4430.488
DART (3B-Base)0.4570.6050.4780.513

같은 백본에서의 Multi-Hop QA 결과다.

MethodHotpotQA2WikiMusiqueBamboogleMH-AvgAvg
RAG0.2550.2260.0470.0800.1520.270
Rejection Sampling0.2400.2330.0590.2100.1860.265
Search-R1 (3B-Instruct)0.3310.3100.1240.2320.2490.336
MixLoRA (3B-Instruct)0.3460.3480.1250.2880.2770.362
DART (3B-Instruct)0.3920.3760.1430.3520.3160.399
Search-R1 (3B-Base)0.2650.2440.0610.1130.1710.303
MixLoRA (3B-Base)0.2920.2820.0630.1760.2030.325
DART (3B-Base)0.3990.3890.1550.3520.3240.405

Qwen2.5-3B-Base 기준으로 DART의 전체 평균은 0.405로 Search-R1의 0.303 대비 10.2 포인트 높다. Multi-Hop 평균에서 격차가 특히 크며, Bamboogle에서는 0.113에서 0.352로 뛴다. 3B-Instruct에서도 DART 0.399 대 Search-R1 0.336으로 6.3 포인트 앞선다.

MixLoRA의 소프트 라우팅은 모든 설정에서 DART에 미치지 못했다. 부분적인 그래디언트 분리로는 충분하지 않고, 하드 토큰 수준 라우팅을 통한 완전한 격리가 필요하다는 뜻이다.

모델 규모와 아키텍처 확장

Qwen2.5-7B와 Llama3.1-8B에서의 전체 평균 비교다.

BackboneMethodGen-AvgMH-AvgAvg
Qwen2.5-7B-InstructSearch-R10.4930.3240.396
Qwen2.5-7B-InstructMixLoRA0.5010.3150.395
Qwen2.5-7B-InstructDART0.5380.3300.420
Qwen2.5-7B-BaseSearch-R10.4480.2770.350
Qwen2.5-7B-BaseMixLoRA0.5090.3230.402
Qwen2.5-7B-BaseDART0.5390.3230.416
Llama3.1-8B-InstructSearch-R10.5430.3680.443
Llama3.1-8B-InstructMixLoRA0.5370.3750.444
Llama3.1-8B-InstructDART0.5610.3920.464

더 크고 새로운 계열인 Qwen3-14B-Base에서도 3개 시드 평균과 표준편차로 검증했다.

MethodNQHotpotQA2WikiPopQAAvg
Search-R10.499 ± 0.0060.463 ± 0.0070.453 ± 0.0120.504 ± 0.0090.480
MixLoRA0.489 ± 0.0110.450 ± 0.0060.443 ± 0.0080.505 ± 0.0140.472
DART0.515 ± 0.0150.479 ± 0.0110.471 ± 0.0050.523 ± 0.0080.497

14B 규모에서도 3B, 7B, 8B에서 관측된 패턴이 그대로 유지된다. 모든 방법이 7B 대비 향상되지만, Search-R1과 MixLoRA는 여전히 비슷한 수준에 머물고 DART가 모든 벤치마크에서 앞선다.

NL2SQL 벤치마크

SkyRL-SQL 학습 데이터와 Qwen2.5-7B-Coder 백본으로 실행 정확도(EX)를 측정했다.

MethodBIRD-DevSpider-DevSpider-DKSpider-RealisticSpider-SynSpider-TestAvg
Sky-SQL0.49120.80850.71210.76110.69250.82810.7156
LoRA0.48440.80750.71590.75980.70210.82770.7162
MixLoRA0.47350.78210.68200.75210.68220.78230.6924
2-Agent0.52710.81620.70840.78940.71080.83140.7306
DART0.52150.82510.71440.78150.71370.82910.7309

DART는 단일 모델 중 최고 성능을 기록했고 평균 0.7309로 자원 소모가 큰 2-Agent의 0.7306을 미세하게 상회한다. Sky-SQL 베이스라인은 6개 벤치마크 전부에서 앞섰다.

MixLoRA의 성능 저하는 QA보다 NL2SQL에서 더 심각했다. 저자들은 추론 토큰(자연어)과 도구 사용 토큰(형식 SQL) 사이의 모달리티 격차가 더 크기 때문이라고 해석한다. 소프트 라우팅은 모든 어댑터가 양쪽 모달리티의 그래디언트를 흡수하도록 강제하므로, 두 토큰 분포가 크게 갈라질수록 간섭이 증폭된다.

메커니즘 분석

간섭이 두 능력 각각을 실제로 손상시키는지 확인하기 위해 검색 컨텍스트를 고정한 실험을 수행했다. DART와 Search-R1에 동일한 검색 결과(Search-R1의 rollout에서 수집)를 주입하면 성능 차이는 추론 능력에만 귀속된다.

BackboneBenchmarkSearch-R1 EMDART EM
Qwen2.5-3B-BaseNQ44.044.6
Qwen2.5-3B-BaseHotpotQA26.537.6
Qwen2.5-7B-BaseNQ39.546.0
Qwen2.5-7B-BaseHotpotQA32.640.9

동일한 근거 문서를 받았을 때도 DART가 일관되게 더 높은 EM을 기록했다. 공동 최적화가 추론 학습을 저해하며 DART가 이를 완화한다는 것을 확인한 결과다. 반대로 추론 트레이스를 고정하고 검색 정확도를 비교한 실험에서도 DART가 NQ와 HotpotQA 모두에서, 3B와 7B 모두에서 Search-R1보다 높은 retrieval accuracy를 보였다. 검색 정확도는 모델 크기에 따라 단조 증가했다.

두 번째 실험은 간섭으로 인한 손상을 추론 시점 모델 조합으로 복구할 수 있는지 검증한다. DART에서 어댑터를 하나씩 분리한 DART-Reas와 DART-Tool을 4.2절의 하이브리드 방식 HReas, HTool과 비교했다.

MethodQwen2.5-3B NQQwen2.5-3B HotpotQAQwen2.5-7B NQQwen2.5-7B HotpotQA
HReas0.4350.3240.4380.327
DART-Reas0.4480.3590.4490.412
HTool0.2480.2120.3050.255
DART-Tool0.3720.2830.3780.332

각 DART 어댑터가 대응하는 하이브리드 대비 확실히 앞선다. 도구 사용 쪽에서 격차가 특히 커서 3B NQ 기준 0.248에서 0.372로 오른다. 공동 학습이 각 능력을 실제로 손상시키며, 추론 시점 조합으로는 그 손상을 되돌릴 수 없다는 뜻이다.

Ablation Study

첫 번째 ablation은 성능 향상이 그래디언트 격리에서 오는지, 단순한 파라미터 증가에서 오는지 분리한다. 비교 대상은 Search-R1(공유 파라미터, 전체 파인튜닝), 단일 LoRA(rank 16으로 DART의 rank 8 두 개와 총 rank 일치), 그리고 파라미터 분리의 상한선인 2-Agent(도구 사용과 추론에 각각 완전히 독립된 모델)다.

Qwen2.5-3B-Base에서의 평균 EM 결과다.

MethodAvg EM
Search-R130.3
LoRA (rank 16)31.6
DART (rank 8 두 개)40.5
2-Agent (상한선)40.6

총 rank가 같은 단일 LoRA는 Search-R1과 거의 동일한 성능에 그친다. 파라미터를 더 준다고 얻는 이득은 제한적이라는 뜻이다. 반면 DART는 2-Agent 상한선에 거의 붙는다. 성능 향상이 용량 증가가 아니라 두 능력의 그래디언트를 격리한 데서 온다는 것을 뒷받침한다.

두 번째 ablation은 LoRA rank를 8, 16, 32로 변화시켰다. Qwen2.5-3B와 Qwen2.5-7B 백본 모두에서 rank 변화가 EM을 미미하게만 바꿨고, 데이터셋과 모델 규모 간 상대적 순위도 유지되었다. 모든 설정에서 DART는 2-Agent 기준선에 근접한 상태를 유지했다. 분리 학습 패러다임에서는 약간의 파라미터 용량만으로도 태스크를 충분히 수행할 수 있다는 관찰이다.

효율성 비교

2-Agent 시스템은 격리를 달성하지만 자원과 지연 측면에서 상당한 부담을 진다. 백본 파라미터 수를 P, LoRA 어댑터 파라미터 수를 p(통상 P의 0.5% 미만)라고 하자. 파라미터와 그래디언트는 BF16, optimizer state는 FP32로 저장된다.

분리된 multi-agent GRPO 설정에서는 학습 가능한 백본 두 개가 GPU에 상주해야 한다. 각 모델이 파라미터, 그래디언트, Adam 계열 optimizer state를 저장하므로 지배적인 정적 메모리 비용은 대략 2 × 4P = 8P로 스케일한다. DART는 하나의 공유 백본 안에서 두 능력을 학습하고 학습 파라미터를 경량 LoRA 어댑터로 한정한다. 백본이 동결되어 있어 그래디언트와 optimizer state는 어댑터 파라미터에 대해서만 저장되므로 비용은 P + O(p)로 스케일한다.

1
O(P_2-agent) / O(P_DART) ≈ 8

DART는 2-Agent와 대등한 성능을 유지하면서 학습 시점 정적 메모리 사용량을 약 8배 줄인다.

추론 지연에서는 KV 캐시가 결정적이다.

항목2-Agent (LoRA)DART (Multi-LoRA)
백본 인스턴스2개1개
VRAM (가중치 지배적)약 2P약 1P
컨텍스트 스위칭 비용재인코딩 O(L^2)KV 캐시 재사용으로 없음

2-Agent에서는 추론 모델이 생성한 사고를 도구 모델에 넘길 때, 도구 모델이 길이 L의 전체 대화 이력을 다시 인코딩해 자기 KV 캐시를 만들어야 하므로 O(L^2)의 재계산이 발생한다. DART는 단일 백본에서 동작하므로 능력 전환에도 KV 캐시가 유효하다. 추론에서 도구 호출로 넘어갈 때 활성 LoRA를 바꾸는 O(1) 비용만 들고 과거 컨텍스트를 다시 처리하지 않아 이후 턴의 Time-To-First-Token이 크게 줄어든다. 또한 2-Agent는 모델 간 상태 동기화와 프롬프트 형식을 맞출 외부 오케스트레이터가 필요하지만, DART는 이 로직을 단일 추론 파이프라인 안에 내재화한다.

한계와 주의사항

그래디언트 정렬 문제를 해소하면 일관된 이득을 얻지만 공짜는 아니다. DART는 단일 공유 LoRA를 서로소인 두 어댑터로 바꾼 것뿐이므로 기존 RL 학습 파이프라인과 완전히 호환된다. 다만 토큰 수준 어댑터 전환은 고동시성 서빙 환경에서 추가적인 스케줄링 복잡도를 유발한다. 배치 단위 어댑터 디스패치나 융합 multi-LoRA 커널로 이 오버헤드를 줄이는 것은 DART의 알고리즘적 기여와 직교하는 엔지니어링 최적화이며 후속 과제로 남겨두었다.

CEA 분석 자체에도 주의할 점이 있다. 6개 변형 모두가 한 번도 정답을 내지 못한 질문은 logit 값이 음의 무한대 근처로 몰려 계수가 경계 아티팩트에 지배되므로 수치 안정성을 위해 제외했다. 또한 이 분해는 3차 상호작용 항 x1x2x3의 효과를 0으로 근사한다는 전제 위에 서 있다. 정답률 추정은 모델과 질문 쌍당 50개 샘플에 기반하므로 디코딩 노이즈가 완전히 제거되지는 않는다.

백본 동결이 표현 용량을 제한할 가능성은 선행 연구의 관찰로 방어되지만, 결과 기반 보상이 아닌 더 조밀한 학습 신호를 쓰는 환경에서도 동일한 결론이 성립하는지는 검증되지 않았다. 라우터가 규칙 기반이라는 점도 양면적이다. 개선분을 순수하게 그래디언트 분리 효과로 귀속시킬 수 있게 해주지만, sentinel 토큰으로 구분되지 않는 더 복잡한 능력 경계에는 그대로 적용하기 어렵다.

결론

이 연구는 ARL에서 그동안 간과되어 온 문제를 규명한다. 추론과 도구 사용은 공동 최적화 하에서 서로 음의 상호작용을 일으킨다. CEA가 이 현상을 질문 단위로 정량화해 드러냈고, 그래디언트 분석이 원인을 두 능력이 서로를 절충 방향으로 밀어내는 정렬 불일치로 추적했다.

DART는 백본을 동결하고 추론과 도구 사용 토큰을 서로소인 LoRA 어댑터로 라우팅하는 최소한의 변경만으로 두 능력이 분리된 파라미터 부분공간을 갱신하도록 보장한다. 이 변경만으로 13개 벤치마크에서 모든 공동 최적화 베이스라인을 넘어섰고 2-Agent 상한선을 거의 회복했다. 능력 간 간섭이 현행 ARL 시스템에서 무시할 수 없는 병목이라는 강력한 증거다.

에이전트의 능력이 확장될수록 획일적인 최적화는 점점 불충분해질 수 있으며, 능력을 인지한 학습이 유망한 대안이 된다는 것이 저자들의 결론이다.

Reference