Agentic RL에서 추론과 도구 사용은 경쟁한다: 간섭 정량화에서 DART까지
목차 개요 배경과 문제 제기 Agentic RL의 공유 파라미터 가정 기존 연구와의 차이 방법론 Capability Effect Attribution 통제된 모델 변형 6종 구성 그래디언트 정렬 분석 DART: Disentangled Act...
목차 개요 배경과 문제 제기 Agentic RL의 공유 파라미터 가정 기존 연구와의 차이 방법론 Capability Effect Attribution 통제된 모델 변형 6종 구성 그래디언트 정렬 분석 DART: Disentangled Act...
목차 개요 방법론 보이지 않는 추론의 정의와 세 가지 진단 기준 합성 태스크 평가 셋업 주요 결과 필러 토큰 종류와 few-shot 설정의 상호작용 태스크 의존성과 Qwen3.5-397B의 포맷 붕괴 메커니즘 분석 프론티어 모델 ...
목차 개요 방법론 Recursive Transformer와 파라미터 공유 전략 라우팅 전략: Expert-choice와 Token-choice KV 캐싱 전략: Recursion-wise Caching과 Recursive Sharing 실험 셋업 주요 결과 ...
목차 개요 배경과 문제 의식 방법론 계층적 순환 구조 계층적 수렴 1-step gradient 근사 Deep Supervision Adaptive Computational Time 아키텍처 세부 사항 실험 셋업 주요 결과 ...
목차 개요 배경 선형 어텐션과 상태 공간 모델 Delta Network와 온라인 학습 규칙 방법론 자기회귀 다음 잠재 예측 정렬 정규화된 스텝 사이즈와 하강 보장 회귀 계열: Falcon-1 / Falcon-2 / Falcon-3 내적 계열...
목차 개요 아키텍처 기본 구조와 토큰화 다변량 토큰 구성 교대 어텐션 TimesFM 2.5 대비 변경점 단변량에서 다변량으로 자기회귀에서 단일 패스로 학습 데이터와 벤치마크 사용 방법 한계와 주의사항 결론 Referen...
목차 개요 저장소 구조 디렉토리 구성 콘텐츠 형식 주요 주제 영역 추론 기초와 프레임워크 추론 성능 최적화 강화학습 프레임워크 훈련 프레임워크와 기초 어텐션 메커니즘과 모델 분석 보조 도구 학습 경로 결론...
목차 개요 배경과 문제 정의 깊이와 파라미터의 결합 관련 연구 방법론 Prelude-Shared-Coda 구조 Recurrent Projection과 Elementwise Gate 학습 중 재귀 깊이 샘플링 Forward Pass 의사코드 ...