Fast Weight Attention for Continual Learning: 자기회귀 정렬 기반 Falcon 패스트 웨이트 갱신 규칙
목차
개요
Fast Weight Attention for Continual Learning은 순환 패스트 웨이트 메모리와 선택적 상태 공간 모델의 상태 전이를 온라인 학습 규칙으로 다시 정의한 논문이다. ByteDance Seed, Princeton University, Tsinghua University 등의 연구진이 2026년 8월 arXiv에 공개했다.
Transformer의 self-attention은 시퀀스 길이 N에 대해 O(N^2) 비용을 가지며, 긴 컨텍스트에서는 어텐션 행렬과 KV 캐시의 메모리 트래픽이 병목이 된다. SSM과 패스트 웨이트 모델은 이 캐시를 고정 크기 순환 상태로 압축하는데, 이때 상태 갱신식이 사실상 지역 학습 규칙(local learning rule)으로 동작한다. 논문은 이 학습 규칙이 어떤 목적함수를 최적화하고 있는지, 그리고 어떤 시간 정렬(temporal alignment)로 학습 쌍을 구성하는지를 명시적으로 드러낸다.
핵심 주장은 read-after-write 자기회귀 규약 아래에서 시점 t에 드러나는 인과적 학습 쌍이 접두사 정렬 쌍 (x_t, y_t) = (φ(k_{t-1}), v_t) 라는 것이다. 기존 다수의 순환 모델이 사용하는 동일 시점 연관 (φ(k_t), v_t) 역시 인과적이지만, 서로 다른 내부 목적함수를 최적화한다.
이 관점에서 저자들은 제곱 오차 회귀 목적과 음의 내적 목적 각각에 대해 정규화된 1차 갱신 규칙을 유도한다. 회귀 계열은 Falcon-1(스칼라 NLMS 갱신), Falcon-2(열 단위 확장), Falcon-3(슬라이딩 윈도우 미니배치)로 구성되고, 내적 목적의 대응물이 Falcon-1A / Falcon-2A / Falcon-3A다. 각 규칙에 대해 순환 형태, 마스크 병렬 형태, 청크 병렬 형태를 함께 제시하며 양의 감쇠(positive-decay) 재정규화로 수치 안정성을 확보한다.
배경
선형 어텐션과 상태 공간 모델
현대 신경망 SSM은 입력 시퀀스를 압축된 잠재 상태로 처리한다. 연속 시간 표현은 h'(t) = A(t)h(t) + B(t)x(t), y(t) = C(t)h(t) 형태를 가지며, 계수가 고정이거나 시변이거나 데이터 의존적일 수 있다. Mamba는 (B, C, Δ)를 현재 입력의 함수로 파라미터화해 내용 인지 필터링을 수행하고, Mamba-2는 전이 행렬 A를 스칼라 또는 대각 구조로 단순화해 Structured State Space Duality(SSD)를 확립했다. SSD는 순환 SSM이 특정 형태의 인과적 선형 어텐션과 동등함을 보이며, 청크 병렬 행렬 곱으로 학습하면서 상수 크기 상태 추론을 유지할 수 있게 한다.
선형 어텐션은 softmax를 커널 특징 사상 φ(·)로 대체해 O(N^2) 비용을 회피한다. 행렬 곱의 결합법칙을 이용하면 컨텍스트를 순환 행렬 상태 S_t와 정규화자 z_t로 압축할 수 있다.
1
2
3
o_t = S_t φ(q_t) / (z_t · φ(q_t) + ε_attn)
S_t = S_{t-1} + φ(k_t) v_t^T
z_t = z_{t-1} + φ(k_t)
논문의 next-latent 정렬은 쓰기 스트림을 한 스텝 이동시킨다. v_t를 관측한 뒤 직전 특징 φ(k_{t-1}) 아래에 기록하며, 이는 표준 인덱싱으로 (φ(k_i), v_{i+1})에 해당한다. 경계 조건은 원시 키 공간이 아니라 특징 공간에서 x_1 := 0으로 부과된다.
많은 SSD 계열 구조는 분모를 아예 제거하고 비정규화 내적 읽기를 사용한다.
1
2
o_t = S_t φ(q_t)
S_t = (1 - η_t λ_t) S_{t-1} + η_t φ(k_{t-1}) v_t^T
논문은 이 분모 없는 형태의 분자 상태 갱신이 정확히 내적 목적함수에 대한 경사 하강임을 보인다.
Delta Network와 온라인 학습 규칙
Fast Weight Programmer와 Delta Network는 시퀀스 모델링을 값 검색 함수의 온라인 학습으로 정식화한다. 순수 가산 누적 대신 순간 제곱 오차의 경사를 이용한 오류 구동 갱신을 쓴다.
1
2
3
ℓ_t(S) = (1/2) || S k_t - v_t ||_2^2
∇_S ℓ_t(S) = k_t (S k_t - v_t)^T
S_t = (I - η_t k_t k_t^T) S_{t-1} + η_t k_t v_t^T
rank-1 항 k_t k_t^T는 현재 키 방향을 따라 표적 축소 및 편집을 수행하며, η_t = 1 / ||k_t||_2^2일 때만 직교 사영이 된다. Gated Delta Network는 여기에 명시적 전역 감쇠 게이트를 추가한다.
논문은 이 갱신들이 특정 온라인 목적함수가 유도하는 경사 스텝이라는 점을 정리하고, 고정 학습률이 회귀 형태의 패스트 웨이트 갱신에는 스케일 불일치임을 지적한다.
방법론
자기회귀 다음 잠재 예측 정렬
순환 쓰기 연산을 명시적 온라인 최적화 문제로 본다. 상태 S는 접두사 쓰기 특징 x_t에서 새로 드러난 타깃 y_t로 가는 온라인 선형 예측기이고, 순간 릿지 회귀 손실을 최적화한다.
1
2
ℓ_t(S) = (1/2) || S x_t - y_t ||_2^2 + (λ_t / 2) || S ||_F^2
x_t = φ(k_{t-1}), y_t = v_t, x_1 := 0, λ_1 := 0
누적 손실의 전배치 최소화는 MesaNet 같은 오프라인 해에 대응하지만, 효율적인 자기회귀 모델링에는 온라인 근사가 필요하므로 Online Gradient Descent(OGD)를 사용한다. 이 목적함수는 외부 자기회귀 우도에 추가되는 지도 손실이 아니라, 패스트 메모리 쓰기 규칙을 정의하는 순간 목적함수다. 학습 시에는 이 갱신을 통해 미분하므로 느린 가중치가 (q, k, v)와 게이트 β_t, λ_t를 유용하게 만들도록 학습된다.
인덱싱 규약은 read-after-write(RAW)다. 토큰 t가 관측되고 기록된 뒤 갱신된 상태 S_t를 읽어 토큰 t+1을 예측한다. 내부 패스트 메모리 예측은 ŷ_t = S_{t-1} x_t이며, 이는 위치 t에서의 모델 출력과 구분된다. 논문은 부록에서 timing 규약(RBW 대 RAW)과 쓰기 페어링(동일 시점 대 이동) 두 축의 2x2 설계로 인과적 타이밍과 단순 인덱스 이동을 분리한다.
정규화된 스텝 사이즈와 하강 보장
단일 경사 스텝은 다음과 같다.
1
2
3
∇_S ℓ_t(S) = x_t (S x_t - y_t)^T + λ_t S
S_t = (1 - η_t λ_t) S_{t-1} + η_t x_t r_t^T
r_t = y_t - S_{t-1} x_t
여기서 r_t는 표준 Delta Network와 달리 직전 쓰기 특징 φ(k_{t-1})로부터의 예측과 현재 값 v_t 사이의 불일치를 측정한다. 손실 ℓ_t는 Frobenius 노름에 대해 L_t = ||x_t||_2^2 + λ_t 평활 상수를 가지므로 정규화된 스텝 사이즈를 채택한다.
1
η_t = β_t / ( ||x_t||_2^2 + λ_t + ε ), β_t ∈ (0, 2), ε ≥ 0
λ_t = 0, ε = 0인 특수 경우 이는 고전적 NLMS 재귀와 정확히 일치한다. Lemma 3.1은 L-평활 함수에 대해 스텝 사이즈가 (0, 2/L)에 있으면 f(S⁺) ≤ f(S) - (η(2 - ηL)/2) ||∇f(S)||_F^2가 성립함을 보인다. 이 진술은 시점별(pointwise) 성질이며, 누적 온라인 손실이나 외부 자기회귀 목적의 단조 감소를 의미하지 않는다.
패스트 웨이트 재귀는 쿼리와 키의 노름에 직접적으로 민감하므로 논문은 명시적 특징 스케일링을 사용한다. (q_t, k_t) 투영에 RMSNorm을 적용하며, 이는 흔히 쓰이는 L2 정규화 DeltaNet 변형과 달리 좌표 크기를 O(1)로 유지해 혼합 정밀도에서 더 안정적이다. 값 v_t에 대한 정규화(VNorm)는 선택 사항이며 기본적으로 비활성이다.
회귀 계열: Falcon-1 / Falcon-2 / Falcon-3
세 규칙 모두 동일한 인과 쌍 x_t = φ(k_{t-1}), y_t = v_t를 사용하고 쓰기 후 읽기 o_t = S_t φ(q_t)를 수행한다. 숫자 1, 2, 3은 각각 스칼라, 열 단위, 슬라이딩 윈도우 동역학을 뜻한다.
1
2
3
4
5
6
7
8
Falcon-1: S_t = (1 - η_t λ_t) S_{t-1} + η_t x_t r_t^T
η_t = β_t / ( ||x_t||_2^2 + λ_t + ε )
Falcon-2: S_t = S_{t-1} ( I_dv - λ_t Diag(η_t) ) + x_t (η_t ⊙ r_t)^T
η_{j,t} = β_{j,t} / ( ||x_t||_2^2 + λ_t + ε )
Falcon-3: S_t = (1 - η_t λ_t) S_{t-1} + (η_t / B_t) Σ_{j∈I_t} x_j ( v_j - S_{t-1} x_j )^T
η_t = β_t / ( μ_t^(B) + λ_t + ε ), μ_t^(B) = λ_max( C̄_t^(B) )
Falcon-1은 모든 d_v개 값 채널에 하나의 스칼라 가소성 η_t를 적용한다. 전이 행렬은 A_t = γ_t I - η_t x_t x_t^T 형태이므로 x_t에 직교하는 부분공간은 고윳값 γ_t = 1 - η_t λ_t를 보고, 쓰기 특징 방향은 1 - η_t(||x_t||^2 + λ_t)를 본다. ε = 0일 때 이 방향 고윳값은 정확히 1 - β_t가 되며, β_t가 1을 넘으면 음의 고윳값이 발생해 상태 추적 능력을 개선할 수 있는 부호 반전 영역이 된다.
Falcon-2는 스텝 사이즈를 벡터 η_t ∈ R^{d_v}로 승격한다. 제곱 오차 릿지 손실이 값 좌표(상태 행렬의 열)에 대해 분리되므로, 모든 j에 대해 β_{j,t} ∈ (0, 2)이면 Lemma 3.1의 하강 논증이 열 단위로 그대로 적용된다. 즉 Falcon-2는 전체 Frobenius 경사에 행렬값 학습률을 곱한 것이 아니라, 분리 가능한 목적함수 위의 d_v개 독립 스칼라 스텝 갱신의 모음이다. 쓰기 특징 x_t와 잔차 r_t는 채널 간에 공유된다.
Falcon-3는 순간 잔차 하나가 아니라 최근 인과 쌍의 유한 윈도우 위에서 한 번의 미니배치 경사 스텝을 밟는다. 활성 윈도우는 I_t = { j : max(2, t - B + 1) ≤ j ≤ t }, 실현 크기는 B_t = |I_t| ≤ B다. 갱신 크기가 공칭 윈도우 크기 B에 무관하도록 윈도우 평균 제곱 손실을 최적화한다.
1
2
3
C̄_t^(B) = (1/B_t) Σ_{j∈I_t} x_j x_j^T
N̄_t^(B) = (1/B_t) Σ_{j∈I_t} x_j v_j^T
∇_S ℓ_t^{reg,(B)}(S_{t-1}) = C̄_t^(B) S_{t-1} - N̄_t^(B) + λ_t S_{t-1}
정규화 분모로는 트레이스 상계가 아니라 윈도우 릿지 목적의 정확한 지역 평활 스케일 μ_t^(B) = λ_max(C̄_t^(B)) = ||X_t||_2^2 / B_t를 사용한다. 윈도우 평균을 최적화하므로 N̄_t^(B)도 μ_t^(B)도 B에 비례해 커지지 않는다. 쓰기 특징이 RMS 정규화되어 있으면 μ_t^(B) ≤ Ē_t^(B) = tr(C̄_t^(B)) ≤ d_x이므로 분모는 O(B d_x)가 아니라 O(d_x)에 머문다. d_x × d_x 행렬 C_t^(B)를 실체화할 필요 없이 B_t × B_t 그램 행렬에서 정확히 계산하거나 몇 번의 거듭제곱 반복으로 근사할 수 있다.
내적 계열: Falcon-1A / Falcon-2A / Falcon-3A
접미사 A는 음의 내적 목적함수를 뜻한다.
1
2
ℓ_t^{ip}(S) = - ⟨ S x_t , y_t ⟩ + (λ_t / 2) || S ||_F^2
∇_S ℓ_t^{ip}(S) = - x_t y_t^T + λ_t S
λ_t = 0이면 목적함수가 S에 대해 선형이라 유한한 최소점이 없고, 경사 하강은 순수 가산 Hebbian 쓰기로 환원된다.
1
2
3
4
5
6
7
8
Falcon-1A: S_t = (1 - η_t λ_t) S_{t-1} + η_t x_t y_t^T
η_t = β_t / ( E_t + λ_t + ε ), E_t = ||x_t||_2^2
Falcon-2A: S_t = S_{t-1} ( I_dv - λ_t Diag(η_t) ) + x_t (η_t ⊙ y_t)^T
η_{j,t} = β_{j,t} / ( E_t + λ_t + ε )
Falcon-3A: S_t = (1 - η_t λ_t) S_{t-1} + η_t N̄_t^(B)
η_t = β_t / ( Ē_t^(B) + λ_t + ε ), Ē_t^(B) = (1/B_t) Σ_{j∈I_t} ||x_j||_2^2
회귀 계열과 달리 내적 계열은 잔차가 아니라 타깃을 직접 기록하므로 쓰기 안에 S_{t-1} x_t 뺄셈이 없다. 망각은 오직 carry에만 작용하며, Falcon-1A와 Falcon-3A에서는 스칼라 인수로, Falcon-2A에서는 열 단위 인수로 나타난다.
내적 목적함수는 쓰기 특징 에너지와 무관하게 λ_t-평활이므로 목적함수 정합 분모는 λ_t에만 의존해야 한다. 그럼에도 구현에서는 에너지 정규화 쓰기 이득을 유지하는데, 이는 곡률 요구가 아니라 가산 쓰기의 크기를 제어하고 λ_t가 0으로 가는 극한을 합리적으로 만들기 위한 안정화 장치다. 표준 미이동 특징 (φ(k_t), v_t)를 쓰면 Falcon-1A의 가산 갱신은 통상적인 선형 어텐션 및 Mamba-2 누적과 일치한다. B = 1이고 t ≥ 2이면 Falcon-3A는 Falcon-1A로 환원된다.
병렬 구현과 수치 안정화
각 규칙은 순환 형태, 마스크 병렬 형태, 청크 병렬 형태의 세 가지 동등한 표현을 가진다.
형태별 복잡도
| 형태 | 시간 복잡도 | 병렬성 |
|---|---|---|
| 순환 형태 | O(N) 시간, 추론 시 O(1) 상태 | 시퀀스 축 순차 스캔 |
| 마스크 병렬 형태 | O(N^2) (Falcon-3 계열은 O(N^2 B)) | 시퀀스 축 완전 병렬 |
| 청크 병렬 형태 | O(NC) (Falcon-3는 O(NCB)) | 청크 내 병렬, 청크 간 순차 |
Falcon-1의 rank-1 재귀는 WY 표현으로 Π (I - η_s x_s x_s^T) = I - U_t T_t U_t^T 형태로 정리되어, 청크마다 한 번의 다중 우변 삼각 해(TriSolve)로 처리된다. Falcon-2는 채널마다 다른 스텝 사이즈를 쓰지만 갱신의 기하는 모든 값 채널이 공유하는 키가 결정한다는 점을 이용한다. 청크 내에서 공유 그램 행렬 G = X^T X를 한 번 만들고 d_v개의 채널별 단위 하삼각 시스템을 배치 TriSolve로 동시에 푼다. 주입된 값 경로와 사영된 이력 경로가 같은 삼각 인수를 공유하므로 하나의 병합된 잔차 시스템만 풀며, 이는 순전파에서 청크당 배치 TriSolve를 하나 줄인다.
Falcon-3는 활성 윈도우를 폭 B로 제로 패딩하면 고정 rank-B 저랭크 재귀가 된다.
1
2
S_t = ( S_{t-1} + A_t R_t^T S_{t-1} ) + A_t R'_t^T
A_t = (η_t / B_t) X_t, R_t = -X_t, R'_t = V_t
이를 ParallelFlow의 tensorInv를 이용한 3단계 청크 병렬 알고리즘으로 실현한다. 1단계는 청크별 tensorInv 해를 병렬로 계산하고, 2단계는 청크 경계 상태를 순차 전파하며, 3단계는 토큰 출력을 병렬로 실체화한다.
Falcon-3A는 명시적 마스크 선형 어텐션 형태를 가진다. 재귀를 풀면 감쇠 가중 인과 마스크가 나온다.
1
2
o_t = γ_t S_0^T φ(q_t) + Σ_{j≤t} M_{t,j} ⟨ φ(q_t), x_j ⟩ v_j
M_{t,j} = Σ_{s=j}^{min(t, j+B-1)} (η_s / B_s) Π_{r=s+1}^{t} γ_r
윈도우 연산자는 B-밴드형이지만 결과 마스크는 일반적으로 조밀한 하삼각 감쇠 꼬리를 가진다.
수치 안정화를 위해 양의 감쇠 클램프와 로그 공간 재정규화를 사용한다. δ_t^{raw} = η_t λ_t를 계산한 뒤 δ_t = min(δ_t^{raw}, 1 - τ)로 클램프하고 γ_t = 1 - δ_t, log γ_t = log1p(-δ_t)를 fp32로 계산한다. 전역 곱 c_t = Π γ_r를 형성하지 않고 청크 내에서 log γ_t를 누적해 경계 상태와 쓰기 타깃에 지역 재정규화를 적용한다. 이때 정확한 동등성은 스텝 사이즈 재조정과 쓰기 타깃의 역감쇠 재조정을 모두 요구하며, η_t만 재조정해서는 충분하지 않다. 클램프가 활성화되면 구현된 축소 경로는 유효 릿지 계수 λ_t' = δ_t / η_t를 쓰는 surrogate로 해석해야 한다.
부호 있는 특징에서는 정규화된 읽기 분모 z_t^T φ(q_t) + ε_attn이 0이 되거나 부호가 바뀔 수 있으므로, 논문의 기본 해석은 분모 없는 내적 읽기다.
실험 설정
언어 모델링 실험은 124M에서 130M 파라미터 모델을 FineWeb-Edu에서 학습한다. 최적화 스텝 100,000회, 시퀀스 길이 1,024, 글로벌 배치 480으로 총 약 49.2B 토큰의 예산을 맞췄다.
학습 하이퍼파라미터
| 항목 | 설정 |
|---|---|
| 정밀도 | bfloat16 |
| 옵티마이저 | AdamW, beta = (0.9, 0.95) |
| 기본 학습률 | 1e-3, cosine decay |
| 워밍업 | 2,000 스텝 |
| 가중치 감쇠 | 0.1 |
| 그래디언트 클리핑 | 1.0 |
| 폭 스케일링 | muP 스타일 |
| 구조 | 임베딩 공유, Pre-Norm RMSNorm, bias 없음, dropout 없음 |
| 하드웨어 | NVIDIA H100 또는 H200 4-GPU 단일 노드 |
Transformer 베이스라인은 RoPE와 SwiGLU를 쓰는 LLaMA 스타일 구조다. 순환 베이스라인으로는 RetNet/LightningAttn, Mamba-2, DeltaNet, Gated DeltaNet을 포함한다. 패스트 웨이트 모델은 별도 명시가 없으면 QK-RMSNorm과 어텐션 투영에 대한 경량 짧은 컨볼루션을 사용한다. 모델 이름의 ctx 표기는 문맥 조건화된 게이트 파라미터를 뜻하며, QK-RMSNorm과 QK-L2 정규화는 패스트 웨이트 블록 내부의 쿼리/키 정규화 방식을 구분한다.
두 번째 과제는 가변 길이 다자릿수 덧셈이다. n자리 프롬프트를 주고 뒤집힌 (n+1)자리 합을 생성하게 해 최하위 자리부터 출력하도록 한다. 학습 폭은 1부터 32까지 균등하게 표집하고 타깃 접미사에 대해서만 마스킹된 다음 토큰 로그 우도를 최적화한다. 평가는 분포 내 검증 정확도와 33자리부터 48자리까지 평균한 분포 외 teacher-forced 접미사 정확도를 함께 본다.
메인 테이블의 평가 대상은 스칼라 및 슬라이딩 내적 변형인 Falcon-1A, Falcon-3A와 회귀 계열 대표 ablation인 Falcon-1.3이다. 열 단위 규칙 Falcon-2, Falcon-2A와 슬라이딩 회귀 규칙 Falcon-3는 정의만 되고 별도로 벤치마크되지 않았다.
주요 결과
언어 모델링 퍼플렉서티
50B 토큰 예산으로 학습한 124M에서 130M 모델의 퍼플렉서티다. 낮을수록 좋다.
| 모델 | Wikitext | LAMBADA | FineWeb-Edu |
|---|---|---|---|
| Transformer (RoPE, 124M) | 33.25 | 47.43 | 17.38 |
| RetNet/LightningAttn (130M) | 36.86 | 65.16 | 18.79 |
| Mamba-2 (130M) | 34.53 | 48.74 | 17.70 |
| DeltaNet (130M) | 34.19 | 52.84 | 17.84 |
| Gated DeltaNet (130M) | 30.99 | 46.70 | 17.32 |
| Falcon-1A.1 (QK-L2, 130M) | 34.41 | 47.93 | 17.70 |
| Falcon-1A.2 (QK-L2, 130M) | 34.20 | 51.01 | 17.70 |
| Falcon-1A.3 (QK-RMSNorm, 130M) | 34.02 | 49.84 | 17.40 |
| Falcon-1.3 (QK-RMSNorm, 130M) | 33.00 | 48.70 | 17.10 |
FineWeb-Edu 검증 퍼플렉서티에서 회귀 계열 Falcon-1.3이 17.10으로 전체 최고다. 베이스라인 중 최강은 Gated DeltaNet의 17.32이고, 평가된 내적 변형 중에서는 Falcon-1A.3이 17.40으로 가장 좋다. 다만 Wikitext에서는 Gated DeltaNet이 30.99로 앞서고 LAMBADA에서도 46.70으로 가장 낮아, 결과가 일률적인 우세는 아니다. 스칼라 내적 ablation 안에서는 QK-RMSNorm이 QK-L2 정규화보다 FineWeb-Edu 퍼플렉서티를 개선한다.
다운스트림 태스크 정확도
PIQA, HellaSwag, WinoGrande, ARC-e, ARC-c, OpenBookQA, Social IQA, SciQ 8개 태스크의 비가중 평균이다.
| 모델 | Zero-shot 평균 | One-shot 평균 |
|---|---|---|
| Transformer (RoPE, 124M) | 48.16 | 49.67 |
| RetNet/LightningAttn (130M) | 48.05 | 47.42 |
| Mamba-2 (130M) | 48.80 | 49.16 |
| DeltaNet (130M) | 48.88 | 48.50 |
| Gated DeltaNet (130M) | 48.78 | 48.57 |
| Falcon-1A.1 (130M) | 48.86 | 49.08 |
| Falcon-1A.2 (130M) | 49.30 | 49.20 |
| Falcon-1A.3 (130M) | 48.95 | 48.89 |
| Falcon-3A.3 (130M) | 49.00 | 49.03 |
| Falcon-1.3 (130M) | 49.18 | 49.54 |
Zero-shot 평균은 Falcon-1A.2가 49.30으로 목록 중 최고이고, 순환 모델 중 one-shot 평균 최고는 Falcon-1.3의 49.54다. One-shot 전체 최고는 Transformer의 49.67이므로 순환 모델이 Transformer를 넘어선 것은 아니다. 개별 태스크에서 Falcon-1A.2는 PIQA 67.03, Falcon-1.3은 HellaSwag 38.38로 각 열의 순환 모델 최고치를 기록한다. 작은 모델 규모에서는 문맥 조건화된 게이트 변형이 대응하는 다른 변형보다 zero-shot 및 one-shot 평균을 개선한다.
가변 자릿수 덧셈 길이 외삽
Teacher-forced 길이 일반화 결과다. 높을수록 좋다.
| 모델 | Best step | 검증 정확도 | 평균 정확도 (33~48자리) | Acc@d33 / Acc@d48 |
|---|---|---|---|---|
| Transformer (RoPE) | 2000 | 100.0 | 65.8 | 97.0 / 49.0 |
| RetNet/LightningAttn | 2000 | 99.7 | 82.9 | 99.0 / 63.0 |
| Mamba-2 | 2000 | 100.0 | 75.2 | 100.0 / 51.0 |
| Falcon-1A.1 (QK-L2) | 1900 | 100.0 | 80.6 | 100.0 / 59.0 |
| Falcon-1A.2 (QK-L2) | 2000 | 100.0 | 85.2 | 100.0 / 63.0 |
| Falcon-1A.3 (QK-RMSNorm) | 1900 | 99.8 | 85.9 | 100.0 / 69.0 |
| Falcon-3A.3 (QK-RMSNorm) | 2000 | 99.9 | 87.2 | 100.0 / 69.0 |
| Falcon-1.3 (QK-RMSNorm) | 2000 | 100.0 | 68.8 | 100.0 / 48.0 |
슬라이딩 윈도우 내적 변형 Falcon-3A.3이 평균 87.2로 최고 외삽 성능을 보이고, Falcon-1A.3이 85.9로 뒤를 잇는다. 두 모델 모두 여기 보고된 베이스라인인 RetNet/LightningAttn(82.9), Mamba-2(75.2), Transformer(65.8)를 상회한다. 48자리 시점에서 Falcon-3A.3과 Falcon-1A.3은 69.0을 유지하는 반면 Transformer는 49.0으로 떨어진다. 반대로 회귀 변형 Falcon-1.3은 언어 모델링 퍼플렉서티에서 가장 좋았지만 이 과제에서는 평균 68.8, 48자리 48.0으로 내적 변형에 뒤진다.
논문은 이 실험을 주된 결과가 아니라 뒷받침 증거로 규정한다. 순환 상태의 메모리 쓰기 동작을 분리해서 보여주며, 저장과 자리올림 전파가 지배적인 상황에서 이동·정규화된 갱신이 잘 외삽함을 보이는 진단 과제라는 것이다.
한계와 주의사항
하강 보장은 순간 목적함수에 대한 시점별 성질이다. Lemma 3.1은 각 스텝에서 ℓ_t가 감소함을 보장할 뿐, 누적 온라인 손실이나 외부 자기회귀 학습 목적의 단조 감소를 함의하지 않는다. 또한 이 보장은 클램프 이전의 재귀에 대한 것이며, 양의 감쇠 클램프가 활성화되면 구현된 갱신은 원래 λ_t에 대한 정확한 경사 스텝이 아니라 유효 계수 λ_t' = δ_t / η_t를 쓰는 수치 안전 surrogate가 된다. 내적 목적에서 λ_t = 0이면 목적함수가 선형이고 아래로 유계가 아니므로, 같은 정규화는 유계 목적 보장이 아니라 가산 쓰기의 크기 안정화로 해석해야 한다.
Falcon-3와 Falcon-3A는 행렬 상태 S_t만으로 Markov가 아니다. 세그먼트 경계를 넘어 정확히 이어가려면 마지막 B-1개 인과 쌍으로 이루어진 고정 폭 tail이 추가로 필요하다. Falcon-3A에서는 (N̄_t^(B), Ē_t^(B), B_t) 같은 집계 통계만으로는 부족한데, 다음 스텝이 가장 오래된 기여를 정확히 제거해야 하기 때문이다. 따라서 분리된 세그먼트 사이에 행렬 경계 상태만 전달하는 것은 정확하지 않으며, tail을 리셋하는 것은 명시적 경계 리셋으로 취급해야 한다.
윈도우가 엄격한 지역성을 보장하지도 않는다. λ_t = 0이고 β_t = β가 상수인 경계 밖 영역에서 각 토큰은 정확히 B개의 연속 윈도우 평균에 가중치 1/B로 등장하므로 누적 주입 계수는 B와 무관하게 β가 된다. 그러나 그 B회의 직접 주입 이후에도 토큰의 영향은 이후 carry 인수를 통해 지속된다. 윈도우는 엄격한 지역 지지가 아니라 유효 메모리 지평을 제어하며, 엄격한 지역성을 원하면 명시적 절단이나 하드 제로 carry 오버라이드가 필요하다.
실험 범위도 제한적이다. 정의된 여섯 규칙 중 Falcon-2, Falcon-2A, Falcon-3는 메인 테이블에서 별도로 벤치마크되지 않았다. 모델 규모는 124M에서 130M, 학습 예산은 50B 토큰, 시퀀스 길이는 1,024로 고정되어 있어 대규모 장문맥 설정에서의 거동은 확인되지 않았다. 언어 모델링 결과도 균일한 승리가 아니며, 논문 스스로 제안 갱신이 경쟁력 있는 품질을 유지하면서 통제된 산술 이득을 제공한다는 정도로 결론을 좁힌다.
정규화된 읽기 형태에는 부호 있는 특징 관련 주의가 따른다. 분모 z_t^T φ(q_t) + ε_attn은 양의 상수를 더하는 것만으로 0이 되거나 부호가 바뀌는 것을 막지 못하므로, 정규화된 부호 있는 특징 읽기를 원한다면 명시적 안전 분모나 클램프 같은 부호 안정 정규화가 필요하다. 또한 로그 공간 재정규화 상태를 정규화된 비율 안에서 그대로 쓰면 고정된 ε_attn 아래에서 동등성이 근사에 그친다. 분모 없는 재귀는 이 문제의 영향을 받지 않는다.
결론
이 논문은 순환 시퀀스 모델링을 명시적 패스트 메모리 목적함수를 가진 온라인 지속 학습으로 재해석한다. read-after-write 규약 아래에서 접두사 정렬된 인과 학습 쌍은 φ(k_{t-1}) → v_t이며, 이 정렬 위에서 정규화된 패스트 웨이트 갱신 계열이 유도된다.
회귀 목적에서는 Falcon-1, Falcon-2, Falcon-3이, 내적 목적에서는 Falcon-1A, Falcon-2A, Falcon-3A가 나온다. 숫자는 스칼라, 열 단위, 슬라이딩 윈도우 동역학을 뜻하고 접미사 A는 내적 목적을 뜻한다. 이 틀은 시간 정렬, 가소성, 망각, 유계 리허설을 분리해서 다루면서도 SSD 스타일 청크 병렬 학습과 호환된다.
실증적으로는 대표 스칼라 회귀 변형과 스칼라/슬라이딩 내적 변형이 언어 모델링에서 경쟁력을 유지했고, 최고 내적 변형이 산술 길이 외삽을 개선했다. 설계 관점에서 가져갈 만한 지점은 고정 학습률이 회귀 형태의 패스트 웨이트 갱신에 스케일 불일치라는 점, 목적함수에 맞춘 정규화 통계(회귀는 지역 평활 스케일, 내적은 쓰기 에너지)를 분모로 써야 한다는 점, 그리고 이 정렬·정규화가 기존 delta 계열 블록의 지역 갱신에 게이팅 파라미터화와 무관하게 대체 투입될 수 있다는 점이다.