포스트

Skaling: 모델 크기와 데이터를 결합한 새로운 스케일링 법칙

목차

  1. 개요
  2. 배경
  3. 방법론
  4. 실험 설정
  5. 주요 결과
  6. 한계와 주의사항
  7. 결론
  8. Reference

개요

FAIR at Meta의 Mathurin Videau, Badr Youbi-Idrissi, David Lopez-Paz, Kartik Ahuja가 2026년 8월 arXiv에 공개한 논문 Skaling: Chinchilla’s Exponents Meet Kaplan’s Coupling을 정리한다. 신경망 스케일링 법칙은 대규모 언어 모델 개발의 기반이지만, 표준적인 함수 형태는 데이터가 부족한 극단과 과훈련 극단에서 손실을 체계적으로 과소·과대 추정한다. 논문은 이 실패의 원인이 모델 크기와 학습 데이터가 손실에 독립적으로 작용한다는 가정 자체에 있다고 지적한다.

저자들은 이를 해결하기 위해 Skaling 법칙(발음은 /skeIlIN/)을 제안한다. Skaling은 모델 용량과 데이터를 단 하나의 상호작용 지수로 결합하는 일반화된 함수 형태다. 파라미터를 하나만 추가했음에도 보간과 외삽 두 영역 모두에서 평균 절대 백분율 오차(MAPE)를 1.5배에서 3배까지 줄인다.

여기에 저컴퓨트 영역으로 제한된 희소 그리드 전략을 결합하면, 균일 스윕 대비 약 10배 적은 컴퓨트로 전체 그리드 외삽을 정확하게 수행할 수 있다. 소규모 실험만으로 신뢰할 수 있는 성능 예측이 가능해지므로, 차세대 모델 학습의 컴퓨트 예산 배분에 더 견고하고 자원 효율적인 프레임워크를 제공한다는 것이 논문의 주장이다.

배경

Chinchilla 가법 구조의 구조적 결함

현대 LLM의 성공은 데이터와 모델 크기를 늘릴 때 성능이 예측 가능하게 개선된다는 성질에 기대고 있다. 이 성질을 형식화한 것이 Kaplan et al. (2020), Hoffmann et al. (2022), Bi et al. (2024)로 이어지는 신경망 스케일링 법칙이며, 소수의 저컴퓨트 모델만으로 고컴퓨트 실행의 성능을 예측한다.

문제는 널리 쓰이는 Chinchilla 법칙이 축소 가능 손실(reducible loss)을 모델 크기 항과 학습 토큰 항의 단순 합으로 모델링한다는 점이다. 이 수학적 구조는 두 변수 사이의 엄격한 독립성을 함의하며, 교차 미분(cross-derivative)을 인위적으로 정확히 0으로 강제한다.

1
Chinchilla:  L(N, D) = A / N^alpha + B / D^beta + E

어떤 가법 법칙 L = f(N) + g(D) + E이든 f와 g로 무엇을 고르든 관계없이 다음이 항등적으로 성립한다.

1
d^2 L / (dN dD) = 0

논문의 Figure 1 분석에 따르면 Chinchilla는 그리드 내부에서는 정확하지만, N과 D의 균형이 가장 크게 깨지는 모서리로 갈수록 부호가 반대인 큰 오차가 발생해 수 퍼센트에 이른다. 이는 N과 D의 상호작용을 누락했을 때 예상되는 안장(saddle) 형태의 잔차다. 논문의 보고에 따르면 Skaling은 전체 설정의 76%에서 Chinchilla보다 정확했고, 오차비의 중앙값은 2.2배, 설정의 3분의 1에서는 4배 이상이었으며, 이득은 저렴한 가장자리에서 가장 컸다.

손실 표면은 실제로 결합되어 있다

저자들은 함수 형태를 정하기 전에 데이터에 직접 질문한다. Moving Least Squares(MLS) 추정기로 손실 표면의 미분을 추정하고, 그리드가 로그 간격이므로 로그 기울기를 실공간 미분으로 변환한다.

1
2
dL/dN = (L / N) * (d ln L / d ln N)
dL/dD = (L / D) * (d ln L / d ln D)

이 변환은 축소 불가능 오차 E를 제거하고 축소 가능 손실의 구조만 분리한다. 1차 구조는 다음 로그 선형 진단식으로 요약된다.

1
2
ln |dL/dN| = alpha_N * ln N + gamma_N * ln D + c_N
ln |dL/dD| = alpha_D * ln N + gamma_D * ln D + c_D

동일 변수 투영은 거의 선형이며 alpha_Nalpha_D가 모두 약 -1.3으로, 주변 미분이 대략 거듭제곱 법칙으로 감쇠함을 보인다. 교차 기울기는 gamma_N이 약 0.13, gamma_D가 약 0.07로 작아서, 1차만 보면 표면은 거의 분리 가능해 보인다. 다만 1차 투영만으로는 더 약한 상호작용의 존재를 배제할 수 없다.

결정적인 검증은 혼합 미분이다. 추정된 혼합 미분은 그리드 전역에서 0이 아니었고, 자체적인 거듭제곱 감쇠를 보였다.

1
ln |d^2 L / (dN dD)| = a * ln N + b * ln D + c

여기서 a와 b는 모두 약 -1.1이고 부호는 지배적으로 음수다. 즉 N과 D를 함께 키우면 어느 한쪽만 키울 때보다 손실이 더 크게 내려가는 시너지가 존재하며, 가법 법칙은 이를 표현할 수 없다.

방법론

Skaling 법칙의 함수 형태

스케일링 법칙 문헌을 지탱하는 두 함수 형태는 모델 크기와 데이터를 결합하는 방식에서 갈린다. Chinchilla는 이를 완전히 분리하고, Kaplan 형태는 정반대로 접근한다.

1
Kaplan:  L(N, D) = ( (Nc/N)^(alpha_N / alpha_D) + Dc/D )^alpha_D

Kaplan에서는 외부 지수 alpha_D가 Skaling의 k에 해당하는 역할을 하지만, 내부 항이 비율 alpha_N / alpha_D로 묶여 있어 축별 감쇠율이 더 이상 독립적이지 않다.

Skaling은 두 패러다임을 잇는다. Chinchilla의 해석 가능한 기저 항과 독립적인 내부 지수를 유지하면서, Kaplan을 따라 그 합 전체를 자유로운 외부 지수 k로 거듭제곱한다.

1
Skaling:  L(N, D) = ( A / N^alpha + B / D^beta )^k + E

이 단일 파라미터가 두 선행 형태 사이를 보간한다. k = 1이면 순수 가법 Chinchilla 법칙을 그대로 복원한다. k가 1이 아니면 Kaplan 방식의 결합과 0이 아닌 교차 미분이 되살아난다. 결정적으로 Kaplan과 달리 Skaling은 외부 지수 k를 통해 결합을 도입하면서 Chinchilla의 독립적인 내부 지수를 보존한다.

추가된 유연성에도 불구하고 Skaling은 가법 법칙의 바람직한 두 성질을 유지한다. 첫째, k > 0이므로 함수는 N과 D 양쪽에 대해 엄격히 감소한다. 즉 모델 용량이나 학습 데이터를 늘렸을 때 예측 손실이 증가하는 일이 없다. 둘째, Chinchilla의 구조를 보존한다. 지수 k는 두 소스 항이 최종 손실로 집계되는 방식만 결정하므로, 결합 기여가 더 이상 가법적으로 분리되지 않더라도 각 항의 개별 해석 가능성은 유지된다.

u = A * N^(-alpha) + B * D^(-beta)로 두면 혼합 미분은 다음과 같다.

1
d^2 L / (dN dD) = k (k - 1) u^(k-2) * alpha * A * N^(-alpha-1) * beta * B * D^(-beta-1)

k = 1은 혼합 미분을 소멸시키고, 경험적으로 관측된 구간인 0 < k < 1에서는 혼합 미분이 음수가 되어 Figure 3에서 관측된 부호와 일치한다. 1차 미분은 다음과 같다.

1
2
dL/dN = -k * alpha * A * N^(-alpha-1) * u^(k-1)
dL/dD = -k * beta  * B * D^(-beta-1)  * u^(k-1)

교차 변수 의존성은 공유 인자 u^(k-1)을 통해서만 들어오므로, Skaling은 1차에서는 거의 분리 가능해 보이면서도 0이 아닌 혼합 미분을 허용한다. 또한 데이터 몫 wD = B D^(-beta) / u와 크기 몫 wN = A N^(-alpha) / u를 쓰면 gamma_N = (1-k) * alpha * wD, gamma_D = (1-k) * beta * wN이 되어, 측정된 비대칭(0.13 대 0.07)이 단일 결합 지수 하나로 재현된다.

왜 곱셈적 결합인가

자연스러운 대안은 Chinchilla를 가법적으로 유지한 채 별도의 곱 항을 덧붙이는 것이다.

1
L = A * N^(-alpha) + B * D^(-beta) + G * N^(-mu) * D^(-nu) + E

이 항도 0이 아닌 혼합 미분을 만들 수 있지만 부호에서 즉각적인 제약이 생긴다.

1
2
d^2 L / (dN dD) = mu * nu * G * N^(-mu-1) * D^(-nu-1)
상호작용 항의 크기 미분 기여 = -mu * G * N^(-mu-1) * D^(-nu)

관측된 음의 혼합 미분을 맞추려면 G가 음수여야 한다. 그런데 G가 음수이면 상호작용 항이 dL/dN에 양의 기여를 하여 모델 크기에 대한 단조 감소를 방해한다. 더구나 적합된 혼합 미분 감쇠는 mu가 약 0.1로 주 크기 지수 alpha보다 작음을 시사하므로, 이 양의 기여는 N에 대해 선도 음수 항보다 더 느리게 감쇠한다. 따라서 N이 크고 D가 작은 영역에서 지배적이 되어 모델이 커질 때 손실이 증가한다는 예측을 낳을 수 있다. 반대로 G를 양수로 두면 단조성 문제는 피하지만 혼합 미분이 양수가 되어 원하던 시너지가 사라진다.

Skaling은 상호작용을 별도의 부호 있는 항이 아니라 양의 곱셈 인자로 도입하기 때문에 이 부호 충돌을 피한다. 크기 기울기는 모든 k > 0에 대해 음수이며, 데이터 의존성은 오직 양의 인자 u^(k-1)을 통해서만 들어온다. 0 < k < 1일 때 D를 늘리면 u가 줄고 u^(k-1)이 커져 이미 음수인 크기 기울기의 크기가 커진다. 결과적으로 dL/dN의 부호를 바꾸지 않으면서 음의 혼합 미분을 얻는다. 이 매개변수화에서 단조성과 시너지는 구조적으로 양립한다.

컴퓨트 최적 배분

고정 예산 C = 6ND 하에서 손실을 최소화하는 문제를 보면 Skaling의 실용적 이점이 드러난다. D = C / (6N)을 대입해 내부 가법 항을 Z(N)으로 정의하면 목적 함수는 다음과 같이 단순화된다.

1
2
3
Z(N) = A * N^(-alpha) + B * (C / (6N))^(-beta)
L(N)  = Z(N)^k + E
dL/dN = k * Z(N)^(k-1) * Z'(N)

Z(N)은 엄격히 양인 항들의 합이고 경험적 적합은 일관되게 k > 0을 주므로, k * Z(N)^(k-1)은 0이 아니다. 따라서 손실 최소화는 Z'(N) = 0을 요구하며, 이는 정확히 가법 Chinchilla 법칙의 정상성 조건이다. 즉 Skaling은 Chinchilla의 닫힌 형식 컴퓨트 최적 배분을 그대로 물려받는다.

1
2
Z'(N) = -alpha * A * N^(-alpha-1) + beta * B * (6/C)^beta * N^(beta-1) = 0
D*/N* 는 C^((alpha - beta) / (alpha + beta)) 에 비례

alphabeta가 거의 같으면(Chinchilla에서 관측된 경우) 최적 토큰-파라미터 비율은 스케일에 걸쳐 일정하게 유지된다. 중요한 점은 대수적 공식이 동일하더라도, 적합된 A, B, alpha, beta가 두 함수 형태 사이에서 전이되지 않기 때문에 실제 최적 비율은 달라진다는 것이다. 단조 외부 사상 x -> x^k + E는 손실을 재척도할 뿐 최소점을 바꾸지 않으므로, Skaling은 다루기 쉬움을 희생하지 않고 표현력을 얻는다.

정확한 최적 비율 식별은 실무적으로도 중요하다. DeepSeek(Bi et al., 2024)과 같은 프런티어 모델은 대체로 고정된 토큰-파라미터 비율을 채택하므로, 차선의 학습이 유발하는 성능 손실을 정량화하려면 진짜 최적값을 알아야 한다.

L-shape 희소 샘플링 전략

표준적인 전체 그리드 설정은 N과 D를 로그 간격의 정사각 격자로 샘플링한다. 이 경우 총 컴퓨트는 가장 큰 모델을 가장 긴 학습 지평으로 돌린 우상단 모서리에 압도적으로 집중된다. 컴퓨트가 기하학적으로 한쪽에 몰리므로 조밀한 샘플링은 특히 낭비가 크다.

논문은 손실 함수의 점근 거동에서 대안을 유도한다.

1
2
D -> 무한대 :  L(N, D) -> ( A / N^alpha )^k + E
N -> 무한대 :  L(N, D) -> ( B / D^beta  )^k + E

데이터 양을 늘리면 추정 오차가 사라지고 손실은 크기 의존 근사 오차로 수렴하므로, D를 늘리는 것은 N 의존 계수를 깨끗하게 분리한다. 대칭적으로 모델 크기를 늘리면 근사 오차가 줄어 데이터 의존 파라미터가 분리된다.

실제로는 이 이론적 극한에 도달할 필요가 없다. 한 축을 고정한 채 다른 축만 변화시키면 해당 감쇠율을 추적하기에 충분한 신호가 나온다. L-shape 전략은 이 원리를 최저 컴퓨트 스케일에 적용한다.

  • D-band: 가장 작은 모델에서만 데이터 양 D를 스윕하여 데이터 파라미터 B와 beta를 적합
  • N-band: 가장 짧은 학습 지평에서만 모델 크기 N을 스윕하여 크기 파라미터 A와 alpha를 적합

독립적인 감쇠율을 그리드 경계에 고정함으로써, 이 희소 기하 구조는 같은 총 컴퓨트 제약 아래에서 전체 그리드 스윕보다 N과 D의 상호작용을 더 효율적으로 매핑한다.

평가 프로토콜

저자들은 단일 정적 학습-테스트 분할 대신 반복 재샘플링 기반 교차 검증을 사용한다. 각 폴드에서 평가 세트는 다음과 같이 분할된다.

평가 영역정의
Validation (보간)학습 그리드 경계 내부에서 무작위로 제외한 지점
Extrapolation N활성 학습 세트를 넘어서는 더 큰 모델 크기 지점
Extrapolation D더 큰 데이터 양, 즉 확장된 학습 지평 지점
Far ExtrapolationN과 D 두 경계를 모두 벗어난 가장 큰 모델과 가장 큰 데이터 조합

모든 폴드에서 각 평가 세트의 MAPE를 보고하고, 결정계수 R2는 보간 세트에만 보고한다.

1
MAPE(S) = (100 / |S|) * sum_{i in S} | (L_hat_i - L_i) / L_i |   [%]

R2를 보간으로 제한한 이유는, 외삽 세트가 그리드의 좁고 다소 임의적인 조각을 덮는 소수의 점만 포함하기 때문이다. R2는 오차를 홀드아웃 타깃의 분산으로 정규화하므로 이 영역에서는 불안정하고 정보가 없으며 종종 작거나 강한 음수가 된다. 반면 MAPE는 모든 영역에서 직접 비교 가능하다.

추가로 저자들은 등비율(iso-ratio) 컴퓨트 외삽 실험을 설계했다. 프런티어 랩은 고정된 토큰-파라미터 비율을 따라 스케일하는 경우가 많으므로, 실행들을 D/N이 일정한 등비율 슬라이스로 묶고 각 슬라이스에서 컴퓨트 상위 K개(K=8)를 홀드아웃한다. 모든 법칙은 슬라이스 전체의 저컴퓨트 지점을 합친 나머지 데이터에 한 번만 재적합된 뒤 홀드아웃된 고컴퓨트 실행에서 평가된다. 강한 베이스라인으로 각 슬라이스 내부에 독립적으로 L = A * C^a + E 형태의 단일 거듭제곱 법칙을 적합하는 per-ratio 방식도 함께 비교한다. 이는 DeepSeek 방법론을 재현한 것이다.

실험 설정

두 개의 사전학습 실행 그리드에서 모든 스케일링 법칙을 적합하고 평가한다.

항목FarseerSK-Grid
구성 수404개 (N, D) 설정134개 설정
모델 크기25종, 100M에서 6.4B 파라미터15종, 134M에서 4.9B 파라미터
데이터 예산55종, 1B에서 512B 토큰16종, 316M에서 316B 토큰
컴퓨트 범위1.6e18에서 4.1e21 FLOPs9.0e16에서 9.9e20 FLOPs
Extrapolation N최대 3개 크기 4.5B에서 6.4B, 36개 지점2.8B에서 4.9B, 7개 지점
Extrapolation D각 모델 크기의 상위 3개 데이터 예산, 66개 지점33개 지점
Far extrapolation2.3B에서 25B 파라미터를 126B에서 453B 토큰으로 학습한 7개 실행약 1e22 FLOPs의 5.8B에서 10.8B 파라미터 3개 실행
적합용 총 컴퓨트302개 설정, 약 5.0e22 FLOPs약 3.1e21 FLOPs

Farseer의 모든 모델은 시퀀스 길이 2048을 사용한다. SK-Grid는 저자들이 직접 학습한 그리드로, 모델 차원은 672에서 3264까지, 깊이는 7층에서 34층까지 폭과 깊이를 함께 키웠고, Llama 3 토크나이저(어휘 128,256)를 사용한다. 토큰 예산은 10배 구간당 5개씩의 기하 사다리로 구성되며, 실행당 컴퓨트가 제한되어 큰 모델일수록 적은 예산으로 학습되는 계단형 그리드가 만들어진다. 데이터 혼합은 모든 실행에서 동일하게 DCLM-Edu 웹 텍스트 60%, 코드 30%, 수학 10%이며, 적합 대상 손실은 이 혼합의 홀드아웃 분할에 대한 검증 손실이다.

학습 하이퍼파라미터는 StepLaw 처방(Li et al., 2025b)을 따르며, 전역 배치 크기 B와 최고 학습률은 토큰당 컴퓨트 F와 토큰 예산 D의 거듭제곱 법칙으로 결정된다.

1
2
B    = 896.07 * F^0.231
peak_lr = 0.0709 * F^(-0.4303) * D^0.2785

고정 설정으로는 RoPE(theta = 1e4), AdamW(beta1 = 0.9, beta2 = 0.95), weight decay 0.1, gradient clip 0.1, cosine 스케줄, warmup 10%, 최종 학습률 1e-6을 사용한다. 모든 (N, D)에서 근사 최적 설정을 사용함으로써, 측정된 손실이 하이퍼파라미터 오조정이 아니라 아키텍처의 스케일링 거동을 반영하도록 했다.

베이스라인은 가법 Chinchilla 법칙과 파라미터가 더 많은 Farseer 법칙(9개 파라미터)이다. 모든 법칙은 동일한 옵티마이저와 로그 공간 목적 함수로 적합되므로, 예측 정확도 차이는 적합 절차가 아니라 함수 형태를 반영한다. 구체적으로는 로그 공간 Huber 손실(delta = 0.05)을 L-BFGS-B와 basin-hopping, autograd 조합으로 최소화하며, 계수 A와 B는 큰 동적 범위를 흡수하기 위해 로그 스케일로 최적화한다. 모든 법칙은 2000회의 basin-hopping 재시작을 사용한다.

주요 결과

경계 오차 감소

가장 뚜렷한 이득은 그리드 경계에서 나타난다. 내부 보간은 가법 Chinchilla 법칙도 이미 정확하지만, 단일 축 외삽과 원거리 외삽 세트에서 오차가 커진다.

Farseer 데이터의 결과는 다음과 같다.

법칙그리드R2 보간보간 MAPE외삽 N외삽 D원거리 외삽
ChinchillaFull (5.0e22 FLOPs)0.9950.77 ± 0.041.48 ± 0.031.98 ± 0.082.46 ± 0.19
FarseerFull0.9821.73 ± 0.452.37 ± 0.084.13 ± 1.362.43 ± 1.93
SkalingFull0.9980.41 ± 0.050.47 ± 0.030.88 ± 0.062.31 ± 0.18
ChinchillaL-shape (5.1e21 FLOPs)0.9542.51 ± 0.074.32 ± 0.133.29 ± 0.119.82 ± 0.48
FarseerL-shape0.9741.81 ± 1.232.07 ± 1.722.52 ± 1.952.37 ± 1.33
SkalingL-shape0.9950.85 ± 0.100.89 ± 0.231.35 ± 0.201.51 ± 0.67

SK-Grid 데이터의 결과는 다음과 같다.

법칙그리드R2 보간보간 MAPE외삽 N외삽 D원거리 외삽
ChinchillaFull (3.1e21 FLOPs)0.9920.81 ± 0.140.83 ± 0.111.44 ± 0.035.17 ± 0.28
FarseerFull0.9671.66 ± 0.320.90 ± 0.494.45 ± 0.213.98 ± 1.25
SkalingFull0.9980.33 ± 0.110.39 ± 0.050.58 ± 0.070.70 ± 0.39
ChinchillaL-shape (6.5e20 FLOPs)0.9552.19 ± 0.106.09 ± 0.243.63 ± 0.1314.63 ± 0.39
FarseerL-shape0.9870.82 ± 0.521.19 ± 0.822.66 ± 2.424.64 ± 1.31
SkalingL-shape0.9980.33 ± 0.030.77 ± 0.440.55 ± 0.081.15 ± 0.53

전체 그리드 기준으로 Farseer 데이터에서 단일 축 MAPE는 1.48에서 0.47로, 1.98에서 0.88로 떨어진다. SK-Grid에서는 0.83에서 0.39로, 1.44에서 0.58로 떨어진다. 가장 큰 이득은 가장 불균형한 모서리에서 나온다. SK-Grid 원거리 외삽 오차는 전체 그리드에서 5.17에서 0.70으로, L-shape 그리드에서 14.63에서 1.15로 감소하며, L-shape의 최대 N 외삽 오차는 6.09에서 0.77로 떨어진다.

보간 적합 품질이 높다고 스케일링 법칙이 검증되는 것은 아니다. Chinchilla는 전체 그리드에서 Farseer 0.995, SK-Grid 0.992라는 강한 보간 R2를 달성하지만, 그리드 경계의 외삽 오차는 Skaling의 수 배에 달한다. 문제의 실패 유형은 내부 적합 불량이 아니라, 관측 영역 밖으로 손실 표면이 어떻게 휘는지에 대한 체계적 오예측이다.

희소 프로파일링과 컴퓨트 절감

L-shape 그리드만으로 학습했을 때, 즉 적합 컴퓨트를 약 10배 줄였을 때도 Skaling은 보간과 단일 축 외삽에서 전체 그리드 Chinchilla 베이스라인에 근접하거나 그보다 우수하다. 반면 Chinchilla는 같은 제약 아래에서 크게 열화된다. Farseer에서 보간 MAPE는 0.77에서 2.51로 증가하고, SK-Grid에서 원거리 외삽 MAPE는 5.17에서 14.63으로 증가한다. 결합된 함수 형태는 학습 그리드가 저컴퓨트 가장자리에 집중되어도 예측 정확도를 유지하며, 이것이 바로 희소 프로파일링 전략이 요구하는 조건이다.

적합된 계수와 결합 지수

경계 예측이 개선되는 이유는 적합된 파라미터에서 드러난다.

설정법칙ABalphabetakE
Farseer, fullChinchilla4.8e1 ± 1.2e11.1e2 ± 0.1e20.27 ± 0.010.24 ± 0.0010.45 ± 0.01
Farseer, fullSkaling2.9e2 ± 0.2e26.0e3 ± 0.3e30.32 ± 0.010.39 ± 0.000.41 ± 0.010.03 ± 0.02
Farseer, L-shapeChinchilla2.6e2 ± 0.6e21.0e2 ± 0.1e20.39 ± 0.020.24 ± 0.0010.59 ± 0.01
Farseer, L-shapeSkaling2.5e2 ± 0.7e21.7e3 ± 0.4e30.32 ± 0.010.33 ± 0.010.45 ± 0.030.05 ± 0.06
SK-Grid, fullChinchilla5.0e2 ± 1.2e27.1e2 ± 0.8e20.34 ± 0.010.31 ± 0.0111.75 ± 0.02
SK-Grid, fullSkaling5.3e6 ± 1.8e67.1e6 ± 2.8e60.73 ± 0.010.63 ± 0.010.31 ± 0.021.14 ± 0.06
SK-Grid, L-shapeChinchilla1.0e4 ± 0.01.7e3 ± 0.4e30.52 ± 0.000.36 ± 0.0112.16 ± 0.02
SK-Grid, L-shapeSkaling1.0e7 ± 0.06.5e6 ± 2.4e60.77 ± 0.020.63 ± 0.010.31 ± 0.021.18 ± 0.12

모든 그리드에서 Skaling은 가법 사례인 k = 1로 붕괴하지 않고 1 미만의 결합 지수를 회복한다. 값은 0.31에서 0.45 범위다. 적합된 축소 불가능 손실 E는 Chinchilla보다 체계적으로 낮으며, Farseer 데이터에서는 전체 그리드에서 0.45에서 0.03으로, L-shape에서 0.59에서 0.05로 거의 사라진다. SK-Grid에서는 1.75에서 1.14로 여전히 상당한 값을 유지한다.

저자들은 E가 0에 가까워진 것을 손실 하한이 사라진다는 의미로 해석하지 않는다. 손실이 평평해지는 방식을 결정하는 두 값, 즉 결합 지수 k와 하한 E는 서로 상쇄 관계다. k < 1이면 오목한 외부 사상 때문에 결합된 축소 가능 항이 대규모에서 더 느리게 감쇠하므로, 가법 법칙이 더 큰 E로만 표현할 수 있는 곡률을 흡수할 수 있다. 실험의 어떤 실행도 손실이 포화되는 스케일에 도달하지 않았기 때문에, 데이터는 총 손실은 고정하지만 감쇠 항과 상수 하한 사이의 분할은 고정하지 못한다. E를 제외한 모든 파라미터는 각 적합 내에서 정밀하게 결정되며, 지수와 결합 지수는 폴드 간 표준편차가 수 퍼센트, 진폭은 최대 약 40% 수준이다.

파라미터 수가 많다고 경계 실패가 해결되지는 않는다. 자유도가 더 많은 Farseer 법칙은 Table 1의 대부분 영역에서 Skaling보다 부정확했고, 가장 큰 오차가 데이터 외삽에 집중되어 전체 그리드에서 MAPE 4.13(Farseer)과 4.45(SK-Grid)를 기록했다. 이득의 원천은 파라미터 추가가 아니라, 관측된 N과 D의 상호작용에 부합하는 귀납 편향을 가진 함수 형태라는 것이 저자들의 해석이다. 다만 더 풍부한 형태가 적합하기 어렵다는 점도 일부 작용할 수 있으며, 저자들은 Farseer 자체 파이프라인을 포함한 여러 옵티마이저를 시도했으나 실질적으로 더 나은 적합을 얻지 못했다고 밝혔다.

등비율 컴퓨트 외삽

교차 검증이 그리드 모서리를 홀드아웃했다면, 이 실험은 각 레시피의 가장 비싼 실행을 저렴한 실행만으로 예측할 수 있는지를 묻는 운영적 시나리오다. Farseer의 홀드아웃된 112개 고컴퓨트 실행에서, 등비율 슬라이스를 D/N 기준으로 저훈련(1.8에서 7), 최적(10에서 40), 과훈련(56에서 158) 세 구간으로 나눈 결과는 다음과 같다.

법칙저훈련 R2저훈련 MAPE최적 R2최적 MAPE과훈련 R2과훈련 MAPE전체 R2전체 MAPE
Power law (per-ratio)0.941.32 ± 0.870.960.77 ± 0.390.970.86 ± 0.750.950.99 ± 0.69
Chinchilla0.891.52 ± 0.800.473.47 ± 0.650.871.94 ± 0.660.742.34 ± 1.11
Farseer0.990.46 ± 0.200.941.20 ± 0.200.990.73 ± 0.230.970.80 ± 0.38
Skaling0.990.45 ± 0.210.970.88 ± 0.150.990.42 ± 0.150.980.60 ± 0.27

Skaling은 모든 영역과 전체에서 최고의 전역 법칙이며, 통합 MAPE 0.60 ± 0.27%로 가법 Chinchilla 대비 3.9배 오차 감소를 달성했다. 파라미터가 훨씬 많은 Farseer 법칙보다도 낮다. 안정성 측면에서도 어떤 영역에서든 오차가 0.9%를 넘지 않는다. 반면 Chinchilla는 영역 의존성이 강해 최적 구간에서 3.47%로 모든 법칙 중 가장 약했으며, 통합 수치만으로는 어디서 실패하는지가 드러나지 않는다. Skaling을 앞서는 유일한 기준선은 per-ratio 거듭제곱 법칙이고 그것도 최적 구간 부근에서만 0.77 대 0.88%로 앞선다. 이 베이스라인은 고정 비율을 따라가는 1차원 법칙이라 자연히 잘 동작하지만, 레시피마다 따로 적합되므로 N과 D의 결합 배분에 대해서는 아무것도 알려주지 못한다.

컴퓨트 최적 토큰-파라미터 비율

수치 미분은 파라메트릭 스케일링 법칙을 적합하지 않고도 컴퓨트 최적 배분을 추정하게 해준다. 고정 예산 C = 6ND에서 가능한 설정은 하나의 등컴퓨트 곡선 위에 놓이며, 경험적 최적은 그 곡선 위 최소 손실 지점이다. 라그랑주 정상성 조건을 나누면 승수가 소거되고 손실 기울기만 남는 조건이 된다.

1
2
N * (dL/dN) = D * (dL/dD)
즉  d ln L / d ln N = d ln L / d ln D

컴퓨트 최적점에서는 모델 크기 1% 증가와 데이터 1% 증가가 손실에 동일한 부호와 크기의 효과를 준다는 의미다. 저자들은 이 등식을 GP 사후 평균 대리 함수와 MLS 국소 대리 함수 두 가지 독립적 방법으로 로그 좌표에서 영교차 추적하여 해결한다.

두 추정은 정성적으로 일치한다. 둘 다 컴퓨트가 커질수록 감소하는 비율을 회복하며 Skaling의 닫힌 형식 최적값을 가깝게 따라가는 반면, Chinchilla는 거의 평평한 비율을 예측한다. 각 경험적 프런티어를 D/N* ~ C^m으로 적합하면 GP는 m이 약 -0.14, MLS는 약 -0.15로, Skaling의 해석적 지수 -0.11에 가깝고 Chinchilla의 +0.03과는 부호가 반대다. 데이터 범위에서 한 자릿수 넘어선 2e25 FLOPs로 외삽하면 배분은 10배 이상 갈라진다. Chinchilla는 파라미터당 약 380 토큰에 접근하는 반면, 경험적 적합과 Skaling은 20에서 40으로 내려간다. 논문 본문은 프런티어 컴퓨트 스케일에서 두 처방의 괴리가 100배까지 누적된다고도 기술한다.

다만 이 배분 추세의 부호는 결합 형태의 보편적 귀결이 아니라 데이터셋에 따라 달라진다. Farseer에서는 적합된 Skaling 지수가 alpha < beta를 만족해 컴퓨트 증가에 따라 해석적 D/N*이 감소한다. 반면 SK-Grid에서는 전체 그리드와 L-shape 그리드 모두에서 alpha > beta가 되어 같은 닫힌 형식 최적값이 컴퓨트 증가에 따라 증가한다. 따라서 견고한 결론은 결합이 대규모 배분을 바꾼다는 것이며, 변화의 방향은 적합된 데이터와 아키텍처에 의존한다는 것이다.

추가 데이터셋

부록에서는 두 개의 추가 데이터셋에 동일한 교차 검증 프로토콜을 반복한다. Farseer-code는 Farseer 그리드의 코드 도메인 대응물로, 9종 모델 크기(201M에서 3.18B)와 20종 토큰 예산(2B에서 128B)에 걸친 117개 실행이며 컴퓨트는 2.4e18에서 2.4e21 FLOPs다. Chinchilla 손실 측정치(Besiroglu et al., 2024)는 57M에서 16.2B 파라미터, 245M에서 318B 토큰을 덮는 245개의 비격자 산포 지점으로, 규칙적 그리드가 아니므로 전체 그리드 무작위 분할만 적용된다.

데이터셋법칙R2 보간보간 MAPE외삽 N외삽 D
Farseer-code (full)Chinchilla0.9980.28 ± 0.070.93 ± 0.150.60 ± 0.04
Farseer-code (full)Farseer0.9830.89 ± 0.121.01 ± 0.043.74 ± 0.23
Farseer-code (full)Skaling0.9990.24 ± 0.090.67 ± 0.190.26 ± 0.06
Farseer-code (L-shape)Chinchilla0.9910.59 ± 0.061.93 ± 0.181.60 ± 0.12
Farseer-code (L-shape)Farseer0.9930.53 ± 0.160.96 ± 0.270.91 ± 0.68
Farseer-code (L-shape)Skaling0.9950.45 ± 0.121.39 ± 0.491.14 ± 0.41
Chinchilla (full)Chinchilla0.9930.63 ± 0.151.16 ± 0.330.63 ± 0.06
Chinchilla (full)Farseer0.9551.27 ± 0.551.23 ± 1.101.12 ± 0.21
Chinchilla (full)Skaling0.9930.61 ± 0.141.28 ± 0.290.51 ± 0.03

이 두 데이터셋에서 적합된 결합 지수는 0.77에서 0.90으로 가법에 훨씬 가깝고, Skaling의 정확도도 대체로 Chinchilla 수준에 머문다. 이는 중첩 구조에서 예상되는 거동이다. k = 1에서 Chinchilla가 복원되므로, Skaling은 데이터가 결합된 표면을 지지할 때 가법 법칙에서 이탈하고 그렇지 않으면 가법 적합에 가깝게 남는다.

하이퍼파라미터 정책 차이도 데이터셋 간 결합 정도가 달라지는 이유의 일부다. 저자들은 손실 표면의 형태가 이러한 튜닝 선택에 매우 민감하며, 하이퍼파라미터 매개변수화가 다르면 겉으로 보이는 N과 D의 상호작용이 달라지고 추론된 컴퓨트 최적 비율이 이동할 수 있다고 명시한다. 원래 Chinchilla 레시피와 StepLaw로 튜닝된 SK-Grid의 차이가 그 예이며, 따라서 데이터셋 간 비교는 각 그리드를 생성한 특정 학습 레시피와 데이터를 반영한다.

Dominated-pair 적합

축소 불가능 손실 E가 약하게만 식별된다는 문제를 다루기 위해, 부록은 목적 함수에서 E를 아예 제거하는 dominated-pair 적합을 제시한다. 설정 i가 j를 지배하는 순서쌍(Fi가 Fj 이상, Di가 Dj 이상, Li가 Lj 미만)에 대해 손실 차이에서 가법 하한이 소거된다.

1
2
Lj - Li = ( A * Fj^(-alpha) + B * Dj^(-beta) )^k - ( A * Fi^(-alpha) + B * Di^(-beta) )^k
E = median_k [ Lk - ( A * Fk^(-alpha) + B * Dk^(-beta) )^k ]

결과적으로 이 기법은 주로 가법 Chinchilla 법칙의 교정 수단으로 작동한다. 전체 그리드에서 Chinchilla의 원거리 외삽 오차는 Farseer에서 2.46%에서 0.79%로, SK-Grid에서 5.17%에서 3.67%로 떨어진다. Chinchilla 외삽 오차의 상당 부분이 하한 E의 약한 식별에서 비롯됨을 시사한다. 반면 Skaling에는 이 교정이 일관된 개선을 주지 않는다.

한계와 주의사항

스케일링 법칙 적합은 파라미터 수가 적음에도 놀라울 만큼 취약한 비볼록 최적화 문제다. 첫째, 계수 A와 B의 큰 크기와 분수 지수 alpha, beta가 수치 스케일이 크게 달라 표준 경사 기반 옵티마이저에 대해 문제를 악조건화한다. 둘째, 최적화 지형이 매우 평평해 옵티마이저가 조기에 정지하기 쉽고, 유한 차분 기울기에 의존하면 더 악화된다. 셋째, 파라미터들이 강한 보상 거동을 보인다. 특히 축소 불가능 손실 E는 다른 계수들이 그 값을 상쇄하도록 이동할 수 있어 정확한 추정이 어렵다. 그 결과 거의 동일한 표면 적합을 주는 서로 다른 국소 최소값의 넓은 골짜기가 형성된다.

저자들은 로그 공간 목적 함수와 신중히 설정한 L-BFGS + basin-hopping 조합, 그리고 스케일 독립적이고 기울기가 필요 없는 BIPOP-CMA-ES가 동등하게 좋은 적합에 도달한다고 보고한다. 차이는 최종 품질이 아니라 실무적인 것으로, L-BFGS는 초기화·재시작·로그 공간 목적을 신중히 조정해야 안정적으로 도달하는 반면 CMA-ES는 별도 조정 없이 같은 해에 도달한다.

E가 거의 0으로 적합되는 현상은 손실 하한이 실제로 사라진다는 뜻이 아니다. 어떤 실행도 손실이 포화되는 스케일에 도달하지 않았으므로, 데이터는 총 손실만 고정하고 감쇠 항과 상수 하한의 분할은 고정하지 못한다.

결합 강도가 가법에 가까울수록 이득은 약해진다. Farseer-code와 원본 Chinchilla 측정치에서는 적합된 k가 0.77에서 0.90으로 가법에 가깝고, Skaling의 성능도 대체로 Chinchilla 수준이다.

배분 방향 역시 보편적이지 않다. Farseer에서는 최적 토큰-파라미터 비율이 컴퓨트에 따라 감소하지만 SK-Grid에서는 증가한다. 결합이 대규모 배분에 실질적 영향을 준다는 것은 견고한 결론이지만, 변화의 방향은 데이터와 아키텍처에 의존한다.

Farseer 법칙 비교에도 주의가 필요하다. Farseer의 원본 파이프라인은 고정된 N에서 연속된 D의 차분으로 구성 요소를 추정하는데, 희소한 L-shape 그리드와 비격자 데이터셋은 이 구조를 제공하지 못하며 교차 검증 홀드아웃 자체가 차분 구조를 깨뜨린다. 따라서 모든 설정에 균일하게 적용 가능한 직접 최적화로 적합했고, 저자들은 이를 자신들이 얻을 수 있었던 최선의 Farseer 결과로 보고한다.

결론

가법 스케일링 법칙은 모델 크기와 데이터 양이 독립적으로 작용한다고 본질적으로 가정한다. 논문이 보인 것은 이 가정이 정확한 예측이 가장 필요한 지점, 즉 학습 그리드의 불균형한 극단에서 무너진다는 사실이다.

Skaling 법칙은 이를 단일 결합 지수 하나로 해결한다. 경험적 손실 표면에 이미 존재하는 N과 D의 상호작용을 포착하는 자연스럽고 단순한 확장이며, 이 파라미터 하나가 경계 편향을 제거하고 가법 베이스라인과 9개 파라미터 형태 양쪽보다 정확한 성능 예측을 제공한다. 또한 엄격히 준가법적인 결합과 닫힌 형식 최적 배분을 동시에 얻으며, 이 결과는 모델 없이 수행한 기울기 추정으로 독립 검증되었다.

결합된 형태는 파라미터 공간의 내부가 아니라 가장자리에 의해 고정되므로, 전체 표면을 측정하지 않아도 복원할 수 있다. 저렴한 경계 실행으로 구성된 희소한 L자 그리드만으로 전체 그리드 법칙을 훨씬 낮은 비용에 회복할 수 있다. 신뢰할 수 있는 스케일링 예측에 더 이상 대규모 조밀 스윕이 필요하지 않다는 의미이며, 원칙에 입각한 컴퓨트 배분의 진입 장벽이 크게 낮아진다. 저자들은 이 결합 동역학이 다른 스케일링 축에도 적용될 것으로 보고 이를 후속 연구 방향으로 제시한다.

Reference