缩放定律:Kaplan 与 Chinchilla

03-训练与微调 前沿 约 25 分钟 #缩放定律#Chinchilla#Kaplan#算力预算 更新 2026-10-02
当前状态:未学
本文基于模型知识整理(生成时未联网核对),两条定律的数字建议对照 Kaplan et al. 2020 与 Hoffmann et al. 2022(Chinchilla)原文复核。

一句话定义

缩放定律是"模型性能随参数 N、数据 D、算力 C 幂律提升"的实证规律:Kaplan(2020)给出各维的幂律与"算力优先堆参数"的配方;Chinchilla(2022)修正指出等比缩放更优——算力最优时 token 数应约为参数的 20 倍(70B 模型配 1.4T token,而非 GPT-3 式 175B 配 300B)。缩放定律是大模型战略(堆大还是堆数据)的定量罗盘。

为什么重要

它把"更大更好"的玄学变成可预算的工程:给定算力,如何分配参数与数据?何时该停训练?下一个模型该多大?Chinchilla 修正直接改写了行业配方(此后模型普遍"参数更小数据更多"——Llama 系是"超 Chinchilla"训练的延伸)。缩放定律也是"涌现"讨论的数据基础(能力随规模的曲线形态 kp-029 呼应)。

前置知识

kp-001/012(架构与预训练目标);幂律函数的概念。

核心概念

  • Kaplan 定律(2020):损失 L 是 N、D、C 的幂律函数 $L(N)\approx L_\infty+N^{\alpha}$(α≈0.076 量级,各维独立拟合);关键结论(当时):① 大模型比小模型样本效率更高(同 token 学到更多);② 算力预算扩张时应大部分给参数(N 增长快于 D);③ 固定模型训更多 token 会饱和(过训浪费)。
  • Chinchilla 修正(2022):同算力下同时放大 N 与 D(约等比),最优 token/参数比 ≈ 20——70B 参数配 1.4T token 的 Chinchilla 击败 280B 的 Gopher。Kaplan 的"参数优先"是未训够数据的假象(大模型欠训练,损失被数据量限制掩盖)。
  • 超 Chinchilla 时代:推理成本进入预算后,"欠训练大模型"在部署端反而划算(一次性训练成本换永久推理效率)——Llama-2 70B 用 ~2T(≈29 倍)、Llama-3 8B 用 15T(≈1875 倍!):推断-aware 的缩放使"最优训练配比"进一步向数据倾斜。
  • 涌现:某些能力(多步推理、指令跟随)在小模型≈0、跨过规模阈值后跃升——两种解释:① 真相变;② 度量方式(全对才算对的不连续指标)造成的视觉涌现——争议持续(kp-029/031 关联)。
  • 缩放定律的适用边界:幂律拟合在同架构/同数据分布内有效;数据质量改变、架构革命(MoE kp-022)会移动曲线——定律是"给定配方的内插工具",不是跨范式的预言书。

原理与机制

幂律为什么会涌现:损失可分解为"不可约熵(数据的真实随机性)+ 模型可学习项"——可学习项随容量/数据的边际收益递减(学习曲线的自然形态),在对数坐标下近似直线=幂律。多团队/多任务重复观察到同形态斜率,使其成为"经验定律"而非巧合。

Chinchilla 怎么修正 Kaplan:Kaplan 的拟合中大模型普遍未训练到各自最优(数据停止点过早)——学习曲线尚未压平就被截断,误判为"数据饱和";Chinchilla 用同算力扫 400+ 个(N,D) 组合、每组合训到饱和,得到无偏的等损失线,发现最优线是 N、D 同比例增长。

20 倍与推断-aware 的推导逻辑:Chinchilla 只优化训练算力(每 token 一次前向反传);部署后每个用户查询都要跑推理——参数大的持久推理成本高 ⇒ 实际最优在 Chinchilla 点的"数据更多侧"。训练经济学与推理经济学的合成最优 ≠ 训练最优——这是 Llama 3"8B 模型喂 15T token"的战略解释。

图示

Kaplan'20: L ∝ N^{−α} (幂律) ; 算力优先堆参数
Chinchilla'22: 等算力扫(N,D) → 最优比 D≈20N
               70B+1.4T 击败 280B+300B (Gopher)
超Chinchilla: 推理成本入预算 → 数据侧继续加
              (Llama-3 8B × 15T ≈ 1875×N)
涌现: 能力跨阈值跃升 (真相变 vs 度量假象之辩)
边界: 同架构同数据内插有效 ; 跨范式失效

直观类比

训练大模型像开工厂:Kaplan 说"钱先买机器(参数)"——大机器学得快;Chinchilla 实测后发现"机器开动就得喂料"——机器再大料不足也白搭,最优是"机器与原料按 1:20 配齐"。超 Chinchilla 像"考虑到产品要卖十年"——一次性多囤原料(数据)把小机器喂到极致,长期总账更划算。

实例或案例

  • Chinchilla 70B 击败 Gopher 280B:同算力下"喂饱的中模型"胜过"欠训的大模型"——配方修正的实证冲击。
  • Llama 3 8B @ 15T token:远超 Chinchilla 比例的"过训"——面向端侧推理成本的当代战略样本。
  • 涌现争议:Schaeffer 等《Are Emergent Abilities a Mirage?》——换连续度量后部分"涌现"变平滑(度量学批评,kp-029 关联)。

常见误区

  • 误区一:"Chinchilla 比例是金科玉律"。它是"只优化训练算力"的最优;部署推理成本、数据可得性、模型生命周期都会移动最优点——超/欠训练各有战略理由。
  • 误区二:"缩放定律预言能力"。它拟合的是损失;损失到能力的映射不连续且任务相关——"loss 降 0.1"不等于"能力加 X"。
  • 误区三:"幂律斜率是普适常数"。不同架构/数据/分词下斜率不同;跨论文比较数字前先核对实验设置。

与其他知识点的关系

  • kp-001/012:定律的对象(架构+目标)。
  • kp-013/014:训练配方(定律成立的实操前提)。
  • kp-029:涌现与 ICL 的数据基础。

自测题

  1. Chinchilla 修正了 Kaplan 的哪个结论?方法上为什么能修正?

答:"算力优先堆参数"——Kaplan 的大模型欠训练(数据截断过早)导致误判;Chinchilla 同算力扫组合并训到饱和,得到等损失最优线 D≈20N。

  1. 为什么 Llama-3 8B 用远超 Chinchilla 的数据量?

答:推理成本入账——小参数+过训数据的部署端总成本更低(训练一次、推理永久受益)。

  1. "涌现"的两种解释是什么?

答:能力随规模真相变;或度量(全对判分)造成的不连续视觉涌现——争议未决,换连续度量常变平滑。

延伸阅读

  • Kaplan 等, "Scaling Laws for Neural Language Models"(arXiv 2020)。
  • Hoffmann 等, "Training Compute-Optimal Large Language Models"(2022,Chinchilla)。
  • Schaeffer 等, "Are Emergent Abilities of LLMs a Mirage?"(NeurIPS 2023 最佳论文)。