循环混合专家(Mixture of Experts)的规模定律
循环Transformer与混合专家模型(Mixture-of-Experts, MoE)为高效扩展提供了互补路径:循环在固定参数量下增加了计算深度,而MoE稀疏性在固定活跃计算量下扩展了总容量。然而,现有的扩展法则仅孤立地对循环或稀疏性进行建模。在本文中,我们引入了Loop Scaling Laws,这是首个将循环与稀疏性连同模型规模和数据一起进行联合建模的扩展法则。其核心是一个有界的、以稀疏性为条件的循环映射,该映射刻画了由循环带来的有效参数增益,以及稀疏性如何提升这一增益。该法则比先前的替代方法更准确地预测了循环模型的留出损失(held-out loss),并将标准的稠密模型与MoE扩展法则作为特例还原。除了预测功能外,拟合后的法则还为在计算与内存约束下设计循环MoE模型提供了原则性基础。下游评估进一步展示了这两个维度的互补优势:稀疏性带来了约3倍的活跃参数效率,循环在推理任务上带来了约2倍的总参数效率,而联合扩展进一步推进了性能前沿。作为一项实际扩展,我们证明了这些收益在万亿token规模下依然成立:在训练计算量匹配的情况下,具有法则推导循环的循环MoE在推理基准测试上与参数量约为其2倍的非循环MoE表现相当,同时通过循环实现了测试时扩展。
赞
评论
请
登录后发表观点

