如何构建 AI 扩展定律以实现高效 LLM 训练和预算最大化

MIT-IBM 团队发布大规模语言模型扩展定律系统性指南,通过分析 485 个模型和 190 万条性能指标,拟合超 1000 条扩展定律。研究发现预测相对误差最佳可控制在 4%,并证实小模型与大模型存在可迁移规律。建议优先训练多个小模型而非追求大模型,中期检查点数据最具预测价值。这项研究为资源受限的研究者提供了更公平参与大模型研究的可能,揭示了扩展定律在跨模型家族间的通用性。

发布于2026年4月13日 10:04
编辑小创
评论0
阅读67

MIT-IBM 团队发布大规模语言模型扩展定律系统性指南

训练大型语言模型往往耗资数百万美元。在预算有限的情况下,研究人员需要在模型架构、优化器和数据集选择等关键决策上精打细算。传统做法是通过扩展定律( scaling laws )来预测大模型性能:用规模更小的模型来估算目标大型模型的预测质量。然而,面对数千种可能的扩展定律构建方式,如何选择一直缺乏系统性的参照标准。

MIT-IBM Watson AI Lab 研究团队近日解决了这一困境。研究人员收集了来自 40 个模型家族的 485 个独立预训练模型及其训练检查点、计算成本、训练轮次等数据,并整理了 190 万条关于损失函数和下游任务的性能指标。基于这些数据,研究团队拟合了超过 1000 条扩展定律,并对比了它们在不同架构、模型规模和训练策略下的预测准确性。

研究的核心发现是:受随机种子噪声影响,扩展定律预测的绝对相对误差( ARE )最佳可控制在 4% 左右,而高达 20% 的误差在资源决策中仍具参考价值。具体而言,将中期训练检查点纳入分析能显著提升预测可靠性,但训练初期、 10 亿 tokens 之前的数据噪声较大,应当舍弃。研究建议优先在不同规模区间训练多个模型,而非一味追求大模型,五模型起步可提供稳健的预测基础。在成本受限的情况下,也可以仅训练目标模型家族中一个较小规模模型,借用架构相近家族的扩展定律参数。

令研究团队感到意外的是,部分训练的小模型展现出相当的预测能力,而来自完全训练模型的中期检查点数据可以直接用于其他目标模型的预测。更出乎意料的是,扩展定律在大型模型和小型模型之间表现出强相关性。此前学界普遍认为小模型与大规模模型存在本质差异。

这篇论文标题为《 A Hitchhiker‘s Guide to Scaling Law Estimation 》,已在国际机器学习大会上正式发表。研究人员下一步计划将分析扩展至模型推理阶段,探讨推理时长与性能的关联。


创艺洞察

这项研究的价值不仅在于提供了操作指南,更在于它揭示了一个长期被忽视的事实:扩展定律并非黑箱,不同模型家族之间存在可迁移的高层规律。三个超参数便能解释几乎全部行为变异,这意味着资源受限的研究者有了更公平地参与大模型研究的可能。与此同时,研究团队对推理阶段扩展定律的布局更具前瞻性。当训练成本相对固定而推理需求持续增长时,能够预判推理资源需求的理论框架将成为下一代模型开发的核心基础设施。

相关文章

Anthropic 开源知识工作插件库,111 个无代码技能包重塑智能体工作流
AI 教程知识
2026年9月18日
0 条评论
小创

Anthropic 开源知识工作插件库,111 个无代码技能包重塑智能体工作流

Anthropic 开源 knowledge-work-plugins 项目,提供 111 个无代码智能体技能包。该体系基于 Markdown 和 JSON 构建标准化模块,支持渐进式披露与 MCP 工具集成,标志提示词工程向软件工程化转型。内置 marketing 与 productivity 等插件展示了结构化输入及分层记忆范式,支持语义路由与轻量化定制。尽管存在多插件上下文竞争及云端连接器限制内网访问等问题,仍为智能体工作流提供了可复用的模块化规范。

#智能体#AI工具#提示词工程
阅读全文
oh-my-hermes 实操:给智能体装上编码拆解与记忆作业层
AI 教程知识
2026年9月18日
0 条评论
小创

oh-my-hermes 实操:给智能体装上编码拆解与记忆作业层

oh-my-hermes 是为 Hermes 智能体设计的工程作业层插件,旨在解决复杂编码任务中的调度与验证难题。该工具通过模型路由、任务拆解及严格证据门禁,将自然语言转化为专业交付流,实测可降低约 85% 成本并大幅缩短耗时。其核心特性包括 12 类任务回退链、基于 Git Worktree 的安全并行执行、四态状态追踪及评审制长期记忆机制,有效防止上下文污染与虚假完成。尽管在超大仓库处理上仍有局限,但显著提升了开源模型的工程交付确定性。

#智能体#AI工具#vibe coding
阅读全文
Google 工程经理开源 agent-skills,用结构化规范约束 AI 写出生产级代码
AI 教程知识
2026年9月18日
0 条评论
小创

Google 工程经理开源 agent-skills,用结构化规范约束 AI 写出生产级代码

Google 工程经理开源项目 agent-skills 通过结构化 SKILL.md 规范约束 AI 编码智能体,解决其生成代码缺乏工程纪律的问题。该项目覆盖定义、计划、构建等六大研发阶段,内置 25 个专业技能与反偷懒机制,强制 AI 遵循测试驱动及质量门禁标准。支持 Claude Code、Cursor 等主流工具集成,推荐从规格定义、TDD 及代码评审三步最小闭环起步,将无序补全转化为可预测的工程化构建,提升 AI 代码的生产级交付能力。

#AI工具#智能体#vibe coding
阅读全文
互动讨论

评论区

围绕《如何构建 AI 扩展定律以实现高效 LLM 训练和预算最大化》展开交流,未登录用户可浏览评论,登录后可参与讨论。

评论数
0
登录后参与评论
支持发表观点与回复一级评论,互动后将同步到消息中心。
登录后评论
暂无评论,欢迎成为第一个参与讨论的人。