昊梵体育网

关于 Scaling Law 的一些思考 take away: 不要再把 Scaling Law 简化为参数 Scaling。更完整的模型能力函数应当是:模型能力 ≈ 总参数容量 × 预训练数据 × 单次推理计算 × 有效推理深度 × 后训练质量 × 推理时计算 1.    总参数量主要代表容量,不等于智能。 它更能解释知识广度和长尾记忆,却不 ​

关于 Scaling Law 的一些思考 take away:

不要再把 Scaling Law 简化为参数 Scaling。更完整的模型能力函数应当是:模型能力 ≈ 总参数容量 × 预训练数据 × 单次推理计算 × 有效推理深度 × 后训练质量 × 推理时计算
1.    总参数量主要代表容量,不等于智能。
它更能解释知识广度和长尾记忆,却不能单独解释复杂推理、Agent 能力或长程任务成功率。
2.    MoE 必须同时看总参数与激活参数。
总参数量回答“能装多少”,激活参数、激活专家数和有效深度回答“每次调用实际用了多少能力”。
3.    推理能力更依赖有效计算深度。
对漏洞发现、编程、科研和复杂 Agent 任务而言,关键在于能否稳定维持长因果链、执行多步行动并从反馈中纠错,记住答案只是基础能力。
4.    Scaling 的主战场正在从预训练向后训练和环境扩展迁移。
当基础模型跨过知识容量阈值后,RL、可验证环境、长程任务轨迹和高质量反馈的边际回报,可能高于继续盲目增加总参数。
5.    模型比较不能只看“多少B”。
以后评价 GLM、Kimi、DeepSeek、Claude、GPT 等模型,应同时考察:总参数、激活参数、训练 token、每次前向计算量、推理时计算、RL 环境规模,以及长程 Agent 任务的完成率。
中国模型公司即使暂时受限于预训练算力,也可能通过环境、RL、验证器和任务数据,把现有基座的能力继续向上“榨取”。