昊梵体育网

SciConsolidate:从经验到能力的原生转化 模型做过的科学计算任务,真

SciConsolidate:从经验到能力的原生转化
模型做过的科学计算任务,真的能“学会”吗?

我们发布 SciConsolidate:让模型把执行中的成败与修复经验,内化成原生科学计算能力。它不是把过往的记忆塞回 prompt,而是让经验真正沉淀到模型参数中。

🚀 它解决什么问题?
科学计算里的错误不只是答案错了:公式、单位、数组轴、接口、数值稳定性或状态更新出错,都会让后续计算偏离。过去,这些反馈大多留在日志里;SciConsolidate 尝试把它们变成下一轮学习的原料。

✨ 核心发现
“知道一条正确规则”不等于“能把规则写成连续可执行的代码”。
在 SciCode 上,同一套程序性知识运行时注入后,Qwen3.6-27B 的子步骤/主问题提升 3.85/6.26 分;但 Qwen3.5-9B 整体几乎没有收益,甚至会出现负迁移。我们把这层差距称为 abstraction-execution gap:抽象经验与执行能力之间,还隔着一次具体化。

🌟 怎么跨过去?
SciConsolidate 不要求弱模型直接“读懂”抽象规则。它先从多次执行轨迹中归纳跨任务失败模式,例如数组/数值推理、逻辑与依赖传递;候选知识还需在独立验证集证明可迁移。随后,强模型把规则绑定到具体任务、生成可执行的过程性解法,弱模型再用 SFT 学习这些轨迹。

📈 结果 SciConsolidate
在覆盖物理、化学、生物、材料、数学五大学科,涵盖 80 个主问题和 338 个子步骤的 SciCode 上进行了验证,部署时不再向模型注入外部程序性知识。procedure-guided SFT 相比 no-procedure SFT,在子步骤/主问题上提升 3.89/6.25 分;相对原始 9B 基线提升 5.62/11.25 分。在数组与数值推理、逻辑判断和依赖传递等主要失败模式上,模型已能显著将一部分程序性知识内化为原生能力。

🔬 数据如何扩展?
它还能根据真实失败模式和领域分布,合成新的科学计算任务,不必先为每道题准备标准答案;但并不跳过校验,候选解法仍要通过执行、接口和局部行为测试。这样,模型暴露出的薄弱处可以用来决定下一批任务分布,用以将失败模式具体化为可学习样本。

论文与代码链接见评论区。

科学智能 科学计算 大模型 人工智能 科研工具ai4s 科技AMA