论文从头训练了基于HRM-Text(分层推理架构)的英丹双语模型,汇入161个数据集、每轮704.8亿token。关键是用Gemma 4 31B生成并审核“移植数据”,替代不合许可的原数据。
它让高低层循环推理,像“先统筹、再细想”,并把许多选择题改成自由生成。英语平均69.0,只比Qwen 3.5 4B低0.3;数学与代码64.1,较HRM-Text 1B提升36.7%;丹麦语56.8,为对比模型最高。
📌 实战上,数据许可、任务形式和目标能力要一起设计。低资源语言可尝试用审核后的合成数据补缺,端侧Agent可用1B模型降成本;但其助手能力有限,数学与代码也落后Gemma 4。
这项工作说明,小模型也能靠架构与数据逼近前沿。喜欢开放模型和高效推理的同学值得细读。
📚 论文地址:https://arxiv.org/pdf/2608.13517
🤗 模型地址:https://huggingface.co/danish-foundation-models/DFM-Mimir
#人工智能就业 #大模型 #AI #机器学习 #论文

