张一鸣罕见发声,严禁豆包蒸馏其他模型!
最近,张一鸣罕见发声,表示:做AI大模型不能靠“蒸馏”去蹭别人的成果,必须走扎扎实实自研的路线。什么是大模型领域的“蒸馏”?就是把市面上别人已经训练好的、更先进的大模型当成“老师”,直接拿它跑出来的回答和数据,去喂养和调教自己的模型。这样做的好处非常明显:省钱、省算力、见效快。只要借用高水平模型的输出,自己的模型就能在短时间内大幅提升性能,在各类测试榜单上跑出一个好看的名次。
但在张一鸣看来,这种看似高效的办法,其实是自己害自己。第一,蒸馏换来的高分是虚的。拿别人的输出去训练自己的模型,就像是直接抄优秀学生的答题过程。你看起来也能考高分,但你并没有真正理解题目背后的底层逻辑。只要遇到没见过的难题,或者原模型不再提供支持,你立刻就会被打回原形。第二,蒸馏会锁死自己的技术上限。依靠蒸馏研发出来的模型,性能上限永远不可能超过被它拿来做参考的那个源头模型。一旦习惯了走这种捷径,研发团队就会产生依赖,进而失去对底层技术、算法架构进行创新的能力。第三,蒸馏会干扰真正的技术突破。大模型技术的发展需要大量的投入和极大的耐性。如果全行业都在用蒸馏去换取一时的榜单排名和公关声量,表面上看百花齐放,实际上大家都在做低水平的重复劳动,真正有难度的底层攻坚反而没人愿意做了。
所以张一鸣提出了八个字:长期主义,延迟满足感。他提倡的是,做模型宁可牺牲一部分短期收益,甚至不惜在内部建立技术检测手段来禁止蒸馏,也要把资源投入到自研和底层突破上。大模型的竞争本质上是一场长跑。依靠蒸馏确实能很快拿出一张好看的成绩单,但到了下半场,决定谁能真正站稳脚跟的,依然是那些愿意下真功夫、从底层架构开始一点点做技术原创的人。
