昊梵体育网

有个YC孵化的团队,把能听懂人话、会自动调用工具的大模型,压缩到了14MB——比

有个YC孵化的团队,把能听懂人话、会自动调用工具的大模型,压缩到了14MB——比一张高清照片还小。

100美元的设备就能跑,智能戒指都塞得进去。

8月10号,这条消息在Hacker News上炸了,一天527个赞。做智能戒指的Pebble已经把它跑进了自家App里,创始人就是当年做Pebble智能手表的Eric Migicovsky。

这公司叫Cactus Compute,专做端侧AI:让AI跑在手机、手表、音箱、扫地机器人上,而不是把数据传上云、等云端算完再传回来。

他们有三件套:Needle是14MB的小模型,专干工具调用——把"空调调到26度"翻译成一行代码,让设备执行;Cactus Engine是跑模型的推理引擎,相当于发动机;Cactus Hybrid是端云协同,简单指令本地处理,复杂问题自动转给云端大模型。

关键问题来了:普通大模型动辄几十GB,14MB凭什么能听懂人话?

靠四招。

第一招,问题重构。聊天大模型要几十亿参数,是因为它得背下整个世界。但"打开灯""定个闹钟"这类指令,本质是把一句话映射到设备预设的功能清单上:选哪个功能、填什么参数。这不需要世界知识,4500万参数就够。Needle 2就是45M参数、14MB体积、28MB运行内存。

第二招,也是最狠的一招:从训练第一天就开始压缩,而不是训练完再压缩。行业常规是先训个大模型,再用"量化"把参数从32位精度砍到4位甚至2位——这是事后压缩,精度有损,模型越小损失越明显,经常一压就废。Cactus叫"量化感知训练":从预训练到微调全程按2bit精度训练,权重、激活、缓存全用2bit。部署出去的模型,就是当初训练的模型本身,一分没打折。

第三招,架构上偷工减料。普通模型里有一大块叫MLP的组件,占了小模型一大半的权重读取。Cactus用一个不需要学习参数的固定数学变换替代它,效果接近,几乎不占体积;世界知识则塞进一张哈希表,每次推理只查几行。好比别人背一整本百科全书,它只带一张索引卡,用到哪页翻哪页。

第四招,内存和速度抠到极致。权重从不解压进内存,2bit的码直接在CPU寄存器里展开、走整数运算;注意力只保留最近256个token;输出时用语法约束,生成前就知道哪些字合法,直接跳过98%的词表计算。结果:树莓派5上每秒生成500个token,100到200美元的安卓机上每秒300到700个,连ESP32-S3这种单片机都能跑。训练数据只用了1150亿加380亿token,对比参数多5倍的同类模型用了19万亿token,数据效率差了120倍。

那它怎么赚钱?官网没公开具体报价,收费细节部分是推测。

一是开源模型当漏斗,卖服务和引擎。Needle按Apache 2.0开源,GitHub五千多星,谁都能下载。但官网挂着大大的"Talk to us":定制工具库、针对特定芯片调优、拿客户自己的数据做后训练,这些是收费服务。模型免费、服务收费,典型的开源引流打法。

二是Hybrid按量收费。模型内置一个路由器,每次收到指令先算个置信度:有把握就本地答,没把握才转云端大模型。官方数据:入门级Gemma 4配上这套路由,视觉、语音类任务本地能扛下五六成到七成,只有两三成上云;纯文本硬核推理本地扛不住,约九成要上云——路由器清楚自己几斤几两。官网口号是"免费起步,随规模付费",即按用量收费(推测)。

三是硬件厂商合作(推测)。Pebble把模型装进戒指,或按设备收授权费,或联合开发定制版。全球IoT设备约210亿台,PC才15亿台,这个盘子比手机大得多。

客户为啥愿意付钱?因为省钱。算笔账:智能音箱每次指令都走云端大模型API,按token计费,一台设备一天几十上百次调用,一年API账单可能比设备本身还贵,百万台设备就是天文数字。模型本地跑一次,电费几乎为零,延迟150毫秒内,断网可用,数据不出门。省下的云账单就是客户的利润,这就是付费理由。

当然也有翻车现场。有网友输入"我宿醉了",模型一本正经调用"锁门",推理写着"宿醉暗示需要锁好门",置信度0。主创下场回应:这正是置信度机制存在的意义——模型知道自己没把握,就返回空调用,把问题抛回给用户或云端。但质疑也有道理:14MB的模型终究没有世界知识,只能做窄而深的工具调用,一泛化就露馅。

我的看法:全世界都在卷通用大模型,它只做"工具调用"一个点,反而成了最锋利的刀。这套打法个人开发者完全能抄:别做大而全,做窄而深;开源做势能,服务做收入;找到帮客户省钱的场景,客户自己上门。AI时代最值钱的不是模型本身,而是帮客户省下的每一分钱。
ai创业 人工智能