PrismML 的 1-bit 大模型在 2026 年 9 月 24 日登上高通 Snapdragon Summit:AI 实验室 PrismML 的 1-bit Bonsai 大语言模型,跑在了一副基于骁龙 AR1 Gen 1 平台的 AI 智能眼镜上,全程本地运行,不需要联网回传云端。PrismML 在 9 月 23 日的官方公告中宣布了这次亮相。
眼镜这副形态,可能是"端侧 AI"迄今最难啃的一块骨头。手机有电池和散热,眼镜没有。一副日常佩戴的眼镜,能塞下的算力和功耗预算极其有限。PrismML 这次演示回答的问题是:一个 20 亿参数的视觉语言模型,到底能不能住进镜腿里。
Bonsai 到底是个什么模型
PrismML 是一家由加州理工学院研究人员创办的 AI 实验室,顾问包括加州大学伯克利分校的 Ion Stoica。它的招牌技术是 1-bit 量化:把大模型压缩到原来的四分之一体积,同时在标准基准测试上几乎不掉点。
这次登陆眼镜的版本,是一个 20 亿参数的模型,专门针对视觉和语言做了调优。演示的效果是:戴着眼镜看向桌上的咖啡杯,随口问一句"这是什么",模型能实时结合看到的画面作答。没有云端中转,延迟和离线可用性是它最大的卖点。
PrismML 的目标说得很直白:做开权重的端侧 AI,把设备上已有的算力用足。它的潜台词也很直白——与其相信闭源大厂的隐私承诺,不如让数据根本不出设备。
为什么"本地运行"四个字是关键
智能眼镜可能是对"本地运行"最敏感的设备形态。它的摄像头对着的是佩戴者的第一视角:家里、办公室、孩子、屏幕上的文件。如果每一帧画面都要上传到云端才能理解,用户要交出的信任成本极高。
本地运行改变了这笔账:画面在设备上被理解,答案在设备上生成,原始视频不需要离开眼镜。对隐私敏感的用户来说,这是从"相信我"到"不用信我"的区别。功耗和延迟是附带的红利——少了网络往返,响应更快,也更省电。
这也是 1-bit 这类极限压缩技术的用武之地。AR1 Gen 1 本来就是为低功耗可穿戴设计的平台,配上一个被压到四分之一体积的模型,"够用的智能"第一次有了塞进眼镜的可能。
演示和产品之间,还差一款真正的眼镜
泼一盆冷水:目前还没有任何一款智能眼镜产品宣布搭载 PrismML 的模型。这次亮相是芯片厂商峰会上的技术展示,证明的是"跑得起来",不是"买得到"。
这条界限很重要。端侧 AI 的历史上,演示惊艳、量产难产的案例不少:功耗达标了,散热没达标;散热达标了,连续使用两小时就没电;电量达标了,模型能力又不够日常用。Bonsai 在基准测试上"几乎不掉点",指的是和它压缩前的版本比,不等于它能替代云端大模型处理复杂任务。
但方向是对的。当 20 亿参数的视觉语言模型能住进眼镜,AI 助手的形态就不再被手机屏幕框住。接下来要看的只有一件事:哪家眼镜厂商敢第一个把它装进量产机,并且回答好续航和发热这两道必答题。