导航菜单
首页
排名 涨幅榜 跌幅榜 24h成交额 新币榜
快讯 机构 观点 人物 专题

27B参数AI模型Bonsai首次实现手机端运行:1-bit压缩技术让大模型瘦身98%

人工智能模型通常消耗大量内存。按照行业标准,一个270亿参数的AI模型被认为是中等规模,在半精度下运行需要约54GB内存。大多数笔记本电脑无法承载,部分台式机也无法满足。本周早些时候,PrismML发布了一个仅3.9GB的版本——小到足以装入iPhone。

参数代表模型可以处理的调节和微调数量。参数越多,模型越密集、能力越强。Bonsai 27B是首个突破消费级智能手机内存天花板270亿参数级别的模型,在iPhone 17 Pro Max上以每秒11个token的速度运行。(Token是AI模型处理和产生的基本信息单位。)三元变体版本大小为5.9GB,在M5 Pro笔记本电脑上可达每秒26个token。两者均在Apache 2.0许可证下免费提供。

压缩方法基于加州理工学院的知识产权,将每个模型权重从16位浮点精度压缩到单个符号——二进制构建中为+1或-1,三元构建中为三个值之一。每128个权重共享一个16位缩放因子,使二进制变体达到每权重1.125位:比全精度原始模型小14倍。三元模型增加了零状态以获得稍强的表达能力,最终达到每权重1.71位。通俗地说,三元AI模型对每个内部值仅使用三种设置——负、零或正——而标准AI可以从约65000种设置中选择。PrismML在几乎不损失输出质量的情况下实现了这一点。

与传统“低比特”模型不同之处在于,没有任何部分获得更高精度的“逃生舱”:嵌入、注意力以及完整的语言模型头部均被端到端压缩。大多数量化版本会保留某些敏感层的全精度,这以牺牲尺寸为代价换取更好的质量。Bonsai不玩这种游戏。

这是该系列第二个重要版本。今年3月,PrismML发布了Bonsai 8B,一个1.15GB的模型,证明了1位架构可以在80亿参数下生存,且推理能力不会崩溃。跃升至270亿参数改变了游戏规则——这个规模下,持续的思维链推理、可靠的工具使用以及多步代理行为才能稳定涌现,而小型模型仍会失败。

基准测试

在NVIDIA H100 GPU上以思考模式评估的15项基准测试中——涵盖知识、数学、编码和工具使用——三元Bonsai 27B平均得分80.49,达到全精度模型的94.6%。1位变体得分为76.11。总体而言,在基准测试中,这些模型在大小相当的情况下表现远优于Gemma 4或Qwen 3.6。

Meet Bonsai: The First 27B AI Model That Fits on Your Phone

考虑到所需的资源极少,这些模型将小型硬件(智能手机和低端PC)的能力提升到了新高度。AIME25和AIME26(基于美国数学邀请赛)中,三元Bonsai 27B得分为93.7%,而更大的Qwen 3.6B为95.3%。Bonsai在编码方面得86分(Qwen 3.6为88分),一般知识方面得77%(Qwen 3.6为83%)。

Meet Bonsai: The First 27B AI Model That Fits on Your Phone

该模型还使用了混合注意力骨干,大约75%的层是线性的而非完全二次注意力。正是这种架构使得262K token的上下文窗口在设备上变得可行——标准注意力堆栈在手机硬件上将过于昂贵。

实测体验

我们亲自测试了Bonsai 27B。编码需要迭代:单次提示无法与云端前沿模型竞争。但本地且免费的特性使这一点无关紧要。在我们的Zombie Type游戏(一款第一人称打字恐怖浏览器游戏)中,两轮“氛围编码”产生了干净碰撞检测、正确计分逻辑以及可靠的图形。模型能很快把握结构;第二遍精化而非重写。有趣的是,某些元素(如骷髅)看起来比GPT 5.6 Sol生成的更精细。这并不意味它全面更好,只是在这个任务上它生成了一个可爱的骷髅,而AI之王做了一个较差的风格选择。

Meet Bonsai: The First 27B AI Model That Fits on Your Phone

游戏可供测试(原文链接)。创意写作则更为主观。粗略来说,若使用零次提示,结果并不特别富有想象力。但Bonsai能生成具有一致内部逻辑、节奏和情节弧线的故事——在类似提示下,优于或与Claude Haiku甚至Sonnet的低成本版本相当。对于一个完全运行在自有硬件上且无API费用的模型,这已相当出色。其创作的故事可在我们的GitHub仓库中找到。

PrismML还随模型提供了DSpark推测解码层——一个轻量级草稿器,可提出候选token块,主模型通过单次前向传递验证,而非逐个token生成。在H100上,这带来了1.37倍的吞吐量提升,且输出质量不变,因为验证保留了精确输出分布。在Apple Silicon上默认尚未启用,但对于GPU服务来说这是真正的增益。

苹果的兴趣增加了商业维度。PrismML CEO Babak Hassibi向CNBC证实,公司正与苹果进行早期洽谈,后者正在评估该压缩技术用于设备端。Hassibi表示,压缩版Gemma模型是下一个计划,随后是更大的前沿模型;1位Bonsai 27B现已可在Apache 2.0下免费下载。如需在本地运行此类模型的指南,请查看我们的教程。