关注微信公众号
-2026-
09/18
作者 李明亮
相关文章 and 关键字:vivo   VDC   
当前位置:爱科技  > 新闻 > 深度 > 端侧30B临界点:vivo的赌注与手机AI的下一个战场

端侧30B临界点:vivo的赌注与手机AI的下一个战场

当手机能跑30B参数大模型的那一刻,端侧AI的游戏规则就变了。

一、从"不可能"到"预研中":vivo修正了一个关键判断

2025年的VDC上,vivo副总裁、OS产品副总裁、vivo AI全球研究院院长周围的观点还是:手机端侧不一定要追求参数量的大小,3B、7B模型已经让内存很吃力了。

仅仅一年后,在2026年VDC的专访现场,周围给出了完全不同的答案——vivo正在预研30B端侧MoE大模型

转变的契机来自行业技术路线的分叉:大模型不一定要一次加载完,可以每次只加载一个或几个专家模型。MoE(Mixture of Experts,混合专家)稀疏架构的成熟,让"用2‑4GB内存激活1‑3B参数,却能调用30B总参数的知识容量"从理论变成了工程现实。

"去年我们觉得手机上跑3B、7B模型对于内存来说很吃力,但是在今年年初的时候,行业发生了变化。"周围说,"现在内存标配旗舰机型已经12G‑16G了,拿2‑4G内存加载MoE的模型变成了现实,基于我们去年对于这个技术的判断,今年做了修正,然后快速做出了我们自己的MoE模型。"

这不是vivo一家的判断。开源社区的进展同样惊人:BigMoeOnEdge项目已经验证了在12GB RAM手机上运行Qwen3‑30B‑A3B的可行性——模型文件比内存还大,但通过"按token从闪存按需读取专家"的流式加载方式,依然能跑出5 tok/s左右的推理速度。16GB机型的表现更好,IQ3_M量化档位下预估可达7‑10 tok/s。

技术上,30B端侧已经不是"能不能"的问题,而是"什么时候产品化"的问题。

二、30B塞进手机:MoE的魔法与工程的真相

    (一)原理:不是全加载,而是"按需叫专家"

    要理解30B模型为什么能在手机上跑,必须先理解MoE架构的本质。

    传统稠密模型(Dense Model)的每一次推理,所有参数都要参与计算。所以7B模型就需要7B参数的内存空间,30B就需要30B的空间——这是线性关系。

    MoE模型不同。它把知识拆成了几十个甚至上百个"专家",每个专家负责不同的领域。每次推理一个token时,路由器(Gate)会从所有专家中选出最相关的少数几个(比如8个),其余的全部跳过。

    以Qwen3‑30B‑A3B为例:总参数30B,但每次推理只激活约3B参数。 这意味着你不需要把30B全部放进内存——只要把当前需要的那几个专家读进来就行。

    BigMoeOnEdge这类引擎的核心贡献在于:它们构建了一层专家流式加载系统,让模型权重主要存储在闪存(UFS)里,RAM中只保留共享权重(注意力层、嵌入层等)和一个LRU专家缓存。每次推理时,通过路由钩子实时知道当前token需要哪些专家,然后用O_DIRECT方式直接从闪存读取这些专家的张量切片。

    这和传统mmap方式的区别是本质性的:mmap依赖操作系统的page cache管理,内存紧张时会剧烈抖动(thrashing),在手机上30B模型只能跑出0.089 tok/s的龟速;而显式的专家流式加载+LRU缓存直接绕过了这个问题,同样的硬件能跑到5.2 tok/s——提升了约58倍。

    (二)内存账本:16GB手机到底够不够用?

    我们来算一笔账。在16GB旗舰机上,内存分配大致是这样的:

    这就是vivo说的"2‑4GB内存就能跑30B"的由来——但要注意,这里的"2‑4GB"指的是真正参与当前计算的活跃专家+共享权重的增量部分,而不是整个模型的全部内存开销。完整运行30B MoE仍然需要大约10‑14GB的总内存空间(含系统、共享权重、缓存等),只是不需要一次性把30B全装进去。

    IQ3M量化(约13‑14GB文件)的版本在16GB手机上基本可驻留,流式加载退化为缓存加速,速度最快(7‑10 tok/s)。Q4K_M量化(约18.5GB)则超出了RAM上限,必须依赖流式加载,速度约5‑7 tok/s,但"模型比内存还大却能跑"本身就是最强的技术叙事。

三、三座大山:能跑≠好用,工程落地的真实挑战

30B端侧在技术上可行,但距离消费者日常可用,还有相当长的路要走。vivo选择用"预研"而非"发布"来描述这个项目,正是因为清楚知道中间的工程鸿沟。

    (一)冷启动太慢

    当前开源方案的冷启动时间在3‑4分钟以上——shared weights要从闪存读入RAM,LRU缓存要初始化,路由表要构建。如果算上prompt prefill(输入处理),一个2000 token的输入可能还要再加7‑8分钟。

    "提问→等5分钟→出答案",这样的体验显然无法作为常规功能交付给普通用户。

    vivo的应对思路是系统级优化:将常用的专家模型常驻内存,利用手机空闲时间(比如夜间充电)预加载;结合Main‑Loop的感知记忆系统,预判用户可能需要的能力,提前唤醒对应专家。周围在专访中提到"专家模型常驻,内存的常驻电流不高,不消耗电,真正耗电是搬运的过程"——这说明vivo已经在考虑专家常驻的功耗模型。

    更深层的优化空间在芯片级协同:2024年不提液态玻璃,2026年才提,是因为芯片规划周期是24个月。同理,MoE端侧的硬件加速——比如在NPU中增加专家路由的专用电路、优化UFS的随机读取性能——需要提前2年进入芯片规划。周围给出的时间节点是2028年底,这正好对应一代旗舰芯片的规划周期。

    (二)热降频

    手机CPU持续高负载10‑15分钟后,温度撞墙,频率骤降——这是所有移动端计算都绕不开的物理规律。

    骁龙8 Gen5的3DMark压力测试稳定性仅66%‑73%,意味着持续推理10分钟后CPU性能可能下降27%‑34%。对应到30B MoE推理,初始5‑7 tok/s的速度可能在热降频后掉到3‑4 tok/s。

    这不是单纯靠软件能解决的问题,但手机厂商有自己的解法空间:

        1. 指令集级GPU/NPU优化:周围明确提到"我们是指令集级别进行GPU的优化。现在做模型训练的厂商做不了端侧,要么功耗很大,要么内存要求很高,只有终端厂商和芯片厂商合作的时候,才能把端侧做得比较好"。

        2. 温度感知的动态调度:根据机身温度实时调整激活的专家数量、推理线程数、甚至动态切换大小模型,在发热和性能之间找最优平衡点。

        3. root/ADB级别的内核调优:通过调整LMK(低内存杀手)阈值、禁用Phantom Process Killer、设置oomscoreadj等手段,保证大模型进程不会被系统中途杀掉。

    (三)Android内存回收

    这可能是最"坑"的一个问题。BigMoeOnEdge项目的作者曾直言:"最难的部分不是流式加载,而是Android在生成过程中回收驻留权重。大部分工作都花在了阻止这件事上。"

    MIUI等定制ROM在RAM使用率达到80%时会激进地杀掉后台进程。跑30B模型意味着内存长期处于高压状态,随时可能被系统"杀"掉。

    vivo作为手机厂商,在这一点上有天然优势:

        1. 系统级白名单:自家的AI引擎进程享有最高优先级,不会被LMK误杀

        2. 内存管理深度定制:可以从底层调整ZRAM策略、page cache回收逻辑、匿名内存保护方式

        3. 前台服务保活:通过前台通知+WakeLock,确保CPU不休眠、进程不挂起

    这些都是第三方开发者想做但做不到的事情——这也是为什么vivo坚持自研端侧模型,而不是直接用开源模型的根本原因之一。

四、为什么是手机厂商?vivo的底气与差异化

在专访中,周围反复强调一个观点:端侧模型的体验优化,只有终端厂商能做好。

"也许在之后就跟PC一样,大家都能把手机运行得很好,我相信在三五年之内,终端厂商有意在这个方向上做自己模型的端侧化,它的体验才会是最好的,这是我们坚持在这个方向上投入的原因。"

这句话不是自大,而是事实判断。端侧AI的竞争,到最后比拼的不是谁的模型参数大,而是谁能把模型和硬件、系统、场景拧成一根绳。

    (一)端侧的核心优势:个人上下文

    vivo对端侧AI的判断,核心锚点是个人化智能。

    vivo AI产品总经理关岩冰在专访中说,vivo AI的两大差异化:一是端侧Harness与OS深度融合,二是基于用户个体数据的个人专属上下文。

    "你用手机,你的手机本地存了相关信息或者对你自己的理解,这部分就是你使用AI的时候最宝贵的上下文,使用端侧的时候可以更加安全、可控地管理。"

    周围又举了一个很具象的例子:做旅游攻略。携程的AI助手也能做,但你得告诉它"我爸70多岁了、有个小孩、老婆怀孕了"这些信息。而手机上的小V不需要——它知道你爸爸的年纪(从通讯录、照片、通话记录推断),知道你老婆怀孕了(从产检提醒、搜索记录、聊天内容感知),知道你最近在看巴音布鲁克的电影(从观影记录、讨论记录提取)。

    "你可以提醒别的智能助手5条、8条、10条,但总会漏几条。"周围说,"真正能做好让你满意,超过你预期,很贴心的攻略,真的需要懂你身边的家庭关系、社会关系和个人习惯、时空。只有这样信息背景的Harness,再去调用大模型小V的时候,它才真正能作出让你满意的个人化产品。"

    这就是端侧30B的真正价值——不是为了在手机上跟云端比推理更快,而是为了在保护隐私的前提下,让AI真正"懂"你。

    30B参数量带来的知识厚度,是7B、3B模型无法比拟的。当你的个人记忆、偏好、关系网都存储在本地,再配上一个知识足够渊博的本地大模型,才能做出真正"比你更懂你"的个人助理。

    (二)云端 vs 端侧:不是替代,是分工

    专访中有一个尖锐的问题:30B部署到手机之后,云端是完全不会介入吗?

    周围的回答很干脆:"完全不会介入。"

    但这指的是30B端侧模型本身的推理过程不依赖云端,而不是说手机AI从此跟云端没关系。实际上,vivo的AI战略是典型的"云‑端协同"架构:

        1. 端侧负责:隐私敏感数据处理、实时交互场景、个人记忆存储、常用功能快速响应

        2. 云端负责:超大模型复杂推理、多模态理解、跨设备同步、开发者服务

    30B端侧的意义在于,它把"云端才能做的事情"的边界又往端侧推了一大步。以前只有简单问答、图片识别能在端侧做;现在,复杂推理、深度摘要、代码生成、长文档分析这些曾经必须上云的任务,端侧也能搞定了——只是慢一点。

    而"慢一点"在很多场景下根本不是问题。比如相册整理、日程规划、信息摘要,这些都是后台可以默默做的事情,用户不需要实时等待结果。端侧的价值在于"能做"和"隐私安全",而不是"秒出"。

五、行业拐点:30B端侧将改变什么

    (一)对云端大模型的冲击

    "大模型能力过剩论"最近甚嚣尘上。OpenAI等公司呼吁不要内卷开发了,资本市场开始质疑大厂的资本开支能否持续。

    周围的判断分了三层:

        1. 通用人工智能的竞赛还远没结束。 "我认为还有一项工作没有开始,就是自我进化、自我迭代、自我训练,这部分大家刚刚开始,所以所谓的AI大模型训练还没有结束,新的征程才刚刚开始。"

        2. 生产力场景的模型能力已经够用了。 "从今年7月份之后绝大多数的生产力场景已经够用了,真正限制你的是想象力,Harness跟不上梦想的翅膀。"

        3. 端侧模型的能力会快速逼近云端。 "我们认为接下来两年之后,随着蒸馏技术的演进,可能3B的模型都已经能够做很多事情了……今天的30B和两年后的专家模型,可能每一个专家模型都相当于去年70B的能力。"

    如果这个判断成立,那么云端大模型的价值重心将从"模型本身"转向"调度和执行"——也就是Harness层、Agent编排层、工具调用层。这也解释了为什么今年VDC上vivo重点讲的是Harness和引擎,而不再拼参数量。

    (二)对芯片行业的倒逼

    30B端侧给手机芯片提出了全新的要求,但不是"更多CPU核心"或者"更高主频"那种简单粗暴的要求。真正需要的是:

        1. UFS随机读取性能:MoE流式加载的瓶颈不在计算,而在I/O。更高的随机读带宽、更低的访问延迟,直接决定推理速度

        2. 内存容量与带宽:12GB是入门,16GB是主流,24GB可能成为下一代旗舰的标配

        3. NPU的MoE加速:如果能在NPU中加入专家路由、稀疏计算的专用硬件单元,能效比将有数量级提升

        4. 散热架构:持续推理需要更高效的散热设计,VC均热板面积、导热材料都要升级

    周围给出的2028年时间节点,本质上是在等下一代芯片。"今年提MoE,同样是24个月之后,对应的这些芯片规划也会出来,加上我们还有一两年的时间把这个模型调校好,所以到2028年底,MoE实现今天所谓的大模型能力在端侧上一定会变成现实。"

    (三)对手机厂商的重新洗牌

    端侧AI正在成为手机厂商的新分水岭。

    不是所有厂商都有能力自研30B MoE模型,更不是所有厂商都有能力把模型从芯片指令集层面一路优化到用户体验。这需要AI团队、OS团队、芯片合作团队的深度协同,需要持续多年的投入。

    vivo的策略很清晰:端侧优先 + 个人化智能 + OS深度融合

        1. 6000+原子化能力开放给Agent调用,先把自家系统的路走通

        2. Main‑Loop感知记忆系统,在后台默默理解用户的数据,构建个人化知识库

        3. 端侧Harness与OS原生融合,而不是在系统之上套一个第三方助手的壳

        4. 30B MoE的预研,为2‑3年后的端侧能力跃迁做技术储备

    这条路不好走,但走通了就是护城河。就像vivo的影像能力——同样的传感器,同样的ISP,出来的照片味道就是不一样。端侧AI也会是一样的道理:参数大家都能追,但体验的厚度,只能靠日复一日的场景打磨。

六、结语:口袋里的算力革命

2026年的今天,手机端侧30B大模型还处在"能跑但不好用"的工程验证阶段。它更像是一个临界点的信号——告诉我们端侧AI的天花板远比想象中高。

但真正重要的不是"30B"这个数字,而是它背后的范式转移:

从"AI是一个你去调用的功能",变成"AI是一个始终在你身边、懂你、替你思考的存在"。

这需要足够强大的端侧模型(否则不够聪明),需要绝对的隐私安全(否则不敢把个人数据交出去),需要深度的系统整合(否则AI只能站在系统外面看,而不是融入系统内部运转)。

vivo在做的,就是把这三件事揉到一起。30B端侧MoE是技术底座,个人化智能是产品理念,OS级融合是工程路径——三者结合,才有可能做出真正"不一样、好很多"的AI手机体验。

2028年底,我们再回头看。

  • 评论

热门产品排行