AI Agent 手机下半场,“国标”L3只是起点

日期:2026-08-09 20:14:40 / 人气:2


一张证书,暂时还不会影响到你「换机」节奏。
时间回到7月下旬,如果你关注智能手机领域的话,应该会记得大量手机厂商开始官宣自己的手机,通过了国家人工智能L3级认证。
这轮集体官宣的起点,是2026年7月17日公布的首批人工智能终端智能化分级测试结果。
按照首批测试名单,移动终端中共有11款产品达到L3,包括9部手机和2台平板。手机部分覆盖华为、摩托罗拉、荣耀、vivo、OPPO、小米和阶跃星辰等品牌。
名单发布后,厂商很快把一份技术测试结果翻译成了适合社交媒体传播的语言。华为强调「首证」,小米强调「国家级」,vivo则直接把L3称作当前最高智能化评级。华为和小米在7月18日官宣,OriginOS在次日跟进,几张相似的L3海报构成了一场少见的集体预热。
虽然口径上存在着一些细微差别。但能看出这些宣传背后指向的是同一个认证测试,既工信部在今年5月发布的《人工智能终端智能化分级》。
这个L3能力究竟代表什么?我们什么时候才能用上这些L3手机?以及如果按照汽车的标准来理解的话,更长远的L4级是否就是代表完全无需人工干预的AI Agent的设备形态?
01
L3不代表「自动驾驶」
在介绍整个认证规范前,其实有两个容易陷入的理解误区。
第一,认证对应的GB/Z 177—2026《人工智能终端智能化分级》是一套国家标准化指导性技术文件,不是强制性国标。
整个系列采用「2+N」结构,前两部分给出参考框架和通用要求,再分别针对手机、电脑等终端制定测试方法;其中,移动终端对应的是GB/Z 177.3—2026。
它提供的是行业共同使用的能力标尺,不是一条决定手机能否上市的准入红线。这也是标题里给「国标」加上引号的原因:它确实属于国家标准体系,但现阶段主要承担指导和评价作用。
第二,L3评的是一款具体终端及其软硬件版本,不是给整个品牌发段位。某个型号通过L3,不等于同品牌所有手机自动升级;没有出现在首批名单里,也不等于测试失败,因为首批结果来自厂商主动送测,并非市场随机抽样。这显然也确实不包括市面上所有的AI Agent手机产品:同样在7月底官宣预热进入内测阶段的OPPO AI Agent手机项目小布NEXT,就没有在这份名单中。
换句话来讲,L3可以成为产品卖点,但它还不是一张手机行业的总排行榜。
02
L1如何「升级」到L3
此外你可能也注意到了:这套标准其实并不是针对模型能力的测试。它把终端能力拆成感知、认知、执行、记忆和学习五个维度,下面再分用户感知、任务规划、工具调用、长短期记忆和情境适应等14项能力。
把这些术语放进一个日常场景,会更容易理解。假设用户对手机说:「帮我安排一次周末去杭州的旅行。」
L1是「响应级」。手机能听懂一条简单而明确的指令,调用确定的工具,完成一步任务。比如打开日历,或者设置周六早上的提醒。它更像一根被语音触发的手指:你让它点哪里,它就点哪里。
L2是「工具级」。手机能够理解简单意图,做有限推理,调用预设工具完成一步或路径明确的多步任务。它可以查杭州天气、生成一份行程建议,再把结果留在当前对话里;但流程基本是产品预先铺好的,记忆也以短期上下文为主;其实已经接近手机上装一个豆包APP等效的效果。
如今主流手机搭载的手机智能助手,其实已经普遍达到了L2级能力|图片来源:Apple
而手机厂商普遍提及的L3,则是目前真正要达到的目标「辅助级」:手机要理解更完整的目标,信息不足时主动追问,把任务拆开,再根据情况选择和编排工具。它还要具备短期与长期记忆,让「不坐早班车」「酒店尽量靠近西湖」这类偏好在下一次任务中继续生效。
阶跃星辰在今年WAIC期间演示的相关AI Agent操作手机能力|图片来源:极客公园
同一句「安排杭州旅行」,到了L3,可能被拆成确认日期和预算、查询交通与天气、筛选酒店、生成日程、写入日历。涉及付款、敏感数据或不可逆操作时,再把确认权交还给用户。
L1到L3的差别,不是AI的回答越来越像人,而是手机对任务承担得越来越完整。
移动终端的测试也比一张演示海报具体。终端需要在至少3个典型场景中接受测试,达到目标难度的工具调用任务比例不低于80%。单项任务默认要在5分钟内完成,最多有3次机会;端侧能力在离线环境中测,端云协同能力则在联网环境中测。
除此之外,L3的长期记忆至少需要覆盖3类信息,可以是用户基本信息、工具偏好、对话历史、常去地点、日程待办或使用习惯。但复杂推理和规划可以放在云端完成,标准也没有要求L3必须具备持续进化学习能力。
这解释了模型与等级之间的关系。大模型负责理解语言、识别图像和规划任务,是手机的核心能力来源;但模型再强,如果只能困在聊天框里回答问题,依然不足以让整台手机成为L3。反过来,一个参数并不夸张的模型,如果能和操作系统、工具接口、用户记忆及云端能力配合,也可能完成L3任务。
此外,7月15日公布的手机端模型备案名单和L3测试同样不是一回事。备案解决生成式AI服务能否合规提供的问题;L3测试评的是模型装进具体手机后,能否和系统、应用一起完成任务。前者是服务的合规底线,后者是终端的能力刻度。
真正参加考试的不是一个模型,而是模型、系统、应用和权限机制组成的整支队伍。
另外,你可能注意到一个与汽车智驾标准不同的细节是,手机厂商普遍把L3称作「当前最高等级」。
但其实这本身也是一个文字游戏:L3的确是当前已经给出明确要求、可以进行测试的最高等级,但并非这套认证中的的最高等级:在标准细则中,L4的名称是「协同级」,具体要求却直接标注为「待定」。面向手机和平板的GB/Z 177.3—2026,目前也只规定了L1、L2和L3的测试方法。
工信部对于适用于移动终端的L3要求介绍|图片来源:工信部官网
换句话来讲,L3级别的AI Agent的手机仍是一名助手:它能拆任务、调用工具、记住偏好,却主要围绕一台终端和一个用户目标工作。到了「协同」,问题会自然扩展到多个智能体、多个设备和多个服务主体。
手机能不能把订票交给旅行智能体,把预算交给支付服务,再让车机、耳机和日历共同调整计划?任务执行错了由谁负责?一个Agent获得的权限,能不能传递给另一个Agent?这些问题没有稳定答案,L4就很难拥有可重复的测试题。
L4空着,暴露的不是模型能力不足,而是协同规则、责任边界和安全机制还没有成熟。
手机的L1—L4也不能套用自动驾驶的责任逻辑。自动驾驶等级围绕车辆接管动态驾驶任务以及事故责任划分;AI终端等级衡量的是任务复杂度与系统能力。数字看起来一样,考试科目完全不同。
因此,现在任何把一部L3手机包装成「全自动驾驶级AI」的说法,其实你都可以理解为是「传播话术」。至于真正的L4手机,至少要等标准先回答什么叫协同——以及协同失败时谁来踩刹车。
03
还需要换手机吗?
对普通消费者来讲,我听到最多关于这套标准的问题是,随着这套分级标准的逐渐落实,为了用到更好的AI Agent能力,我们需要换新手机吗?
如果严格按照国标来问,L3手机什么时候上市,答案是:已经上市了。
因为首批名单并不全是尚未发布的手机新品:华为Pura X Max在4月已经发布,3款联想moto手机也在5月亮相。当然名单中同样存在尚处发布窗口的产品,例如荣耀Robot Phone。此外,更加为人熟知的「豆包手机」二代,也不在相关的名单中。
但消费者真正关心的通常不是证书意义上的L3,而是另一件事:什么时候可以买到一部能稳定理解目标、跨应用办事,并且不在最后一步掉链子的手机?
荣耀已经给出一张较明确的时间表:Robot Phone将在2026年8月首发AgenticOS内核,Magic9系列计划在第四季度提供尝鲜版。
原生Android这边也在推进AppFunctions和界面自动化框架,让应用把功能开放给智能体,并计划在2026年晚些时候公布更多细节。
原生Android对接入智能体的MCP能力实践同样将在今年年内发布|图片来源:Google
据此判断,2026年下半年会是「消费级L3体验」集中出现的第一轮窗口;但如果期待它像今天的相机、支付一样成为主流手机的稳定能力,更现实的观察点是2027年。
按照Counterpoint的预计,到2027年,生成式AI手机将占全球出货量的52%,智能体能力也会继续向旗舰产品扩展。
但这仍然不能直接换算成国标L3的市场占比,两套定义并不相同。但它给出了一个我们可以期待的手机换代节奏:2026年看旗舰机试水,2027年看应用生态和中端机能否跟上。
所以,如果现有手机性能、续航都没有明显问题,不必只为一张L3证书提前换机。
标准允许复杂推理借助云端完成,许多能力也可能通过系统更新到达现有旗舰;真正决定体验的,是厂商是否持续维护系统,以及常用应用愿不愿意开放工具接口。
如果本来就到了换机周期,L3可以成为新的筛选项,但至少还要看三件事:真实任务成功率、常用应用覆盖范围,以及每一步操作是否可见、可暂停、可撤销。
证书证明手机跨过了一条线,却不能证明它已经值得接管你的数字生活。
真正值得等待的,是有一天我们不再关心它属于哪个等级,只记得那句「帮我办了」之后,事情确实被稳稳办完。
本文为极客公园原创文章,转载请联系极客君微信geekparkGO
极客一问
你会为了「L3」等级去换手机吗?"

作者:杏彩体育




现在致电 xylmwohu OR 查看更多联系方式 →

COPYRIGHT 杏彩体育 版权所有