阿里AI硬件卡位:电脑眼镜耳机重构入口
2026云栖大会上,阿里发布QwenBook、随身助理A2、AI眼镜N1等硬件,Qwen3.8-Max用户收入两月增长8.5倍。AI竞争正从模型参数转向硬件入口与办公场景。

手机承载的个人隐私比较多,相比之下电脑承担了大量繁复的办公工作,更需要AI的深度介入。
这句话出自QwenBook研发线的一位产品人士。它解释了一个看似反常识的选择:阿里为什么先做AI电脑,而不是AI手机。2026年9月22日,云栖大会开幕当天,这个选择的底层逻辑变得更加清晰——AI竞争的主战场,正从模型参数转向硬件入口与办公场景。对于中国企业的老板和营销负责人来说,这场发布透露的信号,远比参数竞赛更值得认真对待。
一、先做电脑不做手机:一场关于入口的暗战
QwenBook是这次云栖大会的明星产品。它采用可拆卸形态,配有键盘和能录音的触控笔,现场能看到银色、粉色两种配色。现场演示中,工作人员通过语音操作手机App,让处于休眠状态的QwenBook修改桌面壁纸。打开电脑后,桌面已更改为指定风格的图片,图片由大模型实时生成。
更值得咀嚼的细节在后面。工作人员随后在手机端发了一个“撤回”的表情包。不需要文字,不需要语音,桌面就恢复到了之前的版本。
这个演示传递了一个关键信号:AI硬件的交互,正在从“打开App—输入指令—等待响应”的线性流程,变成跨设备、跨状态、可撤销的连续协作。设备之间不再需要用户反复确认,AI自己理解上下文,自己判断任务状态。
系统级Agent的含金量
QwenBook搭载了多模态模型,端侧配备经过后训练的千问端侧模型,云端会提供更多选择。但真正的差异点,不在模型,而在操作系统。
据产品人士介绍,QwenBook的操作系统是自研的,直接从系统层面支持Agent,更方便处理任务的运行状态。这个设计解决了当前很多Agent远程任务必须保持设备在线的问题——QwenBook是否进入休眠状态,不是用户手动决定的,而是根据有没有任务正在执行来判断的。
这个细节的商业份量不小。今天很多企业的AI Agent应用,卡在实际落地环节:一旦设备断网、休眠或切换,任务就中断。系统级的Agent支持,把AI从“应用层”沉到了“操作系统层”。这是苹果、微软、谷歌都在暗中争夺的战略高地。
对中国企业来说,这个变化意味着:未来采购办公设备时,要看的将不只是CPU、内存和价格,还要看操作系统对AI Agent的原生支持程度。一个能自主管理任务状态的设备,和一个需要人守在旁边盯着AI干活的设备,是两种完全不同的生产力工具。
为什么是电脑不是手机
产品人士给出的解释很直接:手机承载的个人隐私比较多,电脑承担了大量繁复的办公工作。
这个判断背后,是一条更冷静的商业逻辑。AI手机的市场教育成本极高,用户对手机上的AI助手容忍度低、期待值高。而电脑场景天然需要效率提升,企业付费意愿更明确,ROI更容易验证。
还有一个被忽视的细节:这次云栖展示的QwenBook版本,比内部进度落后两到三个版本。关于云端模型与售价,都要等到今年底上市时才能知晓。这说明,当你还在评估要不要试水AI办公硬件时,头部玩家的内部迭代已经跑出了代际差。
二、1199元的随身助理:AI进入劳动力成本曲线
随身助理QwenNote A2,重67克,配备6个麦克风,最远8米拾音。内置4G物联网卡,可以脱离手机独立使用。官方给出的续航是连续转写40小时、最长待机18天,售价1199元。
1199元,放在企业决策者的账本里意味着什么?可能只是一次客户饭局的预算。但它能持续转写40小时,能理解会议内容,能协同钉钉发送消息、安排日程、创建待办、生成AI表格。
A2由去年推出的钉钉A1录音卡升级而来。两个变化尤其值得关注。
第一,提示灯从小红灯变成小绿灯。绿灯意味着会议、谈话都不用担心被录音。A2会将音频加密传到云端,转写后删除原始音频,只留下文字和纪要。
第二,机身上的圆形按钮从“记录”升级为“AI一键干活”。长按语音唤起千问办公,理解、处理信息,并协同钉钉完成后续动作。
这两个变化指向同一件事:AI硬件正在从“记录工具”变成“执行工具”。过去的录音笔,采集信息之后,人再处理信息。现在的A2,直接进入执行环节——理解、转写、分配、协同。它不只是记录会议,而是开始替人干活。
对营销团队来说,这意味着会议纪要、客户访谈、头脑风暴、销售复盘这些高频场景,第一次有了低成本的自动化入口。一个市场经理带着A2去客户现场,回来不必再花两小时整理录音。AI已经生成了纪要、待办和跟进建议。人只需要做判断和决策。
这本质上是把一线岗位的一部分重复性劳动,从人力成本曲线中剥离出来,转移到设备折旧成本曲线上。一旦这个模型跑通,企业对“人”的需求结构和岗位定义都会松动。
三、AI眼镜与耳机:营销人正在错过的新入口
在云栖大会首次亮相的千问AI眼镜N1、N1 Pro,将在10月13日正式发布。相比已发布的G1、S1,N1系列更强调生活化场景,比如拍照录像、健康感知。相机升级到了5000万像素传感器,却没有加上屏幕显示。
N1 Pro还增加了心率、血氧、压力、HRV等健康传感器,以及眼动追踪、虹膜支付功能。现场体验中,用户通过“你好千问”唤醒眼镜,注视收款码说“支付”,成功完成付款。
这是本次发布中最容易被低估的信号。
没有屏幕的眼镜,为什么更值得关注
千问没有给N1加屏幕。这个取舍,让价格预计比S1更亲民。但更重要的不是价格,而是交互逻辑。
屏幕意味着信息展示,也意味着注意力争夺。没有屏幕的眼镜,把交互压缩成“语音+视觉+动作”。用户看什么、说什么、指向哪里,AI就理解什么、执行什么。这是一种比手机更轻、更自然的人机关系。
虹膜支付尤其值得营销负责人重视。当“注视即确认”成为支付动作,线下场景的转化路径会被重写。用户看到商品、注视商品、说“买”,完成支付——中间的扫码、打开App、输入密码全部消失。
对于零售、快消、本地生活、奢侈品、汽车展厅、线下展会等行业,这是一个不可忽视的变量。它距离大规模商用还有一段路,但如果你的品牌在2026年底还没开始研究AI眼镜的用户旅程,明年就可能被先行者拉开身位。
耳机:被低估的语音Agent入口
一起亮相的还有千问AI耳夹式耳机,采用Bose调音,支持面对面翻译、AI听记和语音办事,价格暂未公布。
耳机可能是所有AI硬件中最被低估的品类。它佩戴无感、使用高频、天然贴近语音交互。在中国,通勤、会议、健身、家务、商务差旅,耳机的使用场景覆盖了职场人一天中的多个碎片时段。
当耳机开始支持面对面翻译和AI听记,它就不再是音频设备,而是一个持续的“语音Agent入口”。品牌希望触达用户时,眼镜和耳机提供的是比手机更自然、更轻的路径。营销内容的分发逻辑,可能从“抢占屏幕”转向“进入听觉和视觉的自然流”。
四、Qwen3.8自己训练自己:一个残酷的效率信号
硬件之外,阿里还披露了不少新模型的研发进度。其中最有冲击力的一项,是让Qwen3.8参与自己的训练迭代。
按阿里公布的实验,Qwen3.8-Max可以自主搭建训练流程、构造训练数据、设计实验和定位缺陷。在研究人员不介入的一段迭代过程中,模型持续运行超过一个月,完成了33轮有效迭代。结合模型自我进化(RSI)、后训练等技术,新版本在Artificial Analysis上的得分从40提高到45。
这不是学术噱头。它传递了一个残酷的效率信号:AI模型的能力进步,正在脱离人类工程师的直接控制速度。
更现实的数据是:千问7月发布的Qwen3.8-Max,在用户侧取得了相当不错的成绩。短短两个月,Qwen3.8-Max的真实用户收入比上一代Qwen3.7增长8.5倍,token消耗量暴涨12倍。
8.5倍和12倍,这两个数字值得企业决策者反复咀嚼。它们说明:企业用户对AI的真实需求,不是“试用一下”,而是把AI接入了核心生产流程。Token消耗暴涨,意味着AI从演示工具变成了生产资料。用户不再只是问问题,而是让AI持续干活。
同时,阿里披露采用新架构的Qwen4已经投入训练,后续Qwen4.5、Qwen5等版本的参数规模,计划扩展至5万亿到10万亿。下一代全新视频模型计划在11月发布。
参数规模的竞赛没有停止。但对于企业来说,参数规模不是重点。重点是,你自己的流程是否已经为AI准备好了。模型会继续变强,这是确定的。不确定的是,你的组织能不能跟上。
五、多模态模型集体更新:内容生产的底层变化
千问的语音、图像、音乐模型也都有新的进展。这些更新对内容生产和用户运营的影响,往往被硬件讨论盖过了风头。
语音模型Qwen-Audio-3.1系列已接入千问办公、A2和千问AI眼镜。其中Realtime支持边听、边想、边说,这意味着AI语音交互将从“回合制”走向“实时流”。Qwen-Audio-3.1-TTS-Next可以根据一段文字,一次生成包含人物对白和环境声的音频。Qwen-Audio-3.1-ASR-Next则能理解人物情绪、音乐、环境声与机械声,支持声音描述、事件定位和音频问答。
对内容团队来说,这意味着音频内容的制作门槛正在塌缩。过去需要录音棚、配音演员、后期混音的活儿,未来可能由一段文字直接生成一条带有对白和环境声的完整音频。播客、有声书、短视频配音、广告TVC的音频部分,都将被重新定价。
图像方面,Qwen-Image-3.1面向电商、设计场景更新,支持图像精准编辑。近期已开源的Qwen-Image-2.1,视觉生成部分参数量为7B,支持最多10张参考图的多图编辑,以及圈选、涂抹、掩码三种局部编辑方式。
10张参考图,意味着品牌可以把自己的 VI 规范、产品图、历史素材一次性喂给模型,让AI在一致的品牌视觉体系内生成和修改内容。局部编辑能力则解决了电商场景最常见的“改一个细节就得重做整张图”的痛点。对于有大量SKU、频繁上新的电商团队,这是一个直接的效率杠杆。
音乐模型Happy Shrimp 1.1发布,支持百余种曲风、十余种主流语言。世界模型HappyOyster 2.0 Preview公布了交互、记忆、实时响应和物理规律遵循等方面的更新。这些进展离营销人的日常工作稍远,但它们共同指向一个方向:AI正在从单一模态的文本生成,走向多模态、实时、可交互的内容生产。内容团队的组织能力,需要为这个变化预留弹性。
六、从芯片到硬件到模型:垂直整合的底层变量
底层方面,平头哥发布新一代训推一体AI芯片真武V900,配备216GB显存。按官方说法,单芯片性能达到上一代真武M890的3倍,计划于2027年第一季度量产售卖。
把芯片、模型、操作系统、硬件放在一起看,阿里的战略图景才完整。
这不是一家互联网公司“顺便做点硬件”。这是一个垂直整合的AI栈:芯片(真武V900)提供算力底座,模型(Qwen系列)提供智能核心,操作系统(QwenBook自研OS)提供Agent执行环境,硬件(电脑、眼镜、耳机、随身助理)提供场景入口。
这种垂直整合对中国企业意味着三件事。
第一,端侧AI的成本会继续下降。当芯片性能提升3倍、模型参数持续优化,AI硬件将从小众尝鲜变成企业标配。今天1199元的A2,可能只是这条成本曲线的起点。
第二,企业的AI选型会变得更复杂。你不仅要选模型,还要选终端、选操作系统、设计数据流转方案。简单的“买个大模型API”时代结束了。企业需要有人从系统集成的角度,理解模型、芯片、设备和业务场景之间的关系。
第三,数据资产的重要性会进一步凸显。当AI硬件深入到会议、沟通、支付、健康等场景,企业会积累前所未有的行为数据。这些数据如何管理、如何转化为洞察,将决定营销效率的长期差距。拥有场景入口的公司,同时也在拥有数据入口。
七、给中国企业的三个行动建议
1. 把“AI入口”纳入明年的渠道规划
如果你的团队还在只盯着手机屏幕,你需要补充一个新的认知维度:AI眼镜、AI耳机、随身助理,正在成为新的用户触点。
不是说明天就要投放这些渠道。而是说,你需要有人专门研究这些终端的用户行为、内容形态和转化路径。建议在2026年第四季度成立一个跨部门小组,由品牌、数字化、用户增长各出一人,跟踪AI硬件生态的进展,每两周做一次信息同步。
重点跟踪三类信息:头部玩家的新品节奏、用户在这些终端上的真实行为数据、以及你的竞品是否已经接触这些新入口。
2. 用1199元试错,重新设计会议与客户沟通的AI工作流
1199元的A2提供了一个极低的试错门槛。建议市场团队、销售团队先采购几台,在真实的客户访谈、内部会议、门店巡检中使用。
关键不是设备本身,而是迫使团队重新设计工作流:会前如何设置AI的任务目标,会中如何确保信息被完整采集,会后如何把AI生成的纪要、待办、跟进建议接入现有的CRM和协作系统。
设备是表,流程是里。如果只是把录音卡换成A2,效率提升不会超过10%。如果把AI纳入从沟通到执行的闭环,效率提升可能是50%以上。差距不在工具,在组织。
3. 建立模型能力迭代的季度追踪机制
Qwen3.8在两个月内让真实用户收入增长8.5倍,这提醒我们:模型能力的跃迁,会直接影响内容生产、用户运营、广告投放的ROI。
建议企业建立一个简单的模型追踪表,每季度更新一次市面上主流模型的能力变化、价格变化、适用场景。不需要技术团队深度参与,营销负责人带着数字营销团队就能做。
重点追踪三个指标:模型的内容生成质量、任务执行可靠性、单位成本。当某个模型在这三个指标上出现跳跃式提升时,就是你调整工作流、重新分配预算的信号窗口。
结语:入口变了,竞争的本质没变
云栖大会的主题是“智以致用”。这四个字,比任何技术炫技都更值得企业决策者记住。
AI硬件不是玩具,也不是营销噱头。它是AI从技术能力走向商业价值的必经之路。电脑、眼镜、耳机、随身助理,这些终端争夺的,是用户注意力和企业预算的下一个入口。
对手不会等你准备好。QwenBook现场展示的版本,比内部进度落后两到三个版本;Qwen4已经投入训练;真武V900计划2027年量产。这意味着,你今天在规划的事情,竞争对手可能已经跑完了两三个版本。
窗口期不会太长。企业要做的,不是追每一个新硬件,而是想清楚一个问题:当AI可以听、看、说、执行,你的客户在哪里,你的效率瓶颈在哪里,你的入口就在哪里。