AI零售升级,为什么先给20万员工用?

伍尔沃斯集团把AI助手先交给20万员工使用,再用agentic judges校验输出质量。这种反直觉的落地路径,揭示了零售业AI竞争从功能叠加转向数据深度的关键转折。

AI零售升级,为什么先给20万员工用?正文配图

We aren't just upgrading a bot; we are redefining the retail experience with practical, tangible innovation.

这句话出自伍尔沃斯集团CEO Amanda Bardwell。2026年初,这家澳大利亚零售巨头宣布与Google Cloud合作,用Gemini Enterprise for Customer Experience升级其数字购物助手Olive。但真正值得中国零售决策者关注的,不是他们用了什么模型,而是他们选择了一条反直觉的落地路径:先让20万员工用,再给顾客用。

中国零售业对AI并不陌生。从智能客服到推荐算法,从无人店实验到直播选品,AI早已渗透进各环节。但大多数企业陷入了一个共同误区:急不可耐地把AI推到C端消费者面前,却在准确率、场景适配和组织能力尚未成熟时,消耗了用户信任。伍尔沃斯的做法提供了一个不同的参照。

零售AI的拐点:从回答问题到预判需求

Olive不是新东西。它2018年就已上线,最初只是一个问答型chatbot,帮助顾客查询商品信息、订单状态和门店位置。这类机器人在中国零售业同样泛滥,绝大多数用户体验止步于“问一句、答一句”,甚至常常答非所问。

2026年的升级改变了游戏规则。Olive从一个被动应答工具,变成了一个能主动规划的数字伙伴。它能做餐食规划,能推荐个性化特价商品,能根据预算给出购物建议。Bardwell的原话是:Olive将不再只是回答问题,而是“anticipates your needs”——预判你的需求。

“预判”是关键词。问答式AI解决的是信息对称问题,预判式AI解决的是决策效率问题。当一个顾客打开App,系统不是等他提问,而是根据他的购买历史、时间节点、天气变化、家庭结构,主动提出一个完整的购物方案。这背后需要的不是更聪明的语言模型,而是更完整的用户数据资产、更细颗粒度的场景理解,以及更精准的商业判断力。

伍尔沃斯能做到这一点,是因为它积累了八年的Olive交互数据,加上Everyday Rewards会员体系中数百万用户的购买行为数据。技术是新的,但数据资产的厚度是旧积累。这提醒中国企业:AI能力可以买,数据场景和用户信任买不来。

反常识的落地顺序:20万员工先行

2026年4月,伍尔沃斯将升级后的Olive先推给了20万员工。不是内测,不是小范围试验,而是全面rollout。这个数字几乎等于其全部员工规模。

为什么要让员工先用?很多人会理解为“内部测试”。但伍尔沃斯的目的远不止于此。员工是零售场景中最了解商品、最了解顾客痛点、也最了解运营流程的人。让20万员工在真实工作中使用Olive,相当于同时获得了三个东西:大规模真实反馈、一线场景的纠错数据、以及组织内部对AI能力的认知对齐。

更重要的是,员工使用Olive的过程,本身就是训练AI判断力的过程。当员工纠正一个推荐错误、补充一个品类关联、标记一个不适合特定人群的商品,算法就在学习零售专家的隐性知识。这种“人在回路”的训练方式,远远优于单纯依赖历史交易数据的冷启动。

中国零售企业普遍面临一个困境:AI项目上线快,但用户留存差。根本原因往往是AI对业务场景的理解浅薄,没有经过足够多的真实业务打磨。伍尔沃斯的做法给出了一条路径:把组织内部当成AI的第一训练场,把员工变成AI的第一批用户和第一代教练。

agentic judges:给AI装上“质检员”

伍尔沃斯的Olive升级中有一个容易被忽略的细节:内置了8个“agentic judges”来校验回复准确性。

这个设计的精妙之处在于,它承认了一个所有企业都心知肚明的事实:大语言模型会出错,会产生幻觉,会给出看似合理实则错误的建议。零售场景中,这种错误可能直接导致用户买到不适合的商品,造成体验伤害,甚至引发食品安全类风险。

伍尔沃斯没有回避这个问题,而是用架构设计来解决它。8个judges分别从不同维度审视Olive的每一次输出:价格是否准确、库存是否匹配、营养信息是否真实、促销规则是否正确、场景建议是否恰当等。只有当输出通过多重校验时,才会推送给前端用户。

这是一套“AI治理”思维。它把质量控制从人工抽检变成了自动化、系统化的流程。中国企业做AI应用时,往往把重心放在模型能力和交互体验上,对于输出准确性的系统化校验投入不足。结果就是:演示时表现惊艳,上线后漏洞百出。

8个judges的架构给了我们一个启发:AI时代的质量管理,不是加一道人工审核关,而是构建一个由多个专业化AI组成的质量网络,让AI互相校验、互相制衡。这种“以AI治AI”的思路,对任何想把AI放进核心业务链的企业都有参照价值。

Snap & Shop:把AI放进购物决策链

伍尔沃斯的另一个案例Snap & Shop,展示了AI如何真正进入消费决策链。

功能本身很简单:用户拍一张手写购物清单的照片,AI识别内容,自动转化为数字清单,并结合购买历史匹配商品。技术难度并不高,OCR加推荐逻辑而已。但它的价值在于场景设计。

手写购物清单是一个极其生活化、高频但被数字工具长期忽视的场景。大多数家庭的购物清单仍然写在冰箱贴、便签纸或手机备忘录里。Snap & Shop把这个线下动作直接转化为线上购物车的起点,消除了手动输入商品名称的摩擦。

更重要的是,它与Everyday Rewards的个性化引擎打通。每周向会员推送数百万条定制优惠,这些优惠不是随机发放,而是基于用户当前清单内容、历史偏好和品类特征的精准匹配。这意味着AI不仅帮助用户“记录要买什么”,还在“建议该买什么、何时买、怎么买更划算”。

这个案例对中国零售企业的启发在于:AI应用不一定要追求技术上的炫技,而是要找到用户决策链中真实存在的摩擦点。手写清单数字化,看似小事,但它恰好卡在“用户已有购买意图”和“完成购买行为”之间的关键节点。AI在这里不是创造需求,而是顺畅地承接需求。

从工具到战略:重新理解零售AI的竞争维度

伍尔沃斯的AI实践揭示了一个更深层的趋势:零售业AI竞争的维度正在从“功能有无”转向“数据深度”。

中国零售业的AI应用现状,大多停留在功能叠加阶段。线上有客服机器人,线下有智能导购,推荐系统基于浏览和购买行为做协同过滤。但这些AI彼此孤立,数据不打通,场景不连续,体验割裂。消费者感受到的是一堆智能功能的拼凑,而不是一个连贯的智能服务。

伍尔沃斯的做法不同。Olive、Snap & Shop、Everyday Rewards三者构成了一个闭环:Olive负责交互和规划,Snap & Shop承接线下意图,Everyday Rewards提供数据支撑和个性化输出。AI不是独立功能,而是贯穿整个购物旅程的底层能力。

这种架构上的差异,决定了AI效果的天花板。功能型AI优化的是单点效率,数据闭环型AI优化的是用户终身价值。前者拼命获客,后者深耕留存。

中国零售企业普遍掌握着庞大的用户数据,但数据之间的关联度低,标签体系粗糙,场景标签缺失。很多企业甚至没有打通线上线下数据,更不用说构建贯穿决策链的AI服务层。伍尔沃斯的案例提醒我们:数据资源不等于数据资产,只有用AI把数据变成可决策、可行动的智慧,才能形成真正的竞争壁垒。

给中国零售决策者的五个判断

第一,别急着把AI直接扔给顾客。伍尔沃斯用20万员工做AI的第一训练场,这个顺序值得认真对待。中国零售企业同样拥有庞大的员工规模,但很少有企业把内部员工当成AI成熟度的检验标准。让员工先用、先用透,再面向顾客,是更稳妥也更划算的路径。

第二,把质量校验系统化。AI应用最大的风险从来不是技术选型错误,而是输出质量不可控。伍尔沃斯的agentic judges代表了一种可行的解决方案。中国企业应该把质量校验当成AI系统的基础设施,而不是事后补救。

第三,场景选择比模型能力重要。Snap & Shop没有使用什么颠覆性技术,但它在正确的场景解决了真实的摩擦。中国零售业最不缺的是技术供应商,最缺的是把技术放在用户决策链关键节点的判断力。

第四,数据闭环是真正的护城河。功能可以被复制,模型可以更换,但八年积累的交互数据、会员行为数据和场景标签无法被快速追赶。中国企业应该尽早构建自己的数据闭环,而不是依赖平台方提供的数据能力。

第五,AI落地的节奏可以更务实。伍尔沃斯没有宣布什么宏大的AI战略,也没有搞炫酷的品牌战役,而是把AI放进一个个具体功能里,逐步推进。这种“小切口、深场景、快迭代”的务实路径,比高举高打的AI战略更值得借鉴。

零售业AI的竞争,本质上是一场关于耐心和数据深度的竞争。伍尔沃斯花了八年时间让Olive从聊天机器人成长为数字伙伴,这个过程中没有捷径,只有对场景的持续打磨和对质量的反复校验。对于中国企业而言,真正该焦虑的不是谁用了更先进的模型,而是谁愿意花时间把AI真正嵌入自己的业务土壤。