竹势 AI 营销智库出品
竹势智库竹势智库
会进化的 AI 市场部:评测、反馈与达尔文式优化
BOUNDARY · EVIDENCE · SELECTION · MEMORY

会进化的 AI 市场部
评测、反馈与达尔文式优化

让候选在受控边界和真实证据中接受选择;让每次晋级、暂停、回滚与退役都改变下一轮预算和组织判断。

先限定可变边界目标、法律、品牌承诺与高后果政策不交给模型改写
再分层比较证据离线、影子、在线和经营结果承担不同证明责任
用探索预算控暴露信息价值、可逆性、客户后果与机会成本共同决定试验
把选择写进记忆晋级、暂停、回滚和退役都改变下一轮投入
竹势 AI 营销智库出品shichangbu.ai
BOARD RESEARCH 01

执行摘要

竹势 AI 营销智库出品

核心判断可以压缩为一句话:AI市场部的持续改善来自受治理的选择制度。企业先确定哪些对象允许变化,哪些法律义务、事实承诺和客户权益必须保持稳定;再以分层证据比较候选,用有限探索预算约束真实客户暴露;最后通过晋级、暂停、回滚和退役,把市场结果写入组织记忆。模型、指令、知识源、素材和工作流都只是候选的一部分,董事会真正管理的是客户后果、预算风险与学习速度。

“反馈越多,系统越聪明”缺少成立条件。客户点击、销售评价、投诉、订单、退款、模型评分和员工修改记录来自不同机制,时滞、选择偏差与可操纵性也不同。未经分类的反馈会把高意向客户自选择、渠道波动、库存变化和履约问题混在一起。模型若同时决定展示对象、收集信号并据此更新,很容易形成自我证明的闭环。组织需要保留对照、随机探索或其他可辩护的反事实,并为数据质量失败保留“结论作废”这一正式动作。[E010][E011][E013]

关键事实支持这一判断。Darwin的原作把累积变化建立在变异、选择和遗传的联动上;管理借用该结构时,候选差异对应变异,证据与决策权对应选择,版本与复盘对应遗传。[E001] March指出探索与利用争夺同一批资源,短期回报会系统性偏爱已有做法。[E005] Goodhart与Campbell分别提醒,强控制会改变指标关系,高压考核会诱发数据生成行为适应。[E007][E008] Fisher、Rubin与Pearl提供另一条纪律:因果结论依赖设计、反事实和数据生成机制,相关性再稳定也无法自动回答干预效果。[E009][E010][E011]

企业案例显示,能力与风险会同步放大。Netflix公开的个性化封面机制保留随机探索样本,使系统仍能学习未充分展示的候选;其公开材料只证明机制和局部试验,不能推导长期订阅增量。[E046][E047] LinkedIn实验平台展示数万并行实验所需的流量、指标与告警基础设施,同时其弱关系随机研究也证明,推荐微调可能改变真实职业机会,外部性不能被点击率遮蔽。[E051][E055] Bing预览期用会话限额和逐级放量控制暴露;公司自报用户规模和正向反馈仍缺少完整分母与独立因果识别。[E058][E059][E060][E061]

失败与受限案例提供更硬的边界。2024年Air Canada聊天机器人裁决确认,企业需要为客户可见自动答复承担责任,正确网页无法抵消同站点的错误承诺;法庭判付812.02加元,金额虽小,责任逻辑十分清楚。[E062] FTC对Rite Aid人脸识别案的指控涉及数千次误报以及测试、监测和现场处置缺陷,拟议命令包含五年禁用安排。[E041][E042] 这些案例说明,高后果政策没有自由试错空间,回滚也无法自动补偿已经发生的客户损失。

经营影响有三层。第一,AI内容供给成本下降后,候选数量迅速增加,审核、测量和选择成为稀缺资源。第二,营销、销售、客服和履约共同生成结果,单一部门的局部指标无法承担总目标。第三,自动执行扩大了错误传播速度,企业必须同步建设限额、审批、日志、人工接管和客户补救。若组织只增加模型调用和内容产量,表面速度上升,决策质量可能下降。

主要风险集中在五处:目标由可操纵代理指标替代;离线得分被误当作真实客户效果;样本不足和多重比较制造偶然“赢家”;反馈数据超出客户合理预期或法定目的;高后果答复缺少暂停、回滚与补救。中国个人信息保护、广告、算法推荐、生成式服务和生成内容标识规则已经覆盖这些环节,欧盟与其他监管框架也强调用途风险、记录、透明和人类责任。[E026][E031][E032][E034][E035][E036]

行动优先级应保持克制。优先级一是形成“选择宪法”,明确硬边界、候选范围、决策权和客户补救责任。优先级二是建立证据阶梯,让离线评测、红队、影子运行、有限暴露、随机比较和长期验证各自回答有限问题。优先级三是把探索预算写入用户人数、持续时间、媒体支出、权限和可接受损失。优先级四是让晋级、暂停、回滚和退役成为真实管理动作,并保存预测、版本、结果、异议和适用边界。优先级五是由董事会季度审议客户后果、预算风险、学习速度、复现情况和退役执行。

90天内,企业无需覆盖全部营销链路。第一个月完成边界、基线与责任;第二个月选择一至两个低后果场景,运行离线和影子评测,再进行小范围暴露;第三个月要求至少一个结论被复现,一个失败候选被正式退役,并验证回滚与客户补救。九十天结束时,董事会应看到一套能拒绝错误候选的制度,而非一张内容产量增长图。

BOARD RESEARCH 02

1.1 候选爆炸改变了市场部的瓶颈

竹势 AI 营销智库出品

生成式技术把文案、图片、视频、受众组合和触达节奏的试制成本压低后,企业很快遇到新的稀缺:哪一个候选值得进入真实市场,哪一个结果可以相信,哪一项经验能够复用。过去,团队常因制作成本高而只做少数版本;现在,十个版本可能在一次会议前完成。候选供给增加没有自动带来更好的判断,反而放大了比较成本、审核负担和偶然赢家。

这一变化要求董事会重新定义“AI市场部表现”。产出量、响应速度和模型调用量只能说明系统很忙,无法说明客户获得了更好结果。真正的经营能力体现在三项结果:高价值问题的证据周期缩短,单次失败造成的客户与预算损失受控,经过复现的结论可以在明确边界内重复使用。三者共同决定学习速度。

反馈需要经过治理才能成为资产。点击来自界面和流量分配,订单同时受价格、库存和履约影响,销售备注带有人员判断,投诉通常只覆盖愿意表达的客户,模型评分又可能继承训练偏好。企业若把这些信号汇总成一个“综合分”,会抹去信号产生机制,失去解释和问责能力。反馈必须先被分类,再进入比较。

BOARD RESEARCH 03

1.2 进化需要四个同时成立的环节

竹势 AI 营销智库出品

管理语境中的“进化”需要具备候选差异、证据选择、决策权和组织记忆。候选差异回答“改变了什么”;证据选择回答“凭什么比较”;决策权回答“谁可以扩大或停止”;组织记忆回答“如何让结论跨越人员和时间”。缺少任何一环,改善都难以累积。

许多企业只有前两项的片段。团队持续改指令、换模型、调素材,并查看平台报表,却没有稳定版本、预先门槛和决策记录。一次高点击版本被宣布为胜利,下一次活动又重新摸索;负面结果散落在聊天记录里,人员变化后再次发生。系统看似频繁迭代,组织经验仍停留在个人脑中。

董事会介入源于选择会改变客户承诺和资源配置,技术复杂度居于次位。候选进入广告账户会花费预算,进入客服会影响权利解释,进入销售线索排序会改变机会分配,进入公开内容会留下可搜索记录。选择制度因此属于经营治理,不能由模型或单一执行团队自行定义目标。

FIGURE 01图1|可持续改善依赖“候选—证据—选择—记忆”的闭环
候选生成|允许变化:模型、指令、素材、受众、渠道、节奏、流程
分层证据|离线评测、红队、影子运行、有限暴露、随机比较、长期观察
受权选择|晋级、暂停、回滚、退役;由业务与风险责任人共同决定
组织记忆|保存版本、预测、结果、异议、边界和复用条件

来源:E001、E002、E019、E022 口径:机制节点;持续机制;企业级AI营销活动 限制:管理隐喻不等同于生物进化;不能赋予系统自主目标权。

图中的四个环节共同成立,改善才会累积。只生成更多候选,会把组织推向内容过剩;只收集更多反馈,会把噪声、投诉和平台偏差混在一起;只做一次胜负判断,则会让成功依赖个人记忆。选择制度把候选变化、证据等级、决策权和可复用记忆连接起来。

董事会应把注意力放在客户后果、预算暴露与学习速度。模型版本和指令版本属于可替换部件,晋级标准、法律边界、品牌承诺与客户补救责任由企业持有。

BOARD RESEARCH 04

1.3 三个董事会问题替代“AI变聪明了吗”

竹势 AI 营销智库出品

第一个问题是客户后果:候选改变了谁的体验、权利、价格理解、机会或隐私,最坏结果能否补救。第二个问题是预算风险:探索占用多少媒体、人员、数据与权限,停止时损失是否封顶。第三个问题是学习速度:企业用了多长时间获得可复现结论,多少结论因数据问题作废,多少失败真正退役。

这三问能够防止技术叙事遮盖经营责任。模型得分提高,却导致投诉或退款上升,客户后果已经否决局部进步;实验更快,却因样本污染无法复现,学习速度没有改善;预算被大量低价值候选分散,探索也没有产生选择价值。

董事会无需审阅每个创意版本,却要批准边界、风险档位和授权层级。低后果版式可由业务团队在额度内自主选择;价格承诺、自动客服、个人画像和高监管表达需要更高层批准;法律、事实和既有承诺属于硬边界。责任层级与后果绑定后,组织才能在速度和控制之间形成稳定秩序。

BOARD RESEARCH 05

1.4 经营定义:学习速度必须扣除伤害和返工

竹势 AI 营销智库出品

学习速度可以用“每单位时间获得的可复现决策价值”理解,而不宜用实验数或内容数代替。决策价值包含新增收入、贡献毛利、客户体验、风险避免和机会成本;可复现要求相同机制在相近条件下再次成立;单位时间还要扣除修复错误、客户补救和组织返工。

这一定义会改变优先级。一个两周内完成、样本不足、无法复现的实验,速度很快却没有学习;一个月识别出自动答复的政策冲突并在上线前退役,虽然没有带来收入,却避免了客户损失,产生了明确决策价值。负面结论由此进入经营账目。

企业最终需要管理一条有限的候选管道。每一阶段都有进入条件、资源上限和退出动作;候选数量由审核与证据能力决定,不能由生成能力决定。选择比生成更可靠,才是AI市场部持续改善的起点。

BOARD RESEARCH 06

1.5 决策产能要与生成产能匹配

竹势 AI 营销智库出品

当候选生成速度高于审查和证据速度,等待队列会变成长尾风险。旧候选仍在审批,新候选已经改变模型、素材或渠道环境,比较对象迅速失去一致性。企业应把候选入口与评测容量绑定:只有问题价值、风险档位和资源预算清楚的候选进入队列,其余想法保留为待研究假设。这样做会主动放弃一部分即时产量,却能减少重复评审、过期素材和无法解释的并发变化。

决策产能还包括拒绝能力。团队能否在管理层关注、活动节点和供应商压力下,坚持证据不足不放量;能否在明星创意出现后仍保留对照;能否把“没有足够样本”写进结论。董事会若只奖励上线和增量,选择制度会在压力下失真。年度预算应为测量、复现、退役和客户补救留出明确资源,使这些动作拥有与生产相当的组织地位。

BOARD RESEARCH 07

2.1 原作提供的是结构,无法提供企业伦理许可

竹势 AI 营销智库出品

Darwin在1859年讨论自然选择时,解释对象是种群在世代中的差异、保留和延续。[E001] 企业借用这一思想,只能获得一个结构提醒:没有差异便无从比较,没有选择压力便无方向,没有传承便无累积。它不能回答客户是否应被暴露、某项实验是否合法、品牌应承诺什么,也不能替董事会决定价值目标。

生物选择没有预先设计的组织目的,企业经营却必须设定目的和责任。市场部追求增长时仍受广告真实性、个人信息目的、合同承诺和客户公平约束。把“适者生存”写成“点击高者生存”会犯两重错误:代理指标被误当成适应度,企业责任又被伪装成自然结果。

因此,本报告使用“达尔文式优化”描述有限管理隐喻:候选有血统,选择有环境,保留有条件,失效会发生。客户、员工和社会都不属于可任意消耗的实验材料;模型没有定义价值的权力;法律、事实、品牌承诺和高后果政策没有自由变异空间。

BOARD RESEARCH 08

2.2 可变对象要有最小可识别差异

竹势 AI 营销智库出品

候选必须清楚说明变化对象。若一次活动同时更换模型、改写卖点、调整受众、增加优惠并改变投放时段,即使结果上升,也无法识别关键机制。最小可识别差异要求企业说清候选之间的结构差异和因果假设,无需永远只改一个元素。

模型只是候选的一层。知识源版本、检索范围、系统指令、工具权限、人工审核方式、创意素材、分流规则和履约能力都会改变客户结果。团队只记录“某模型胜出”,往往掩盖了上下文、数据和流程差异,也让供应商更换后无法复现。

候选血统应保留父版本、变更理由、依赖条件和生成时间。其价值不在工程追踪本身,而在经营解释:何时开始、谁批准、影响了哪些客户、出现问题能否定位。没有血统的候选一旦进入多渠道传播,回滚很容易只撤掉表面素材,遗漏已发送消息、销售话术和知识库缓存。

BOARD RESEARCH 09

2.3 不可妥协边界先于效果比较

竹势 AI 营销智库出品

硬边界必须在候选生成前明确。广告真实性、必要审查、个人信息合法基础、生成内容标识、合同价格和退款政策属于典型边界。它们可以在正式治理程序内更新,却不能在普通转化试验中自由变化。某个违法或误导版本即使转化率更高,也没有晋级资格。[E031][E032][E033][E036]

品牌承诺也需要分层。口号、视觉和叙事可以有创意空间;有关质量、交付、价格、环保、社会责任和售后权利的承诺必须有事实与履约支持。AI市场部若只优化表达,会把履约缺口推向更大流量。选择制度应让市场、销售、客服、法务和运营共同定义承诺边界。

高后果政策的稳定性尤其重要。资格判断、信贷、就业、医疗、未成年人、敏感个人信息和自动拒绝等场景,即使与营销漏斗相连,也不能按普通广告创意处理。可逆性低、伤害严重或影响人数大时,企业应采用规则执行、影子运行、专家复核与审计,停止自由探索。

FIGURE 02图2|可改变对象必须被不可妥协边界包围
时间/类别对象或机制证据/边界
可变层主题、创意表达、版式、渠道组合、发送时点、预算小步配置允许比较,但需预先范围与回滚
条件可变层价格呈现、优惠结构、客户分群、自动回复、推荐逻辑需法务、业务和客户后果评审
不可自由变异层法律义务、事实真伪、品牌承诺、个人信息目的、高后果政策只能在授权治理程序内调整

来源:E019、E025、E031、E032、E035 口径:边界类别;持续机制;营销决策对象 限制:具体归类依行业、市场、客户群和合同而变。

同一对象在不同情境下可能跨层。普通标题措辞通常可小规模比较;涉及医疗、金融、未成年人、价格或个人信息的表达会迅速进入条件可变层甚至硬边界。企业需要按后果分类,而非按技术难度分类。

硬边界没有“探索预算”。当法律要求、真实事实或既有承诺明确时,系统只能在边界内寻找表达和执行方案。任何试图用转化率证明违法表达“有效”的做法,都把选择制度变成风险放大器。

BOARD RESEARCH 10

2.4 “选择环境”由企业设计,也会被渠道扭曲

竹势 AI 营销智库出品

在自然选择隐喻中,环境决定差异的保留概率;企业环境由指标、预算、渠道算法、组织激励和审核规则共同构成。若平台把点击作为主要优化信号,销售只奖励线索量,内容团队只看发布频次,候选会向短期刺激收敛。系统学到的是组织奖励结构,未必代表客户价值。

选择环境还会变化。节日、竞品动作、库存、渠道政策和宏观需求都可能让过去有效的候选失效。组织记忆必须保存适用市场、时间、客户群和依赖条件,并设置失效信号。所谓“遗传”指传递带条件的知识,永久复制赢家不在其内。

董事会要防止选择环境被单一平台占据。平台归因、站内互动和模型评分都由外部规则生成,企业需要保留自有交易、毛利、投诉、复购和客户研究。多源证据不会消除偏差,却能让偏差更可见。

BOARD RESEARCH 11

2.5 管理判断:有限隐喻带来四条纪律

竹势 AI 营销智库出品

第一,变异由人类目标和授权范围限定。第二,选择依据必须分层,低等级证据只能支持低等级暴露。第三,保留赢家的同时保存失败与边界,防止选择性记忆。第四,任何可累积机制都要接受法律、伦理和客户补救约束。

四条纪律将“会进化”落实为可审查秩序。自动生成、评分、发布和调参若缺少目标治理、反事实、退役和组织记忆,只会扩大自动化;选择质量不会随吞吐量同步增长。

保持不变也应成为积极决策。品牌核心事实、长期承诺和高后果政策的稳定,可降低客户认知与执行风险;成熟制度清楚何处可变、何处必须稳定。

BOARD RESEARCH 12

2.6 隐喻失效时要回到责任语言

竹势 AI 营销智库出品

“进化”“适应”“优胜”容易把经营结果说成自然发生。团队称候选被市场淘汰时,董事会仍需追问谁定义市场、控制展示、排除了哪些客户,以及企业依据什么承担责任。

隐喻还有路径依赖风险。早期偶然赢家获得更多预算、数据和组织关注,后续候选的比较基础随之变弱。企业可以用固定探索样本、周期性基准复测和外部客户研究打破自我强化。若环境变化使旧赢家失效,组织应允许稳定回退,避免以“持续进化”之名维持复杂度。有限隐喻的价值在提醒累积机制,其使用期限也应受到审查。

BOARD RESEARCH 13

3.1 宪法回答目标、边界、权力和补救

竹势 AI 营销智库出品

选择宪法是一组董事会认可的经营规则,用来限定AI市场部如何产生候选、怎样接触客户、谁有权扩大、出现问题由谁补救。它应先回答四个问题:优化服务哪项客户与经营目标;哪些边界不可突破;不同风险档位由谁批准;错误发生后如何停止、通知、纠正和赔偿。

目标必须指向经营结果和客户后果。以“提高互动”作为目标过于宽泛,互动可以由争议、误导或猎奇推动。更完整的目标可以是:在不增加误导、投诉和退订的条件下,提高合格咨询率,并保持贡献毛利。目标语言越接近真实价值,候选选择越不容易被代理指标绑架。

边界应使用可执行表述。诸如“保持品牌调性”“注意合规”无法作为停止条件;“所有价格与退款答复只能引用当前批准政策”“涉及个人画像的分群必须有合法基础并提供退出”“生成合成内容按适用规则保留标识”才具有约束力。[E031][E032][E036]

BOARD RESEARCH 14

3.2 决策权按后果分层,不能按工具分层

竹势 AI 营销智库出品

企业常把权限按系统划分:谁能用模型、谁能进广告账户、谁能改CRM。选择权更应按客户后果划分。同一位员工可以生成数百个内部草稿,却无权改变公开价格;具备发布权限的团队也不一定有权调整客户资格逻辑。工具权限只说明“能做”,决策授权说明“可以承担何种后果”。

低后果、易回滚的版式、标题和发送时点可以给团队额度内自主权;中后果的受众、优惠表达和自动回复需要业务与风险共同批准;高后果的政策、敏感数据和资格判断进入专业责任链。授权层级还要规定替代人,防止紧急情况下无人能暂停。

NIST AI RMF把治理置于跨生命周期位置,并要求结合情境进行映射、测量与处置。[E019][E022] 这提示企业,风险不能在模型上线后才交给合规审查。选择宪法应进入问题定义、数据取得、候选设计、试点和扩张各环节。

BOARD RESEARCH 15

3.3 证据等级决定允许暴露的等级

竹势 AI 营销智库出品

候选先在无真实客户或低暴露环境中证明基本可靠。事实核验、品牌一致性、格式、敏感内容和历史问题重放属于离线评测;诱导输入、越权请求、极端边界与攻击属于对抗测试;影子运行让系统在真实流量旁产生建议,却不对客户执行。

有限暴露首次把客户后果引入学习,因此必须设人数、时间、预算、权限和损失上限。随机比较可以提高因果识别,却仍要满足知情、公平、可逆和行业要求。长期验证关注复购、投诉、品牌记忆、群体差异和履约后果,防止短期赢家侵蚀持续价值。

证据阶梯的管理意义是允许拒绝跃级。一个离线得分高的自动客服没有资格直接覆盖全部客户;一个小流量点击赢家没有资格立即改写品牌政策;一个随机实验的短期正效应也没有资格覆盖长期与群体风险。每层只回答有限问题。

FIGURE 03图3|证据等级越高,允许的客户暴露才应越大
时间/类别对象或机制证据/边界
1 离线评测事实、品牌、格式、敏感内容、历史重放无真实客户暴露
2 对抗与红队诱导、越权、边界条件、极端输入内部或受控测试
3 影子运行系统给建议但不对外执行观察差异与失败模式
4 有限暴露小流量、短时段、低后果人群设预算与自动停止
5 随机比较预注册指标、可比组、功效规划估计短期因果影响
6 长期验证复购、投诉、品牌记忆、群体差异确认收益能否持续

来源:E009、E010、E013、E015、E019 口径:证据层级;单次候选周期;候选版本与客户结果 限制:部分场景无法进入随机实验;高后果场景可能在前层即停止。

离线得分适合过滤明显错误,却无法证明客户会如何行动。影子运行能够暴露流程差异,却没有真实行为后果。有限暴露和随机比较增加因果识别能力,同时也增加客户接触和声誉风险。证据阶梯因此既是学习路径,也是风险配额路径。

候选未通过某一层,决策应停留在该层。组织不应为了赶上线而把“暂未发现问题”改写为“已经证明安全”。同理,随机实验赢得点击也只回答被预先定义的短期问题,长期承诺仍需后续验证。

BOARD RESEARCH 16

3.4 停止条件与补救条件必须提前写出

竹势 AI 营销智库出品

停止条件包括法律或政策越界、关键护栏恶化、数据质量失效、样本比例异常、投诉聚集、预算超限和不可逆错误。团队在结果出现后才决定阈值,会受到沉没成本和目标压力影响。事前条件让停止成为制度动作,减少个人承担“叫停业务”的心理成本。

补救条件处理已经发生的影响。回滚可以恢复旧版本,却不能撤回客户已经看到的错误价格、已经发送的误导消息或已经形成的不当画像。企业要能识别受影响人群,提供更正、人工接管、退款、删除或申诉。客户补救应有时限、责任人和预算。

ICO关于AI问责的指南明确把责任留在高级管理层,不能全部委托给数据科学人员。[E027] 这一点同样适用于市场系统:技术团队可以诊断模型,业务负责人需要承担承诺,法务判断义务,客户团队执行补救,董事会批准风险接受。

BOARD RESEARCH 17

3.5 Air Canada之前的管理问题:同一企业有几个真相源

竹势 AI 营销智库出品

自动答复最常见的根因是政策、网页、客服脚本、销售话术和知识库同时维护所形成的版本冲突。不同版本各自“正确”,客户却在同一品牌下收到冲突信息。选择宪法需要指定权威源、版本生效时间、同步责任和失效机制。

价格、退款、资格、交付和安全承诺应采用受控发布。新政策批准后,旧内容进入失效队列;自动系统只能检索生效版本;无法确认时转人工;渠道缓存和历史素材要有撤回计划。系统若没有这些机制,增加评测题库只能延缓冲突暴露。

董事会可以用一个简单问题检验:企业能否在两小时内回答“某一时点,某类客户在各渠道看到的有效承诺是什么”。无法回答时,自动化扩张会放大知识治理缺口。选择宪法的首要产物因此是一致责任,而非更多模型规则。

BOARD RESEARCH 18

3.6 例外管理决定宪法是否真实

竹势 AI 营销智库出品

重大活动、突发舆情和销售冲刺最容易产生例外请求。业务会以时间紧、竞争激烈或客户特殊为由,要求跳过评测、扩大权限或延后补救。选择宪法若没有例外程序,实际运行会由私下沟通取代。例外应写清理由、期限、最大暴露、批准人、补偿控制和恢复日期,且不得突破法律与事实硬边界。

季度审议需要单独查看例外,不能把它们混入正常流程。例外频繁发生,可能说明制度过重,也可能说明目标与资源不匹配;同一团队持续申请例外,可能暴露计划能力或激励问题。例外到期后自动恢复标准规则,任何延期重新批准。制度能够约束最紧迫时刻,才具备真实治理效力。

BOARD RESEARCH 19

4.1 评测对象必须与决策对象一致

竹势 AI 营销智库出品

离线评测适合回答候选是否遵守事实、品牌、格式和安全边界。它使用固定题集、历史数据、专家标注或模拟客户,成本低、可重复、没有直接客户暴露。其弱点在于题集分布与真实市场不同,标注者偏好也可能替代客户结果。

团队常用一个总分比较模型或指令,随后把最高分版本投入市场。总分会掩盖严重错误的分布:平均准确率相同的两个系统,可能分别在低价值问答和退款政策上出错。ICO区分个人数据的法律准确性与模型统计准确性,并指出适当水平取决于用途和后果。[E028] 因此,评测必须按任务、客户群、错误类型和损失拆分。

决策对象若是“是否让系统自动回复退款问题”,评测就要覆盖当前政策、边界案例、冲突页面、拒答、转人工和补救,而不能仅测试通用问答。对象一致性比题量更重要。

BOARD RESEARCH 20

4.2 预测先于结果,避免事后合理化

竹势 AI 营销智库出品

Deming的知识理论强调预测在学习中的位置:“人们在作出预测时学得更好。”[E003] 对市场团队而言,预测应具体到方向、幅度、时点、客户群和可能副作用。例如,“新封面将使目标作品开始观看率增加1至2个百分点,同时不会提高短时退出和投诉”,比“更吸引人”更可检验。

事前预测会暴露团队真正相信的机制。若无人愿意写预期幅度,候选可能只是审美偏好;若所有结果都能被解释为成功,实验没有淘汰能力;若主指标上升而护栏下降,事前优先级决定是否晋级。

预测还为组织记忆提供基线。结果出现后,团队比较预测与现实,识别因果链中哪一环失效。没有预测,复盘容易围绕最终数字编排故事,难以改变下次决策。

BOARD RESEARCH 21

4.3 功效规划决定组织能看到多小的差异

竹势 AI 营销智库出品

实验没有“有数据就够”的状态。最小可检出差异、基线比例、显著性、功效、随机化单元和可用样本共同决定设计。样本不足时,非显著结果可能只是缺乏检出能力;频繁查看并提前停止又会放大误报。

图4使用两组二项比例的规划近似:基线转化率10%,双侧显著性5%,功效80%。它没有计入客户重复、门店聚类、渠道串扰、流失和多重比较,因此只用于说明数量级。真实设计需按数据结构修正。

FIGURE 04图4|小效应需要大样本,样本不足会把噪声伪装成胜负
变化/检验数数值
0.5个百分点56,512
1.0个百分点14,128
2.0个百分点3,532
3.0个百分点1,570
5.0个百分点566

来源:E009、E010、E013 口径:每组样本数(近似);规划期;两组二项比例;基线10%;双侧α=0.05;功效80% 限制:正态近似;未计入流失、聚类、重复测量、多重比较和网络干扰。

当董事会要求识别0.5个百分点的真实差异时,每组约需五万六千余个独立样本;若业务量只能支持数千样本,组织只能识别更大的变化,或延长周期、扩大单元、改用更灵敏指标。功效不足会造成两种错误:把有价值候选过早退役,或被偶然波动诱导晋级。

样本规划还决定探索预算。小企业不应复制超大平台的实验频次,可选择更少候选、更大预期差异、更长观察窗,或先用质性证据排除低价值变体。公式给出规划起点,最终设计仍要处理重复客户、门店聚类、渠道串扰和季节性。

BOARD RESEARCH 22

4.4 离线、影子与在线证据应接力

竹势 AI 营销智库出品

离线评测先排除事实错误、品牌越界和明显低质;红队寻找异常输入与越权;影子运行比较系统建议和人工决策,观察差异、延迟和转人工率;有限在线暴露估计真实行为;长期跟踪验证关系与履约。每层都应带着上一层尚未解决的问题进入下一层。

影子运行尤其适合高后果场景。系统可以对真实客服问题生成答案,由员工处理客户,企业比较建议与最终答复,测量政策冲突、事实错误和人工修改。它没有直接自动执行风险,却仍需保护个人信息和限制数据用途。

在线实验提供更强的干预证据,但只在随机化、数据管线和干扰假设成立时有效。随机分派无法修复错误指标,显著性无法证明客户福利,短期结果无法自动推导长期价值。

锚点案例|Netflix个性化封面:探索样本让创意学习保持可识别

2016年至2017年,Netflix公开了视频封面选择与个性化的实验方法。业务冲突十分具体:同一部作品可以有多张候选图片,图片会影响会员是否进入详情或开始观看;若平台长期只展示当前表现最好的图片,系统很快失去了解其他候选的机会,新作品与新用户也会被早期偶然结果锁定。创意供给越丰富,单靠编辑经验或历史平均值越难处理标题、位置、用户偏好与时点的交互。[E046][E047]

其公开机制包含两个层次。第一层以随机实验比较候选图片,并将作品选择、观看等结果纳入评估;第二层使用情境多臂老虎机,在更可能有效的图片上增加展示,同时保留随机子样本,维持无偏学习。随机子样本很关键,它承担“探路”责任,让平台仍能估计尚未充分展示的候选。若完全按当前预测贪婪分配,反馈会由既有模型决定,模型又用这些反馈证明自身正确,选择偏差由此闭合。

公司材料支持的结论是:图片选择能够影响用户对作品的选择,个性化系统可以在利用当前知识的同时继续探索。公开材料没有给出完整效应分布、订阅增量、长期满意度或对不同群体的全部影响,也没有证明该机制在其他行业具有相同收益。观看开始还可能受首页位置、作品热度、推荐顺序和账号共享影响,因此封面效果只能在具体分流设计内解释。

这个案例对AI市场部的可复制价值在制度结构。候选创意需有可比较的唯一版本;展示分配需保留可识别的探索样本;主指标应连接真实客户任务;探索比例应受客户后果和预算约束;晋级后仍要保留小规模验证,防止季节、市场和受众改变。对于样本较小的企业,探索可以更少、更慢,先用事实审查和质性访谈排除大量低价值候选,再把有限流量留给真正不同的假设。

其边界同样清楚。点击或播放起始不能独占目标,夸张、误导、敏感画像和未经授权的个性化不因随机实验而获得正当性。封面属于相对低后果、可回滚的创意对象,价格承诺、资格判断和客户权益具有更高后果,不能照搬同一探索强度。董事会应借鉴“保留学习样本、记录候选血统、限制暴露”,并拒绝把平台自报机制包装成普遍因果定律。

案例证据:E046、E047 证据属性:公开论文、公司自报、监管材料或裁决,边界见正文。

BOARD RESEARCH 23

4.5 专家判断:Kohavi的“可信实验”先处理失败模式

竹势 AI 营销智库出品

Ron Kohavi及合作者长期研究在线受控实验,重点放在可信性失败,统计公式只是其中一环:样本比例异常、指标实现错误、实验间干扰、功效不足、频繁窥视、局部赢家和长期反转。[E013][E015][E016][E017] 这些问题说明,实验平台需要证明自身测量可信。

本报告接受其核心主张:随机实验是可随机、低后果、可逆数字场景中极有价值的因果工具。必要修正有三项。第一,营销结果常穿过广告、销售、库存和履约,实验边界比页面更长;第二,客户之间、渠道之间可能互相影响;第三,品牌和合规后果无法被单次短期实验穷尽。

管理判断是:在线实验拥有高证据等级,却没有最高治理等级。董事会仍要决定哪些问题可以随机、谁承担外部性、何时停止以及怎样补救。证据强度扩大了决策责任,没有取消责任。

BOARD RESEARCH 24

4.6 评测集也需要版本、覆盖和退役

竹势 AI 营销智库出品

固定题集会被团队熟悉,候选可能逐渐针对题目优化。真实客户语言、政策和渠道变化后,旧题集仍给出高分,离线评测便产生虚假安全感。评测集需要记录来源、覆盖任务、更新时间、敏感分组、泄漏风险和适用版本,并定期用新近失败、投诉和人工接管补充。新增题目不能只追逐罕见异常,也要保持常见任务分布。

评测集更新会破坏跨期可比性,因此应保留稳定核心集与滚动挑战集。核心集观察回归,挑战集发现新风险;对外部基准只使用与业务用途相符的部分。题目一旦含个人信息、版权材料或内部政策,还要限制访问与保留。评测基础设施本身属于受治理资产,过时、泄漏或无法解释的题集需要退役。

BOARD RESEARCH 25

5.1 代理指标会被组织和系统共同适应

竹势 AI 营销智库出品

市场经营依赖指标,却不能把指标当成目标本身。Goodhart在货币管理语境中指出,当统计规律承受控制压力时,规律会改变;Campbell进一步讨论社会指标在高压决策下遭遇的腐蚀压力。[E007][E008] 两者对AI市场部的共同提醒是:参与者、渠道和模型都会适应奖励结构。

内容系统若只奖励点击,候选会向夸张、冲突和模糊承诺靠拢;销售若只奖励线索数,低质量名单会增加;客服若只奖励时长,复杂问题可能被过早关闭;投放若只看平台归因收入,会忽略自然购买、退货和毛利。指标没有主动欺骗企业,企业用单一指标压缩复杂价值,系统便沿最短路径响应。

模型自动优化会加快这种适应。过去,员工需要时间摸索考核漏洞;现在,生成和选择系统可以快速搜索高分表达。护栏若不进入目标,算法会把它视为无关约束。董事会因此要审查目标函数背后的行为激励,而非只审查公式。

BOARD RESEARCH 26

5.2 主指标、护栏与诊断指标承担不同责任

竹势 AI 营销智库出品

主指标回答候选是否推进核心客户任务,例如合格咨询、净收入、有效激活或复购。护栏回答收益是否以不可接受代价取得,例如投诉、误导、退订、退款、毛利、群体差异和服务负荷。诊断指标解释机制,例如点击、阅读深度、人工修改率、转人工和页面延迟。

三类指标不能混成加权总分。加权总分会让严重护栏越界被主指标上涨抵消,也会让多个诊断波动掩盖经营结论。更稳健的决策是先看硬护栏,再看数据可信,然后判断主结果,最后用诊断指标解释。护栏属于否决条件,其权重不能被视为“较低”。

指标还要写清分母、时间窗、去重、归因和成本。所谓“转化率上升20%”可能是相对变化,基线由1%升至1.2%;“收入增加”可能未扣退款、优惠和媒体;“投诉率下降”可能因联系入口变难。口径不清会让候选选择失去共同事实。

BOARD RESEARCH 27

5.3 多重比较让候选过剩转化为统计噪声

竹势 AI 营销智库出品

生成能力提高后,一次试验很容易包含十个标题、五种受众、三种落地页和数十项指标。若团队对每个组合独立寻找5%显著性,再只汇报其中一个赢家,误报概率会迅速上升。图5在各检验相互独立且真实效应均为零的简化条件下,计算至少一次误报的概率。

FIGURE 05图5|并行检验越多,至少一次误报的概率迅速上升
变化/检验数数值
15.0%
522.6%
1040.1%
2064.2%
5092.3%

来源:E007、E008、E013 口径:至少一次误报概率;单批实验;k个相互独立且均无真实效应的检验 限制:独立性是假设;相关检验会改变精确概率,但多重比较风险仍存在。

当一批同时查看20项指标或候选,至少出现一次5%水平误报的理论概率约64.2%。若团队只展示“显著”的一项,事后选择会把偶然结果包装成学习。候选越多、切片越细、观察越频繁,结果解释越需要预先约束。

治理动作包括预先指定主指标与护栏、控制检验家族、记录所有候选、限制事后切片并要求复现实验。多重比较校正会降低检出能力,因此更根本的办法是减少无价值假设,把实验资源集中在能改变经营决策的问题上。

多重比较的管理问题不止统计校正。候选太多会稀释样本,延长周期,增加审核与解释自由度。团队可以通过预先指定主假设、缩小候选差异、把探索批次与确认批次分开、保留全部结果并要求复现来降低风险。

事后切片也属于多重比较。全体客户没有显著结果后,团队可能连续查看地区、年龄、设备、渠道和新老客,直到找到“有意义”小组。异质性研究很重要,却应有机制假设、足够样本和后续确认。未经确认的切片只能生成下一轮候选。

BOARD RESEARCH 28

5.4 品牌意义属于护栏,不能被即时行为吞没

竹势 AI 营销智库出品

品牌在客户生活中承担关系与意义。亲情、身份、专业判断、劳动尊严和社会责任等语境,常常无法被观看完成率完整表达。创意可以获得注意,同时让客户感到企业轻视真实表达或推卸责任。此类风险通常先出现在访谈、评论和一线反馈中,晚于发布却早于财务报表。

品牌护栏需要被具体化:哪些角色不能由自动系统替代,哪些承诺必须由具名专业人员确认,哪些情境要求真实经历或授权,哪些内容容易让人误解产品能力。质性审查无法估计总体效应,却能发现目标函数尚未命名的损失。

高曝光活动尤其需要撤回门槛。媒体预算越大,单次错误的扩散越快;撤回可以停止新增暴露,却无法清除截图、新闻与客户记忆。探索预算应在制作和投放前包含这一不可逆部分。

BOARD RESEARCH 29

5.5 监管对性能宣称提出证据责任

竹势 AI 营销智库出品

FTC针对AI营销宣称的业务指南要求企业审视性能承诺、比较依据与风险,避免夸大或缺乏支持的说法。[E040] 中国广告法要求广告真实、不得虚假或引人误解,广告主承担真实性责任。[E032] 这些规则把“效果文案”变成证据问题。

团队不能用模型内部基准证明客户场景表现,也不能用少数成功案例证明普遍能力。宣称“更准确”“自动增长”“降低成本”时,需要说明比较对象、样本、时间、用途和限制。供应商自报可以支持机制介绍,不能自动支持独立因果承诺。

董事会应要求所有重大AI能力宣称进入同一选择制度:先界定用途,再核验数据与对照,保留反例与适用边界,最后决定可公开措辞。市场部推广自己的AI能力时,同样受真实性和客户合理预期约束。

BOARD RESEARCH 30

5.6 指标审议要寻找“看不见的交换”

竹势 AI 营销智库出品

每个指标改善都可能伴随交换。响应更快可能减少解释,表单更短可能降低线索信息,自动分群可能提高转化同时扩大排斥,创意更强烈可能提高记忆同时损害信任。季度审议应要求团队列出赢家付出的代价,并检查代价是否落在其他部门、其他客户群或更晚时间。没有观察到代价,只能说明当前测量尚未发现。

财务口径能够纠正部分错觉。新增收入要扣除媒体、优惠、退款、履约、人工审核和补救;线索要连接合格率、销售时长和成交毛利;复购要区分自然回访与促销拉动。品牌和公平后果难以全部货币化,仍需作为独立护栏。董事会不必强行把所有价值压成一个数,可以用多条件决策保留不可通约的责任。

BOARD RESEARCH 31

6.1 市场反馈先回答“发生了什么”

竹势 AI 营销智库出品

曝光、点击、会话、订单、退款、投诉和复购能够描述结果,却不会自动说明原因。一次内容发布后订单上升,可能来自创意、价格、渠道流量、库存恢复、节日需求或销售跟进。反馈数据越丰富,潜在解释也越多。

Judea Pearl指出,因果问题需要理解数据生成机制,单靠数据无法计算干预效果。[E011] 对董事会而言,这句话的实际含义是,报表必须附带经营过程:客户怎样进入、谁看到候选、是否同时接受其他行动、结果在哪一环被记录、哪些因素改变。

相关性仍有价值。它可以发现异常、生成候选、定位人群和安排访谈。其边界在于不能直接支持预算扩张或自动执行。候选阶段可以宽,晋级阶段需要更强证据。

BOARD RESEARCH 32

6.2 Rubin的反事实提醒:每位客户只有一条实际路径

竹势 AI 营销智库出品

Rubin的潜在结果框架把因果问题表达为同一单位在不同处理下结果之差,但同一客户在同一时刻只能经历一种处理。[E010] 另一条路径属于反事实,需要随机化、匹配、自然实验或结构假设来估计。

随机分派的优势在于让处理组和对照组在概率意义上可比,既平衡已知因素,也平衡未观测因素的期望分布。它仍依赖执行:分流不能被销售人员绕过,曝光需要真实发生,结果记录要一致,客户之间的相互影响要可接受。

无法随机时,企业可以使用时间切换、地区分阶段、阈值规则、匹配或合成对照,但必须写出识别假设。观察性结果可以支持决策,却要降低证据等级,并安排替代验证。Rubin原文也承认,严格控制的非随机数据在许多情境中有必要,条件是不能掩盖假设。[E010]

BOARD RESEARCH 33

6.3 Fisher的随机化需要与经营单元一致

竹势 AI 营销智库出品

Fisher把随机化置于实验推断基础。[E009] 在营销场景,随机化单元可以是客户、账号、门店、地区、销售团队或时间段。单元选择应匹配干预传播范围。若同一家庭共享账号,客户级分流可能串扰;若门店员工共享话术,个人级分流无法隔离;若社交推荐影响关系网络,成员结果彼此相关。

聚类随机化能够减少串扰,却降低有效样本并增加设计复杂度。时间切换容易受趋势、节日和学习效应影响。地区试验受本地竞争和媒体外溢影响。没有完美设计,只有明确假设、风险和可接受误差。

董事会无需决定统计模型,却要追问随机化单元为何与经营机制相符。若团队无法解释谁影响谁、哪里可能串扰,显著性数字缺少可信基础。

BOARD RESEARCH 34

6.4 信号速度与证据强度应分开

竹势 AI 营销智库出品
FIGURE 06图6|反馈信号的速度与因果强度并不一致
信号示例时滞性质证据强度
即时行为点击、停留、回复、跳出分钟至天快;易受界面和渠道影响低至中
交易后果订单、净收入、退款、贡献毛利天至月接近经营结果;受库存和履约影响
关系后果复购、投诉、退订、信任、推荐周至季度慢;更接近持续价值
质性证据访谈、客服记录、销售异议、审稿意见随事件解释机制;样本选择偏差大诊断用
因果证据随机比较、准实验、自然实验按设计可回答特定干预问题中至高

来源:E010、E011、E028、E055 口径:信号类型/时滞/证据性质;持续经营;客户行为、交易与关系结果 限制:任何信号都受测量与选择偏差影响;权重依具体决策。

最快的反馈往往离长期价值最远。点击可以在数小时内稳定,却可能由夸张承诺、误导版式或猎奇创意驱动;退款和投诉较慢,却更能揭示承诺与履约之间的冲突。反馈体系应让速度服务于诊断,不让速度垄断目标。

质性记录能够解释“为什么”,随机比较能够估计“是否因候选而变”。两者互补:没有质性证据,团队难以生成合理候选;没有因果设计,团队容易把高意向人群的自选择归因给内容。

即时行为适合快速诊断,交易结果接近经营价值,关系后果检验持续性,质性证据解释机制,因果设计估计特定干预效果。任何一类都不能独占决策。企业需要一张“信号合同”,规定每种信号的口径、时滞、偏差和可支持动作。

例如,点击在一天内上升可以支持继续有限暴露,却不能支持全量推广;退款在两周后恶化可以触发暂停,即使点击依旧领先;访谈揭示客户误解可以生成新候选,但不能量化总体损失;随机实验确认短期咨询增加后,仍要等待线索质量与履约结果。

证据分层还能处理部门冲突。市场团队看到互动上涨,销售看到无效线索,客服看到政策咨询增加,财务看到毛利下降。选择制度要求共同解释完整客户路径,避免每个部门用自己的局部信号宣布胜负。

案例|LinkedIn弱关系实验:产品小改动也会改变真实机会分配

2022年《Science》论文汇总LinkedIn五年间多项随机化“你可能认识的人”推荐实验,涉及超过两千万名成员。研究利用推荐算法的随机变化,估计不同强度社会关系对就业流动的影响。[E055]

这项研究拥有大规模随机设计,证据强度明显高于普通点击相关分析。它同时揭示外部性:推荐变化会改变人与人连接,处理影响可能沿网络传播,最终触及职业机会。个人级指标上涨无法完整表达社会分配后果。

论文结论限于特定平台、时期、推荐机制和就业结果,不能推导所有弱关系都更有价值,也不能证明平台总体福利改善。实验参与者规模大,不代表每项效应都适合商业复制。

研究还提醒实验治理者审查社会效应。推荐使一部分关系更容易形成,也可能改变其他成员的可见性;某位成员获得机会,未必等于系统创造了同等数量的新机会。总体就业流动与个体重新分配需要分开解释,平台实验的显著性不能替代公共利益判断。

可复制的管理条件是,在社交推荐、线索分配和客户排序中审查网络干扰、机会公平、长期结果与申诉。董事会应要求团队说明谁获得机会、谁被挤出,以及短期连接指标和真实业务后果之间的因果链。

案例证据:E055 证据属性:公开论文、公司自报、监管材料或裁决,边界见正文。

BOARD RESEARCH 35

6.5 因果结论要附带适用边界

竹势 AI 营销智库出品

随机实验的结论属于特定候选、特定人群、特定时间和特定执行状态。复制到新市场、渠道或客户群时,价格、竞争、文化和履约可能变化。组织记忆应保存这些边界,并把“外推”视为新决策。

长期效应也可能与短期相反。新奇感提高早期互动,几周后消失;优惠扩大订单,随后降低价格预期;自动回复缩短响应,复杂客户却因缺少人类判断而流失。时间分段与长期护栏需要预先安排。[E016]

管理层应拒绝“实验已经证明”的绝对表达,改用“在某条件下,某候选相对于某对照,对某指标产生了可估计影响”。这一句虽然更长,却保留了决策所需的边界。

BOARD RESEARCH 36

6.6 异质性分析应服务保护与适配

竹势 AI 营销智库出品

总体平均效应可能隐藏群体差异。新客户受益、老客户受损,移动端改善、低带宽地区恶化,普通问题准确、少数语言错误集中。异质性分析首先用于发现受损群体和机制差异,其次才用于寻找更高收益人群。若团队只寻找“最容易转化”的切片,个性化会演变为机会排除。

分析前应确定具有业务或权益意义的分组,并检查样本和多重比较。事后发现的小组效应属于待确认信号,不能直接驱动自动差别待遇。涉及敏感属性时,还要判断数据使用是否合法、是否必要、代理变量会否产生间接区分。因果证据越细,样本与假设压力越大,结论表述应随之收缩。

BOARD RESEARCH 37

7.1 March的两难发生在真实资源上

竹势 AI 营销智库出品

James March把组织学习描述为探索与利用之间的资源竞争。[E005] 探索包括搜索、试验、变化和发现,利用包括执行、效率和复制。短期回报通常偏向利用,因为成熟做法反馈更快、更稳定;长期适应依赖探索,因为环境会变、旧知识会失效。

企业不能用一句“保持平衡”解决两难。探索占用客户流量、媒体预算、员工注意力、数据权限和品牌容错;利用占用稳定交付能力。预算必须在真实资源上体现,并根据客户后果、可逆性和不确定性调整。

低后果创意可以使用较多候选和较短周期;高后果自动答复应将主要探索放在离线与影子环境;难回滚的公开承诺需要更小暴露甚至取消试验。固定比例无法适应不同风险。

FIGURE 07图7|探索预算应随客户后果和可逆性收缩
对象公开规模/动作口径含义
低后果/易回滚内部内容草稿、非关键版式可并行多候选自动回滚;抽样复核
中后果/可回滚广告创意、推荐排序、发送时点小流量、短周期护栏触发即停;人工晋级
高后果/部分可逆价格沟通、自动客服、线索资格判断影子运行或极小范围双人批准;客户补救预案
高后果/难回滚合规声明、授信/就业/医疗类决定、儿童场景通常不进行自由探索规则执行、审计与专业责任

来源:E005、E019、E026、E027、E031 口径:风险档位;规划期;候选暴露额度 限制:示意矩阵,不能替代行业风险评估。

探索预算包含客户人数、持续时间、媒体支出、可调用权限和可接受损失。预算越小,学习速度可能越慢;预算过大,单次失败会跨越可补救边界。管理层的任务是在可逆范围内购买信息,而非追求最高试验吞吐量。

高后果场景的“试点”常常只能采用影子运行、专家复核或模拟数据。即使技术上能随机,企业仍要判断客户是否会承担不合理风险、是否知情、是否有退出和申诉机会。

BOARD RESEARCH 38

7.2 探索预算有五种额度

竹势 AI 营销智库出品

第一是人数额度,限定可接触客户或账号数量。第二是时间额度,限定候选运行窗口。第三是资金额度,包含媒体、优惠、模型、人工审核和补救。第四是权限额度,限定系统可读、可写、可发送和可调用范围。第五是损失额度,规定可接受的投诉、退款、误发或服务负荷。

五种额度要同时存在。只设媒体上限,却允许系统向全部客户自动回复,风险没有封顶;只设用户比例,却不限制优惠和权限,单次损失仍可能很大;只设时间,却没有自动停止,夜间异常会继续扩散。

探索预算还要包含机会成本。样本被低价值候选占用,高价值问题会延迟;团队处理几十个微小版本,无法研究真正改变客户任务的假设。候选管道应按决策价值排序,生成速度不能决定入场顺序。

BOARD RESEARCH 39

7.3 阶段放量将不可逆风险留在小范围

竹势 AI 营销智库出品

阶段放量可以采用内部、员工、邀请用户、1%、5%、20%和更大范围等阶梯,具体比例依业务量和风险而定。每一级都应重新检查数据、护栏和异质性,不能把前一级自动延伸。

小流量阶段主要寻找严重错误和测量问题,未必有足够功效识别小收益。团队要避免用小样本“证明有效”,也要避免因未显著而过早退役。放量门槛可以由安全、数据可信和方向一致性构成,收益确认留给足够样本阶段。

阶段放量需要稳定对照。全部客户最终接受新版本后,企业会失去监测环境变化的基线。低后果场景可以保留小比例长期对照;无法保留时,应使用历史基线、地区轮换或定期回测,并清楚降低证据等级。

FIGURE 08图8|晋级、暂停、回滚与退役需要不同证据
时间/类别对象或机制证据/边界
护栏是否越界?是 → 立即暂停/回滚并启动补救否 → 继续
数据是否可信?否 → 修复测量,结论作废或重跑是 → 继续
主结果是否达到事前门槛?是 → 检查异质性、成本和长期风险否 → 诊断无效或负效应
收益能否覆盖成本与风险?能 → 分阶段晋级并保留对照不能 → 退役或重新设计
结论是否可复现?否 → 不进入标准作业是 → 写入组织记忆

来源:E015、E016、E017、E019 口径:决策节点;每次评审;候选版本 限制:门槛需在具体业务中量化;流程不能替代判断。

四种动作解决不同问题。暂停用于不确定或正在调查的候选;回滚用于恢复已知稳定状态;退役用于停止继续投入;晋级用于扩大经过证据支持的版本。把所有负面结果都归入“优化中”,会让失败候选永久占用客户暴露和团队注意力。

数据质量失败与业务失败必须分开。样本比例异常、事件漏报或分流污染时,任何好坏结论都不可信;护栏明确越界时,即使主指标上涨也应回滚。决策记录需要保存反对意见,以便后续环境变化时重新判断。

FIGURE 09图9|Bing预览期以限额和阶段放量控制真实世界暴露
时间/类别对象或机制证据/边界
2023-02-22预览用户超过100万,覆盖169个国家;71%拇指反馈为正公司自报,反馈分母不完整
2023-03-09单次会话上限6→10轮;每日上限120轮继续试验更长会话
2023-03-31单次会话15→20轮;每日150→200轮发布记录,无公开对照数据
2023-05-0490天累计聊天超过5亿;日活超过1亿公司自报规模,不能识别单功能增量

来源:E058、E059、E060、E061 口径:公开里程碑;2023-02至2023-05;预览产品与用户 限制:没有公开事故率、实验分母和完整因果设计;规模均为公司自报。

这一时间线的管理价值在暴露控制,而非证明产品已安全或商业成功。先以邀请预览获取真实信号,随后调整会话和每日上限,再逐步开放,是一种可逆推进方式。限额既保护客户,也为团队争取诊断时间。

公开数字仍有明显边界:正向反馈的作答人群、长期留存、错误率和群体差异均未完整披露。董事会借鉴的应是“先设上限、逐步放量、保留回滚”,不能把用户规模作为安全证据。

案例|Bing预览期:限额、逐级放量与公开反馈共同控制暴露

2023年2月至5月,Microsoft通过预览方式扩大Bing新型对话体验。公司在2月22日自报,已有超过一百万名用户、覆盖169个国家,搜索和回答能力获得71%的拇指正向反馈;这些数字支持继续观察,却没有提供完整反馈分母、错误率或长期留存。[E058]

公开发布记录显示,会话上限被当作风险控制旋钮。3月9日,单次会话由6轮增至10轮,每日上限为120轮;3月31日,单次会话由15轮增至20轮,每日由150轮增至200轮。团队同时修复错误、降低延迟并继续测试更长会话。[E059][E060]

5月4日,公司又自报90天内累计聊天超过5亿次、生成图片超过2亿张,日活超过1亿。规模增长说明真实环境暴露迅速扩大,仍无法识别某次限额调整的净效应,也没有公开不同群体的错误后果。[E061]

案例可复制之处在“有上限的预览”:先限制用户、时长、调用频次和功能权限,再依据护栏与真实反馈逐级放量;任何阶段都保留收缩和回滚能力。企业不能把拇指反馈或用户规模当作安全证明,必须并列查看错误类型、投诉、事实性、滥用和补救速度。

阶段放量还要求统一事件口径。若会话轮数变化时,模型版本、用户入口、地区、提示和内容政策同步变化,公开时间线只能说明整体版本推进,无法识别单一调整的作用。企业复制时应冻结关键条件或留下版本血统,并把每次扩大暴露与具体证据、批准人和恢复方案对应。

案例证据:E058、E059、E060、E061 证据属性:公开论文、公司自报、监管材料或裁决,边界见正文。

BOARD RESEARCH 40

7.4 探索的伦理底线:谁承担学习成本

竹势 AI 营销智库出品

任何真实世界探索都在分配学习成本。客户可能看到较差版本,员工可能承担额外审核,销售可能处理低质线索,品牌可能留下公开记录。企业必须判断承担者是否知情、后果是否合理、是否有退出和补救。

客户接受常规产品差异,不代表同意承受高后果政策试验。涉及权利、价格、健康、安全、就业和儿童时,低概率伤害也可能不可接受。伦理审查不能被“整体收益可能更高”概括,需要看受影响群体与伤害集中度。

March的探索理论解释资源困境,没有提供伦理许可。本报告对其作必要修正:探索预算由企业承担主要成本,客户暴露以最小必要为原则,无法补救的高后果优先使用模拟、影子和专业评审。

BOARD RESEARCH 41

7.5 学习速度要与回滚速度共同衡量

竹势 AI 营销智库出品

许多团队强调快速实验,却忽略停止和恢复。真正可控的系统需要知道何时发现、多久决策、多久撤回、多久完成客户补救。回滚时间越长,探索预算越应收缩。

回滚包括技术状态、渠道素材、知识库、销售话术和客户沟通。只恢复模型版本,旧素材仍在投放,错误继续传播;只停止广告,已经获得的错误线索仍进入销售。企业要以客户路径检验回滚完整性。

董事会可以要求每次高于低风险档的试点进行一次回滚演练。演练不需要制造客户伤害,可以在影子或员工环境验证权限、日志、通知与恢复。无法演练的系统不应获得大规模自动执行权。

BOARD RESEARCH 42

7.6 预算应包含停止探索的机会

竹势 AI 营销智库出品

探索常因沉没成本继续:素材已经制作、供应商已经签约、活动窗口即将结束,团队希望再多跑几天。预算设计需要预先承认停止可能,并把未花完的额度视为风险节省,不能视为执行不足。暂停后保留剩余预算,待数据修复或新候选出现再使用,可以减轻“必须花完”的压力。

探索组合还要设置集中度上限。多个候选若依赖同一模型、同一数据源或同一平台,表面分散仍可能共同失败。企业应观察共享依赖、同类承诺和同一客户群的总暴露。组合层面的停止条件能够处理单项都未越界、合计却造成服务拥堵或品牌过度触达的情形。

BOARD RESEARCH 43

8.1 四种动作对应四类经营状态

竹势 AI 营销智库出品

晋级表示证据达到扩大条件,候选进入更大流量或标准作业;暂停表示存在异常、数据不确定或需调查,暴露暂时停止;回滚表示恢复已知稳定版本;退役表示企业停止继续投资和使用该候选。四者必须有不同状态和责任。

实践中,团队常把暂停写成“继续优化”,把退役写成“暂不上线”,让失败候选长期占用注意力。没有正式退役,员工会在下一次活动重新提出同一做法,模型知识库也可能继续检索旧结论。选择制度需要结束动作。

晋级也不能等同于永久胜出。候选获得的是在明确条件下扩大资格,仍受长期护栏、环境变化和失效信号约束。大规模发布后应保留监测与回滚。

BOARD RESEARCH 44

8.2 数据可信是胜负判断的前置门

竹势 AI 营销智库出品

样本比例异常、埋点遗漏、重复事件、机器人流量、跨组污染和延迟回填会让结果失效。可信实验实践把这些问题置于业务结论之前。[E015][E016] 若数据门没有通过,团队只能修复并重跑,不能“参考趋势”晋级。

结论作废是一项重要组织能力。目标压力容易让团队保留看起来有利的数据,尤其在活动窗口短、预算已投入或高层公开承诺之后。预先规定作废条件可以保护决策免受沉没成本影响。

董事会应查看作废率及原因,目的在于识别测量系统薄弱处,不用于惩罚团队。作废率长期为零可能代表系统极稳,也可能代表团队从不承认数据失败,需要结合诊断事件判断。

BOARD RESEARCH 45

8.3 平台规模必须服从共同语义

竹势 AI 营销智库出品
FIGURE 10图10|实验平台的工程规模不可直接替代决策质量
对象公开规模/动作口径含义
Microsoft ExP(2013)每年超过10,000项实验年实验数公司技术论文
LinkedIn早期论文(2014)每日超过400项并行实验并行实验/日公司研究论文
LinkedIn引擎(2023)约35,000项并行实验;每日23万亿次评估并发与计算评估公司技术博客
LinkedIn T-REX页面每日超过40,000项实验;约8,000个指标平台口径持续更新页面

来源:E014、E051、E053、E054 口径:公司自报规模;2013–2023;超大数字产品实验平台 限制:年份、实验定义、并行口径和计算评估均不同。

图中数字展示实验基础设施为何需要自动分流、指标计算、冲突检测和异常告警,也同时说明跨公司比较的危险。年实验数、并行实验、每日评估和指标数量属于不同量纲,把它们排成“成熟度榜单”没有统计意义。

中型企业的优势不在追赶平台吞吐量。更有价值的目标是缩短高价值问题的证据周期,提高可复现率,降低客户损失,并让退役决定得到执行。平台规模只有在这些结果改善时才具有经营意义。

大型平台的公开规模说明自动化基础设施为何必要:数万并行实验无法靠表格协调,实时请求需要稳定分派,数千指标需要共同定义,异常需要自动告警。它们同时说明,实验计数不能跨企业直接比较,量纲和定义差异巨大。

中型企业可以用较轻系统达成关键控制:统一候选身份、随机化单元、互斥范围、指标版本、流量上限、审批、停止、回滚和结论。技术复杂度应由并发和风险决定,治理语义不能省略。

董事会关注的规模指标可改为“有多少重要决策被可信证据覆盖”“多少候选因护栏停止”“多少结论复现”“退役是否执行”。这些指标仍需防止被考核化,适合与案例审议共同使用。

锚点案例|LinkedIn T-REX:实验规模只有被可信诊断约束才有价值

LinkedIn在2014年至2023年的论文和工程材料中持续披露其在线实验体系。早期研究报告每日有四百多项并行实验;后续T-REX页面与工程博客给出更大的自报规模,包括约三万五千项并行实验、每秒八十万次请求、每日二十三万亿次评估,以及数千项指标。[E051][E052][E053][E054] 这些数字容易制造“实验越多,组织越先进”的印象,实际挑战恰好相反:并行数量上升会加剧流量冲突、指标污染、网络干扰、数据延迟和错误放量。

平台演进围绕可信性展开。实验配置需要明确随机化单元、流量、目标群体和指标;逐级放量配合告警,异常样本比例、关键护栏或服务指标触发调查;平台还要处理同一成员同时进入多项实验的冲突。社交网络尤其复杂,成员之间会互动,一个人的处理可能改变另一个人的结果,个人级随机分派由此可能违背独立性。工程吞吐量只解决“能运行多少”,实验设计与诊断才决定“结论能否相信”。

公开材料能证明平台具备大规模分流、指标计算和诊断能力,并展示公司长期投资实验基础设施。材料没有公开每项实验的成功率、误判率、客户损失、净收入贡献或组织成本;不同年份的“实验”口径也不一致,年实验数、并行实验与每日评估无法直接比较。公司自报规模属于机制证据,不能充当商业成效的独立验证。

可复制条件包括统一实验身份、候选版本、指标语义、互斥规则、逐级流量、异常告警和结论留存。中型企业无需复制超大平台架构,可以先把高价值决策纳入共同分流规则,禁止团队各自在广告、CRM和内容系统里建立互相污染的对照。每项实验都要写明停止条件,并在数据管线异常时使结论失效。

平台公开材料还提示,逐级放量与自动告警只有在处置权真实存在时才有效。告警后若业务仍可绕过停止、指标定义由各团队私改、实验冲突无人负责,基础设施会输出更精致的错误。可复制目标应包含告警响应时长、结论作废和版本回收,并把这些指标与实验吞吐量并列审议。

董事会应把平台规模改写为三类经营问题:高价值问题的证据周期是否缩短,客户暴露是否可控,错误结论是否更少。若实验数量增长却没有退役记录、复现率和护栏事件,平台可能只是在更快生产统计噪声。T-REX的启示是基础设施必须服务选择纪律,不能让计算能力替代目标治理。

案例证据:E051、E052、E053、E054 证据属性:公开论文、公司自报、监管材料或裁决,边界见正文。

BOARD RESEARCH 46

8.4 入口评审和出口评审形成闭环

竹势 AI 营销智库出品

入口评审决定候选是否值得消耗客户流量。它检查经营问题、候选差异、因果链、功效、护栏、风险档位、权限和回滚。出口评审决定结果能支持什么动作,检查数据可信、效应大小、区间、异质性、成本、长期风险和外推边界。

评审不应变成会议数量。低风险候选可以标准化快速通过,高风险候选由相应责任人集中判断。关键是每次评审产生可执行决策,且决策与系统状态联动。

出口评审还要处理失败价值。候选没有改善主指标,可能排除一个假设;护栏恶化,可能揭示客户机制;数据失效,可能暴露测量缺陷。只有写入后续动作,失败才成为学习,而非安慰话术。

BOARD RESEARCH 47

8.5 退役制度保护组织免受“僵尸候选”拖累

竹势 AI 营销智库出品

退役对象包括模型、指令、知识源、创意、受众规则、流程和指标。退役要处理调用入口、缓存、定时任务、文档、权限和历史素材,防止旧版本在边缘系统继续运行。

退役理由应区分负效应、无效、成本过高、规则变化、数据不可用、供应商退出和被更优候选替代。理由决定未来是否重新评估。环境改变后,某些旧假设可以作为新候选,前提是重新进入证据阶梯。

董事会每季度应查看重大退役清单。组织若持续增加能力却没有退役,复杂度会累积,攻击面、维护成本和错误路径同步增长。会进化的系统也必须会遗忘。

BOARD RESEARCH 48

8.6 决策时限要覆盖调查,避免强迫结论

竹势 AI 营销智库出品

候选运行后需要明确评审时点,避免无人决策;同时,时限不能迫使团队在数据延迟或异常未解时给出胜负。处置时限可以区分:护栏事件立即响应,数据问题限定调查窗口,主结果在达到样本后评审,长期后果按业务周期复核。不同节奏共同进入一张决策日历。

每次处置还要记录替代方案。回滚使用哪个稳定版本,暂停期间由谁人工接管,退役后相关需求如何满足,晋级后保留什么监测。只有“停掉”且无替代,业务会通过非正式工具绕开制度;只有“上线”且无监测,赢家会迅速失去约束。处置设计因此连接风险控制与业务连续性。

BOARD RESEARCH 49

9.1 收集更多反馈会同时增加偏差与责任

竹势 AI 营销智库出品

反馈经常被描述为系统学习的燃料,现实中每一条反馈都有来源、目的和权利边界。点击只覆盖被展示的人,问卷只覆盖愿意作答的人,投诉偏向感受强烈且能找到入口的人,销售备注受人员经验影响,客服摘要又可能被自动工具压缩。反馈量增加会降低某些随机误差,也可能稳定地放大选择偏差。

个人信息保护要求处理具有明确、合理目的,并与目的直接相关,采取对个人权益影响最小的方式。[E031] 企业不能因为“以后可能有助于优化”便无限留存客户对话、画像和行为。每类反馈需要说明业务目的、合法基础、保留期、访问者和退出方式。

ICO关于数据最小化的指南指出,更多数据与统计表现之间存在权衡,同时带来安全和用途风险。[E030] 这意味着“多收集”本身需要证据,尤其当新增字段涉及敏感信息、儿童、位置或跨场景合并。

BOARD RESEARCH 50

9.2 反馈应保留事件上下文与不确定性

竹势 AI 营销智库出品

一条“客户不喜欢”不足以进入选择。反馈记录至少需要事件时间、接触候选、渠道、客户任务、表达主体、影响和后续结果。自动归类可以帮助聚合,原始语义和不确定性仍要保留,避免分类标签替代客户声音。

推断与事实必须区分。系统根据行为推断“高意向”“价格敏感”或“可能流失”,这些标签属于概率判断,不能被销售和客服当作客户事实。ICO建议将统计推断标记为推断,并保留来源和系统信息。[E028] 企业还应允许员工和客户纠正明显错误。

上下文完整性决定反馈能否迁移。客户为售后提供的信息不一定适合广告定向;一线销售对某行业的判断不一定代表全体客户;某渠道的评论语言不一定适合正式服务。用途变化需要重新评估,而非默认复用。

BOARD RESEARCH 51

9.3 质性证据负责解释机制

竹势 AI 营销智库出品

客户访谈、客服记录、销售异议、审稿意见和现场观察能够揭示指标背后的机制。退款上升可能来自错误承诺,也可能来自履约延迟;点击下降可能说明标题弱,也可能说明流量更精准;人工修改率高可能来自模型低质,也可能来自审批者标准不一致。

质性证据的局限是样本选择、回忆和解释偏差。企业不应把几条评论等同于总体比例,也不应因样本小而忽略它们。最佳用法是发现失败模式、生成候选、解释异常,并安排可量化验证。

每次重大候选评审都应包含一线声音,尤其是销售、客服、门店和交付。他们接触指标无法捕捉的后果,也可能因绩效压力隐藏问题。反馈制度需要安全的异议通道。

BOARD RESEARCH 52

9.4 Edmondson:没有心理安全,坏消息不会进入系统

竹势 AI 营销智库出品

Amy Edmondson在1999年对51个团队、427名成员的研究中,把心理安全与团队学习行为联系起来。[E012] 原始语境是团队成员是否愿意提问、承认错误、寻求帮助和讨论问题。AI市场部引入自动评分后,这一条件更加重要。

若员工担心报告模型错误会被解释为抵制技术,错误会被悄悄修补;若销售只因线索数受奖,无效线索不会被如实标记;若内容团队因退役候选受罚,失败记录会消失。系统日志可以记录动作,却无法强迫真实解释出现。

本报告接受Edmondson对学习行为的机制判断,同时保留边界:其研究具有特定组织样本和相关分析,不能提供所有企业的效应大小。管理应用应聚焦可观察制度,例如无责报告、独立复核、异议留存和对数据问题的非惩罚处理。

BOARD RESEARCH 53

9.5 反馈污染需要独立控制样本

竹势 AI 营销智库出品

当模型根据用户反馈持续更新,反馈又受模型展示决定,数据分布会被系统自身改变。热门候选获得更多曝光和反馈,冷门候选缺少数据;自动回复引导客户用特定表达,后续训练再把这种表达当作自然需求。系统由此形成反馈回路。

控制方法包括保留随机探索样本、固定基准集、独立客户研究、冻结评测窗口和记录政策变化。对高风险任务,还应使用外部专家与真实政策源复核。独立控制样本旨在防止系统只看见自己制造的世界;它不追求“完全客观”。

反馈进入训练、检索或规则更新前要有晋级门。未经核验的销售备注不能直接成为事实知识,单次投诉不能自动改写政策,平台热门内容不能自动进入品牌规范。反馈先作为候选证据,再由责任人决定其用途。

BOARD RESEARCH 54

9.6 客户补救也是高价值反馈

竹势 AI 营销智库出品

更正、退款、删除、人工接管和申诉记录揭示系统在哪一环给客户造成了负担。企业常把这些记录视为服务成本,选择制度应把它们纳入后果证据:补救发生率、完成时长、重复问题和受影响群体可以触发暂停或退役。

补救数据不能只追求“关闭工单”。客户是否真正恢复权益、错误内容是否在各渠道纠正、派生画像是否删除、销售是否停止继续使用错误信息,都需要验证。FTC关于语音助手数据的解读强调企业需要兑现数据保留与删除承诺,派生模型也可能延续义务。[E044]

董事会应查看重大补救案例,而非只看平均处理时长。平均值可能掩盖少数严重伤害;案例能够暴露责任断点和回滚不完整。组织对失败的处理方式,本身就是下一轮选择的输入。

BOARD RESEARCH 55

9.7 反馈权利要进入客户界面

竹势 AI 营销智库出品

企业内部把反馈分类得再精细,客户若不知道自动化参与、无法更正或退出,治理仍不完整。适用场景应以清楚方式说明系统角色、信息用途和人工渠道,避免用冗长条款掩盖关键影响。高后果推断应让相关人员知道其概率性质,并提供纠正和申诉路径。

反馈界面也会影响数据。复杂入口会压低投诉,诱导式选项会改变答案,强制评分会制造敷衍信号。设计反馈机制时应记录无响应、放弃和转人工,将“沉默”与“满意”分开。客户权利与测量质量在这里相互支持:更可达的纠正渠道既保护个人,也帮助企业发现系统性错误。

BOARD RESEARCH 56

10.1 版本记录只是记忆的骨架

竹势 AI 营销智库出品

保存模型、指令、素材和配置版本可以回答“运行了什么”,却不能回答“为什么运行、预期什么、结果为何可信、何时可以复用”。组织记忆需要把技术版本与经营问题、客户群、指标、护栏、决策和边界连接起来。

记忆的最小单元是一项可复用判断。例如:“在2026年第二季度的某类B2B线索中,简化表单相对于旧表单提高合格提交,未增加无效线索;效果依赖销售两小时内跟进,尚未验证其他行业。”这条判断比“版本B胜出”更有迁移价值。

记忆还要保留失败。被退役候选的假设、证据和原因可以阻止重复浪费,也能在环境变化时重新评估。只保存赢家会产生幸存者偏差,让后来者误以为每次改变都有效。

BOARD RESEARCH 57

10.2 Deming:研究结果要对照事前预测

竹势 AI 营销智库出品

Deming的PDSA循环强调用预测组织学习,实验的目的在于获得知识。[E002][E003][E004] 企业常把“计划—执行—检查—行动”压缩为任务管理,遗漏了预测、理论和研究。结果一旦出现,团队只比较是否达标,很少比较为何与预期不同。

真正的研究阶段要检查效应方向、幅度、时间、群体和副作用。预测正确但幅度较小,可能说明机制成立、商业价值不足;方向相反,可能说明因果链错误;总体正向但某群体受损,需要调整范围;短期正向、长期衰减,需要改变晋级条件。

PDSA没有规定所有问题都用随机实验,也没有给出统一节奏。其当代连接在于把模型迭代放入可预测、可检验和可行动的学习循环。必要修正是加入客户权益、数据治理和自动执行风险。

BOARD RESEARCH 58

10.3 Argyris:指标持续失败时需要改写支配规则

竹势 AI 营销智库出品

Argyris区分单环与双环学习:单环修正行动,双环审视支配行动的目标、假设和规范。[E006] AI市场部很擅长单环调优,例如改标题、换素材、调阈值;当同类问题反复出现,继续调参会掩盖目标错误。

典型信号包括点击持续提高而线索质量下降,内容产量增加而品牌辨识下降,自动回复缩短时长而投诉增加,实验频次增长而复现率降低。此时应质疑目标、客户定义、奖励和组织分工,而不只寻找新候选。

双环学习也有边界。一次失败可能来自数据管线或执行偏差,不能立即推翻战略。组织应先排查测量与实施,再判断支配规则。关键是保留质疑目标的权利,并让董事会承担目标修订责任。

FIGURE 11图11|组织记忆需要保存预测、版本、结果和边界
阶段/类别结论或动作
决策前经营问题、候选差异、预测、主指标、护栏、停止条件
运行中实际版本、分流记录、异常、成本、客户补救
决策后结果、置信区间、异质性、归因限制、反对意见
复用时适用市场、客户群、有效期、依赖条件、失效信号
更新时新证据、环境变化、规则修订、退役原因

来源:E002、E003、E006、E017、E018 口径:记忆要素;全生命周期;实验与运营记录 限制:记录质量不保证复用;需检索、责任人和定期失效审查。

保存最终胜负远远不够。没有事前预测,组织无法识别事后编故事;没有实际版本和分流记录,后续无法复现;没有适用边界,局部成功容易被错误复制到新市场。组织记忆是一份带条件的决策资产。

负面结果尤其值得保存。它们可以阻止同类失败再次消耗预算,也可能说明原目标、客户定义或品牌假设需要修正。双环学习发生在团队愿意改写支配规则时,而非把每次失败都归因于执行人员。

BOARD RESEARCH 59

10.4 记忆要有失效日期和复用审查

竹势 AI 营销智库出品

市场知识会随价格、渠道、竞争、法规、客户结构和模型变化而失效。每条结论应标记有效期、适用条件和失效信号。渠道规则改变、产品价格调整、目标人群迁移或政策更新,都可能触发重新验证。

复用时不能直接复制赢家。团队先确认问题、对象、机制和边界是否相同,再决定采用、缩小试点或重新实验。越接近硬边界,复用审查越严格。

知识库检索还可能放大过时结论。系统应优先生效版本,显示证据等级和日期,对冲突结论进行提示。无法判断时转给责任人,不能让检索排名代替决策。

案例|Microsoft ExP:入口与出口评审把实验结果变成组织资产

Microsoft研究团队在2013年论文中将大型实验平台拆为实验管理、运行、数据管线和分析等组件,并自报每年运行一万多项实验。[E014] 后续关于实验飞轮的研究收集417名实践者答复,另有约200家公司提供258份会议调查答复。[E018]

材料强调可信性、规模、价值证明和组织教育。入口评审用于检查假设、功效、指标与数据,出口评审用于处理结论、异常和后续动作。即使候选失败,只要排除了错误方向并留下可复用知识,仍可能产生决策价值。

这些材料主要来自软件企业,实验频次、数据基础和可逆发布条件优于多数传统行业;年实验量属于公司自报,不能外推每项实验的质量或财务回报。

飞轮研究还把组织教育列为基础条件。指标阅读、异常识别和因果边界若只掌握在少数数据人员手中,业务会把平台输出当成答案;数据团队也可能因缺少经营语境而误读短期变化。培训应以真实失败案例、作废结论和出口决策为核心,让共同语言进入日常评审。

可复制条件是把评审与决策绑定:入口没有清楚预测和护栏便不获得客户流量;出口没有晋级、复现、退役或再设计动作便不算完成。董事会应关注被停止的错误、被复现的结论和节省的机会成本,而非单纯的实验计数。

案例证据:E014、E018 证据属性:公开论文、公司自报、监管材料或裁决,边界见正文。

BOARD RESEARCH 60

10.5 组织记忆的质量用复用结果检验

竹势 AI 营销智库出品

文档数量不能证明记忆有效。更有意义的问题是:新团队能否复现结论,类似失败是否减少,环境变化能否触发失效,重大决策能否追溯到当时证据。记忆只有被调用并产生更好判断时才创造价值。

企业可以抽取少量高价值结论进行季度复核,检查版本、证据、适用边界和当前状态。复核结果包括继续有效、范围收缩、需要复现和退役。这样的审查比建立抽象知识评分更接近经营。

董事会应特别关注“反对意见是否被保存”。结论形成时被否决的风险,可能在规模扩大后出现。保留异议能帮助组织识别早期信号,也减少事后追责把复杂决策简化为个人过错。

BOARD RESEARCH 61

10.6 记忆治理要防止权威化与堆积

竹势 AI 营销智库出品

知识一旦进入企业库,使用者容易把它视为已验证事实。系统应显示证据等级、有效期、责任人和冲突状态,让使用者知道哪些是随机结果、哪些是观察性信号、哪些只是公司自报。摘要不能抹去不确定性,检索排序也不能把高频引用等同于高可信。

堆积同样会降低质量。重复结论、互相冲突的版本和失效政策会增加检索噪声。企业应按季度合并重复、标记冲突、归档旧版并执行退役。删除不会抹去历史,审计存档可以保留;日常检索只暴露当前有效知识。记忆系统需要同时支持工作使用与历史追溯,两者权限和界面可以分开。

BOARD RESEARCH 62

11.1 法律义务构成选择制度的外部边界

竹势 AI 营销智库出品

AI营销同时受数据、广告、算法、内容和行业规则约束。个人信息保护法要求目的明确、最小必要、透明,并对自动化决策和影响评估作出安排;广告法要求真实,广告主承担内容责任;互联网广告规则覆盖可识别性、主体责任和算法推荐等场景;生成式服务与生成内容标识规则增加准确、权益与标识义务。[E031][E032][E033][E035][E036]

这些义务不能被实验结果覆盖。即使某种隐蔽广告、未经授权画像或误导承诺提高转化,候选仍应在进入市场前被拒绝。法律义务可以因规则修订而变化,变化需要正式法律与治理程序,不能作为普通创意变量。

跨境企业还要处理欧盟人工智能法等规则的用途与角色分类。该法强调以人为本、风险分级、透明、记录和高风险义务。[E026] 具体适用需要专业判断,董事会至少要知道同一系统在不同市场可能获得不同暴露资格。

FIGURE 12图12|AI营销的监管边界正在进入可执行义务
时间/类别对象或机制证据/边界
2021-11中国个人信息保护法施行目的、最小必要、自动化决策、影响评估
2022-03中国算法推荐规定施行主体责任、用户权益、算法治理
2023-05中国互联网广告管理办法施行广告可识别性与主体责任
2023-08中国生成式人工智能服务暂行办法施行内容、权益、准确性与投诉责任
2024-07欧盟人工智能法公布风险分级、透明、记录和高风险义务
2025-09中国生成合成内容标识规则及强制标准施行显式/隐式标识与传播链责任

来源:E026、E031、E033、E034、E035、E036、E038 口径:法规节点;2021–2025;中国及欧盟相关规则 限制:法律适用需结合地区、行业、角色和生效阶段,时间轴不构成法律意见。

规则演进显示,自动化营销的治理重点已经覆盖数据目的、算法权益、广告识别、生成内容责任和标识链条。企业若只评测转化效果,仍可能在数据、表达和分发环节违反硬边界。

董事会应要求每个候选明确适用市场和主体角色。跨境企业还要处理规则叠加:一项在技术上可回滚的创意,一旦触发个人信息处理、误导性承诺或高风险用途,法律后果并不会随着版本回滚自动消失。

BOARD RESEARCH 63

11.2 生成内容标识要贯穿生产与分发链

竹势 AI 营销智库出品

中国生成合成内容标识办法及配套强制性国家标准于2025年9月施行,建立显式和隐式标识要求,并涉及生成服务、传播平台和用户责任。[E036][E037][E038] 2025年监管通报进一步表明标识问题已经进入执法。[E039]

AI市场部的候选管道要保留标识元数据,处理转码、剪辑、截图、再发布和多平台适配。若标识在导出或渠道转换中丢失,原始生成端合规无法自动覆盖传播端风险。

标识属于硬边界,不参与“有无标识哪种点击更高”的试验。企业可以优化标识呈现的清晰度与体验,前提是满足规则要求并避免误导。

BOARD RESEARCH 64

11.3 高后果政策需要权威源、人工接管和补救

竹势 AI 营销智库出品

价格、退款、资格、合同期限、健康安全和个人权利等答复会直接影响客户决定。自动系统应从批准政策源获取答案,显示版本与生效时间;无法确认或出现冲突时转人工;重大变更进行历史问题重放和影子运行。

人工接管不能只是按钮。企业要规定触发条件、接管时限、交接上下文和责任层级,确保员工能看到系统已说过什么。若人工在没有上下文时重复询问,客户负担仍然存在。

错误发生后,回滚与补救分开管理。回滚停止未来错误,补救处理已受影响客户。企业需要识别范围、发送更正、恢复权益、删除错误画像并记录完成情况。

锚点案例|Air Canada聊天机器人:企业无法把错误承诺外包给自动系统

2022年11月,Jake Moffatt因祖母去世需要紧急往返温哥华与多伦多。他在Air Canada网站询问丧亲票价,聊天机器人答复称,旅客已经出行后仍可在出票九十天内申请优惠。网站另一个丧亲旅行页面却写明,完成旅行后不能追溯申请。Moffatt依据机器人信息购买两段全价机票并提交退款申请,航空公司随后承认机器人使用了误导性措辞,却拒绝按优惠差额处理。[E062]

争议进入不列颠哥伦比亚省民事解决法庭。Air Canada主张客户可以在其他网页找到正确政策,并试图把聊天机器人视为独立于公司的信息来源。法庭在2024年2月14日裁决中否定该逻辑:机器人属于企业网站的一部分,企业应对网站全部信息负责;客户没有义务猜测同一网站哪个页面更可信。裁决认定公司未尽合理注意义务,最终判付包括损害、利息和费用在内的812.02加元。

这个案例没有大样本,也没有证明某类模型普遍容易出错。它提供了另一种高强度证据:真实客户依赖错误表达作出购买决定,企业承诺与政策页面发生冲突,裁决明确了责任归属。其关键机制是“知识不一致—客户合理依赖—经济损失—企业责任”。正确页面的存在没有抵消机器人答复,事后更新也没有自动消除已经发生的损失。

可复制的治理条件十分具体。涉及价格、退款、资格、时限和合同权利的自动答复,应以受控政策源为准;候选系统先进行历史问题重放和影子运行;高风险回答要求引用政策版本或转人工;发布后监测冲突率、投诉和补救时长;发现错误时要暂停相关意图,保存影响范围并主动处理受影响客户。回滚只恢复未来状态,客户补救另有责任链。

其边界也需要保留。该裁决属于特定法域的小额争议解决机构,不能直接等同于所有国家的判例规则;公开材料没有说明机器人技术细节,问题可能来自知识维护、规则配置或生成机制。董事会仍可据此形成稳健判断:客户可见承诺由企业承担,自动系统没有独立人格,任何“模型自己说的”都不能成为免责理由。高后果政策应保持稳定、可追溯和可人工接管,严禁把真实客户作为政策一致性的试验材料。

案例证据:E062 证据属性:公开论文、公司自报、监管材料或裁决,边界见正文。

BOARD RESEARCH 65

11.4 生物识别与资格判断展示平均准确率的局限

竹势 AI 营销智库出品

受限案例|Rite Aid人脸识别:高后果误报要求退役与补救

FTC在2023年提出的案件材料称,Rite Aid于2012年至2020年在数百家门店部署人脸识别,系统把进店者与关注名单比较。监管机构指控其产生数千次误报,对女性及有色人种造成不成比例影响,并存在测试、监测、员工培训和消费者通知缺陷。[E041]

拟议命令包含五年禁用人脸识别,并要求未来自动生物识别系统进行风险评估、测试、通知、投诉处理和数据删除。[E042] 这说明高后果失败的处置可能是正式退役,而非继续微调阈值。

案件属于监管指控与和解安排,企业并未因和解自动承认全部事实;其技术、数据和门店执行也不同于营销创意。可确认的边界是:误报会落在人身、尊严和机会之上,平均准确率无法抵消群体伤害与现场处置风险。

现场人员的动作属于系统后果的一部分。即使模型只给出提示,员工据此盘问、拒绝或公开指认,伤害已经发生。培训、权限、升级、冲突降级和事件记录必须与模型评测同步,不能把模型准确率与门店行为分开验收。

可复制条件是把受影响人数、误报后果、群体差异、员工行动和申诉补救纳入上线门槛。高后果识别与资格判断应默认收缩探索,供应商宣称需独立验证,发现系统性伤害时应暂停、删除相关数据并处理受影响者,而非用更多客户暴露购买学习。

案例证据:E041、E042、E043 证据属性:公开论文、公司自报、监管材料或裁决,边界见正文。

FTC生物信息政策声明要求企业在部署前后考虑可预见伤害、准确性、偏差、安全和供应商宣称。[E043] 这类场景说明,平均表现良好仍可能对特定群体产生集中伤害。错误的现场处置会把技术误报转化为羞辱、排斥和机会损失。

市场部也可能接触相似逻辑,例如线索资格、欺诈判断、客户价值、销售优先级和门店风险。系统输出若影响谁获得优惠、服务或人工关注,就需要审查群体差异、申诉和人工覆核。把输出称为“推荐”不能自动降低后果。

BOARD RESEARCH 66

11.5 品牌承诺属于企业长期政策

竹势 AI 营销智库出品

品牌承诺常以广告、客服、销售和履约共同表达。AI系统加快表达后,同一承诺可能在更多场景出现,履约责任随之扩大。企业必须确认产品、库存、服务和合同能否支持候选表达。

品牌边界不能只写语气词和禁词。真正重要的是哪些事实可说、证据在哪、承诺由谁兑现、例外怎样解释、错误怎样更正。长期承诺的改变应由经营层批准,并同步渠道与一线团队。

董事会要接受一个约束:某些高转化表达必须放弃。选择制度的价值之一就是让组织能够拒绝短期收益,保护法律责任和长期信任。

BOARD RESEARCH 67

11.6 法律映射要贴近客户旅程

竹势 AI 营销智库出品

法规清单很容易停留在法务文件。更有效的方法是沿客户旅程标记数据取得、画像、内容生成、广告展示、互动、线索转交、自动答复、交易和售后,每一节点说明主体角色、处理目的、对外承诺与适用规则。候选改变任一节点时,系统提示重新审查相关义务。

跨境场景还要关注数据位置、客户所在地、服务提供者角色和内容传播范围。同一素材在国内渠道与欧盟市场可能触发不同透明和风险要求;同一模型由内部使用转为客户可见,也会改变责任。法律映射不替代专业意见,其价值在于让业务在候选阶段看见问题,避免临发布时才发现无法补救的设计。

BOARD RESEARCH 68

12.1 案例不能只回答“谁做过”

竹势 AI 营销智库出品

案例研究在AI营销中容易滑向技术展示:品牌用了某工具、生成多少版本、获得多少曝光。董事会需要更严格的问题:业务冲突是什么,候选改变了什么,证据怎样产生,客户承担什么,结果能否归因,哪些条件允许复制。

本报告把案例按证据强度和客户后果同时审查。随机实验可以提供较强因果证据,公司技术博客适合证明机制,监管裁决与执法材料可以确认责任和伤害,新闻争议主要揭示语境风险。不同证据不能在同一尺度上排名。

成功案例也要保留不可确认部分。公司自报规模、平台使用量和制作效率不能自动证明销售、毛利或品牌长期变化;负面舆论不能自动证明总体客户态度或财务损失。边界越诚实,案例越可用。

FIGURE 13图13|案例组合显示:证据强度与客户后果必须同时审查
时间/类别对象或机制证据/边界
高证据/中后果Netflix随机创意实验;LinkedIn弱关系随机实验可估计特定因果影响,仍需外部性与长期审查
中证据/中后果Bing阶段预览;腾讯TAB机制公司自报流程,适合学习治理方式
高证据/高后果Air Canada裁决;Rite Aid执法责任和伤害证据明确,表明硬边界与补救重要
低至中证据/品牌后果Coca-Cola节日活动;Dear Sydney撤回公开机制或舆论可见,经营增量无法确认

来源:E041、E047、E055、E056、E058、E062、E063、E064 口径:案例位置;2012–2025;本报告案例组合 限制:位置属于本报告分析,不构成统计评分;不同案例不可直接排名。

证据强并不意味着后果轻。LinkedIn弱关系研究拥有大规模随机设计,却触及真实职业流动;Air Canada与Rite Aid案例没有营销增量问题,却清晰展示错误信息和误报给个人带来的损失。董事会需要同时问“我们知道多少”和“客户承担什么”。

公司自报案例适合了解机制,不适合证明普遍收益。品牌舆论案例能揭示语境冲突,却很难把撤回、评论和销售联系成因果链。案例组合因此避免单一成功叙事,保留可复制条件和不可确认部分。

案例|腾讯TAB:本土实验平台公开强调异常识别与下线

腾讯企点公开的TAB帮助材料把实验创建、分流、指标、诊断和异常处理置于同一流程。文档强调实验数量、质量和速度,并提出不合理实验在创建阶段被拦截,存在问题的实验能够较快识别并下线。[E056]

腾讯云相关产品文档还描述分层分流、实验组配置、指标和分析环节,反映中国企业在产品迭代中面临相同的流量冲突与测量一致性问题。[E057] 这类材料能够核验平台声称的机制,却没有披露客户样本、独立审计、实验成功率或业务增量。

案例的管理含义是先统一分流和指标语义。团队若在广告账户、落地页、私域和CRM各自创建对照,很容易出现同一客户接受多项冲突处理,后端结果又无法对应具体候选。平台必须让异常实验真正下线,不能只在看板上标红。

本土企业还要处理多渠道账号、企业通信、客户关系管理系统与广告平台之间的数据延迟。若实验身份不能贯穿线索、商机和成交,前端点击改善无法连接后端价值;若销售在分流后自行挑选线索,随机性也会被破坏。试点应先验证一条端到端数据链,明确缺失、延迟和人工改动,再扩展渠道。

可复制条件包括实验身份、互斥层、主指标、护栏、数据延迟说明、权限审批和停止动作。对于董事会,产品文档属于机制证据,适合评估治理设计;采购决策仍需用试点数据、服务责任和退出条件验证,不能用厂商页面替代本企业结果。

案例证据:E056、E057 证据属性:公开论文、公司自报、监管材料或裁决,边界见正文。

受限案例|Coca-Cola 2024节日活动:版本规模可核验,经营增量未披露

Coca-Cola在2024年12月发布材料介绍节日活动,称三家制作伙伴参与影片制作,内容覆盖四十五种以上语言,并结合人工创意与生成式技术开展本地化和互动体验。[E063]

公开信息足以证明活动采用多伙伴、多语言、多版本的生产机制,也说明品牌仍保留人工创意监督。材料没有公开随机对照、销售增量、品牌记忆变化、投诉率或长期效果,因此“制作规模”不能被改写为“市场成效”。

生成工具能够降低版本试制成本,却会增加风格漂移、权利、标识和文化语境风险。若每个市场只追求快速上线,局部反馈可能把品牌长期资产切碎。版本多还会提高审核和撤回成本。

多语言生产还增加版本一致性问题。翻译、配音、图像、产品包装和生成内容标识在各市场可能产生不同含义;一个地区的幽默、节庆符号或家庭角色,换到另一个地区可能触发相反解释。企业需要地区责任人、版权与文化审查以及可执行撤回能力,不能用中央模板自动覆盖当地判断。

可复制条件是先锁定品牌不可变线索、权利来源和地区禁区,再对相对低后果的构图、节奏和语言版本做受控比较。董事会应把本案例视为生产机制证据,并要求后续用独立结果验证,避免把公司新闻稿当成因果结论。

案例证据:E063 证据属性:公开论文、公司自报、监管材料或裁决,边界见正文。

受限案例|“Dear Sydney”撤回:高曝光创意仍可能触碰关系意义

2024年巴黎奥运传播期间,Google投放“Dear Sydney”广告:一位父亲借助生成系统替女儿起草给偶像的信。媒体报道显示,广告因被批评削弱儿童亲自表达和亲子参与的意义而撤回;公司回应称本意是展示系统提供起步想法,仍强调人的表达。[E064]

公开报道能确认创意内容、争议焦点、撤回与公司回应,却没有披露曝光分母、态度样本、销售或品牌净影响。网络批评容易被活跃人群和媒体选题放大,撤回也可能出于多重考虑,因果链无法完整识别。

案例揭示品牌护栏需要覆盖关系语境。某项工具展示若让客户感到企业在替代关爱、劳动或真实表达,即使记忆度很高,也可能与品牌承诺冲突。单纯测试观看完成率会漏掉这一层。

撤回决定本身也应留下组织记忆:争议最早出现在哪里,哪些评论指向目标人群,内部评审漏掉了何种关系含义,后续怎样修改创意任务书、审核问题和媒体安排。若事件只留下“网友不喜欢AI”的粗略标签,下一次团队仍会重复相同误判。

可复制条件包括在上线前进行语境审查,邀请目标人群解释作品传达的角色关系,并设置争议升级和撤回门槛。低样本质性异议不能直接估计总体效应,却能发现主指标尚未命名的风险。

案例证据:E064 证据属性:公开论文、公司自报、监管材料或裁决,边界见正文。

BOARD RESEARCH 69

12.2 三类可复制机制

竹势 AI 营销智库出品

第一类是探索机制。Netflix保留随机样本,Bing使用限额和预览,说明学习需要保留未知候选与暴露上限。复制时应调整样本、风险和周期,不能复制平台规模。

第二类是可信测量机制。LinkedIn与Microsoft实验平台强调统一分流、指标、诊断、入口和出口评审。中型企业可以采用轻量实现,核心语义不能缺失。

第三类是责任与补救机制。Air Canada裁决和Rite Aid执法提醒企业,自动系统输出仍由企业负责;高后果失败可能要求禁用、删除、通知和补救。复制的重点是权威源、人工接管、回滚完整性和客户恢复。

BOARD RESEARCH 70

12.3 三类不可复制的表面

竹势 AI 营销智库出品

第一是实验数量。不同平台对实验、并发和评估的定义不同,计算规模没有直接经营含义。第二是单项正向指标。点击、拇指反馈、用户规模和曝光均受分母与选择机制影响。第三是品牌声量。争议和撤回能发现风险,却无法直接量化长期价值。

企业还应警惕“行业相似即机制相同”。同为消费品牌,渠道、购买频次、风险、履约和品牌关系差异很大;同为B2B,合同周期、线索价值和销售介入不同。复制需要确认客户任务和因果链。

案例的最佳用途是生成制度问题,而非提供现成答案。团队可以据此检查是否保留探索样本、是否设暴露上限、是否有独立结果、是否准备补救。答案仍须由本企业证据产生。

BOARD RESEARCH 71

12.4 失败案例应进入投资判断

竹势 AI 营销智库出品

失败会揭示隐性成本:品牌撤回、客户补偿、监管处置、员工调查、数据删除和系统退役。项目商业论证若只计算模型和媒体成本,会系统性低估自动执行风险。

投资评审应包含最坏合理情境和补救成本。低后果内容可以设较小准备金;涉及价格、客户权利或敏感数据,需要更明确的通知、退款、法律和人工接管资源。探索预算只有覆盖补救,才算真正封顶。

失败案例也能改善供应商管理。合同应要求性能依据、变更通知、日志、数据处置、事故合作和退出。供应商提供模型,企业仍持有客户关系和最终责任。

BOARD RESEARCH 72

12.5 案例组合支持的总判断

竹势 AI 营销智库出品

综合十个案例,可以确认三点。其一,受控实验和阶段放量能够提高特定决策的证据质量;其二,公司公开机制不等于独立商业成效;其三,客户后果越高,企业越需要稳定政策、责任人和补救,探索空间越小。

没有任何案例支持“系统收集反馈后会自然变好”。每个有效机制都包含人为定义目标、版本、随机或受控比较、限额、诊断和决策;每个严重失败都与责任、知识一致性、测试、监测或现场处置缺口有关。

达尔文隐喻在这里得到严格收束:企业可以让候选竞争,不能让法律与客户权益竞争;可以提高学习速度,不能把伤害成本外包给客户;可以保留赢家,也必须退役失败和过时知识。

BOARD RESEARCH 73

12.6 案例库要记录淘汰理由与迁移条件

竹势 AI 营销智库出品

企业内部案例库应保存业务情境、候选差异、证据、结果、限制和迁移条件。只收录成功会鼓励过度自信,只收录事故会抑制合理探索。正向、无效、负向、数据作废和规则禁止都需要代表性案例,让团队学习不同处置。

案例迁移时,评审者应逐项检查客户任务、风险、样本、渠道、履约和组织能力。任何关键条件不同,都降低直接复用资格。外部案例尤其需要标记证据属性:公司自报、同行评审、监管指控、裁决或新闻。证据类型一目了然,案例才不会在演示中被不断夸大。

BOARD RESEARCH 74

13.1 董事会需要一张决策账,而非技术仪表盘

竹势 AI 营销智库出品

董事会审议AI市场部时,最容易看到模型数量、调用量、内容产量和自动化率。这些指标描述投入与活动,无法说明选择质量。更有用的决策账包含重大候选、客户后果、暴露额度、证据等级、处置动作、补救和复用结论。

决策账不需要覆盖每条内容。企业可以按风险和预算设重大性门槛:影响价格、权利、敏感数据、公开品牌承诺、较大媒体支出或大量客户的候选进入董事会或专门委员会视野;低风险事项由授权团队管理。

每项重大候选都应能回答:改变了什么,为什么现在,最坏合理后果,证据等级,谁能停止,回滚多久,客户如何补救。回答不清时,预算和权限不应扩大。

BOARD RESEARCH 75

13.2 三类经营指标需要案例解释

竹势 AI 营销智库出品

客户后果可以观察投诉、误导、退订、退款、群体差异、服务负担和申诉;预算风险包括媒体、优惠、人工审核、补救和机会成本;学习速度包括证据周期、数据作废、复现、退役和复用。任何指标都可能被考核化,因此董事会需结合具体案例审议。

例如,退役数量增加可能说明选择纪律变强,也可能说明候选质量下降;实验周期缩短可能源于平台改进,也可能因降低长期观察;投诉下降可能源于体验改善,也可能因入口变难。指标必须附带生成机制。

季度审议可选择三至五项重大决策,回看事前预测、实际结果和客户后果,验证制度是否真的改变行为。深度样本比一张综合分更能发现治理问题。

BOARD RESEARCH 76

13.3 专家角色必须保留原始语境

竹势 AI 营销智库出品

本报告采用十一位具名学者与实践者的思想。Darwin解释种群差异与选择;Deming讨论预测和系统学习;March研究探索与利用;Argyris研究组织防御与双环学习;Goodhart讨论货币控制指标;Fisher奠定随机化实验设计;Rubin形式化潜在结果;Pearl强调数据生成结构;Kohavi研究在线受控实验;Edmondson研究团队心理安全;NIST的Elham Tabassi等风险框架实践者推动情境化治理。

这些观点提供不同问题的工具,没有任何一位专家可以替企业决定客户价值或法律责任。Darwin无法授权商业试验,March无法给出固定探索比例,Goodhart不能证明所有指标已失效,随机实验无法回答未测量的伦理问题,心理安全也不能替代事实核验。

董事会使用专家观点时,要保留原始语境、必要修正和适用边界。脱离语境的名言容易变成装饰,甚至为既定决策背书。

BOARD RESEARCH 77

13.4 责任结构应横跨市场、销售、客服、数据和法务

竹势 AI 营销智库出品

AI市场结果跨越多部门。市场定义候选和媒体,销售处理线索,客服解释政策,运营履约,数据维护测量,法务判断义务,技术管理系统。任何单一部门都无法对完整客户后果负责。

责任结构应明确业务所有者、证据负责人、风险批准者、执行者和客户补救负责人。重大候选至少需要业务与风险双重批准;数据负责人可以宣布结论作废;一线团队可以触发暂停;董事会批准高风险接受与制度例外。

“人类在环”只有在人具备信息、时间、权力和责任时才成立。让员工在数秒内点击批准、看不到来源和后果,属于形式审核。审批负荷超过人员能力时,应收缩候选和自动化范围。

BOARD RESEARCH 78

13.5 供应商和模型变化不能绕过治理

竹势 AI 营销智库出品

基础模型、接口、内容平台和数据供应商会更新,输出、成本、延迟和政策随之变化。企业需要把重要依赖纳入候选血统,设变更通知、回归评测、降级和退出方案。供应商更新不能自动继承旧批准。

合同与采购评审应覆盖性能依据、用途限制、数据处理、日志、事故合作、服务连续性和删除。公司技术博客与产品文档可以证明公开机制,采购仍需本企业试点和责任条款。

关键场景应保留替代路径。模型不可用、内容平台拒绝、数据源中断或合规状态变化时,业务可以降级到人工或稳定规则。韧性是选择制度的一部分。

BOARD RESEARCH 79

13.6 董事会季度审议的十个问题

竹势 AI 营销智库出品

季度审议可以围绕十问展开:本季度哪些客户后果最严重;哪些候选因硬边界被拒绝;哪些结论因数据问题作废;最大探索暴露是多少;回滚和补救用了多久;主指标赢家是否伤害护栏;哪些结果被复现;哪些旧知识被判定失效;哪些能力被正式退役;下一季度哪一项高价值不确定性最值得购买证据。

这些问题避免制造通用成熟度分数。每家企业的产品、客户、法规、样本和风险不同,统一分值会产生虚假可比性。董事会需要的是可追溯决定和真实后果。

审议结果应改变预算和授权。证据制度稳定、回滚可靠、客户后果受控的低风险场景可以扩大;数据失效、补救迟缓或边界冲突的场景应收缩。治理只有能改变资源配置时才有力量。

BOARD RESEARCH 80

13.7 五个治理红旗值得董事会直接追问

竹势 AI 营销智库出品

第一,系统只报告赢家,没有数据作废和退役。第二,所有场景使用同一准确率、转化率或风险阈值。第三,供应商更新自动进入生产,无回归评测。第四,人工审批量很大,却没有驳回、暂停或补救记录。第五,平台归因增长与财务、投诉和履约结果长期不一致。任何一个红旗都提示选择环境可能失真。

董事会追问时应避免把问题转成对技术团队的单点问责。多数红旗来自目标、预算、资源和跨部门责任。治理改进可能要求减少候选、延长周期、补充一线人员、重建权威源或放弃某项自动化。真正的高层支持体现在愿意为可靠证据承担速度成本,也愿意为客户后果放弃短期收益。

BOARD RESEARCH 81

14.1 第1—30天:建立边界、基线和责任

竹势 AI 营销智库出品

首月目标是形成最小选择宪法。企业选定一条真实营销链路,梳理客户任务、候选对象、硬边界、风险档位、权威事实源、决策权和补救责任。场景应具有业务价值、可观察结果和较低不可逆风险。

同时建立基线:现有人工或系统流程的质量、周期、成本、投诉、退款、线索质量和履约结果。没有基线,后续变化只能与主观印象比较。基线需要明确分母、时间和缺失数据。

首月还要完成回滚设计与数据责任。企业应知道怎样停止自动执行、恢复稳定状态、识别受影响客户和纠正错误。无法定义补救的场景不进入真实客户试点。

BOARD RESEARCH 82

14.2 第31—60天:运行离线、影子和有限暴露

竹势 AI 营销智库出品

第二个月选择一至两个低后果候选。先运行事实、品牌、格式、敏感内容和历史问题重放,再进行对抗测试。通过后进入影子运行,比较系统建议与人工结果,记录错误类型、人工修改、延迟和政策冲突。

有限暴露必须有用户、时间、预算、权限和损失上限。事前写出主指标、护栏、最小有意义差异、停止条件和评审时间。样本不足时,目标是发现严重问题和验证测量,不能宣称小效应胜出。

期间至少演练一次暂停和回滚,检查渠道、知识库、定时任务、销售和客服是否同步。演练发现的缺口在扩大前修复。

BOARD RESEARCH 83

14.3 第61—90天:复现、退役与制度化

竹势 AI 营销智库出品

第三个月要求结论接受复现或替代验证。正向候选在相近条件下再次运行,检查效应方向、护栏和成本;负面候选完成正式退役,清理入口、缓存、权限和文档;数据失败案例记录作废原因并修复测量。

至少形成一条带适用边界的组织记忆,以及一条被验证失效或负面的知识。只有正向结论而没有退役,往往代表选择偏差。企业还应完成季度审议样本,向董事会展示事前预测、证据、决定和客户后果。

九十天结束时,自动化范围可以很小,选择纪律必须真实运行。制度能拒绝候选、停止暴露、作废结论和补救客户,比覆盖更多渠道更重要。

FIGURE 14图14|90天内应先建立选择纪律,再扩大自动执行
时间/类别对象或机制证据/边界
第1–30天:立宪与基线明确硬边界、候选范围、风险分档、基线指标、数据责任通过条件:能说清客户后果与回滚
第31–60天:受控试点运行离线评测、影子流程和1–2个低后果有限暴露通过条件:数据可信、护栏可触发、补救可执行
第61–90天:复现与制度化复现实验、评估长期信号、形成晋级/退役和季度审议通过条件:至少一个结论可复用,一个失败被正式退役

来源:E002、E015、E017、E019、E022 口径:阶段门;90天;企业AI市场部治理试点 限制:阶段长度可按业务周期调整;高监管场景可能停留在影子运行。

90天计划的产出应是选择制度的最小可运行版本,而非一套覆盖所有营销环节的自动化系统。第一个月解决目标和边界,第二个月验证测量与回滚,第三个月要求复现和退役。每一阶段都可以拒绝进入下一阶段。

董事会验收要看真实决策:是否有候选因护栏越界而停;是否有结论因数据不可信而作废;是否有失败被退役;是否有客户补救得到执行。若九十天只增加了内容数量和模型调用,组织仍停留在工具扩张。

BOARD RESEARCH 84

14.4 阶段门的通过与拒绝条件

竹势 AI 营销智库出品

第一个阶段门要求边界可执行、责任明确、基线可用、回滚可设计;缺一便继续准备。第二个阶段门要求数据可信、护栏可触发、补救可执行;任何重大缺陷都暂停扩张。第三个阶段门要求至少一项结论可复现、一项失败完成退役、董事会能够追溯决定。

拒绝进入下一阶段属于正常结果。高监管场景可能长期停留在影子运行,样本较小的企业可能用较长周期和更大效应门槛,线下业务可能采用门店或地区单元。阶段门服务风险与证据,不服务日历表。

企业不应承诺九十天产生固定收入增量。可承诺的是建立可验证的决策能力:知道何处可以探索,知道证据强度,知道何时停止,知道怎样把结果留下。

BOARD RESEARCH 85

14.5 董事会可执行优先级

竹势 AI 营销智库出品

第一优先级:批准选择宪法和硬边界,明确高后果场景的禁止项。第二优先级:挑选一条价值清晰、可逆、样本可用的链路。第三优先级:先建设权威事实源、分流、护栏、日志和回滚,再扩大生成。第四优先级:将客户补救预算纳入项目商业论证。第五优先级:以复现、退役和决策价值审议学习速度。

未来扩展应沿已验证机制进行。新增渠道、新模型、新数据源或自动权限都视为新候选,重新进入适当证据层级。过去批准不能无限继承,环境和依赖变化会让旧结论失效。

会进化的AI市场部最终呈现为一种经营秩序:变化有边界,比较有证据,暴露有预算,决定有权责,失败有退役,客户有补救,经验有期限。董事会管理这一秩序,模型和工具才有机会成为可靠生产力。

BOARD RESEARCH 86

14.6 九十天之后按机制扩张,不按渠道铺开

竹势 AI 营销智库出品

试点通过后,扩张顺序应围绕已验证机制。若企业已经证明某类低后果内容的版本、分流、护栏和回滚可靠,可以扩展到相近产品或地区;若新增场景涉及价格、敏感数据或自动决策,即使渠道相同,也应重新分级。渠道数量不能替代机制相似性。

下一阶段预算优先补足试点暴露的瓶颈:数据延迟高就改测量,人工接管慢就补服务,知识冲突多就治理权威源,复现困难就减少并发变化。只有当这些基础改善后,更多自动权限才具有净价值。年度计划可以设少数重大不确定性,每项配套证据和退出条件,形成稳定的经营学习节奏。

BOARD RESEARCH 87

公开来源索引

竹势 AI 营销智库出品

以下条目仅列作者/机构、题名、载体与日期;公司技术博客和产品材料均按自报证据使用。

[E001] Charles Darwin:《On the Origin of Species, 1st ed.》,1859-11-24。

[E002] W. Edwards Deming Institute:《PDSA Cycle》,网页持续更新。

[E003] W. Edwards Deming Institute:《Theory of Knowledge》,网页持续更新。

[E004] W. Edwards Deming Institute:《The History and Evolution of the PDSA Cycle》,网页持续更新。

[E005] James G. March:《Exploration and Exploitation in Organizational Learning》,1991。

[E006] Chris Argyris:《Double Loop Learning in Organizations》,1977-09。

[E007] Charles Goodhart:《Problems of Monetary Management: The U.K. Experience》,1975。

[E008] Donald T. Campbell:《Assessing the Impact of Planned Social Change》,1979。

[E009] R. A. Fisher:《The Design of Experiments》,1935。

[E010] Donald B. Rubin:《Estimating Causal Effects of Treatments in Randomized and Nonrandomized Studies》,1972。

BOARD RESEARCH 88

来源索引(2)

竹势 AI 营销智库出品

[E011] Judea Pearl:《Causal Inference》,2010。

[E012] Amy C. Edmondson:《Psychological Safety and Learning Behavior in Work Teams》,1999。

[E013] Ron Kohavi et al.:《Controlled Experiments on the Web: Survey and Practical Guide》,2009。

[E014] Pavel Dmitriev et al.:《The Anatomy of a Large-Scale Experimentation Platform》,2013。

[E015] Microsoft Experimentation Platform team:《Patterns of Trustworthy Experimentation: Pre-experiment Stage》,2023。

[E016] Microsoft Experimentation Platform team:《Patterns of Trustworthy Experimentation: During-experiment Stage》,2023。

[E017] Microsoft Experimentation Platform team:《Patterns of Trustworthy Experimentation: Post-experiment Stage》,2023。

[E018] Aleksander Fabijan et al.:《The A/B Testing Flywheel》,2021。

[E019] NIST:《Artificial Intelligence Risk Management Framework 1.0》,2023-01。

[E020] NIST:《Artificial Intelligence Risk Management Framework: Generative AI Profile》,2024-07。

BOARD RESEARCH 89

来源索引(3)

竹势 AI 营销智库出品

[E021] NIST:《AI RMF Playbook》,持续更新。

[E022] NIST:《AI RMF Core》,持续更新。

[E023] ISO:《ISO/IEC 42001:2023 — Artificial intelligence management system》,2023-12。

[E024] ISO:《ISO/IEC 23894:2023 — Guidance on risk management》,2023-02。

[E025] OECD:《OECD AI Principles》,2019;2024更新。

[E026] European Union:《Regulation (EU) 2024/1689 (Artificial Intelligence Act)》,2024-07-12。

[E027] UK Information Commissioner’s Office:《Accountability and governance implications of AI》,2023-03-15。

[E028] UK Information Commissioner’s Office:《Accuracy and statistical accuracy in AI》,2023-03-15。

[E029] UK Information Commissioner’s Office:《How do we ensure fairness in AI?》,2023-03-15。

[E030] UK Information Commissioner’s Office:《Security and data minimisation in AI》,2023-03-15。

BOARD RESEARCH 90

来源索引(4)

竹势 AI 营销智库出品

[E031] 全国人大常委会:《中华人民共和国个人信息保护法》,2021-08-20。

[E032] 全国人大常委会:《中华人民共和国广告法(2021年修正)》,2021-04-29现行版本。

[E033] 国家市场监督管理总局:《互联网广告管理办法》,2023-03-31。

[E034] 国家互联网信息办公室等:《互联网信息服务算法推荐管理规定》,2022-01-04。

[E035] 国家互联网信息办公室等:《生成式人工智能服务管理暂行办法》,2023-07-13。

[E036] 国家互联网信息办公室等:《人工智能生成合成内容标识办法》,2025-03-14。

[E037] 国家互联网信息办公室:《人工智能生成合成内容标识办法答记者问》,2025-03-14。

[E038] 国家市场监督管理总局、国家标准化管理委员会:《GB 45438—2025 网络安全技术 人工智能生成合成内容标识方法》,2025-02-28。

[E039] 国家互联网信息办公室:《网信部门依法集中查处一批生成合成内容标识违法违规应用》,2025-11-25。

[E040] U.S. Federal Trade Commission:《Keep Your AI Claims in Check》,2023-02-27。

BOARD RESEARCH 91

来源索引(5)

竹势 AI 营销智库出品

[E041] U.S. Federal Trade Commission:《Rite Aid Banned From Using AI Facial Recognition》,2023-12-19。

[E042] U.S. Federal Trade Commission:《Rite Aid Corporation, FTC v. — Case page》,2024-03-08更新。

[E043] U.S. Federal Trade Commission:《Policy Statement on Biometric Information and Section 5》,2023-05-18。

[E044] U.S. Federal Trade Commission:《Hey, Alexa! What Are You Doing With My Data?》,2023-06-13。

[E045] Netflix Technology Blog:《What is an A/B Test?》,2022-04-18。

[E046] Netflix Technology Blog:《Selecting the Best Artwork for Videos Through A/B Testing》,2016-05-03。

[E047] Netflix Technology Blog:《Artwork Personalization at Netflix》,2017-12-07。

[E048] Netflix Technology Blog:《It’s All A/Bout Testing: The Netflix Experimentation Platform》,2020-09-23。

[E049] Netflix Technology Blog:《Reimagining Experimentation Analysis at Netflix》,2022-06-28。

[E050] Netflix Technology Blog:《Causal Machine Learning for Creative Insights》,2024-03-25。

BOARD RESEARCH 92

来源索引(6)

竹势 AI 营销智库出品

[E051] Deepak Agarwal et al.:《Challenges in A/B Testing Social Network Features》,2014。

[E052] LinkedIn Engineering:《Our Evolution toward T-REX: The Prehistory of Experimentation at LinkedIn》,2020-10-15。

[E053] LinkedIn Engineering:《T-REX Experimentation Platform》,网页持续更新。

[E054] LinkedIn Engineering:《Making the LinkedIn Experimentation Engine 20x Faster》,2023-05-17。

[E055] Rajkumar et al.:《A Causal Test of the Strength of Weak Ties》,2022-09-16。

[E056] 腾讯企点:《腾讯AB实验平台TAB帮助中心》,网页持续更新。

[E057] 腾讯云:《AB实验平台产品文档》,2024-06-11更新。

[E058] Microsoft:《New Bing Preview on Mobile and Skype》,2023-02-22。

[E059] Bing Team:《Bing Preview Release Notes: Increasing Chat Turns》,2023-03-09。

[E060] Bing Team:《Bing Preview Release Notes: Image & Video Search》,2023-03-31。

BOARD RESEARCH 93

来源索引(7)

竹势 AI 营销智库出品

[E061] Microsoft:《Announcing the Next Wave of AI Innovation with Bing and Edge》,2023-05-04。

[E062] British Columbia Civil Resolution Tribunal:《Moffatt v. Air Canada, 2024 BCCRT 149》,2024-02-14。

[E063] The Coca-Cola Company:《Groundbreaking Digital Experience and Films Fuse Holiday Heritage With Cutting-Edge Tech》,2024-12-10。

[E064] The Verge:《Google Pulls Gemini AI Ad From Olympics After Backlash》,2024-08-02。

shichangbu.ai