从两名工作人员肩后看向显示器;坐着的工作人员拿着陶杯,同事在身侧查看订单与辅助建议,桌上有打开的退货包裹。

· 3

要我看,中国赢:AI 的本事,要在使用中长出来

收听本文

找客服的时候,人通常顾不上关心对方用了哪个大模型。东西没收到,退款没着落,能不能先弄明白我在说什么?

2024 年初,淘宝做过一场为期四周的随机实验:近六千名入职不足一年的客服,一部分获得 AI 助手。助手在对话开场提供问题诊断和处理建议,客服可以采用、修改,也可以不用。研究估计,提供工具使识别问题的时间平均减少 8.2%,整段聊天时间减少 1.1%。

听起来不够惊天动地。没有谁的工作一夜之间被消灭,也没有生产率翻十倍。可它发生在真正有人等着处理问题的地方。

上一轮我们看电怎样送进机房,又看技术怎样改变能源这道题。算力交付之后,事情还没完:它究竟用来做什么,用过一遍之后,又留下了什么?

这一回,我站在中国一边。我押的具体事情是:从现在到 2030 年,中国能把已有的数字业务变成不断改进 AI 的场所,在应用这一端积累自己的服务能力和收益。模型的榜首即使换来换去,这些做事的本钱也不会自动跟着搬走。

这篇说的赢,先落在应用这一端:企业留下值得继续经营的收益,使用者真正办成事。要让这张票成立,已有的本事得进入更多业务,收益也经得住后续开销。中国有很大的数字商业,这份家底能变成多少本事,要往里面看。

小本事,要放回大生意里看

按照国家统计局的数据,2025 年中国实物商品网上零售额约为 13.09 万亿元,占社会消费品零售总额的 26.1%。

这当然不是 AI 创造的产值,更不能拿它乘上刚才的实验增幅,得出一个壮观的“中国 AI 红利”。它说明的是,模型到来之前,这里已经有很大的生意,有订单、商家、顾客,也有必须天天处理的麻烦。

一场售后服务,既要听懂人的话,又要核对订单,理解规则,找到可行的处理办法。把一个通用模型放在旁边,它未必知道这笔订单出了什么问题;把相关资料、工具和流程接进去,才有机会让它少说空话,多办一点事。数据能否取得、有没有权使用,仍要具体解决,不能因为用户多就视作企业的随手之物。

这些连接做起来并不潇洒。退款条件变了要更新,建议出错了得追查,模型很有把握地答错,还得有人兜住。但它们会影响一项服务到底可不可用。模型的本领相近,接上不同的业务,交到人手里的结果也可能不同。

所以,我愿意认真看待淘宝实验中的那点改善。少花一点时间识别问题,若能在大量重复任务里可靠地保留下来,就可能有实际分量。至于这点节约最终剩下多少,要连同新增复核一起算。

中国的机会正在这些已经存在的生意里。要找下一次应用,不必每回都从一个尚不存在的需求开始。不过,客户多,最多意味着有更多事情可以做;会不会越做越好,还隔着另一道工夫。

用过以后,什么留下来了

“AI 用得越多,就越聪明”,这句话说得太省事。

一次对话结束,记录存进硬盘,并不会自动使模型长出新的本事。要改进,得先知道哪里出了错,错在信息、规则还是回答方式,再决定怎样处理。否则,积累的也可能只是一大堆旧毛病。

美团在 WOWService 技术报告中披露了一套具体做法:收集服务中的错误案例,经筛选、标注,形成训练材料,再训练模型;之后用人工和自动测试检查新版,最后上线,进入下一轮。这是企业披露的工程流程,还不是多年收益的独立审计,却让“反馈”这个词有了实际动作。

报告里有一个很眼熟的毛病:用户已经提供了信息,模型却反复询问。在企业列出的这类错误样本测试中,新一轮训练前后,修复比例从约 74% 提高到约 79%。这是特定错误样本的结果,不是线上所有对话的解决率,也未解决全部问题;但它至少让我们看到,改进可以落在“别再问一遍刚刚说过的事”这样的地方。

这里长本事的,也不只是一颗抽象的“大脑”。人可以学会处理问题,流程可以少绕弯,领域模型也可以经过再训练而改进。淘宝的短期实验和美团的迭代报告,展示的是不同部分,不能把它们拼成一个模型多年不断成长的故事。

然而,这两部分连在一起,确实让中国一侧有了具体的立足点:已有业务可供使用,已有办法检查局部结果,也有企业把错误带回下一次训练。它们不保证成功,却说明这条路已经有人在走。

站在这个位置看,AI 竞争就不只有“谁先做出了更厉害的模型”。还包括谁能把模型带进实际工作,让用过之后留下的经验,成为下一次做事的本钱。

纸张与工作记录插画旁纵向排列找出问题、整理案例、选择改法、检验改动四步;强调检验通过再上线,使用本身不会自动更新模型。
记录下来只是起点;经过核实、修改与检验,才可能留下下一次做事的本钱。(应用改进的简化示意,非企业流程复原)

我押的是应用这一端

当然,美国企业也懂这个道理。

在一项面向美国客户的跨国客服研究中,研究者发现 AI 助手能够提高每小时解决问题的数量,并有帮助员工学习的迹象。客服多数位于菲律宾。发明、使用与收益的归属,本来就不整整齐齐地待在一面国旗下面。

所以,我不能把应用和反馈登记为中国的专利。美国也能走这条路,现有几个案例没有测出谁铺开得更快。我的下注,还在于对另一件事的判断:已有业务中的经验和改进,会使一部分 AI 价值留在经营这些服务的人手里,而不会全随通用模型的名次重新分配。

中国让我愿意下这张票,是因为要办的事、实际服务和调整系统的人,已经在本土业务里接上了。淘宝已经做过接入后的现场实验,美团已有把服务错误带回模型的工程流程。它们面对的是自己的订单、规则和使用者,业务可以不断提出下一批需要解决的问题,做完之后又有结果可查。通用模型即使从别处取得,这部分工作仍要贴着实际业务来做;中国已经有企业在积累它。

更何况,模型的来源并不能包办收益的去向。企业即使购买外部模型,也可能通过改进业务留下收益;供应商收取的费用、服务中保留的经验、用户省下的时间,要分别看。反过来,用了国产模型,也不能把每一笔支出都算成自家人的共同胜利。钱付给谁,麻烦落到谁头上,仍须一项一项算。

我押中国能沿着这些本土业务继续积累,让应用这一端长出自己的本事。美国也会这样做;如果它在可比较任务中更早、更稳定地兑现了收益,中国的相对胜出理由当然会减弱。那要继续比,不能拿一句“我们人多”搪塞。

中国这条路的分量,不靠把美国写成一个只会做模型、不会用模型的国家来维持。

先别急着替顾客结案

回到开头的淘宝实验,还有一项结果值得放慢一点看:顾客评分有所改善,但同一问题三天内重访的比例,没有显著变化。

体验变好,自有价值。能更顺畅地说清一件事,少受一点气,并不是假的收获。但评分好看了,并不等于原来的问题一定解决得更彻底。重访也只是一个观察窗口,不能单靠它给整个服务判生死。

这便把我们带到另一个问题:谁来决定,这件事已经办好了?

如果顾客认为问题还在,系统却已经把工单标成“已解决”,那么下一轮反馈究竟以哪一个为准?除了满意度,还核验什么?人能否对那个结案判断提出异议,还是只剩下重新排队、再说一遍?这些是我想追问的设计选择,并不是上述实验已经揭露了某种操纵。

俯视桌面,包装纸里的陶杯断柄放在杯旁;正面朝上的手机显示售后服务、杯柄破损、已结案及查看处理记录等内容,一只手停在手机旁。
系统已经结案,人的问题是否也办好了?(概念插画,非文中实验场景)

AI 越会理解人,这个问题越躲不过去。理解可以用来减少误会,也可以用来安排话术、控制节奏,让人更容易接受一个既定结果。后一种能力,对使用它的组织未必没有价值;只是它与人的问题真正得到解决,并非总是一回事。

若有一天,一个系统越来越擅长让人不再争辩,而我们就把它叫作“更智能”,我恐怕高兴不起来。我承认这可能是一门本事,却不愿替被管理的人一同庆功。

政治信息的限制,也是中国这一侧必须面对的负面。Pan、Xu 的研究对 2023 年、2025 年相应模型的测试发现,在特定政治题目上,中国来源模型更常拒答,也出现关键事实遗漏或不准确。它记录的是历史版本、特定题集的表现,不能直接推成中国 AI 在所有任务上的能力判断;但凡用户的工作需要这些事实,信息缺损就会妨碍使用,不能装作没有这回事。

这没有抹去前面那些业务改进,却限制了“多用就会补齐一切”的想象。如果某些事实始终不能进入答案,增加对话次数并不会自动替用户把它找回来。研究没有直接测量长期训练因此损失了多少能力,这一层不能冒充已有结论。美国一侧能从这里提出多强的反驳,下一篇再展开;此刻替中国下注,也得把这项代价留在账上。

这门本事,得一直验下去

到 2030 年,我希望用持续的任务结果来验这一票:中国企业是否把眼前的应用本事带进了更多业务,使用者是否因此少走弯路,经营者是否也留下了继续改进的收益。这便是本篇替中国争的一种赢法。

不过,使用次数不是验收单。若后续只剩下更多访问、更长对话和更漂亮的演示,任务并没有变好;若新增复核和维护吞掉了收益;若使用者所需要的事实始终被排除,这些都不能靠“规模大”三个字交差。

我希望看到的,是同样的麻烦再来一次时,人真的少绕一点弯,系统真的少犯一次错。至于这份本事究竟长在模型里、流程里,还是使用它的人身上,可以继续分辨;只盯着模型榜单,容易漏掉这一整片正在发生的工作。

等顾客下一次打开那个窗口,我们最好还记得问一句:上回的事,究竟办好了没有?

X

类似文章

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注