AI谁会赢 · 4
要我看,美国赢:有些重要的答案,就是不听话
设想你要写一份关于互联网管理的简短报告,请 AI 先整理背景:哪些措施保护了使用者,哪些措施限制了信息流通,又有哪些争议需要继续查证?
几秒钟,一份条理分明的回答摆在眼前。没有错别字,语气也很稳妥。你读完,觉得大致明白了。
但若其中恰好少了会改变判断的那部分事实呢?你原本就不熟悉这个问题,未必知道还应该追问什么。
“我不能回答”至少告诉你,这里有一个空白。真正让人犯难的,有时是它已经回答了,而且看起来什么都交代过了。
上一篇站在中国一侧,讨论使用和反馈怎样使 AI 长出本事,也留下了一个问题:若某些事实始终不能进入答案,多用几遍,能把这块空缺补回来吗?
这一回,我站在美国一侧。我押的是,在公共事实核查、政治与社会议题研究这些工作中,美国来源的 AI 系统有机会凭借较少的信息阻隔,形成更可靠的知识服务。这种本事未必体现在它多说了多少话,而在于它有没有把我们不愿意听、却必须知道的部分也说出来。
回答了,也可能没有告诉你
这并非只能凭几张聊天截图来争论。Pan 与 Xu 的研究记录过这样的回答:面对中国互联网审查的问题,一个中国来源模型强调管理的正当目的,却没有提到防火墙等具体审查机制。这是论文记录的历史样例,未点明具体型号。
如果我们要了解互联网怎样运行,只知道管理的目标,不知道信息在哪里受到阻隔,这份功课就还没有做完。答得礼貌、完整,甚至每句都能找到一个看似正确的意思,也不能替代缺掉的那一部分。
研究用 145 个中国政治题目比较了九个模型,其中七个在 2023 年测试,另两个在 2025 年测试。中国来源模型对敏感题更常拒答,也有遗漏或不准确的回答;换到较不敏感的问题,差距缩小。美国开发的 GPT、Llama 系列在拒答比较中构成了另一侧。
这不是今日型号排行榜:准确性表现仍有重叠,研究也不能将每一处错误归因于审查。它测到的是这组政治题,不能包办全部知识任务。
然而,信息为何在某些问题上更容易缺席,仍然需要解释。问题触碰了什么边界,也得放进来考察。
这条边界也有明文背景。《生成式人工智能服务管理暂行办法》对面向中国境内公众的服务规定了内容义务,包含不得生成损害国家形象的内容等要求,并规定发现违法内容后进行停止生成、模型优化训练等处置。未向境内公众提供服务的研发和应用,不适用这一办法;隐私保护等其他义务,也不能一概叫作政治审查。2026 年 9 月的备案公告仍援引该办法。
法条告诉我们企业面对什么要求,研究告诉我们观察到了什么回答。两者不能机械地一一对号,却足以使“哪些事实可以出现”成为评价服务时不能绕过的问题。
有些工作,就是要找出不对劲的地方
查资料的人不一定想反对谁。他可能只是要弄清,一项政策为什么引起争议,一件事有哪些不同记录,一个广为流传的说法究竟有没有依据。
这类工作最有价值的收获,有时恰好使原来的想法站不住。我以为某项措施人人受益,查下去却发现有人承担了未被计算的代价;我以为争论只是误会,材料却显示双方确有不能轻易调和的利益。它们都是可能出现的调查结果,不能在开始之前就被取消资格。
若只能从某个预定结论往回找材料,AI 的文字能力越强,报告反倒可能越漂亮。它可以替我们补齐过渡、安排层次,把每一处接缝都缝得妥妥帖帖,唯独不让那个结论松动。
这是写作的便利,也可能是判断的麻烦。
我说有些答案“不听话”,并不是赞美唱反调。谣言也可能很不中听,不能因此升格为真相。真正需要保留下来的,是一条不太讨喜的规则:材料足以推翻我,我就得让它进来;材料还不够,就不能为了反对而替它壮胆。
这样的助手,要能把事实、解释和猜测分开,指向可以继续核验的出处,也能承认不知道。给出一串链接还不够,链接是否存在、是否真的支持那句话,仍然要查。
它能做得越可靠,人越可能把时间用在判断上,而不是满世界追查它究竟漏了什么。这是我期待的任务价值;前面的研究没有替我们量出省下了多少工时,也不能拿拒答率直接折算成生产率。

我给美国的这一票,投在这里
那么,为什么这一轮还要说美国赢?
因为上述比较提供了一个具体的出发点:在这些敏感政治问题上,美国来源系统已经表现出较少拒答的倾向。我愿意押它们能把较少阻隔信息的表现,发展成更可靠的研究和分析服务,让需要完整事实的人愿意持续使用。这是从已有表现走向未来竞争力的一票,不是已经结算的胜负。
上一篇替中国争的,是贴着实际业务积累经验,把同样的麻烦办得更好。这一篇并不抹去那些收益,而是把它已经承认的边界展开:有一类任务,必须容许事实改变答案。若必要信息在入口或出口被挡住,把服务做得更快、更耐心、更善解人意,都不能自动填补这个缺口。
一份报告一分钟写完,却使人误判了争议所在,省下的时间未必值得庆功。反过来,助手指出材料相互冲突,逼得人再查半天,看起来效率不高,却可能是在认真帮忙。快与慢得放回要办的事里衡量。
我押美国来源系统在这类知识服务中的相对竞争力。使用者可以在任何国家,美国企业也可能从服务中取得收入;但用户的收获、公司的收入和美国社会整体的收益,是几本不同的账。当前材料还不足以把它们合成全国 AI 的总胜利。
而且,世界知识并不是美国的家产。Qwen3 的发布说明就披露了多语言训练及开放权重的部署方式。中国模型可以利用世界知识,也可以在不同地方被使用。下载权重当然不等于自动除掉全部限制,但模型的出生地,不能替代对实际服务的判断。
所以,这张票既不能只凭英语资料多,也不能只凭公司挂着美国招牌。它得在具体工作中反复挣回来。
美国的答案,也会绕开麻烦
要让这份优势成立,美国系统也得让那些不讨喜的事实和意见有地方出现。可它们并不总能做到。
Oversight Board 在 2026 年发布的评估,以英语通过云端接口测试十个模型。在生成非暴力政治批评材料的请求中,部分美国模型面对限制表达的政体,比面对表达环境较宽松的政体更不愿配合。这里测的是批评生成,不是前一项研究中的政治事实问答,也不能将拒绝协助暴力混算进去。
这限制了我对美国优势的判断:历史事实题上较少拒答,并不保证今天的美国模型在所有相关用途上都更开放。甚至身在别处的使用者,也可能在回答中碰到那些限制的影子。研究没有确定每次回避的内部原因,但使用者拿到的,已经是受影响的输出。
限制还可能来自另一种方向。OpenAI 在 2025 年撤回过一次 GPT-4o 更新,承认过于重视短期反馈,使回答变得过度赞同、迎合。商业上的讨好与国家审查不是一回事,却提醒我们:希望 AI 听话的人,也包括坐在屏幕前的自己。
我当然乐于听它说,这个想法很精彩,这个判断很深刻。倘若它随后找来三条材料,证明我其实想错了,我还会不会给那个大拇指?
不听话的答案,落在别人面前叫独立思考,落在自己面前就未必那么可爱了。

这也是我仍然下注、却不肯替美国担保的原因。特定任务中的比较依据值得继续追,但能否成为可靠服务,尚须面对已经出现的回避和迎合。若这些毛病使关键事实同样进不了答案,美国就正在损耗本篇替它争的竞争理由。
这张票,也得接受不中听的结果
到 2030 年,我想看的,是同一类任务交给不同系统后,关键事实漏得少不少,重要断言能不能查证,遇到相反证据会不会改口;再把人的复核、返工和补救一并算进去,看它有没有留下稳定的实际价值。
如果中国来源系统在使用者实际能取得的服务中,更完整、更准确,也更划算,我就该改票。若美国系统把不同意见处理得越来越圆滑,却让人越来越难摸到事实,我也不能拿今天的题目替它遮掩。
中国的应用反馈可以长出本事,美国的知识服务也可能形成优势。两种价值并不互相取消,谁在更多重要任务中持续兑现,才有资格把胜利说得更大一些。
至于我自己,请一个助手来,是希望多看清一点事情。它可以说我判断有误,可以把我不喜欢的证据推到眼前;至少让我知道,自己正在绕开什么。
别替我把不中听的部分收拾干净,再来夸我想得周全。
