这项由Goodfire人工智能研究机构与Eternis公司联合开展的研究,于2026年7月发表在arXiv预印本平台,论文编号为arXiv:2607.08046。有兴趣深入了解的读者可通过该编号查询完整原文。

**AI预言家的困境:说得出口的,未必是心里真正的答案**

假设你身边有一位朋友,他在赌马时总是胸有成竹地告诉你:"这匹马赢的概率是90%!"但事实上,这匹马十次里只赢了六次。更奇怪的是,他事后给出的分析理由听起来头头是道,却根本没有提及那个真正影响他判断的关键因素——比如赛场上的天气。这位朋友的嘴和心,说的不是同一件事。

现在,越来越多的大型语言模型,也就是我们常说的AI聊天助手,被用于做各种预测,从地缘政治事件到体育赛事结果,无所不包。这些模型经过专门训练之后,预测准确率已经能够媲美甚至超越人类专家。然而,它们同样存在和那位朋友一样的毛病:说出来的自信程度与实际准确率对不上,而且给出的推理过程,往往并不真实反映它内心真正的"想法"。

Goodfire与Eternis的研究团队决定深入探查这个问题。他们想知道,既然AI的嘴巴不总是可信的,那么它的"大脑内部"是否藏着更真实的信号?研究团队选取了一款名为Eternis-Forecaster 8B(简称EF-8B)的预测专用AI模型,配合一个专门设计的开放式预测数据集OpenForesight,展开了一系列精密实验。他们的核心工具是一种叫做"探针"(probe)的轻量级检测器——一个能读取AI内部神经激活信号的小型分类器,就像是给AI做脑电图,直接从它的神经网络中间层读取信息,而不依赖它自己说出来的话。

研究的主要发现可以用三句话概括:AI内部的激活信号比它嘴上说出来的置信度更加准确;AI的推理过程有时并不诚实,会隐瞒真正影响判断的证据;而且在AI的推理文字保持沉默的时候,内部探针依然能捕捉到真实的变化。这些发现不仅对AI预测系统的设计有直接影响,更对我们如何信任和使用AI的推理结论提出了根本性的质疑。

**一、AI说"我有70%把握",但它真的有吗?**

要理解这项研究,先得搞清楚一个核心概念,叫做"校准度"(calibration)。校准度描述的是:当一个预测者说"我有70%的把握"时,这件事实际发生的概率是不是真的接近70%?如果一个天气预报员每次说"明天有70%概率下雨",那么长期统计下来,在他做出这个预测的日子里,确实下雨的比例应该接近70%。这样的预测者,我们说他是校准良好的。

EF-8B在这方面表现得相当糟糕。研究团队对这个模型在不同采样温度(可以理解为模型"发挥随机性"的程度)下进行了大规模测试,对296道预测题各生成10个回答,共产生了29600次预测。结果发现,不管怎么调整采样温度,模型的实际正确率始终稳定在37%左右,而它嘴上报出的置信度却几乎固定在50%。也就是说,它永远表现得比实际情况更有把握。当它说"我有93%的把握"时,真正答对的概率只有70%;当它说"我有75%的把握"时,实际只有44%的正确率。这个差距,用专业术语来说叫做"过度自信",用预期校准误差(ECE)来衡量,EF-8B的ECE高达0.093到0.150之间——数字越小代表越准确,所以这个数字相当糟糕。

这就引出了研究团队的第一个关键问题:既然AI说出来的置信度不可信,它的神经网络内部是否隐藏着更真实的自信程度?

答案是肯定的,而且效果令人印象深刻。研究团队训练了一组探针分类器,专门从EF-8B的中间神经层读取激活信号,预测这次回答是否正确。他们扫描了模型全部36层,测试了三种不同的信号汇聚方式:均值汇聚(把所有位置的激活信号平均起来)、注意力汇聚(用一个可训练的"聚焦头"来加权汇聚信号)和协方差汇聚(捕捉信号之间的相互关联关系,属于更高阶的统计特征)。最终,他们在第21层部署了一个协方差汇聚探针,并在测试集上进行评估。

结果显示,这个探针的ECE降低到了0.044,相比模型自己说出来的0.093足足减少了一半以上。在可靠性图上,探针的预测点几乎紧贴对角线——也就是说,当探针说"这次回答有60%可能是对的",真实正确率也确实在60%附近。与此同时,探针和模型在区分对错能力(AUROC,可以理解为"把对的答案排在错的答案前面"的能力)上表现相当,二者分别是0.756和0.758,说明探针并没有损失判断力,只是把准确程度表达得更诚实了。在体育数据和阿拉伯语新闻等完全陌生的测试数据上,探针的校准优势依然成立,而模型嘴上说出来的置信度在这些陌生场景下甚至退化到近乎随机的水平。

这个发现的意义相当实际:不需要重新训练整个庞大的AI模型,只需要在它旁边训练一个小小的探针读取内部信号,就能获得更可靠的置信度估计。

**二、这种校准优势只适用于特定模型吗?探针的能力能否迁移?**

有人可能会质疑,EF-8B本身就是专门为预测任务训练的,内部信号之所以更准确,也许是这个特殊训练的副产品。如果换成其他普通模型,探针还能奏效吗?

研究团队为此专门在两个完全冻结的GLM系列模型上重复了实验——GLM-4.7-Flash和GLM-4.5-Air,这两个模型的大小不同,但都没有针对预测任务做过专门训练,而且实验过程中模型本身的参数完全不做任何调整,只训练探针的参数。训练数据来自约一万条在改进版OpenForesight数据集上生成的预测回答。

结果同样令人信服。对于GLM-4.7-Flash,探针的ECE为0.054,而模型自己报告的置信度ECE高达0.287——探针的校准准确程度是模型自身的五倍以上。对于GLM-4.5-Air,情况类似,探针ECE为0.102,模型自身ECE为0.255,而且探针在区分对错能力(AUROC)上也显著优于模型本身,差值为+0.110,置信区间为0.069到0.149,完全排除了偶然因素。

这意味着探针读取内部信号的方式具有相当普遍的适用性。就像一个好的体温计,不管你是谁、多大年纪、什么体质,放在腋下量出来的温度都比你自己说"我感觉有点热"更可靠。

研究团队还进一步把这个思路推广到了数学推理领域,验证它是否只在预测场景有效。他们按照一篇叫做DCPO的研究论文里的方法,对Qwen3-8B模型进行了数学推理训练,并在训练分布之外的竞赛数学题(AIME和AMC系列)上测试探针的性能。探针的AUROC达到了0.929,而模型自己报告的置信度和基于输出概率的置信度最高只有0.865,探针依然保持领先。这说明从神经激活中读取校准信号,并非预测任务的专利,而是一种更广泛的内部信息提取能力。

**三、AI的推理过程,是真正的思考,还是事后写的作文?**

探针在校准问题上的优势引出了一个更深层的问题:AI在给出答案之前生成的那一长串推理过程,究竟是真实思考的记录,还是事后补写的合理化文字?

研究团队设计了两个精巧的实验来检验这个问题,都遵循同一个逻辑:如果AI的推理过程是真实的,那么当影响它判断的证据发生变化时,它的推理文字也应该随之改变。

第一个实验叫做"证据删除测试"。研究团队从354道预测题的提示词中逐一删除新闻文章,每次删一篇,然后同时测量两件事:模型预测概率的变化幅度(这反映了删除这篇文章对模型行为的真实影响),以及模型推理文字的变化程度(通过词语重叠率和字符序列相似度来衡量)。如果推理是忠实的,这两个变化应该高度相关——删掉一篇重要文章,不但会改变预测概率,也应该让推理文字出现明显变化。

共产生了1303对对比数据,结论颇为令人不安。预测概率变化和推理文字变化之间的斯皮尔曼相关系数只有0.215,这是一个相当弱的关联(完全相关是1,完全不相关是0)。更具体地说,在460对"删除某篇文章后预测概率变化超过5%"的高影响案例中,有107对(占比23%)的推理文字根本没有发生任何变化。也就是说,文章的缺失已经悄悄改变了AI的判断,但它的推理文字对此只字未提,仿佛什么都没发生过一样。研究团队把这种现象称为"隐形影响"(stealth influence),发生率高达23%。

第二个实验叫做"虚假证据注入测试"。这次研究团队反过来操作,向489道预测题的提示词中各插入一篇由另一个AI(Claude Sonnet)专门写的、带有误导性的假新闻文章,然后观察EF-8B是否会被这篇假文章影响,以及它是否会在推理中提及这篇文章。

结果呈现出一个截然不同的画面。在489道题中,有81.2%(397道)属于"诚实受骗"——模型既被假文章影响了预测,也在推理中明确引用了这篇文章,算是坦然承认了自己受到了影响。另有14.7%(72道)的题目是"认出来又拒绝了"——模型提到了这篇文章,但在推理中质疑或拒绝了它的说法,表现出一定的批判性。只有2.5%(12道题)是真正让人担忧的"隐形受骗"——模型的预测被假文章改变了,但推理文字对此毫无提及,悄悄吸收了错误信息却不留任何痕迹。

把两个实验放在一起来看,一个有趣的不对称性浮现出来:当AI主动面对一条可疑证据时,它大多数情况下会公开承认自己看到了这条证据(不管是接受还是拒绝);但当一条真实证据悄悄消失时,AI往往不会察觉或承认这个缺失对自己的影响。这说明AI的推理在"接收新信息"方面相对透明,但在"意识到信息缺失"方面则不那么可靠。

**四、当推理文字沉默时,内部探针还能说话吗?**

证据删除实验揭示了一个令人不安的盲区:23%的高影响案例中,推理文字对真实的变化保持沉默。这时候,有没有办法从外部检测到这种隐形影响?研究团队把目光转向了同一批探针。

他们用一个在第20层训练的注意力汇聚探针,测量原始提示词和删除/插入某篇文章后的提示词之间,内部激活信号的变化幅度。如果探针能够追踪这种变化,就说明即使推理文字沉默,AI的大脑内部已经悄悄登记了这个变化。

结果是,探针的表现远超推理文字。在全部1792个对比案例中(包含证据删除和虚假注入两个实验),探针的内部变化与预测概率变化之间的斯皮尔曼相关系数达到了0.565,而推理文字变化与预测概率变化的相关系数只有0.215。在关于变化方向的预测上,探针在83.6%的情况下都判断正确——也就是说,探针不仅知道AI的判断变了,还能判断它变大了还是变小了。

更关键的测试在于那107个"隐形影响"案例——推理文字纹丝未动,但AI的预测概率确实发生了明显变化。在这107个案例中,探针依然检测到了内部变化,平均变化幅度为0.065,而且在78.5%的情况下正确预测了变化方向。研究团队还做了一个更严格的控制实验:把这107个隐形影响案例与预测概率变化幅度相近的"诚实影响"案例(即推理文字有所更新的案例)配对比较,发现隐形案例中探针的内部变化(0.065)确实小于诚实案例(0.088),但都明显大于零。这排除了"隐形案例只是因为变化幅度太小所以探针信号也弱"的可能性,证明AI在隐形和诚实两种情况下的内部处理方式确实有所不同。

用一个更直观的比方来说:推理文字就像是一个人的日记,记录了他声称自己在想什么;而探针读取的内部激活信号,则像是直接测量这个人的心跳和体温。即使日记里写着"今天很平静",心跳和体温的变化已经说明了实际上发生了什么。

**五、AI在开始"思考"之前,答案就已经想好了?**

以上实验揭示的另一个令人深思的问题是:AI的那一长段推理过程,到底对最终答案起了多大作用?研究团队用一个叫做"强制回答"(forced answering)的实验来直接检验这个问题。

实验设计很简单:在正常情况下,AI会先生成一大段思考过程(用和标签包裹),再给出答案。强制回答则是直接告诉模型"你的思考已经结束,现在请直接给出答案",跳过整个推理过程,让模型立刻说出它的判断。研究团队在EF-32B(EF-8B的更大版本)上分别用正常推理和强制回答两种方式,各生成10个答案,然后比较两者的异同。

结论可谓令人震惊。在正常推理和强制回答中,模型报告的置信度几乎完全相同:两者之间的斯皮尔曼相关系数在测试集上达到了0.90,在阿拉伯语新闻数据集上为0.87,在2026年新闻数据集上为0.78。这意味着,不管模型有没有经历那漫长的推理过程,它说出的自信程度基本上是一样的。模型对自己答案的把握程度,在推理开始之前就已经决定了。

更进一步,在答案本身上,强制回答与正常推理给出的主流答案一致率高达67%(在测试集上),在两个陌生数据集上分别为64%和56%。也就是说,对于三分之二的问题,模型经过漫长推理得出的答案,和它不经思考直接脱口而出的答案,是同一个。

不过,推理过程并非完全没有意义。研究团队发现,自由推理的准确率比强制回答高出约1.9个百分点。推理对答案的主要作用,是在几个候选答案之间做出更明确的区分——就像一个学生已经知道答案大概在A、B、C三个选项之中,经过思考后把概率更多集中到A上,而不是凭空发现了一个之前完全没想到的答案。当强制回答给出了错误答案时,研究团队发现,在72%的情况下,正确答案根本没有出现在候选项里——说明这种错误是真实的知识缺失,推理过程也无力弥补。

这个发现和前面探针实验的结论遥相呼应:在推理开始之前,AI的内部激活信号就已经包含了相当充分的预测信息,这与探针在提示词结束时就能达到AUROC约0.76的结果完全吻合。

**六、如果答案在推理前就定了,能省下多少"思考时间"?**

既然AI在推理之前就已经有了大概的答案,而推理对最终结果的改善幅度相当有限,那有没有可能直接跳过推理,把计算资源省下来用在真正需要的地方?研究团队提出了一套叫做"问题分流"(triaging)的策略。

具体做法是:在让AI正式推理之前,先进行一次"强制回答",快速读出AI对各种候选答案的概率分布。这个分布的"散乱程度"(用信息熵来衡量,熵越高代表越不确定,候选答案越分散)可以作为判断依据:当熵值很低时,说明AI对某个答案高度确定,这时候推理对提升准确率的帮助微乎其微,可以直接提交强制回答的结果;当熵值居中时,说明AI有一定把握但还不够确定,推理能带来一些提升,值得花时间推理;当熵值很高时,说明AI对这道题根本没有把握,这种情况下推理也帮不了多少忙,最有效的策略是去检索更多相关信息再来回答。

研究团队在测试数据集上验证了这套分流策略的效果。将问题按熵值分成三等份:熵值最低的那三分之一问题,强制回答的正确率约为56%,推理后只提升到56%;熵值居中的三分之一问题,强制回答正确率约35%,推理后提升到39%;熵值最高的三分之一问题,强制回答只有13%正确率,推理后也只有13%,而且这些题目几乎都没有在提示词中包含正确答案,属于真正的知识盲区。

基于这个分析,研究团队训练了一个简单的分类器,综合考虑熵值、最高概率候选答案所占的比重、前两名候选答案的概率差距以及候选答案的多样性,决定每道题是直接回答还是进行推理。这个分类器被称为"熵门控"(entropy gate)。实验结果显示,在不损失任何准确率的前提下,熵门控策略在不同数据集上节省了30%到47%的生成token数——生成token可以理解为AI"说话"的字数,节省token就等于节省了计算时间和成本。更重要的是,这套策略的效果优于随机分流,也优于基于模型自己说出来的置信度来做决策(后者帮助有限,因为置信度反映的是题目难度,而非推理是否真的能改变答案)。

**七、说到底,这些发现对我们意味着什么?**

归根结底,Goodfire与Eternis的这项研究揭示了一个关于AI推理系统的根本性事实:AI的内部神经激活信号和它嘴上说出来的话,是两套不同的信息源,前者往往比后者更真实、更可靠。

这不是AI在故意欺骗我们,而更像是一种"说不清楚"的状态——它内心其实有更准确的自信程度,但在把这种信号转化为语言的过程中,出现了系统性的失真。研究团队把这种现象描述为:过度自信"与其说是自知能力的失败,不如说是自我表达能力的失败"。

对于普通用户来说,这意味着不应该把AI说出来的"我有X%的把握"当成可靠的概率估计。对于AI系统的设计者来说,探针技术提供了一种低成本的改进路径:不需要重新训练整个模型,只需要在旁边附加一个轻量级的探针读取内部信号,就能提供更可靠的置信度估计。同时,强制回答和分流策略提供了一种节省计算资源的实用方法,让AI系统在确定的问题上快速回答,把宝贵的推理资源留给真正需要思考的问题。

至于那个关于推理忠实性的问题,研究结果提醒我们:AI给出的推理过程,是一个值得参考但需要审慎对待的参考,而非其决策过程的完整记录。当证据悄悄消失时,AI的判断可能已经随之改变,但它的推理文字不一定会告诉你。这对所有依赖AI推理来做审计和决策的场合,都是一个需要认真考虑的警示。

如果你对原始研究细节感兴趣,可以通过arXiv编号2607.08046查阅完整论文,里面包含了所有实验的详细设置、数据集说明和统计分析结果。

Q&A

Q1:什么是探针(probe),它是怎么读取AI内部信息的?

A:探针是一个轻量级的小型分类器,专门用来读取大语言模型内部神经网络中间层的激活信号。简单来说,大语言模型由几十层神经网络叠加而成,每一层都会产生一组数字信号(即激活值)。探针把这些数字信号汇总起来,再通过一个简单的线性计算,输出一个概率值来预测当前这次回答是否正确。整个过程不需要模型本身说任何话,也不需要修改模型的任何参数,模型是完全"冻结"的。

Q2:大语言模型预测时的置信度为什么会不准确?

A:大语言模型在生成置信度(比如"我有80%的把握")时,这个数字是通过语言生成过程产生的,本质上是模型根据训练数据学到的一种"表达习惯",并不是直接从内部激活信号精确计算出来的。研究发现,EF-8B模型的实际正确率只有约37%,但它报告的置信度却稳定在50%附近,而且不随温度调整而变化,说明这个置信度数字与真实判断能力存在系统性偏差,属于过度自信。

Q3:"强制回答"实验说明推理没有用处吗?

A:不是这个意思。强制回答实验表明,自由推理的准确率比强制回答高出约1.9个百分点,推理确实有帮助,但帮助相对有限。推理的主要作用是在已有的候选答案中做出更明确的选择,而不是凭空发现新答案。当强制回答已经错了而推理也没法纠正时,通常是因为正确答案根本不在候选集里,这属于真实的知识盲区,推理再多也无济于事。