那个名字明明就在嘴边。

你看到一张熟脸,却死活想不起他的名字,心理学给这种现象起过一个名字:「舌尖现象」(tip-of-the-tongue)。

现在,谷歌在一项研究里发现,GPT-5和Gemini 3也有同一种毛病。

这两个模型把95%–98%的测试事实都装进了参数里。可你直接去问,它们却有26%–34%的事实答不出来。

开启thinking多想一会儿,还剩11%–12%怎么也想不起来。

大模型答不出来,很多情况下真不是它大脑里没有,是学过了,取不出来。

这项研究叫《空货架,还是丢钥匙?》(Empty Shelves or Lost Keys?),收录于ICML 2026。

8月12日,Google Research发博客把结果集中讲了一遍,同时公开的还有一套名叫WikiProfile的基准和完整数据集。

01

货架没空

钥匙丢了

模型答错题,可能是两种毛病。

一种是压根没学过,那得往预训练里加数据、加参数;另一种是学过了,换个问法就调不出来,那是后训练和推理环节的事。

这两种问题,都曾被归结为一个准确率的问题。

谷歌提出的「知识画像」框架,不再问「这道题答对没有」,而是判断「这条事实在这个模型记忆中处于什么状态」,一共划分出五种。

「知识画像」把一条事实分成五种状态:存入失败、回忆失败、直接回忆、借助thinking回忆、未存入却靠推理答对。

同样一个错误答案,在不同的状态,修改方法也完全不同。

怎么判断一条事实存没存进去?

办法是把维基原文截到答案出现之前,让模型顺着写下去;或者在同样的上下文后面直接发问。

这两道题都不许开thinking,为的是把「记住了」和「推出来的」分开。

左侧测存没存进去,把维基原文截断让模型补完;右侧测答不答得出,换措辞、换正反方向反复提问。

基准叫WikiProfile,一共2150条事实,全部取自英文维基百科。

每条事实配10道题:2道测存没存进去,4道让它自己答,4道给选项挑。加起来21500道题。

出题全交给了模型:Gemini-2.5-Pro生成,Google搜索逐题验证,答案不唯一或题目有歧义的,连带整条事实一起丢弃。最后人工再验一遍,又砍掉不到2%。

跑分的是13个模型,覆盖Gemini 3、GPT-5、GPT-4.1和Gemma 3四个家族,每个模型开关thinking各跑一遍,每道题采样八次,攒出约450万条回答。

把一个前沿模型完整测一遍,大概要花500美元。

结果就是开头那组数字。

在前沿模型的事实错误里,「取不出来」已经压过了「没学过」,成了大头。

02

取不出来的

都卡在同两个地方

第一个是冷门知识。

过去的主流解释是模型容量不够,一些冷门事实压根没学进去。

这次的数据,冷门知识其实都存进去了。Gemini-3-Pro存下了94.5%的冷门事实,热门事实是99.5%,只差5个点。

可一开口回答,冷门事实就掉到63.3%,热门事实还有84.7%,差了21个点。

存的时候几乎没差别,取的时候差出四倍。

冷门事实(后20%)与热门事实(前20%)对比,存入率差距很小,直接回忆率差距明显拉开。

GPT-5的落差更大。

冷门事实它存住了90.7%,热门事实98.4%。可一开口,冷门事实只剩下52.9%,热门事实还有77.8%。

将近一半的冷门事实明明躺在模型里,就是调不出来。

存入的时候差别不大,取的时候差别很大。长尾问题的真相,不是模型没见过那些冷门事实,是那些知识更难被叫醒。

第二个场景是反向提问,你问AI,汤姆·克鲁斯的妈妈是谁,它答得又快又准。你反过来问,这位女士的儿子是谁,它就卡壳了。

2023年那篇论文给它起名叫「反转诅咒」,模型学会了「A是B」,不会自动泛化出「B是A」。当年的解释是:双向关联压根没被学进去。

谷歌把同一批题改成了四选一,结果马上反转。

GPT-5正向问答的回忆率是82.9%,反向掉到74%。可一换成给选项的识别题,反向不但不比正向难,13个模型里有9个反而答得更好,剩下4个持平。

选择题会做,一换成问答题就答不出来了。

同一批正反向问题,四选一识别里反向不比正向难,闭卷生成里反向明显更难。

这说明那层关联显然是在的,真正卡住的是怎么把它挖出来。

作者的解释是,事实被存进去的时候,当时的语境、措辞和顺序也一并留在了里面。

你问的方式一旦偏离训练时的样子,钥匙就对不上锁。

03

thinking的另一个身份

帮它回忆

WikiProfile里的题,都是问一句答一句,中间没有推理步骤。

「Oasis第一场演出在哪个俱乐部」,这种题要么记得,要么不记得。

按理说让模型多想一会儿,也帮不上什么忙。

但thinking真捞回来了。那些存进去却答不出的事实,它找回了40%–65%。

关键线索,藏在它的偏好上:那些压根没存进去的事实,thinking只能捞回5%–15%。

开启thinking后被找回的事实比例,已存进参数的能捞回40%–65%,没存进去的只有5%–15%。

它不是在凭别的知识推演,是在原地找钥匙。

作者还顺手排除了一个更省事的解释。

有人会想,thinking无非是让模型答得更花,八次里蒙中一次的机会变大了。真是这样的话,答案应该更飘才对。

实际反过来了,开了thinking,同一道题八次里答对的次数反而更集中。

收益最大的两处,恰好是前面最堵的那两处。

Gemini-3-Pro的冷热门差距从21.4个点收窄到12.5个点,GPT-5的正反向差距从9个点收窄到2个点。哪儿最堵,它就往哪儿使劲。

谷歌另一篇姊妹论文《思考以回忆》(Thinking to Recall)给出了机制解释:

一是计算缓冲,那些吐出来的思考token哪怕内容本身没什么意义,也在给模型争取额外的隐式算力;

二是事实启动,模型先说出一批相关事实,等于给正确答案搭了一座语义桥。

这在人类认知里叫「扩散激活」(spreading activation)。

想不起某个人的名字,就先回忆他在哪家公司、留什么发型、上次见面是什么场合,名字常常自己就冒出来了。

摆脱「舌尖现象」的办法,人和模型居然是同一套。

但这种方式也有代价。

同一篇论文警告:如果思维链里那些中间事实是编的,最终答案的幻觉概率反而更高。

桥搭歪了,走得越远错得越离谱。

04

扩规模等于补货

不负责配钥匙

拿开源的Gemma 3家族当尺子。

参数从1B涨到27B,编码失败率从85%一路降到23%。

规模确实在补货,货架肉眼可见地被填满了。可回忆失败没有同步下降。它在剩余错误里的占比一路上升,到27B时成了错误的主要构成。

放到前沿模型上更极端:回忆失败占了GPT-5.2全部错误的七成以上,而且模型越强,这个比例越高。

13个模型的五种状态分布,参数越大编码失败一路收缩,回忆失败几乎不动。

规模改善的是存了多少,不是取得出多少。

这并没有给scaling判死刑,而是给它划了一条边界。

既然存进去的比例已经摸到95%–98%的天花板,那么继续加参数、加数据,能换来的准确率提升正在肉眼可见地变小。

下一段增益更可能来自后训练和推理时的方法,也就是怎么用好已经存进去的知识。

检索增强当然能补位。

但作者也提醒道:参数里的知识仍然关系到流畅度、响应速度和跨语境整合,很难被外部检索完全替代。

05

它得先知道自己想不起来

那么,什么时候该让模型多想一会儿?

论文把这个问题定义成了元认知,也就是模型对自己状态的判断:它得先意识到「我直接答不上来」,才知道这道题值得开thinking多想一会儿。

过去两年,让模型更靠谱的默认答案是喂更多数据、堆更大参数。

这项研究把话说清楚了:事实层面,前沿模型的货已经上架得差不多了。接下来考验的,是它能不能自己把货取出来。

更麻烦的是下一步:它得先知道,自己想不起来。

本文转自:凤凰网科技

原文地址: https://tech.ifeng.com/c/8vaJka97nO2