AI 在"思考"的时候到底在做什么:一份大模型底层逻辑的拆解笔记
最近 AI 圈有一个奇怪的现象:模型越来越像”会思考的人”,但它们的底层,其实从来没变过。
这一篇我想把”大模型到底是什么”这件事讲清楚。不是讲 API、不是讲 Prompt 技巧,是从最底层——它到底是怎么”吐出下一个字”的——拆给你看。
看完你会发现,我们平时说的”AI 思考”、”AI 推理”,其实都不是它真的在思考。
一、先把一件事说死:AI 不认识字
很多人对 AI 的第一误解,就是把 ChatGPT、Claude、文心一言想象成一个”读过全人类书籍的超级大脑”。这个画面很酷,但从原理上就不对。
大模型的输入和输出,从头到尾只有一种东西:数字序列,在专业术语里叫 Token(词元)。
所以当你问 AI “你今天吃饭了吗”这句话,它看到的不是中文汉字,而是一串数字。比如它眼里这句话可能是:
1 | 你 → 123 |
这个”汉字 ↔ 数字”的翻译过程,叫做分词(Tokenization),由一个叫”分词器”的小组件完成。
这里有一个细节容易踩坑:同一个汉字,在不同的模型里对应的数字可能完全不同。同一句话,丢给 GPT 是 [34, 28, 109],丢给 Claude 是 [892, 41, 776],丢给 Qwen 又是一套。这没什么神秘的——每个团队在训模型的时候,自己选了一套”汉字到数字”的字典。这就是为什么你换模型,提示词的”魔法值”常常会失效。
二、所谓”思考”,其实是个接龙游戏
好,现在 AI 拿到了一串数字,它要做什么?
它做的事情,极其无聊:猜下一个数字是几。
比如模型已经收到 [你, 今天, 吃饭],它要猜第四个数字最可能是几。它不会”想”——它只会计算一个概率分布:第四个 Token 是「了」的概率 30%、是「的」的概率 22%、是「吗」的概率 18%…… 然后取概率最高的那一个作为输出。
这就是 Transformer 架构的核心机制——自回归。所谓”自回归”,拆开看就是:
- 自:自己
- 回归:用前面输出的东西,继续预测下一个
每猜一个字,就把新字塞回输入,再猜下一个字。直到模型觉得”话说到这儿差不多了”(输出了句号、或者达到了最大长度),才停下来。
所以从数学上讲,大模型的”思考过程”,就是一个逐字猜概率的过程。它没有”我想表达什么”的意图,只有”哪个字最容易接在前面的字后面”。
如果用一句话来总结这个机制,我比较喜欢这个说法:
AI 的本质,是一个概率预测机器。 它不是在思考,它是在做”哪句话最像人说的话”的统计。
这句话听起来不性感,但它是真相。
三、AI 幻觉:不是”胡说八道”,是”接不下去”
顺着上面这条线,一个经常被讨论的现象就很好理解了:AI 幻觉(Hallucination)。
经典例子:你问 AI”请写一首李白的《咏鹅》”,它真的会给你编一首出来,而且格式整齐、押韵完美、五言七言都对。
很多人看到这里会想:这是 AI 在胡说八道,或者是它在”模仿李白”。
实际上都不是。模型对”李白”和”咏鹅”两个概念没有任何”理解”,它只是知道:
- 「请写一首李白的《咏鹅》」后面,最像”诗”的东西概率最高
- 一首五言诗的第一句应该是几×几字的字组合,概率最高
- 「鹅、鹅、鹅」这种重复词,**在”诗 + 动物 + 古代”**这个上下文里概率最高
于是它把概率最高的 Token 一个一个拼出来,生成了一首”看起来完全正确但李白从没写过”的诗。它甚至不知道自己拼出来的是”假”的——因为它没有”真假”的概念,它只有”概率高低”的概念。
所以”幻觉”这个词其实有点拟人化了。更准确的说法是:模型的输出是统计意义上的”最像答案的字符串”,而统计学上的”最像”,和事实上的”是真的”,完全是两件事。
如果用电影来类比,大模型更像是《黑客帝国》里的”母体”——它能给你一个完美的、有秩序的虚拟世界,但这个世界的规则不是”物理事实”,而是它自己的统计规律。
这个类比比通常的”AI 像人”或”AI 像字典”都更贴切——母体不是”骗你”,它只是按自己的规则在运行。
这一条想通,你就能看穿市面上很多 AI 产品的”自信”——它语气越肯定,只是说明它在训练数据里见过越多”类似句式”,不代表它说的是对的。
四、KV 缓存:显存为什么永远不够用
讲完”模型怎么生成”,我们再聊一个偏工程的问题:显存去哪儿了。
如果你跑过大模型本地部署,或者读过类似 “我的 4090 跑不动 70B 模型” 的吐槽,你会反复听到一个数字:上下文长度。8K、32K、128K、200K…… 现在厂商动辄宣传”百万级上下文”,听起来 AI 已经”什么都能记住”了。
但这里有一个很多人不知道的真相:上下文长度越长,显存占用不是线性增长,而是某种意义上的”平方级”压力,至少在 attention 这一层是这样。
背后机制叫 KV 缓存(Key-Value Cache)。每次模型读到一个 Token,它都要存两组中间数据(Key 和 Value),用于后面的 Token 计算”注意力”——也就是说”前面哪些字和我现在要说的字有关”。
- 上下文 1K:存 1000 个 Token 的 KV
- 上下文 10K:存 10000 个 Token 的 KV
- 上下文 100K:存 100000 个 Token 的 KV
显存压力随着上下文长度 线性增长。而模型本身的参数(权重)是固定的,这意味着:上下文越长,留给”模型本身”的显存就越少。
这就是为什么:
- 你让一个号称”128K 上下文”的模型读一本 50 万字的书,它跑得动,但每吐一个字都要扫一遍前面的 128K,慢得离谱。
- 跑分测试里上下文长度刷得很高,实际真塞满 128K 提问,模型质量会肉眼可见地下降。
- 厂商宣称的”上下文长度”,很多只是理论上限,不是日常可用上限。
理解了 KV 缓存,你就能看穿市面上很多”长上下文神器”的真实表现:
- 它能不能塞满?——能
- 它塞满后输出质量怎么样?——大概率下降
- 它塞满后速度快不快?——慢到你想关掉浏览器
五、”思考模式”:包装得更好的概率游戏
2025 年开始,主流大模型陆续上线了一个新功能:思考模式(Thinking Mode)。也叫 Reasoning Mode。
典型界面是这样的:模型接到你的问题后,不直接给答案,而是先输出一大段”Thought for 24.10 second…”的内心独白,然后才输出最终答案。
这个功能看起来很神奇——AI 真的学会”思考”了吗?
没有。 底层还是上面讲的那套东西:逐字猜概率,只不过现在模型的”内部独白”也算 Token,也参与下一轮的概率计算。
举个具体例子。问 AI:”小明有 5 个苹果,吃了 2 个,还剩几个?”
- 不开思考模式:AI 看到”5 个苹果,吃了 2 个”,直接猜出”还剩”后面跟着”3”这个数字概率最高,输出”还剩 3 个”。
- 开思考模式:AI 先输出一段”让我算一下…… 5 - 2 = …… 所以答案是……” 这种看起来像推理链的文本,然后基于这段文字再猜下一字,最终输出”还剩 3 个”。
区别在哪?
不开思考模式时,模型只有一次”猜”的机会。
开了之后,它多了一轮”用文字写下推理过程”的猜,而这轮猜测出的”推理文字”会被塞回上下文,影响下一轮猜测。
听起来是不是很聪明?
但本质上,这只是让模型”在拼字符串之前先拼一段更长、更像人话的字符串”。它没有变出新的能力,它只是把概率游戏的回合数变多了。某些任务(尤其是数学题、代码题)上,这确实能显著提升正确率——因为模型现在可以”先用语言把问题重写一遍”,让”答案”在统计意义上更突出。
但它的天花板,和不开思考模式的模型,是同一个天花板:Transformer 架构本身能算到的最大能力。
六、Transformer 的天花板:为什么”AGI”还远得很
顺着上面这条线,我想聊一个很多人关心、但被舆论严重带偏的问题:为什么这几年 AI 这么火,AGI 却一直没来?
先讲一个被反复验证的工程事实:Transformer 这个架构,本质上只能做”概率接龙”。它的所有惊艳表现——写诗、写代码、做数学题、聊天——都是”概率接龙”在足够大数据、足够多参数下的涌现结果。
但”概率接龙”有几件事做不到:
- 真正的事实校验。它没有”我知道 X 是错的”这种机制,它只知道”在训练数据里,X 后面不常跟 Y”。
- 真正的逻辑链条。它能做”看起来像逻辑”的字符串拼接,但没有”如果 A 则 B,B 不成立所以 A 不成立”这种命题演算。
- 真正的目标理解。它能模仿”想达成某事”的人类语言,但没有”主动想要达成”的内在动机。
- 跨模态的统一理解。文字、图片、视频虽然都能用 Token 化塞进模型,但模型对”红色”和”红色的图片”是不是同一个东西,只有统计上的关联,没有概念上的等价。
这些不是”再训大一点就能解决”的问题,是架构本身的天花板。
这也是为什么你看 2024-2026 这几年的 AI 行业,会出现一个很奇怪的现象:
- 模型参数越来越大,从千亿到万亿,再到所谓”百万亿混合专家”。
- 但”AI 的根本性突破”几乎没有。每一次”突破”,都是”接龙接得更像人话”。
- 真正的产品突破,反而出现在接得更像的那些地方——比如 Sora 在视频生成上接得更像,字节跳动的视频模型在风格化上接得更像,Gemini 在多模态拼装上接得更像。
而 Sam Altman 每隔几个月就出来喊”AGI 还有几个月就到”,喊了好几年,Sora 被市场淘汰了,真正的统治者是那些把”接龙”做得更好的工程团队,而不是那些鼓吹”AI 即将觉醒”的叙事团队。
这个现象本身就是 Transformer 天花板的最强证据:架构没变,变的是工程能力,所以产品形态也变不出新维度。
七、回到最开头:那我们该怎么用 AI?
讲完这么多底层,最后想落回一个实用问题:既然 AI 是”概率接龙”机器,我们应该怎么用它?
我自己的几条原则,供你参考:
- 别把它当”无所不知的老师”,当它是一个”极其勤奋但记性差的学生”。它知道的来自训练数据,数据有时效性、有偏差、有遗漏。
- 重要的事实,自己核一遍。尤其是数字、日期、引用、人名——这些是幻觉高发区。
- 让它”拼字符串”,别让它”想事情”。你要它做的,最好是”基于给定材料,生成一段像样的输出”这类任务。
- 长上下文是奢侈品不是日用品。尽量把上下文控制在模型实际表现良好的范围内,而不是号称的最大值。
- 思考模式可以用,但别迷信。它对某些任务有用,但本质上还是更长的接龙,不是更深的思考。
最后一句话送给这个 AI 时代:
真正决定 AI 能帮你做什么的,从来不是 AI 自己,而是你对”AI 到底是什么”的理解。
理解得越深,你越不会被它的”语气自信”骗到,也不会被厂商的”AGI 还有几个月”忽悠到。
清醒地使用工具,比盲目地崇拜工具,重要得多。