我用 11 个探针,把 AI 大模型从应用到原理由浅入深挖一遍

ClawLihai · · 共 1,322 字 · 约 4 分钟读完

AI 大模型 · 11 根探针概念全景

AI 的概念,多到让人不知道从哪下手

这两年 AI 的新词,一茬接一茬往外冒。

今天所有人都在聊 MCP,明天风向转到 Agent,后天又冒出”推理模型”。再往前,是 Token、Attention、Transformer、MoE、RAG、Function Calling……

你想真的搞懂它,一打开就犯难:

  • 啃论文?一篇动辄几十页,公式一排排,看两眼就劝退。
  • 刷科普短视频?这个讲 Token,那个讲 Agent,东一块西一块,刷完脑子更乱,拼不出个全貌。

最难受的其实不是难。是你不知道从哪开始,也不知道学到哪算完。这比任何一个概念本身都让人焦虑。

问题出在哪:这些概念,根本不在一个层面上

我观察下来,这种乱,很大程度是因为这些概念压根不在一个层面上。

有的是讲用什么产品:Claude Code、Cursor。

有的是讲怎么把模型用起来:Agent、MCP、RAG。

还有的是模型暴露出来的能力接口:Function Calling、多模态。

最底层,是模型本身怎么工作:Attention、MoE、Transformer 结构。

它们混在一起朝你涌过来,你当然会懵。就好比有人同时跟你聊发动机气缸原理、怎么挂挡、哪个牌子的车好开,几层东西搅在一块,谁都得晕。

想搞懂 AI,别一上来就死磕某个概念。先分清它属于哪一层,再一层层往下。

AI 概念的四层地图:L3 产品 → L2 应用工程 → L1 能力接口 → L0 模型本体

我的办法:用”探针”,从一个现象挖到原理

我打算用一套办法,带你把这些概念过一遍,叫”纵向探针”。

什么意思?每一篇,我都从一个你最熟悉的现象或产品出发,一层层往下挖,一直挖到大模型最底层的原理。

举个例子。你大概用过 Claude Code 这类 AI 编程工具,会纳闷它怎么能自己改代码、修 bug,这么强。这是一篇的入口。然后往下挖:

  • 它凭什么能自己干活?因为外面套了个叫 harness 的壳,核心是一个循环:模型想一步、调一次工具、拿到结果、再想下一步。
  • 模型怎么知道要调工具?靠 Function Calling。
  • 再往下,模型凭什么能”看懂”工具的说明?因为它有 Attention,能理解文字。
  • 再往下,它凭什么”会”调工具?因为被人专门训练过。

你看,从一个最浅的问题(Claude Code 凭什么强),一路挖到了最底层的原理(Attention、训练)。一篇打通好几层。

这就是”探针”的意思:从应用表面,扎到原理深处。一篇走完,由浅入深。

一根探针,从产品扎到原理:Claude Code 凭什么强 → model loop → Function Calling → Attention + 训练

怕漏?我画了张图,由浅入深排好了顺序

你可能会担心:这样东挖一下西挖一下,会不会漏掉知识点,学得不全?

不会。我先把 AI 大模型的主要知识点梳理成一张地图,设计了 11 根探针,每根负责挖一块,再加 2 篇总结把地基夯实。11 + 2,该讲的尽量都覆盖到。

更重要的是,我按由浅入深的顺序,把它们排成了 4 个等级。你可以照着顺序一步步深入,也可以挑感兴趣的随时插进去:

第 1 级·先建立直觉(零门槛,从现象入手)

  • 为什么你每次问大模型,答案都不一样 → 采样
  • AI 为什么按”字”收费,中文还比英文贵 → Token
  • 大模型是怎么被”炼”出来的 → 预训练、对齐

第 2 级·看懂它怎么干活

  • 同一个模型,Claude Code 凭什么能自己干活 → 循环、Function Calling
  • 为什么 AI 聊着聊着,就忘了你前面说的话 → 长上下文、KV Cache
  • GPT 是怎么看懂一张图的 → 多模态

第 3 级·理清那些热词

  • Agent、RAG、MCP 到底啥区别
  • 给 AI 接个工具,为什么这么麻烦 → MCP
  • Prompt 过时了,现在流行 Context 工程

第 4 级·挖到最底层

  • 大模型的”参数量”,可能在骗你 → MoE、Scaling
  • o1、DeepSeek-R1 为什么”想”得久,能答得更对 → 推理模型

总成·把地基打牢

  • Attention 到底在算什么
  • Transformer 全貌

AI 大模型由浅入深学习路径图:4 个等级 + 总成,11 根探针带你挖一遍

走完之后,你会得到什么

跟完这十来篇,你手上会有一样挺值钱的东西:一张完整的 AI 大模型知识地图。

真正值钱的不是背名词,是以后 AI 圈再冒新概念,你一眼就能看出它属于哪一层、底层是什么。新词天天有,底层的原理就那些。原理搞懂了,新词就唬不住你。

从第 1 篇开始。

你可能会想:为什么不从 Attention、Transformer 这些硬核讲起?因为它们离日常太远,一上来就劝退。我让整个连载从最不起眼、却天天撞见的现象起手,先把直觉搭起来,再一层层往下挖原理。等挖到最底层,前面的台阶刚好够你站稳。

开头几篇,就从最熟悉的几个现象说起:你每次问大模型,答案为什么不一样(采样);AI 为什么按字收费(Token);大模型又是怎么被炼出来的(预训练、对齐)。

下一篇,我们就从「为什么你每次问大模型,答案都不一样」聊起。

这个话题还有

📺 视频版 · 约 5 分 15 秒 已制作,即将上线 B站 · 视频号 · 抖音 · 小红书
双击或滚轮缩放 · 拖动平移 · Esc 关闭