做产品 PMaker 首页
搜索
跟随系统
颜色主题
空格的键盘
名词不是零散的一堆,它们各自长在一次调用的某一段上把东西装进去系统提示、历史对话、检索到的片段、用户这句话,一起装进按 Token 计量的上下文窗口。模型开始算唯一的机制是预测下一个词,反复几百次写完一段回答。能力上限在训练时就定死了。把字吐出来现场生成,不是查库。遇到不知道的地方会用最像的内容补上——这就是幻觉。它想动手输出工具调用,由你的代码执行,结果塞回第一段继续算,转起来就是 Agent 循环。

这一整章讲的东西,都挂在这四段上。碰到一个新名词,先问它属于哪一段,作用范围和它的坑就基本能猜到。

AI 名词地图

把高频名词放回同一张地图:它是什么、解决哪一段问题、和你有什么关系。

名词多,不是因为这件事复杂,是因为它们分别长在一次调用的不同段落上。把这四段走一遍,绝大多数词自己就落位了。

你会遇到的现象:

  • 一篇报道里四个词不认识,读完不确定它说了什么
  • 会上有人说「这个上 RAG 就行了」,你不知道该追问什么才不露怯
  • Token、Agent、微调你都能单独解释,但说不出它们之间是什么关系

一次调用发生了什么

你的产品每问模型一次,都要走完四段。

第一段,把东西装进去。模型不会自己找资料,所有它该知道的,都由你的代码在这一次请求里发过去:系统提示、历史对话、检索出的相关片段(RAG)、用户刚说的这句话。这四样装进容量有上限的上下文窗口,按 Token 计。

第二段,模型开始算。它只做一件事:算下一个词最可能是什么,抽一个接上,再把整段从头算一遍。重复几百次,回答就写完了。这段你能调的只有温度之类旋钮;参数量、能力上限、知道多少东西,训练时就定死了

**第三段,它把字吐出来。**注意这是现场生成,不是从库里查出来的——这是它和搜索引擎最根本的区别。遇到不知道的地方,它用「最像的内容」补上,语气和真话一样,这就是幻觉;它也不知道训练之后发生的事

**第四段,它想动手。**光会说话不够。你把工具说明书放进第一段,它就能输出「调这个工具、参数是这些」,由你的代码执行,结果塞回第一段接着算。这一来一回几十轮,就是 Agent 循环

关键在回流:**每转一圈,前三段全部重算一遍。**上下文越滚越长,每轮都要把所有内容重发一次、重新计费。Agent 为什么又慢又贵,答案就在这条线上,省钱也全在控制上下文长度

最容易混淆的六组

记住定义没用。真正让你在会上判断失误的是下面六组——它们听起来像同一件事,实际差得很远。

**一、Token 不是字。**它是模型自己统计出来的切法,一个常见英文单词可能占 1 个,一个生僻汉字可能占 3 个。计费、上下文长度、限流全按 Token 算,所以别凭字数估成本,得实际切一遍

**二、参数量不是上下文长度。**一个是模型有多大(7B、70B),一个是它一次能读多少(128K、1M)。两者毫无关系,可以任意组合,选型时最常被混着说

**三、微调不是喂资料。**微调改的是模型「怎么说话」的倾向,要花钱训练、要准备成千上万条样本,而且教不会新知识。要让它知道公司规章制度,正确答案几乎总是 RAG——把文档检索出来放进第一段。这条误判最贵:很多团队花几个月微调,最后发现做个检索就解决了。

**四、Agent 不是更聪明的模型。**Agent 是模型外面那一层:循环、工具、权限、终止条件。同一个模型,套上好循环就能干活,套上坏循环就会绕圈子。「它老是漏步骤」多半不是模型笨,而是流程没定义清或没给它验证结果的工具。

**五、Skill 不是 MCP。**Skill 是一包写好的知识和流程,用到时才加载,解决「每次都要重新交代一遍」;MCP 是让 Agent 连外部系统的接口协议,解决「怎么接上你的数据库和第三方服务」。一个装知识,一个装接口,不能互相替代。

六、开源不等于免费。「开源模型」通常只公开权重,训练数据和代码一般不给。你可以下载自己跑,但要自备显卡、自己运维、自己扛并发。算总账,中小规模自部署往往比调 API 更贵。开源买到的是可控——数据不出门、模型不会被突然下线或涨价。

名词对照表

按四段顺序排:每个词一句说清是什么、一句说清跟你有什么关系。Anthropic 的术语表也提醒,这些概念在不同厂商那里边界并不完全一致。claude-glossary

① 装进去 —— 上下文这一侧

名词 一句话是什么 为什么你要关心
提示词 Prompt 你这一次发过去的全部文字。 它不是咒语,是需求文档。你没写清的地方,它一定会自己补一个。
系统提示 放在最前面、每轮都带上的设定与规则。 产品的性格、边界、禁区都写在这,也是最该做缓存的一段。
上下文窗口 一次请求能装下的内容上限,按 Token 算。 超了就得截断或压缩。被截掉的部分它真的看不见,而且不会告诉你。
Token 模型眼里的最小单位,既不是字也不是词。 计费、上下文长度、限流全按它算。估成本必须先换算。
中段丢失 上下文太长时,开头结尾记得清楚,中间容易被忽略。 关键指令放最前或最后,别埋在一堆资料中间。
向量 Embedding 把文字变成一串坐标,意思相近的靠得近。 整套语义检索建在它上面。它算的是「像不像」,不是「对不对」。
RAG / 知识库 先从你的资料里检索相关片段,再连问题一起交给模型。 治幻觉最有效的一招,也是绝大多数「企业知识库」的真身。
上下文压缩 对话太长时把前文摘要成一小段,替换原文。 省了钱也丢了细节,丢的常常正是早期定下的约束。
长期记忆 把该记的事存在外部,下次对话再注入。 模型本身没有记忆,所谓记忆都是你的系统在替它存取。

② 模型算 —— 模型本身

名词 一句话是什么 为什么你要关心
下一个词预测 每一步只算下一个 token 最可能是什么,抽一个接上,再重复。 这是唯一的机制。它所有的能与不能都要回到这句话解释。
训练 / 推理 训练是一次性喂出来,推理是每次调用时用起来。 你的账单全在推理侧,能力边界在训练侧就定死了。
训练数据 训练时喂进去的全部文本、图片与代码。 语料里没有的,它只能靠猜。你们的内部概念就属于这一类。
参数量 模型内部权重的数量,写成 7B、70B。 跟聪明程度不是一回事,跟上下文长度更是毫无关系。
温度 控制抽样随机性的旋钮:低就稳,高就野。 要稳定输出就调低。默认值往往不是你要的那档。
推理模型 回答前先生成一大段思考过程,再给结论。 难题上更准,但那段思考也要按输出价计费。简单任务上纯属浪费。
开源模型 权重公开、可以自己部署的模型。 买到的是可控,不是便宜。中小规模自部署往往更贵。

③ 吐出来 —— 输出与它的边界

名词 一句话是什么 为什么你要关心
幻觉 把不知道的部分用最像的内容补上,语气和真话一样。 机制的必然产物,不是 bug。只能防,不能等它被修好。
知识截止 训练语料的最后时间点,之后的事一概不知。 凡是涉及「最新」的功能,都得由你把最新信息喂进去。
多模态 能读图、音频、视频的模型,这些能力多半是后来加装的。 小字、表格线、精确坐标是高发失败区。

④ 动手 —— Agent 这一侧

名词 一句话是什么 为什么你要关心
Agent 能自己决定下一步、并调工具去做的一套程序。 它不是更聪明的模型,是模型外面那层循环和权限。
工具调用 你给它工具说明书,它输出调哪个、参数是什么,由你的代码执行。 工具给到哪,它的能力边界就到哪。
Agent 循环 想一步、做一步、看结果、再想,反复到收敛。 成本和延迟按轮数翻倍。不收敛的循环是最贵的故障。
Skill 一包写好的知识和流程,用到时才加载。 把「每次都要交代一遍」的经验固化下来,平时还不占窗口。
MCP 让 Agent 接外部系统的标准接口协议。 接一次多处可用。选第三方 MCP 要当成开权限来审。
多 Agent 把任务拆给几个各管一摊的 Agent,再合并结果。 确实更稳,但上下文要复制好几份,成本涨得很快。
提示注入 它读到的资料里藏了一句指令,它照做了。 模型分不清指令和数据。原理层面的漏洞,靠提示词补不上。
API / 网页版 一个给程序调用,一个给人使用。 数据留存策略、可控参数、计费方式都不同。谈合规先分清这两个。

听不懂时问哪一句

还有一件事得说明白:**这些词的边界在业内本来就不统一。**同一个「Agent」,供应商、工程师、报道里读到的,经常不是一回事。有人管带工具的对话框叫 Agent,也有人非要能跑几十轮才算。

所以真正管用的不是背定义,而是在会上追问:**「你说的这个,具体是指哪一步?」**让对方把它落到上面四段里的某一段。大部分误会在这一句里就解掉了。

如果只带走一句话:*模型只会预测下一个词,其余所有名词,都是人们为了绕开这个限制而发明出来的东西。*知道每个词在绕哪个限制,就不需要记它的定义。

参考资料

  1. Glossary — Anthropic