AI 名词地图
把高频名词放回同一张地图:它是什么、解决哪一段问题、和你有什么关系。
名词多,不是因为这件事复杂,是因为它们分别长在一次调用的不同段落上。把这四段走一遍,绝大多数词自己就落位了。
你会遇到的现象:
- 一篇报道里四个词不认识,读完不确定它说了什么
- 会上有人说「这个上 RAG 就行了」,你不知道该追问什么才不露怯
- Token、Agent、微调你都能单独解释,但说不出它们之间是什么关系
一次调用发生了什么
你的产品每问模型一次,都要走完四段。
第一段,把东西装进去。模型不会自己找资料,所有它该知道的,都由你的代码在这一次请求里发过去:系统提示、历史对话、检索出的相关片段(RAG)、用户刚说的这句话。这四样装进容量有上限的上下文窗口,按 Token 计。
第二段,模型开始算。它只做一件事:算下一个词最可能是什么,抽一个接上,再把整段从头算一遍。重复几百次,回答就写完了。这段你能调的只有温度之类旋钮;参数量、能力上限、知道多少东西,训练时就定死了。
**第三段,它把字吐出来。**注意这是现场生成,不是从库里查出来的——这是它和搜索引擎最根本的区别。遇到不知道的地方,它用「最像的内容」补上,语气和真话一样,这就是幻觉;它也不知道训练之后发生的事。
**第四段,它想动手。**光会说话不够。你把工具说明书放进第一段,它就能输出「调这个工具、参数是这些」,由你的代码执行,结果塞回第一段接着算。这一来一回几十轮,就是 Agent 循环。
关键在回流:**每转一圈,前三段全部重算一遍。**上下文越滚越长,每轮都要把所有内容重发一次、重新计费。Agent 为什么又慢又贵,答案就在这条线上,省钱也全在控制上下文长度。
最容易混淆的六组
记住定义没用。真正让你在会上判断失误的是下面六组——它们听起来像同一件事,实际差得很远。
**一、Token 不是字。**它是模型自己统计出来的切法,一个常见英文单词可能占 1 个,一个生僻汉字可能占 3 个。计费、上下文长度、限流全按 Token 算,所以别凭字数估成本,得实际切一遍。
**二、参数量不是上下文长度。**一个是模型有多大(7B、70B),一个是它一次能读多少(128K、1M)。两者毫无关系,可以任意组合,选型时最常被混着说。
**三、微调不是喂资料。**微调改的是模型「怎么说话」的倾向,要花钱训练、要准备成千上万条样本,而且教不会新知识。要让它知道公司规章制度,正确答案几乎总是 RAG——把文档检索出来放进第一段。这条误判最贵:很多团队花几个月微调,最后发现做个检索就解决了。
**四、Agent 不是更聪明的模型。**Agent 是模型外面那一层:循环、工具、权限、终止条件。同一个模型,套上好循环就能干活,套上坏循环就会绕圈子。「它老是漏步骤」多半不是模型笨,而是流程没定义清或没给它验证结果的工具。
**五、Skill 不是 MCP。**Skill 是一包写好的知识和流程,用到时才加载,解决「每次都要重新交代一遍」;MCP 是让 Agent 连外部系统的接口协议,解决「怎么接上你的数据库和第三方服务」。一个装知识,一个装接口,不能互相替代。
六、开源不等于免费。「开源模型」通常只公开权重,训练数据和代码一般不给。你可以下载自己跑,但要自备显卡、自己运维、自己扛并发。算总账,中小规模自部署往往比调 API 更贵。开源买到的是可控——数据不出门、模型不会被突然下线或涨价。
名词对照表
按四段顺序排:每个词一句说清是什么、一句说清跟你有什么关系。Anthropic 的术语表也提醒,这些概念在不同厂商那里边界并不完全一致。claude-glossary
① 装进去 —— 上下文这一侧
| 名词 | 一句话是什么 | 为什么你要关心 |
|---|---|---|
| 提示词 Prompt | 你这一次发过去的全部文字。 | 它不是咒语,是需求文档。你没写清的地方,它一定会自己补一个。 |
| 系统提示 | 放在最前面、每轮都带上的设定与规则。 | 产品的性格、边界、禁区都写在这,也是最该做缓存的一段。 |
| 上下文窗口 | 一次请求能装下的内容上限,按 Token 算。 | 超了就得截断或压缩。被截掉的部分它真的看不见,而且不会告诉你。 |
| Token | 模型眼里的最小单位,既不是字也不是词。 | 计费、上下文长度、限流全按它算。估成本必须先换算。 |
| 中段丢失 | 上下文太长时,开头结尾记得清楚,中间容易被忽略。 | 关键指令放最前或最后,别埋在一堆资料中间。 |
| 向量 Embedding | 把文字变成一串坐标,意思相近的靠得近。 | 整套语义检索建在它上面。它算的是「像不像」,不是「对不对」。 |
| RAG / 知识库 | 先从你的资料里检索相关片段,再连问题一起交给模型。 | 治幻觉最有效的一招,也是绝大多数「企业知识库」的真身。 |
| 上下文压缩 | 对话太长时把前文摘要成一小段,替换原文。 | 省了钱也丢了细节,丢的常常正是早期定下的约束。 |
| 长期记忆 | 把该记的事存在外部,下次对话再注入。 | 模型本身没有记忆,所谓记忆都是你的系统在替它存取。 |
② 模型算 —— 模型本身
| 名词 | 一句话是什么 | 为什么你要关心 |
|---|---|---|
| 下一个词预测 | 每一步只算下一个 token 最可能是什么,抽一个接上,再重复。 | 这是唯一的机制。它所有的能与不能都要回到这句话解释。 |
| 训练 / 推理 | 训练是一次性喂出来,推理是每次调用时用起来。 | 你的账单全在推理侧,能力边界在训练侧就定死了。 |
| 训练数据 | 训练时喂进去的全部文本、图片与代码。 | 语料里没有的,它只能靠猜。你们的内部概念就属于这一类。 |
| 参数量 | 模型内部权重的数量,写成 7B、70B。 | 跟聪明程度不是一回事,跟上下文长度更是毫无关系。 |
| 温度 | 控制抽样随机性的旋钮:低就稳,高就野。 | 要稳定输出就调低。默认值往往不是你要的那档。 |
| 推理模型 | 回答前先生成一大段思考过程,再给结论。 | 难题上更准,但那段思考也要按输出价计费。简单任务上纯属浪费。 |
| 开源模型 | 权重公开、可以自己部署的模型。 | 买到的是可控,不是便宜。中小规模自部署往往更贵。 |
③ 吐出来 —— 输出与它的边界
| 名词 | 一句话是什么 | 为什么你要关心 |
|---|---|---|
| 幻觉 | 把不知道的部分用最像的内容补上,语气和真话一样。 | 机制的必然产物,不是 bug。只能防,不能等它被修好。 |
| 知识截止 | 训练语料的最后时间点,之后的事一概不知。 | 凡是涉及「最新」的功能,都得由你把最新信息喂进去。 |
| 多模态 | 能读图、音频、视频的模型,这些能力多半是后来加装的。 | 小字、表格线、精确坐标是高发失败区。 |
④ 动手 —— Agent 这一侧
| 名词 | 一句话是什么 | 为什么你要关心 |
|---|---|---|
| Agent | 能自己决定下一步、并调工具去做的一套程序。 | 它不是更聪明的模型,是模型外面那层循环和权限。 |
| 工具调用 | 你给它工具说明书,它输出调哪个、参数是什么,由你的代码执行。 | 工具给到哪,它的能力边界就到哪。 |
| Agent 循环 | 想一步、做一步、看结果、再想,反复到收敛。 | 成本和延迟按轮数翻倍。不收敛的循环是最贵的故障。 |
| Skill | 一包写好的知识和流程,用到时才加载。 | 把「每次都要交代一遍」的经验固化下来,平时还不占窗口。 |
| MCP | 让 Agent 接外部系统的标准接口协议。 | 接一次多处可用。选第三方 MCP 要当成开权限来审。 |
| 多 Agent | 把任务拆给几个各管一摊的 Agent,再合并结果。 | 确实更稳,但上下文要复制好几份,成本涨得很快。 |
| 提示注入 | 它读到的资料里藏了一句指令,它照做了。 | 模型分不清指令和数据。原理层面的漏洞,靠提示词补不上。 |
| API / 网页版 | 一个给程序调用,一个给人使用。 | 数据留存策略、可控参数、计费方式都不同。谈合规先分清这两个。 |
听不懂时问哪一句
还有一件事得说明白:**这些词的边界在业内本来就不统一。**同一个「Agent」,供应商、工程师、报道里读到的,经常不是一回事。有人管带工具的对话框叫 Agent,也有人非要能跑几十轮才算。
所以真正管用的不是背定义,而是在会上追问:**「你说的这个,具体是指哪一步?」**让对方把它落到上面四段里的某一段。大部分误会在这一句里就解掉了。
如果只带走一句话:*模型只会预测下一个词,其余所有名词,都是人们为了绕开这个限制而发明出来的东西。*知道每个词在绕哪个限制,就不需要记它的定义。
