大模型与搜索引擎的区别
搜索给你书架,它给你结论。凭记忆回答,就没有出处可查。
搜索给你书架,它给你结论。凭记忆回答,就没有出处可查。
搜索引擎替你找到东西放在哪一页,模型直接从记忆里说出它认为的答案。同一个问题,两种交付物。
你会遇到的现象:
- 它给了一个看起来很权威的数字,但你搜遍全网找不到出处
- 它把两个相似产品的功能说混了,两边的描述都对,就是配错了对象
- 你让它「给个链接」,它给了一个格式完美但打不开的网址
差别在哪一步
搜索引擎干活时,原文一直在。它做的是建索引、匹配、排序,最后把「这段话在哪个文档的哪个位置」还给你。你点开就能看到原句,作者是谁、什么时候写的,一目了然。
模型不是这样。训练结束之后,语料就被扔掉了,留下的只有一堆权重。这堆权重记住的不是「哪句话出现在哪」,而是「什么样的内容后面通常跟什么样的内容」。它是把语料的统计规律压缩进了参数,不是把语料存进了硬盘。
所以「它记得那篇论文」这句话本身就不准确。它记得的是那类论文里常出现的说法、结构和术语搭配。回答的时候,它是把这些东西重新组装出来的,不是调出来的。
凭记忆的三个后果
- **会记串。**权重里没有「这条信息属于哪一篇」这种标记,相似的内容会互相污染。两个同类产品的定价、两个同名 API 的参数、两个相邻年份的数据,最容易被串到一起。而且串了之后,它照样答得很顺。幻觉研究把这类失败模式描述得很完整,值得读一遍。hallucination-survey
- **有知识截止日。**权重固定在训练结束那一刻。之后发布的版本、改过的接口、换过的政策,它一概不知,但它会用截止日之前的模式往下推,推出一个听起来很合理的错答案。
- **没有出处。**这一条最要命:它给不出出处,但能编出出处。链接的格式、论文的作者和年份、条款的编号,这些都是有强统计规律的东西,编起来毫无难度。凡是它主动给的引用,默认都要当成待核实。
联网之后呢
现在很多产品会先搜再答。这确实解决了一部分问题,但要清楚它解决的是哪一部分。
联网检索做的是:把几段真实原文塞进这一次的输入里,让模型基于这几段来写。这就是 RAG(检索增强生成),和那篇把名字定下来的论文讲的是同一套做法。rag-paper **好处是有了出处,坏处是它仍然是在生成。**检索到的几段原文如果不全,它照样会用记忆去补;如果检索到的内容互相矛盾,它会挑一个顺的说法圆过去。
所以看到带引用的回答,仍然要做两件事:一是点开链接确认这个链接是真的,二是确认引用的那句话真的在那个页面里。第二条比第一条更常出问题——链接是真的,但那句话是它自己加工过的。
还有一个产品上的判断:**需要出处的场景,检索这一层要你自己控。**不要把「去哪儿找资料」也交给模型自由发挥,而是明确限定它能用哪些库、哪些文档、哪个时间范围。范围一收窄,答案的可核实性会立刻上一个台阶。
