做产品 PMaker 首页
搜索
跟随系统
颜色主题
空格的键盘
搜索引擎:给你位置;大模型:给你结论搜索引擎原文一直在,建索引、匹配、排序,返回「在哪一页」点开就能核对出处大模型语料被压成权重,凭统计规律重新组装答案会记串、有截止日、没有出处联网检索先搜几段真实原文塞进上下文,再基于它们生成有出处了,但它仍然是在生成要事实、要出处用搜索;要转换、要重写用模型

搜索返回的是「东西在哪」,模型返回的是「东西是什么」。前者可以点开核对,后者只能你自己去查。

大模型与搜索引擎的区别

搜索给你书架,它给你结论。凭记忆回答,就没有出处可查。

搜索给你书架,它给你结论。凭记忆回答,就没有出处可查。

搜索引擎替你找到东西放在哪一页,模型直接从记忆里说出它认为的答案。同一个问题,两种交付物。

你会遇到的现象:

  • 它给了一个看起来很权威的数字,但你搜遍全网找不到出处
  • 它把两个相似产品的功能说混了,两边的描述都对,就是配错了对象
  • 你让它「给个链接」,它给了一个格式完美但打不开的网址

差别在哪一步

搜索引擎干活时,原文一直在。它做的是建索引、匹配、排序,最后把「这段话在哪个文档的哪个位置」还给你。你点开就能看到原句,作者是谁、什么时候写的,一目了然。

模型不是这样。训练结束之后,语料就被扔掉了,留下的只有一堆权重。这堆权重记住的不是「哪句话出现在哪」,而是「什么样的内容后面通常跟什么样的内容」。它是把语料的统计规律压缩进了参数,不是把语料存进了硬盘。

所以「它记得那篇论文」这句话本身就不准确。它记得的是那类论文里常出现的说法、结构和术语搭配。回答的时候,它是把这些东西重新组装出来的,不是调出来的。

凭记忆的三个后果

  • **会记串。**权重里没有「这条信息属于哪一篇」这种标记,相似的内容会互相污染。两个同类产品的定价、两个同名 API 的参数、两个相邻年份的数据,最容易被串到一起。而且串了之后,它照样答得很顺。幻觉研究把这类失败模式描述得很完整,值得读一遍。hallucination-survey
  • **有知识截止日。**权重固定在训练结束那一刻。之后发布的版本、改过的接口、换过的政策,它一概不知,但它会用截止日之前的模式往下推,推出一个听起来很合理的错答案。
  • **没有出处。**这一条最要命:它给不出出处,但能编出出处。链接的格式、论文的作者和年份、条款的编号,这些都是有强统计规律的东西,编起来毫无难度。凡是它主动给的引用,默认都要当成待核实。

联网之后呢

现在很多产品会先搜再答。这确实解决了一部分问题,但要清楚它解决的是哪一部分。

联网检索做的是:把几段真实原文塞进这一次的输入里,让模型基于这几段来写。这就是 RAG(检索增强生成),和那篇把名字定下来的论文讲的是同一套做法。rag-paper **好处是有了出处,坏处是它仍然是在生成。**检索到的几段原文如果不全,它照样会用记忆去补;如果检索到的内容互相矛盾,它会挑一个顺的说法圆过去。

所以看到带引用的回答,仍然要做两件事:一是点开链接确认这个链接是真的,二是确认引用的那句话真的在那个页面里。第二条比第一条更常出问题——链接是真的,但那句话是它自己加工过的。

还有一个产品上的判断:**需要出处的场景,检索这一层要你自己控。**不要把「去哪儿找资料」也交给模型自由发挥,而是明确限定它能用哪些库、哪些文档、哪个时间范围。范围一收窄,答案的可核实性会立刻上一个台阶。

参考资料

  1. Survey of Hallucination in Natural Language Generation — arXiv
  2. Retrieval-Augmented Generation for Knowledge-Intensive NLP Tasks — arXiv