训练数据从哪来
训练数据的构成,决定了它偏向谁、缺哪一块。
训练数据的构成,决定了它偏向谁、缺哪一块。 它的能力不是凭空来的,是语料的形状。哪一类文本多,它在哪一类上就强;哪一类没有,它在那一块就只能编。 你会遇到的现象:
- 让它写 React 代码又快又准,让它写你们内部框架的代码全是瞎编
- 问英文技术问题答得很好,同一个问题换成中文答案明显变浅
- 它默认给出的方案总是最主流的那一种,冷门但更合适的选项它想不到
语料里有什么
各家配比不公开,但大结构是清楚的:网页占大头,书和论文占一块,代码占一块,对话和问答占一块。后面还有一轮人工标注的偏好数据,那一轮决定的是它说话的姿态,不是它的知识。
- **网页给了它广度。**百科、论坛、新闻、博客、商品页。什么都懂一点,但也把网上的错误、过时信息、营销话术一起吃了进去。它说的「业界最佳实践」,很多时候只是被写得最多的那种说法。Common Crawl 这类公开爬取语料,就是网页部分的常见来源。commoncrawl
- **书和论文给了它长程推理。**连贯几千字的论证、层层递进的结构,只有长文本里才有。这部分数据受版权限制,实际拿到的比你想象的少,这也是为什么它在通俗话题上比在专业深水区靠谱得多。像 The Pile 这种公开语料,已经是最用心的组合尝试。pile
- **代码给了它结构感。**代码强不只是因为它能写代码。有严格语法、能被机器判对错的文本,训练价值特别高。它能稳定吐出合法 JSON、能照着格式填表,很大程度上是代码语料喂出来的。
- **对话给了它说人话的能力。**也顺带给了它顺着你说的毛病。你说「是不是这样」,它倾向于说「是的」——这不是它懂了,是这种回答在语料和标注里被奖励得更多。
于是它偏向谁
语料不是世界的均匀采样,是「有多少人把这件事写到网上」的采样。写得多的,它熟;写得少的,它生。这个偏差是系统性的,落到具体场景里就是这几条:
| 语料里多的 | 语料里少的 | 对你的影响 |
|---|---|---|
| 英文 | 中文,以及更小的语种 | 同一问题换语言问,深度不一样 |
| 流行框架、大厂技术栈 | 小众方案、国内自研工具 | 它默认推荐的未必最合适 |
| 面向大众的通俗解释 | 行业内部的真实做法 | 答案听着对,落地全是坑 |
| 成功案例、正面叙述 | 失败复盘、负面细节 | 它对风险的估计天然偏乐观 |
最后一行做产品时要特别留意:让它评估一个方案,它给的往往是这个方案在网上被宣传的样子,不是它在真实项目里的样子。斯坦福 AI Index 每年做的数据统计也印证了这一点:语料的语言和领域分布,直接决定模型在哪类任务上表现好。stanford-ai-index
应对的动作很朴素:**把「用哪一套」这个判断从它手里拿回来。**不要问「该用什么方案」,而是告诉它用哪个方案,让它在这个约束下干活。它擅长的是执行你定的路线,不是替你选路线。
缺的那一块
还有一整块东西从来没有进过语料:你公司的内部文档、你们的业务口径、没公开的行业数据、客户名单、上周才改的流程。这些不是「它了解得不够」,是它一次都没见过。
危险在于,**它对「没见过」和「见得少」的反应是一样的:照样给你一个答案。**问它一个只有你们内部才知道的字段含义,它会根据字段名的字面推一个出来,语气和它答一个真懂的问题时毫无区别。
所以这一块只能靠你补进去,途径就三条:写进提示、挂检索、给工具让它去查。**选哪条取决于这块知识有多大、多久变一次。**几百字的固定口径,直接写进提示;几百页会更新的文档,挂检索;实时变化的数据,给工具。
最后一条判断:如果一个场景里,正确答案完全依赖语料里没有的信息,那这个场景不该由模型直接回答,应该由你的系统把信息取出来、再让模型做加工。分不清这一点,做出来的功能一定是幻觉重灾区。
