做产品 PMaker 首页
搜索
跟随系统
颜色主题
空格的键盘

Think product. Make products.

探索 AI 时代,
产品如何被构想、设计与实现。

AI 让更多人能把想法做成产品。做得越快,越要想清楚做什么、怎么做、做完之后怎么改。

基础认知

先建立共同语言和行业坐标。知道 AI 从哪来、发展到哪一步,以及产业链上的角色各自做什么。

1建立坐标先看懂名词、历史与当下
名词不是零散的一堆,它们各自长在一次调用的某一段上把东西装进去系统提示、历史对话、检索到的片段、用户这句话,一起装进按 Token 计量的上下文窗口。模型开始算唯一的机制是预测下一个词,反复几百次写完一段回答。能力上限在训练时就定死了。把字吐出来现场生成,不是查库。遇到不知道的地方会用最像的内容补上——这就是幻觉。它想动手输出工具调用,由你的代码执行,结果塞回第一段继续算,转起来就是 Agent 循环。
01

AI 名词地图

把高频名词放回同一张地图:它是什么、解决哪一段问题、和你有什么关系。

每一代的分界线,是「哪一段还得人来干」一条一直在移的线每个时代的 AI 都由「人来干的一段」和「机器自己学的一段」拼成。技术进步就是这条分界线往右挪,动力一直是人干的那段干不完了。四次转移人写规则(专家系统)→ 机器学习学统计 → 深度学习自己学特征 → 先训一个底座、靠提示词改用途。瓶颈从来没消失,只是换了位置。六个节点1950 图灵、1956 达特茅斯、1970s–80s 专家系统、2012 AlexNet、2016–17 AlphaGo 与 Transformer、2022 起对话式大模型。对做产品的三个提醒能力进步不等于可靠性进步;旧范式各就各位;每次扩张换一个新瓶颈——高质量上下文、可验证反馈、可控行动边界。
02

AI 发展简史

从符号规则、机器学习到大模型。每次范式变化,究竟换掉了什么。

我们默认「难的做得到,简单的当然也做得到」——对模型不成立已经好用改写、摘要、翻译、抽取、代码补全、草稿;当副驾驶用有条件可用知识问答、文档分析、受控工具调用、短流程 Agent;配评估与人工兜底仍需谨慎无人值守、高风险审批、医疗法律结论、开放网页操作;关键动作人工确认决定档位的是后果,不是技术
03

AI 目前到了哪一步

今天已经稳定可用的、仍在快速变化的,以及演示很好但落地还不稳的。

你的产品站在哪一层,就决定了你的成本结构和护城河应用层直接面对终端用户。离钱最近,但技术门槛最低中间层模型平台、向量库、Agent 框架。靠降低接入门槛收钱模型层训练并出售模型。烧钱最猛,价格战最凶算力层芯片与云。供给紧、替代难,定价权最强每一层都是下一层的客户,钱从上往下流
04

AI 行业的四层

算力、模型、平台与应用。看懂每层卖什么、向谁付钱、壁垒在哪里。

榜单三个月就翻一遍,这六条不会① 任务表现在你那类任务上的准确率与稳定性20–50 条真实样例,同套提示词各跑一遍,人工判对错② 真实成本一次完整调用的钱,不是每百万 token 单价用真实请求量,算上输入、输出和多轮重发③ 稳定性与合规限流额度、超时率、数据出境、能否签协议让法务看数据处理条款,别看营销页④ 可替换性换掉它要改多少东西、提示词要重调多少选两个而不是一个,备用的接入要真跑通过用你自己的任务去量,这份表下个季度还能接着用
05

主流模型厂商的差异

不背厂商排名,按能力、成本、生态、部署和合规做一次真正的选型。

同一个模型,五条路能拿到。差别不在能不能用,在出事时找谁你的产品模型调用封装在你自己的一层里官方 API最快用上新版,限流与 SLA 最明确,出事有官方支持云厂商平台合同、发票、合规资质齐全,正式上线最省事聚合平台一个 Key 调多家,横向对比和快速切换最方便自建网关官方价格加统一管理,代价是自己运维一层API 中转站价格诱人,但数据要过手陌生第三方,风险不匹配把模型调用封在自己一层里——换渠道这件事迟早会发生
06

从哪里拿到模型

官方 API、云平台、模型社区与聚合服务,控制权和责任边界各不相同。

2看懂行业谁提供算力、模型、平台与应用

大模型

大模型的运作原理。从「预测下一个词」这一条机制,推出它全部的本事和全部的毛病。

1认识先看清大模型在做什么
一次生成,它只做这一件事读序列把已有的整段文字全部读进来算分布算出下一个 token 的概率分布抽样按概率抽一个,不是选概率最高的那个接上重来把抽中的接在序列尾巴上,从第一步重来让它多说几句,等于让它多算几轮
01

大模型的运作原理

每次只预测下一个词,这就是全部。所有本事和所有毛病都从这里长出来。

搜索引擎:给你位置;大模型:给你结论搜索引擎原文一直在,建索引、匹配、排序,返回「在哪一页」点开就能核对出处大模型语料被压成权重,凭统计规律重新组装答案会记串、有截止日、没有出处联网检索先搜几段真实原文塞进上下文,再基于它们生成有出处了,但它仍然是在生成要事实、要出处用搜索;要转换、要重写用模型
02

大模型与搜索引擎的区别

搜索给你书架,大模型给你结论。凭记忆回答,就没有出处可查。

训练只发生一次,推理每次调用都发生——费用和能力的边界就在这条线两边训练拿海量文本一遍遍猜下一个词,重复几万亿次:几个月、上万张卡能力、语言、风格都在这里定死,你基本碰不到推理把输入喂进权重算一次答案:几秒、几分钱,每次调用都重来提示、上下文、温度、工具全在你手上,九成工作量在这微调在已有权重上用少量数据再训一轮:改风格、格式、领域口径介于两者之间,先别急着用「训练一个我们自己的模型」这句话,九成情况真正要的是推理侧的事
03

训练与推理的区别

一个是喂出来,一个是用起来。费用和能力的边界都在这条线两边。

训练语料的大致构成(各家配比不同,量级大体如此)网页百科、论坛、新闻、博客、商品页,占大头给了广度,也吃进了错误、过时信息和营销话术书和论文连贯几千字的论证和结构受版权限制,实际拿到的比想象的少代码有严格语法、能被机器判对错的文本喂出了结构感,也喂出了稳定输出 JSON 的能力对话与问答给了它说人话的能力也给了它顺着你说的毛病你的内部数据公司文档、业务口径、客户名单、最新流程一次都没进过语料,只能靠你补语料决定它偏向谁、缺哪一块
04

训练数据从哪来

语料的构成,决定了模型偏向谁、缺哪一块。

六种模型,六个不同的计费单位文本模型文字进、文字出,按 Token 计费,输出比输入贵几倍最熟的一种,绝大多数 AI 功能的主力图片 / 视频按张、按秒计费,跳档式涨价,一次视频可能顶几百次文本调用成本最高的两类,预算要单独算语音 TTS / ASR按字符数、按音频时长计费,和 Token 无关时长相同,说多说少价钱一样向量模型把「意思」变成坐标,不生成内容,语义检索的地基六类里最便宜的,便宜一两个数量级估成本时六类必须分开算——任何一项用错单位,整个预算就废了
05

模型的六种类型

文本、图片、视频、语音合成、语音识别、向量。输入输出和计费单位各不相同。

同一个问题,两种模型的处理过程:多写就是多算普通模型直接预测下一个词,一步跳到结论,快、便宜、延迟稳多步任务容易错,因为没有中间的修正机会推理模型先显式写出一长段推演,拆解问题、列中间步骤,再作答多步任务更稳,但慢、贵,延迟还不可预测要不要开推理,取决于任务是否需要多步推演
06

推理模型与普通模型

深度思考是先生成一段推理再作答。什么任务值得多花那份钱。

「开源模型」四个字,开的是中间那一块——权重开的是什么训练数据、权重、训练配方,通常只公开权重你能用,但复现不出、查不到它学过什么许可证公开不等于随便用:商用、规模限制、衍生模型归谁别看宣传页,去读许可证原文自部署的账显卡、机房、运维、并发,大部分是固定成本调用量不大时,单位成本比 API 贵得多开源卖给你的是控制权,不是便宜
07

开源与闭源

权重公开意味着什么,什么时候自己部署才划算。

同一段 strawberry,你看到字符,模型看到 token——切分单位既不是字,也不是词你看到的strawberry 是 10 个字符,r 出现 3 次,一眼能数清以为模型也能数清字数、拼写、字符模型看到的同一段被切成 str、aw、berry 三个 token,字母封在里面看不见数不清字数、数学不稳、字符级任务全吃力很多「模型怎么连这个都不会」的时刻,根都在这条错位上
08

Token 与计费单位

大模型不按字数收费。中英文的差价,就是从切分方式来的。

三个经常被混为一谈的数字,其实互不相干参数量模型里权重的个数,决定能力的上限不决定这次任务做得好不好;多数模型已不公布上下文长度一次请求能装多少 token装得进不代表用得上,中间段会被忽略跑分在标准题库上的正确率题库可能泄漏进训练集,题型和你的场景对不上真正该看的第四个数字:拿你自己的 20 条真实用例,让候选各跑一遍
09

参数量与跑分怎么看

参数、上下文长度、跑分,是三件不同的事,别混着看。

同一个候选分布,温度只改变它的形状——每一根柱子是一个候选 token低温把分布拉尖,只在最有把握的几个候选里选输出保守、重复、安全,几乎每次一样高温把分布压平,长尾候选被抬起来说法更新鲜,但胡说的概率同步上升创造力和可靠性是同一个旋钮的两端,没有两全
10

温度与随机性

同一个问题每次答案不同,是设计出来的,不是故障。什么时候该关掉。

一次调用只需要三样东西——换厂商时,通常只改前两样一次模型调用往哪发 · 用哪个 · 算谁的钱base_url「往哪发」:模型服务的地址,官方、云平台或自建网关各有各的填法模型名「用哪个」:一串标识符。生产环境要钉到具体版本,小心 -latest 别名API Key「算谁的钱」:身份凭证兼账单归属,绝不能出现在前端接入本身不复杂,复杂的在接入之后:控成本、处理失败、验收质量
11

调用一个模型需要什么

base_url、模型名、API Key 三件套。为什么大家都兼容 OpenAI 格式。

参数不用全记,按它管哪一段来分就清楚了调用参数按作用分三类管「说什么」system、temperature、top_p管「说多少」max_tokens、stop管「怎么给」stream、response_format、seed默认值几乎从来不是你要的那一档——每上线一个功能,这三类都该过一遍
12

常用调用参数

max_tokens、top_p、stream、system,每个参数在产品上意味着什么。

不是所有请求都值得用最贵的那个模型按任务分档轻、中、重三档,多数时候按功能入口静态分配就够简单功能走贵档,账单虚高主备降级主模型挂了自动切备用,备用要定期真实跑一遍备用从没验证过,切过去才发现格式对不上固定用例验证留一组固定测试用例,每次换模型都跑一遍并排比只靠感觉,效果掉了都发现不了封装成一层分档、降级、校验都发生在你自己那一层封装里业务代码散落各家 SDK,每一件事都会变贵限流、超时、某天下线一个版本——这是常态,不是意外
13

选型与降级

按任务分档配模型,主模型挂了怎么自动退到备用。

它没有「我不知道」这个默认选项为什么必然发生每一步都在从候选里抽 token 接上去,没有任何环节检查「这句话是不是真的」。它没有「不知道」状态,越有规律的内容越好编,后训练放大自信,还会顺着你的假设说。最容易出现的地方冷门专业话题、具体数字日期版本号、引用链接出处、训练截止之后的事、你们内部的概念、长回答的后半段。防的四个动作限定来源、要求出处、交叉验证、让「不知道」成为合法答案。把校验责任放在你的系统里,不放用户的警惕心上。
14

幻觉产生的原因

幻觉是生成机制的必然产物,不是 bug。所以只能防,不能修。

模型知道的世界,停在某一个日期截止日是什么训练语料在某个日期停止收集,之后还要训练、评估、内测才发布。你拿到的模型,知识比今天旧一大截,甚至比发布日还旧几个月。为什么讲错还很自信「不知道」在模型那里不是状态。截止日之后它没有记忆,但有大量这类事情的规律,于是按规律外推:版本加一位、惯例照抄。推出来很合理,只是不是真的。怎么把今天塞给它凡是会过时的信息都由你提供:日期写进系统提示、事实先检索、实时数据走工具、版本钉死。别指望它记得。
15

知识截止日期

大模型不知道昨天发生了什么,除非你把昨天塞进去。

图片是被切碎、编码,然后接进同一条序列的缩放图片先被缩放到模型能接受的尺寸细节上限在这一步就定死了,小字先糊切块切成 patch,每一块交给视觉编码器变成向量映射拼接向量映射成和文字 token 同空间,接进文字序列一起进模型继续生成模型不再区分文字和图片,照样一个接一个猜下一个 token文字理解的毛病,读图时一个不少对精度有硬要求,别用通用模型——专门的 OCR 又准又便宜
16

多模态:图片怎么被读懂

多模态是后来加装的。加装的方式决定了模型能看多细。

2种类有哪几种模型,各管什么
3度量按什么计费、按什么衡量
4接入怎么调用、配置与降级
5边界哪些地方一定会出事

提示词工程

提示词不是咒语,是需求文档。写清楚一分,它就多做对一分。

1认识提示词到底是什么
提示词做的事,是把「它可能写出的东西」这个范围收窄只说「写篇文案」写给谁、什么产品、多长、什么语气,全没说它只能按训练语料里最常见的样子选,得到一段通用文案+ 给老用户看排除掉所有面向新用户的写法范围开始收窄+ 不超过一百字长度定了,结构也就定了大半范围继续收窄+ 不要感叹号、不要营销腔剩下的可能性已经很接近你要的了「请认真思考」这类话一寸都没收窄提示词工程不是找神奇句式,是系统地把该说的都说清楚
01

提示词不是咒语

它是需求文档。你没写清的地方,模型一定会自己补一个。

四个部件,各自防住一种典型的跑偏提示词四个部件,缺一不可背景给谁的、什么场景;缺了它,产出放之四海而皆准要求具体要它做出什么;缺了它,它挑最常见的解释限制不许做什么;缺了它,它自由发挥甚至编造验收什么样算做完;缺了它,格式每次都不一样缺哪一段,就在哪一段上跑偏
02

提示词的四个部件

背景、要求、限制、验收。缺哪一段,就会在哪一段上跑偏。

每次请求发过去的都是一整条序列,不只是用户刚说的那句系统提示每次都成立的东西,每轮重发,固定前缀可命中缓存混入动态内容会打碎缓存历史对话user 和 assistant 轮流累加,工具结果也塞在这里Agent 场景膨胀得最快最新一条本轮请求和材料,动态内容都放这一层用户可控内容绝不能拼进系统提示固定内容放前面,变化内容放后面
03

系统提示与用户提示

哪些话该每轮都带,哪些话只说一次,优先级不一样。

同样的内容,两种写法在模型眼里的差别一整段话边界信息全丢,哪里换话题、哪几条并列、哪段是材料,全靠模型猜提示词越长越杂,猜错的概率越高分节结构化标题、列表、围栏把边界标清楚哪段是指令、哪段是材料,一目了然结构本身就是信息,不是审美
04

为什么用 Markdown 写提示词

结构化的文本,模型解析得更准。这不是审美问题。

一个例子里,藏着你说不出口的那些要求形容词压缩过的信息,每个人解压出来不一样。你说「专业」,模型按语料里最常见的写法取平均值写十个,它拿到的还是平均数示例一条输入配一条输出,同时携带长度、语气、称呼、结论顺序等全部隐含要求给一个,它拿到的是全部细节陷阱例子的偏差会被放大;分类任务有顺序和比例效应;例子多了没人敢动保持多样性、均衡比例、每条例子附注释例子该来自真实数据,不该是你现编的
05

给例子比讲道理管用

少样本示例的用法与陷阱:给几个、给什么样的、什么时候反而有害。

三层手段,可靠性依次上升——程序要读的输出,别只靠第一层① 提示词请求写清格式、给格式样例,可靠性约九成剩下的那成,放到线上就是每天几百次失败② 接口强制response_format 加 schema,在生成层面约束输出只保证语法合法,不保证内容正确③ 自己校验重试、降级、明确拒绝,把解析失败率做成监控这一层不能省,哪怕前两层都上了三层是叠加,不是三选一
06

控制输出格式

从「请返回 JSON」到强制格式,以及流式输出时的取舍。

四个技巧,四种机制——知道原理才知道什么时候该用高杠杆技巧各治一种病先反问需求说不清时,让它先问 3 到 5 个问题再动手参考锚定用具体对照物代替形容词,细节不丢失先想再答显式写出分析步骤,等于多几次纠错机会角色设定只调语气和措辞,不调能力与准确率技巧不是万能咒语,场景匹配才有效
07

几个高杠杆技巧

让它先反问、参考锚定、先想再答、角色设定真正起的作用。

同样是「改提示词」,两种做法的差别凭感觉调改完试一条,感觉好了就上线另一类输入变差,说不清是哪一句改坏的用样例迭代固定测试集,一次只改一处,全套跑分每次改动有依据,能回滚、能定位先有尺子,再谈调
08

提示词怎么迭代

一次只改一处,留一组测试样例。凭感觉调是调不出来的。

同样一句「不要编造数据」,两种存放方式走向不同的命运拼在代码里四个文件四种写法,有一条当初忘了加没人敢删、改一处漏三处、想回滚找不到上一版集中管理定义一处、各处引用,改动能单独 diff改一次全站生效,能跑样例、能回滚、能追责提示词是资产,不是字符串
09

提示词的沉淀与版本

散落在代码里的提示词,迟早会变成没人敢动的一坨。

2写法让它稳定听懂
3迭代从能用到稳定

上下文与 RAG

大模型没有记忆。先看清检索是怎么找到东西的,再谈怎么把它装进有限的窗口。

1检索机制机器怎么判断「意思接近」
把每句话放到一张地图上,找答案就变成了「找最近的邻居」它解决了什么关键词搜索是字面匹配,「退款」「退钱」「不想要了」字面零重合、意思是一回事。向量不看字面看意思,转成坐标后意思相近的靠得近。怎么变成坐标的专门的向量模型把文字变成几百到几千维的数字。坐标从海量文本里训练出来:常出现在相似语境的词句,坐标被拉近。距离算余弦相似度。产品上意味着什么文档先离线切段、逐段算向量入库;文档更新要重算;换向量模型等于全部重算。查询时只给问题算一次向量,然后比距离,很快。几个要知道的限制算的是「像不像」不是「对不对」;对否定不敏感;精确匹配是弱项;长文本会被稀释。
01

向量与语义相似度

把一句话变成一串坐标,意思相近的靠得近。整套检索都建在这上面。

用户问:「我买的东西七天了还能退吗?」——相似度前三名目录页标题全是「退货」「常见问题」,用词高度重合,分数最高只有标题没有正文,一句有用的话都没有反向条款「本类目不支持七天无理由退货」,用词几乎和问题一样说的是「不支持」,模型可能据此答反正确答案真正能回答的那段,排在第三名只取前两名,它根本到不了模型眼前相似度衡量「像不像」,重排才判断「能不能回答」
02

相似不等于相关

算出来最像的那几段,未必能回答你的问题。这是检索最大的误差来源。

两种找法的强弱几乎互补——所以实际系统都混着用关键词检索看字面重合:订单号、型号、法条编号、人名、新词都能精确命中换个说法就漏:用户说「不想要」,文档写「退货」,零重合向量检索看意思接近:同义改写、口语提问、概念相近都能找到精确串、否定词、新词全不灵,它擅长「差不多」混合检索两路各召回一批,合并去重,再统一排序几乎总比单一检索好,企业知识库尤其明显只上一种,等于主动放弃一半召回能力
03

关键词、向量与混合检索

三种找法各有各的盲区,实际系统几乎都是混着用。

这张台面上摆的所有东西,加起来不能超过窗口上限上下文窗口一次请求的全部内容系统提示产品的设定和规则,每轮都要重发历史对话之前所有的来回,持续增长检索资料RAG 塞进来的文档片段,往往是最大的一块用户输入本次提问和附带的材料输出额度最常被忘的一块——输出也占窗口先给输出留足额度,剩下的才是输入能用的
04

上下文窗口

一次请求能装下的全部内容,就这么大一张台面。

同一条关键信息放在不同位置,它被用上的概率不同开头主题、设定、任务目标被正确用上的概率高中间展开、铺垫、背景资料随上下文长度增加,越来越容易被忽略结尾结论、当前焦点、最新指令被正确用上的概率高重要的放两头,关键约束重复一次,长任务拆开做
05

上下文中段丢失

开头和结尾看得最清楚,中间那段随长度增加逐渐失焦。

对话长到装不下时,三种处理方式——丢掉的东西不一样直接截断丢掉最早的几轮,保留最近的最早几轮往往最重要,丢了之后模型就开始漂移摘要替换把前面 N 轮总结成一小段,替换原文比截断好,但有损,且摘要本身可能总结错分层保留硬约束留原文,中间过程做摘要,最近几轮留原文多做一点工,但稳定性差别很大该记死的记死,该模糊的才模糊
06

对话压缩

聊长了会自动丢内容。丢的通常正是早期定下的约束。

所谓「它记得我」,其实是你的系统在替它存和取提取对话结束时,用一个模型调用挑出「以后还用得上」的信息记太多,记忆库很快塞满琐事存储写进记忆库并处理冲突:新记忆和旧记忆矛盾时,更新而不是追加分不清「临时」和「长期」,是最容易出错的地方注入新会话开始时取相关几条拼进系统提示,模型就表现成「还记得我」用户愿意主动告诉你的信息,做成设置项,别让 AI 去猜
07

长期记忆的实现方式

提取、冲突、注入。让模型认识你,代价是什么。

先检索再回答——模型不用重训,就能知道它没学过的事建库文档切段、每段算向量、存进向量库,文档更新时做一次切分质量决定检索上限检索把问题转向量,在库里找最相关的几段成熟做法是混合检索加重排拼上下文片段、问题、约束组装成一次请求材料地位、摆放位置都决定成败回答模型基于材料作答,并标明出处有出处,错误才可发现RAG 不是模型,是一套工程流程
08

RAG:知识库的三步

先检索再回答。三个环节,以及它到底解决了什么。

同一份政策文档,三种切法三种命运切得太碎条件和例外被拆到两段,例外召回不到自信、有出处地答错,测试还难覆盖切得太大几个主题压成一个坐标,哪个都不突出什么问题都能召回一点,什么问题都不够准按结构切一段说完一件事,条件带例外检索的最小单位正好是一个完整意思切出来的片段,就是检索能返回的最小单位
09

切分:RAG 成败的第一步

切得太碎丢上下文,切得太大稀释重点。这一步定生死。

答错了先别改提示词——按这个顺序往前查,多数问题在前两环库里有吗直接搜关键词,把原始片段调出来看很多「答错」是文档压根没写被召回吗把本次召回的全部片段打日志正确那段可能压根没进召回排第几排第 18 名而只取前 5,等于没召回这是重排的问题材料对还错手动贴片段和问题再试一次只有这一步错,才轮到改提示词前三环出错时改提示词,纯属白费力气
10

RAG 答不准的三个环节

切分、召回、重排,每一环都会掉链子,各有各的症状。

一句话分清:微调教「怎么说」,RAG 给「说什么」微调改的是模型本身:拿一批「输入—输出」样本继续训练,调整内部权重,改变输出倾向适合固定格式、风格与领域表达;补不了知识、没有出处、更新慢、可能损伤原能力RAG改的是给它看的材料:模型一个字节没动,只在提问时把相关资料递到眼前补知识、可标引用、更新快;但不改变说话方式缺知识用 RAG,不对味先试提示词,最后才考虑微调
11

微调还是 RAG

要补知识几乎总是 RAG。什么时候才真的需要微调。

2上下文工程把资料装进有限的窗口
3知识库 RAG把检索和上下文接起来

Agent 与 Skill

从聊天到办事,中间加了工具调用、循环、Skill 与 MCP 这几层。

1认识从聊天到干活,差在哪
「AI」不是一个东西,是三层叠在一起的东西应用界面、流程、权限、数据、文案——用户只看得见这层Agent工具、循环、记忆、Skill、权限边界——让模型能动起来模型只做一件事:根据输入预测下一个 Token模型只背「材料都对还答不好」这最后一口锅
01

模型、Agent、应用的分层

一张图分清三层。分不清就会把产品问题当成模型问题。

模型的「调用」其实是一次请求——真正执行的是你的代码① 发工具清单你的代码把每个工具的名字、参数结构、用途说明发给模型说明写得好不好,直接决定模型会不会用对② 写出调用请求模型在回答里输出一段结构化文本,通常是 JSON格式由接口规范决定,本质都是「一段文字」③ 解析并执行你的代码解析请求、校验参数、调用函数、捕获错误参数不可信,校验必须放在执行层④ 结果回流把执行结果或错误信息写回上下文,模型据此想下一步错误不回流,它就会原样重试到卡死四个格子里有三个是你的代码——你写请求,你干活,你把结果还给它
02

工具调用

模型自己什么也做不了。是你把手借给它,它才够得着世界。

想、做、看、再想——每一轮把结果写进上下文看当前上下文,决定调工具还是直接回答执行工具调用,拿到结果结果写回上下文,这一步不能省再想基于多了一轮的信息,决定继续还是收尾循环的全部记忆都摊在上下文里,装得下就记得,被挤掉就失忆
03

Agent 循环

想一下、做一下、看结果、再想。跑几十轮的东西就是这么转起来的。

两个词总被混着用,其实分工很清楚Skill给模型的一份说明:步骤、格式、边界、示例,不碰任何外部系统管「它会不会做事」,改起来就是改文档,零成本MCP一套接口接入标准:把数据库、订单、邮件按统一格式包装起来管「它够不够得着」,解决连接问题,不管会不会用问题出在「不会做事」用 Skill,出在「够不着」用 MCP,多数场景一起用
04

Skill 与 MCP

一个装知识,一个装接口。分别解决什么,别混着上。

拆的收益很诱人,成本也很实在——先算清楚再拆主从主管理解目标、拆任务、派活,执行者各自回报汇总代价:主管成了新的瓶颈和单点流水线按顺序 A→B→C,每步角色单一、可单独评测代价:总时延是各步之和,一步卡住全链卡住对等各自做独立任务,最后汇总比较代价:谁来判、按什么标准判,往往没想清楚单 Agent 没在窗口、角色、并行三处出问题,拆就只是纯成本
05

多 Agent 协作

什么时候值得拆成几个,拆完成本涨在哪一段。

三层提示词,各管一段——混在一起写,迟早互相打架系统提示定义你是谁、全局规则、安全底线,每轮都在最前面不轻易变,变一次影响全局长期规则Skill、记忆、项目规范,按需加载、按场景选用在底线内配置行为,不能覆盖上层临时指令用户本轮真正要什么,短、具体、一次有效只决定做什么,不能改框架本身上层决定能不能,下层决定做什么
06

提示词的分层

系统提示、长期规则、临时指令,各管一段,优先级不一样。

跑偏不是「它变坏了」,是循环在三种地方失去约束目标漂移上下文变长后,模型把「完成子任务」当成了目标拦:写成终点条件 + 固定在高注意力位置 + 允许拒绝延展工具误用工具清单太杂,或被外部内容诱导调错拦:写清工具边界 + 风险工具分级 + 参数校验放执行层循环不收敛失败没带回原因,只能换参数原地打转拦:硬性最大轮数 + 重试带回原因 + 失败收敛策略一切克制都来自你搭的约束,不在模型的自觉里
07

Agent 跑偏的三种形态

目标漂移、工具误用、循环不收敛,各有各的拦法。

给 Agent 的权限要分级——不是「给不给」,而是「给到哪一级」只读查文档、读数据、看代码,错了能重来,放开给 Agent几乎不用拦低风险写写草稿、存临时文件,可自动放行但要留日志错了可回滚高风险写删除、覆盖、发送、付款,默认禁止,需明确授权不可逆,必须把关人工断点超出授权范围或命中高风险清单,停下来等人批准由人做最终决策影响越不可逆,越要靠人
08

权限分级与人工断点

该在哪几步拦一下,才不至于让它把库删了。

测 Agent 不能只看「最后答得对不对」——三层都要看结果层完成度、正确性、副作用;人工打分或强模型辅助,定期人工判过程层工具顺序、重试次数、被拦的动作;读日志自动统计,每次改动跑成本层轮数、Token 总量、时长、调用次数;全自动,高频跑跑完第一遍,最关键的是把记录留作基线——没有基线,之后每次改动都无法对比
09

Agent 评测

不评测就是在裸奔。一份能跑起来的最小验收方案。

2组织给它装能力的几种方式
3失控别让它自己跑太远

成本与安全

Token 账单怎么算、提示注入怎么防、哪一段判断永远不该交出去。

1账单这笔钱到底怎么算
看懂一次调用的账单,只有一行公式输入系统提示、历史对话、检索资料按输入价计费,命中缓存再打折一次调用输入 × 输入价 + 输出 × 输出价输出模型生成的回答通常比输入贵 3–5 倍 比价比的是同任务下跑出来的账单,不是报价单上的数字
01

一次调用的计费构成

输入、输出、缓存三种价,差好几倍。看懂报价表再选模型。

图片不按「一张」计费——按分辨率换算成等效 Token图片怎么计费模型把图片切成若干小块、每块单独理解再拼起来。小块数目由分辨率决定,所以按长边分档,跨过阈值价格跳档。为什么贵贵在理解工作量:像素信息密度低但计算密度高。多图 + 文本一起进,成本涨得更快。省钱的几招按需降分辨率、只发相关部分、裁掉无关区域、批量走低价通道、分清看懂图与生成图是两种计费。
02

生图为什么贵几十倍

图片的 Token 是怎么数出来的,分辨率一调账单就跳档。

前缀缓存:不变的部分打骨折,变的部分原价——把不变的放前面前缀一致固定内容放最前,每次请求保持一致命中缓存一致的部分按折扣价计费,低至输入价的十分之一成本下降典型客服场景输入成本可降 80% 以上把缓存命中率当指标统计,0 提到 80% 是最省力的一笔优化
03

缓存命中与省钱

前缀不变才命中。把提示词的顺序换一下,账单能差一半。

外部内容里的一句话,被模型当成了给它的指令藏入内容网页、邮件、文档里埋一句像指令的话任何能往上下文塞内容的人都做得到混进上下文外部内容和用户请求一起发给模型RAG 检索片段、工具返回都可能带毒当成指令模型分不清指令和数据,很可能照做它只看到 Token,没有内部标记造成后果泄露内部信息、越权执行动作最危险的是「间接注入」,攻击者不直接对话防它靠权限和流程,不靠提示词求饶
04

提示注入

模型分不清哪句是指令、哪句是数据。这是原理层面的漏洞。

同一句话,在不同形态的产品里,去的地方不一样网页版 / App个人产品形态,政策最宽松:对话可能用于改进模型,人工可能抽查部分对话个人用最方便,贴敏感信息最不该用API开发者接口接入,多数主流厂商默认不用于训练,但有留存期限、加密等细节「做个 AI 功能」的默认选择,各厂商条款不同企业版组织商业协议,明确承诺不用于训练、可签保密协议、可约定数据驻留唯一能把数据边界写进合同的形态,合规场景几乎必须走按你实际要用的那个产品去查它的条款,不要类推
05

对话数据的去向

网页版、API、企业版,三种形态的数据去向不一样。

AI 写代码又快又勤,也把三类老毛病写得特别顺手密钥硬编码API 密钥、数据库密码直接写进代码并提交入库一旦上云,密钥等于公开,账单还记在你头上越权访问校验了「是否登录」,没校验「能不能看这条数据」登录用户能看别人的订单、改别人的资料注入把用户输入直接拼进 SQL、命令、HTML把「数据」当「指令」,是提示注入在代码世界的亲戚AI 是流水线,你是质检。流水线快,不代表产品合格
06

AI 代码的常见漏洞

密钥硬编码、越权访问、注入,AI 最常留下的几个。

要不要把它交给 AI?问三个问题,三秒钟出结果① 可不可逆邮件能撤回吗?文件能找回吗?钱能退吗?不可逆 → 别让 AI 自动执行② 影响多大只影响一个人一条数据,还是全体用户整个生产环境?影响全体 → 留一道人工关卡③ 能不能核验它做完了,你能看出对不对吗?有出处、有标准答案吗?编了你都不知道 → 谨慎三问里有一问「否」,就降级:加人工确认,或缩小范围
07

什么能交给 AI

一套三秒钟就能跑完的信任判断法。

不用逐条查证——三个动作就能筛掉大部分编造三个动作查来源 · 找反例 · 复算关键数字查来源引用、数据、人物、文献,去翻原文;查不到,这条基本不可信找反例对「一定」「都会」「从不」这类断言,想一个失效场景复算关键数字百分比、金额、日期、换算,自己动手算一遍剩下的零散小错,用「会不会害到我」来权衡要不要查
08

核实 AI 回答的三个动作

不用逐条查证,三个动作就能筛掉大部分编造。

AI 是极好的执行者,糟糕的决策者——边界就划在这实现补全代码、生成文档、批量整理、翻译改写、快速出初稿。快、不累、不限量、不厌倦交给 AI,把效率最大化判断没有立场、没有价值观、没有动机,也无法承担后果。目标、取舍、责任都给不了你永远是你的活,不交出去AI 是你的同事,不是你的老板,也不是你的替罪羊
09

人机边界

AI 能补全实现,补不上判断。哪一段永远是你的活。

2安全它会信错谁
3判断它的活和你的活

做产品

基础

这一行做产品的人默认都知道的事。已经懂的跳过,直接看下面的模式。

1认识这一行先知道自己在什么盘子里
产品经理不交付代码和设计稿,交付判断进来的市场、用户、业务、技术四样彼此矛盾的信息产品经理翻译 + 取舍出去的做什么、怎么做、先做什么能执行下去的决定 同一个需求,判断质量决定你做出一堆功能,还是一条能转起来的业务
01

产品经理在干什么

这个岗位的职责边界,以及它在一家公司的组织里坐在哪。

十六个环节,每段都有明确交付物想清楚用户、问题、价值、竞品最容易整段跳过设计出来流程、页面、原型、方案跳过评审直接开发做出来开发、联调、测试、验收需求未冻结改到最后一刻用起来上线、灰度、数据、复盘上线即终点没人看数据跳过的每一步,欠的债都会在后面某一步还
02

产品的工作流程

从想法到上线要经过哪些环节,各个角色在哪一步进来。

C 端和 B 端的差别不在界面,在决策与责任C 端产品用户随时可以走人每多一步都是流失做减法是默认动作B 端产品用户走不了,但每一步背后有一条业务和一份责任少一步反而出事加步骤要配确认同一个功能,两边的做法能差出一个「确认」按钮
03

产品的类型与方向

C 端、B 端、平台、工具、内容,不同类型的判断标准差别很大。

选行业等于选了一套判断标准存量行业电商、社交、内容、工具新玩家只能拿边角增量位置出海、企业服务、AI 应用判断难度更高怎么选看阶段、看信息优势、算清抢谁的饭碗别用存量思维看增量行业决定天花板,也决定你要跟谁抢
04

互联网行业地图

电商、社交、SaaS、内容、工具各自走到了哪个阶段。

商业模式不是怎么赚钱,而是谁付钱、为什么付、规模变大后更赚还是更亏你的产品用的人 ≠ 付钱的人广告用的人免费,广告主付钱订阅按周期付钱,买持续价值抽佣平台撮合,按交易额分成免费增值基础免费,高级功能收费决定成败的不是收钱方式本身,而是那四条经济规律
05

常见的商业模式

钱从哪来:广告、订阅、抽佣、增值、免费加付费,以及怎么验证。

你不需要会写代码,但要知道一件事发生在哪一层浏览器页面、交互、输入前端能改的只有自己的界面接口前后端之间的约定权限校验必须在这层做服务器业务规则、计算、鉴权牵钱、权限、别人数据的逻辑只能在这数据库一张张表,靠 id 关联数据模型画的就是这个每次请求都走过这条路;出问题先定位在哪一层
06

理解技术

前后端、API、数据库、登录、部署、安全,最小的一份技术底子。

黑话很多,高频的没几个,按场景认就够了术语表按场景分组,不按字母排需求与用户PRD、用户画像、场景、痛点产品与设计MVP、原型、交互、体验开发与上线前端、后端、接口、灰度、回滚数据与增长转化率、留存、北极星、A/B开会听到的词,回来知道它属于哪一环就够了
07

术语表

产品和技术两套黑话,查得到就不会在会上懵。

模型不给答案,只当检查清单用思维模型按阶段索引调研PEST、SWOT 看外部与自身需求分档KANO 决定先做哪个体验五要素定位问题在哪层增长AARRR 拆用户全路径判断一次用得值不值:用完,你的决定变了吗
08

产品思维模型

PEST、SWOT、AARRR、KANO、用户体验五要素,什么时候用哪个。

工具解决熟练度,不解决能力想清楚白板、思维导图、AI 对话别把时间花在排版上画出来流程图、原型、架构图输出要能被下一步吃掉写出来文档、PRD、需求说明用模板别从零写验证竞品分析、访谈、数据看板验证结果要能回流到判断挑工具只看一件事:能不能减少搬运成本
09

工具与模板

画图、写文档、找竞品、扒设计稿,常用的那几个就够。

产品能力不是读出来的,是做砸几次之后长出来的能做出来工具、技术底子、流程卡点是熟练度做得对需求、判断、思维模型卡点是判断力带得动协作、流程、让别人也能做卡点是沟通说得清商业、表达、向外部要资源卡点是视野每段挑一两本读透,比列二十本管用
10

进阶路线与书单

从入门到能独立带一条线,中间该补什么。

未来工作的方向:执行交给 agent,人负责方向划桨写代码、做表格、整理资料、跟进执行可以被智能体大量接管做得越快,越该放手掌舵定方向、选目标、做有主见的判断暂时只能由人来做抽象层级越升越高当每个人都拥有同样的工具,区分人与人的是判断和观点
11

从划桨到掌舵

AI 时代工作方式的根本变化:执行交给 agent,人负责方向。

2懂点技术够跟 AI 和工程师对话就行
3手边的东西随时能翻出来用的

发现问题

需求从哪来、哪些是真的、哪些值得做。

1认识先搞清楚需求到底是什么
同一件事有三种说法,只有中间那层才是需求用户说的话他能想到的解决办法,比如「能不能加一个导出 Excel 的按钮」他想达成的状态这才是需求。每月对账那天,把散在各处的改稿记录变成一份能直接发给客户的清单中间这层写清楚了,方案可以有好几个,你才有得选你打算做的功能你能想到的解决办法,比如一键生成对账单,也可以导出 Excel上下两层都是方案,只有中间那层才是需求
01

什么是需求

用户说的话、他真正想要的、和你打算给的方案,是三样东西。

需求从哪儿来,决定它该怎么被验证需求进池子必须带来源用户反馈有人卡住了,卡在哪一步业务目标公司这个季度要什么数据异常哪一步掉得比往常狠竞品动作别人押了什么方向可信度从高到低:数据、用户行为、用户说的话、竞品,但都要配上原始场景
02

需求的四个来源

用户反馈、业务目标、数据异常、竞品动作,各自的可信度不同。

伪需求是用户在回答一个假设性问题伪需求从哪来用户表达不准、过度设计、错误的假设、技术驱动四道筛子问过去发生的事实,不问将来的打算含糊其辞的时候,答案通常已经出来了几个典型用户要「更多可能性」,实际要的是「更好的默认值」四条里过不了两条,先别做
03

真需求与伪需求

分辨他说他想要,和他真的会用。

人预测不了将来,但记得住过去——只问过去,不问将来问意愿「这个功能你会用吗」「你愿意付费吗」他模拟理想版的自己,回答的是客气话问行为「上次遇到是什么时候,你当时怎么处理的」拿到的是发生过的事实,可信度最高听到「我现在是自己弄一张表」,比十句「很重要」都值钱
04

问行为不问意愿

问他上次是怎么做的,别问他会不会用。

如果一个问题真的存在,用户一定已经在用某种笨办法解决它了现有替代方案免费的需求说明书自己搭的表格列名就是字段,颜色就是状态,需求最清楚截图和微信收藏核心诉求是「攒起来以后找得到」,即检索写了个小脚本痛到愿意学,这类用户是最好的早期用户雇了个人在做已经在付钱,能算出具体金额——定价的锚点几个工具串着用你的机会在那几个工具的接缝处干脆放弃了需求存在但成本太高,做出来可能是新市场没有凑合就说明问题不够痛——或者痛到没人能凑合
05

先找现有替代方案

他现在是怎么凑合的?没有凑合就说明问题不够痛。

三个维度不是加起来看,是乘起来看人数符合这个描述的人有多少。决定天花板,人数少但付费高也能成立频率最近两次分别是什么时候。决定能不能养成习惯,也决定留存痛感那次没做好,后果是什么。决定他愿不愿意付钱,以及愿意付多少乘法里的零补不回来算不出量级的先别做,算不出来说明你对这群人还不够了解
06

值不值得做

频率、痛感、人数,三个都低就别做。

抽象的需求推不出设计,具体的处境可以写锚点谁、什么时候、想达成、卡在哪、现在怎么办,五个要素拿它量方案每个方案过一遍锚点,说不通的自己就淘汰了没有锚点时,只能靠嗓门或职级来定放进提示词让 AI 先说出硬约束、主任务、还有哪些做法不适用第三问最有用:逼 AI 说出「这个场景下不适用」
07

场景锚点

用一个具体的人在具体时刻的处境,代替一句用户觉得不方便。

一次访谈是一段固定的流程,方案一次都不要拿出来暖场问一天的工作长什么样,建立背景、让他放松回溯问最近一次遇到这个情况是什么时候,拉回具体日子别一上来就问产品追问带我过一遍那天你先做了什么,还原完整步骤收尾问还有谁值得聊,拿到下一个人方案一出现,剩下的时间就废了你要的是事实,不是评价
08

用户访谈怎么问

开放式提问、追问细节、避免引导,一份可复用的提纲。

一直问到答案不再是「因为系统不支持」,而是变成一个业务事实为止第 0 层 · 方案他要什么。多半是他见过的某个界面第 1 层 · 任务他拿这个方案去干什么,开始有场景了第 2 层 · 缺口为什么必须自己干这件事,系统在哪一步断了第 3 层 · 结构问题为什么会有这个缺口,通常是当初的信息架构没设计对第 4 层 · 业务事实为什么当初这么设计,到这一层可以停了追到底之后还要往回走一步,选一个成本合适的层次下手
09

五个为什么

从表面诉求追到根因,再决定要不要照着做。

排优先级的目的不是绝对正确的顺序,是让每次插队都要给理由先用 KANO 分档五类,先分档再排序。分档解决该不该做,排序解决先做哪个再套排序公式优先级 = 需求价值 ÷ 成本,价值是乘数,是零结果就是零池子怎么维护每条有来源和场景,砍掉的留记录,定期清理填不满五格的说明还没想清楚,先别排队池子的价值在于能被读完
10

需求池与优先级

KANO 分类加上一套排序规则,别靠谁嗓门大。

2原则判断标准
3方法可以照着做的步骤

定义产品

给谁、解决什么、做到哪为止。

1认识一份产品定义包含什么
给谁、解决什么、做到哪为止,缺一块后面每个决定都会摇摆产品定义三块缺一不可目标用户具体到能在脑子里想出一个人:职业、设备、熟练度、日常在忙什么核心价值他现在怎么办,以及你凭什么让他换过来功能边界一份要做的清单,加一份明确不做的清单写完之后拿三个问题过一遍,答不上来就回去改
01

定义由三部分组成

目标用户、核心价值、功能边界,缺哪一块后面都会摇摆。

先问产品在哪一段,再决定该做什么探索期有没有一小撮人非用不可,只看次周留存成长期怎么让同类人更快找到你,看获客与激活成熟期怎么留住并且赚到钱,看付费转化与续费衰退期维持收着还是转方向,看流失与维护成本大投入抢救老功能,回报远低于新方向一个人做产品,绝大多数时间都在探索期
02

产品的生命周期

探索期、成长期、成熟期、衰退期,侧重点完全不同。

收钱方式会反过来决定产品长成什么样订阅要证明「这个月我依然在帮你」首页一眼看到累积价值,留人要留得住买断要证明「这一次就值这个价」功能完整度是卖点,可以用完即走广告要证明「有很多人在这里待很久」信息流、无限滚动,与帮用户快速办完事冲突按用量要证明「你用得多,得到的多」用量看得见、有额度提醒,AI 产品多数走这条免费用户能真心推荐你,付费用户觉得那笔钱比省下的时间便宜
03

商业模式怎么接上

产品定义要能回答钱从哪来,否则做完就停在那。

一句话说不清,是还没决定放弃什么填满四格给谁、什么时候、从什么状态、到什么状态,一格都不能空拿来检验讲给不了解背景的人听,他能复述个大概才算过要你补充说明,就还没写对常写常新方向会漂,定期重写;四格都变了就该停下来想想一句话里塞两个目标用户,句子立刻散
04

一句话产品

一句话说不清做什么给谁,就先别让 AI 动手。

一个产品只能有一件事做到出彩怎么找出主线用户重复最多的动作、他会跟人提起的那句、砍掉就死的那个资源怎么分主线占七成,其余四个方向分剩下的三成怎么守住它每个新功能先回答:加强主线,还是稀释主线好一点点换不动人,要好到一眼能感觉到主线可以换,但一次只能有一条
05

唯一主线

找出产品的主任务,其余功能都是配角。

面向所有人等于没有用户宽的做法面向所有自由职业者,潜在市场很大每个人都觉得「差不多但不完全适合我」——大市场 × 极低转化 = 没有用户窄的做法面向用微信对接的设计师,潜在市场小很多「这就是给我做的」——小市场 × 高转化 + 口碑 = 有用户先在一小撮人里做到不可替代,再往外扩
06

目标用户收窄

面向所有人等于没有用户,先服务好一小撮。

要做什么的清单是意向,不做什么的清单才是决定要做什么列出来不需要放弃任何东西它是意向,拦不住范围膨胀不做什么每写一条都要放弃一样东西它是决定,能挡住十几个「顺手加一下」范围失控是十几个「顺手加一下」累积的结果,反面清单就是那个挡着的东西
07

反面清单

明确写下这个版本不做什么,比写要做什么更管用。

第一版的目标不是覆盖所有功能,是让一个真实的人完整做完一件事横着切按技术分层:先做完所有界面,再做完所有接口在全部做完之前,你手上没有任何能验证的东西竖着切按一次完整的用户任务:界面、逻辑、数据一起做穿第一条切片做完就有人能用,开始收到真实反馈判断标准:这一片做完,能不能找真人来用,用完学到新东西
08

最小切片

砍到能完整跑通一遍的最小范围,再往上加。

借结构省的是用户的学习成本,抄功能省的是自己的思考成本借什么,不借什么结构、交互、命名可以借,功能别借——抄是省自己的思考成本去哪儿借先借用户天天用的,再借同结构的成熟产品,跟着系统规范走给 AI 的话给 AI 一个具体的参照物,比给一堆形容词有效得多借完要说清楚你哪里不一样,否则用户会问「那我为什么用你」差异化体现在你解决问题的方式上,不是按钮叫什么名字
09

借形

从已有产品借走通的结构,而不是从零发明。

蓝图排的是验证顺序按假设排每一版写明要验证什么,功能列表是结果,不是起点每版四行要验证的假设、为此要做的、看哪个数、什么算成立写不满四行,说明这一版还没想清楚发完重看假设成立走下一版;不成立换个方式再验同一条假设排期表无法失败,蓝图每一版都有明确结论
10

产品演进蓝图

把未来几个版本画成一张图,让每一版都有交代。

叙事先于产品:先讲清楚为什么,再决定做什么讲好故事深度理解技术 + 深度理解目标客户最容易跳过的一步测试故事给 100 个人做 pitch,不断精炼讲给自嗨的人听,听不到真话再建产品叙事成立后,才承诺产品形态先建产品再编故事,返工最贵你谈论产品的方式,可以也应该先于构建产品本身
11

先讲好故事再建产品

产品营销契合与产品市场契合同样重要,甚至先于构建。

2原则判断标准
3方法可以照着做的步骤

设计结构

信息架构、页面地图、数据模型。产品的组织方式。

1认识信息架构是什么,有哪几种
用户在任何一屏上都要能回答三个问题,信息架构才成立信息架构回答三个问题的那套结构我在哪导航高亮、面包屑、页面标题。答不上来,用户不确定自己进对了没有,操作会犹豫我能去哪同级项、下级入口、相关推荐。答不上来,用户以为功能不存在,其实是没找到入口我怎么回来面包屑每级可点、返回、顶层入口常驻。答不上来,用户只能靠浏览器后退或重新开始界面调不好先分层:是东西放错了地方,还是放对了但不好操作
01

什么是信息架构

让用户随时知道自己在哪、能去哪、怎么回来。

内容之间的关系决定结构层级内容天然有从属关系,一个东西只属于一个分类代价:分类边界模糊时,用户得猜你怎么归的类矩阵一个东西同时有多个属性,用户从不同角度找它代价:要做好筛选和排序,否则等于把难题丢给用户线性步骤有严格先后,前一步没完成后一步没意义代价:中途要能退回和保存,否则断在半路就全丢了自然内容之间的关联比归属更重要,探索本身是价值代价:新用户会迷路,必须配入口页或推荐能同时属于两个分类,就是矩阵——硬做成层级,会一直有东西无处安放
02

四种组织结构

层级、矩阵、线性、自然,不同内容适合不同的组织方式。

桌面的空间优势和手机的手势优势,各自决定不同的做法同屏信息量桌面能并排放两三栏,列表和详情同屏手机一次一栏,同样的内容拆成两三页导航位置桌面左侧或顶部常驻,随时可见手机底部四五个标签,或收进汉堡菜单能承受的深度桌面三到四层,有面包屑撑着手机两到三层,再深用户就不回来了输入方式与使用状态触屏输入决定热区,单手与打断决定操作和停留方式手机上的任何流程都要假设用户会被中途打断,必须能保存进度、随时接着做
03

网页与移动端的差别

屏幕、导航位置、能承受的层级深度都不一样,结构不能照搬。

判断标准就一条:几个一级模块,并列还是包含仅左侧一级文档、笔记、单一系统,模块五到九个内容都属于同一件事仅顶部一级官网、电商、内容站,一级入口不多页面要留给内容左一级 顶二级模块多的管理后台,一级超过九个每个一级下面还有好几个二级顶一级 左二级门户加多个子系统,顶部切换独立系统手机上通常要拆成几个独立入口第三种和第四种最容易选反:顶部切换后左边内容完全换一套,就是第四种
04

四种导航形式

仅左侧、仅顶部、左一顶二、顶一左二,取决于有多少个一级模块。

功能齐全和主次分明是两回事功能平铺五块等大的卡片,每样都一样重用户进来要先做一道选择题一屏一件事一个主任务,其余让位:缩小、靠后、收进导航用户不用想就知道该干什么如果用户只能点一个东西,应该是哪个?答不上来,页面就没设计完
05

一屏一件事

每个页面只承担一个主任务,其余的让位。

你怎么分组,用户就怎么理解这个产品分组方式按任务、对象、角色、频率、系统模块按任务大多数情况的默认选择 — 风险:任务本身要够稳定,否则改版时结构要重来按对象产品里有明确的核心实体,比如项目、客户 — 风险:用户如果不是围绕实体思考,会觉得绕按角色不同角色用的功能完全不重合 — 风险:一人多角色时会来回切换,很烦按频率作为二级排序用,不适合当主分组 — 风险:频率会变,而且不同用户的频率不一样按系统模块几乎没有合适的时候 — 风险:这是把实现细节丢给用户去理解分错了,之后每一次找东西他都要重新猜一遍
06

分组与命名

你怎么分组,用户就怎么理解这个产品。

每多一层,就会流失一批人视觉上分组同屏内用分隔线或小标题把十几项分成三组用户还是一眼扫完,没有多点一次结构上分层看起来最整齐每个人都要多做一次「猜它在哪一类里」的判断面包屑解决不了深度问题,它只回答「我在哪」
07

宽而浅

一级菜单五到九个,主路径不超过三层,深了没人走到底。

从信息开始想,页面数量是被内容量推出来的从页面开始想照着见过的界面缺什么补什么,页面数量一直变画到一半发现少字段,布局要重排从信息开始想先列全,再按频率和长度分页,结果是自己推出来的清单还是数据模型草稿,表结构定了大半高频且短的进列表,低频或长的进详情,几乎不看的干脆不展示
08

内容清单

先把要展示的信息列全,再谈分几个页面。

先开放后封闭,顺序反了这一轮就白做怎么做准备卡片、开放分类、封闭分类、追问犹豫处,五到八个人就够结果怎么读看总在一起的、到处乱跑的、组名和犹豫的地方一个人怎么做线上白板、反向测试、看竞品,让 AI 先跑一轮AI 给的是同类产品的常见分法,不是你的用户的想法他们起的组名可以直接拿来当导航名字,比你自己想的准
09

卡片分类

把功能写在卡片上让用户来分组,比你自己拍脑袋准。

页面数量是范围,跳转关系是复杂度列页面每个独立页面写成一个方块,弹窗和抽屉标注在所属页面上连层级实线画出从属关系,对应导航和面包屑连跳转虚线画出做完动作后去哪,对应按钮标状态需要登录、需要权限、可能为空的页面做标记你不画出来,那些连接对 AI 就不存在
10

页面地图

画出全部页面和它们之间的跳转,再开工。

顺序不能反,混成一张谁都看不明白功能结构图有哪些功能模块、怎么划分,树状功能名 2 到 3 级,梳理需求范围信息结构图每个业务对象包含哪些信息,以对象为根字段为枝,供数据表设计参考产品结构图功能和信息怎么落到页面上,页面框架加各页承载的信息,能替代原型评审只画一张就选信息结构——画错了要重构数据库的只有它
11

三种结构图

功能结构、信息结构、产品结构,各画各的,别混成一张。

界面改一次是几分钟,数据模型改一次是要把已有数据一起迁走找名词把内容清单和场景描述里的名词圈出来:项目、客户、改稿记录判断实体能被单独增删改的是实体,只是某个实体的属性的是字段定关系两两问:一个 A 能对应几个 B,一个 B 能对应几个 A查重复同一个信息出现在两个表里,多半该抽成独立实体多对多需要中间表,定得越晚改起来越麻烦
12

数据模型先行

实体和关系定错了,界面怎么改都别扭。

2原则判断标准
3方法可以照着做的步骤

设计交互

路径、状态、反馈、异常、权限。所有不顺利的时刻。

1认识交互设计在管什么
画面里看得见的,撑不起「怎么用」画面里看得见的布局 · 字段 · 按钮在哪交互说明把行为写进需求画面里没有的点下去发生什么 · 何时不可点 · 出错怎么办 你不写出来,做的人只能猜
01

交互管的是行为

原型图能传达长相,传达不了行为。行为要写清楚,交给 AI 才不会全靠猜。

按问题记组件,比按名字记有用按问题认组件选一个、选多个、输入、装不下、展示数据,每组都有成熟答案几组容易选错的下拉还是单选、弹窗还是抽屉、分页还是无限滚动每个组件都有状态默认、悬停、按下、聚焦、不可点、处理中聚焦最常被漏掉——它决定键盘用户能不能用你的产品看到一个需求,能立刻说出「这是从一组里选一个的问题」
02

常用组件有哪些

下拉、步骤条、分页、抽屉,先认全再谈选哪个。

提示要跟事情的严重程度匹配数字提示有几条待处理的东西。图标角上的小红点,不打断任何操作气泡提示引导注意某个新功能。角落的短文本气泡,看不看都行全局提示重要的状态变化或紧急信息。顶部横幅或中央弹窗消息公告长篇信息,比如维护通知、更新说明。专门的公告板块推送用户不在应用里,但你需要他知道。系统通知中心,用多了会被关掉用弹窗报无关紧要的消息,用户下次就学会了闭眼点确定
03

提示的五种形式

数字、气泡、全局、公告、推送,强度从弱到强。

任何一次取数据,结果只会落在四个格子里数据组件四种状态缺一不可正常态有数据时的正常渲染空态没数据。区分「还没有」和「筛没了」加载态骨架屏,别用居中转圈错误态说明现状 + 引导措施,配重试按钮AI 默认只写正常态,剩下三种要靠需求带出来
04

四态齐全

空、加载、出错、正常。AI 默认只写最后一种。

用户点了一下,屏幕上必须有东西变化;没有变化,他的默认假设是没点上即时反馈点击瞬间出现,回答「我点上了吗」。按钮变色、进入加载态结果反馈操作完成时出现,回答「成功了还是失败了」。轻提示、错误信息状态反馈操作完成后一直存在,回答「现在是什么状态」。数据真的变了、标记变了弹了「保存成功」列表却还是旧数据,用户会刷新页面确认
05

操作必有反馈

点完之后,用户怎么知道生效了。

确认弹窗的成本分摊反了先确认再执行一百次操作,一百次都被打断弹多了形成肌肉记忆,真误操照样拦不住先执行给撤销窗口正常操作完全不被打断出错的那次,花一秒钟点一下撤销判断只有两条:这个动作可不可逆、后果影响几个人
06

可撤销优于确认

危险操作给一次后悔的机会,好过弹窗问三遍。

用户看到的界面,应该等于他能做的事分三类权限页面、操作、数据,三类做法完全不同,数据权限最容易漏中间加一层角色RBAC:用户通过角色拿权限,加人加权限都变成配置界面默认不显示没权限的入口不渲染;只有能自行申请时才显示禁用前端隐藏只是体验,不是安全写进项目规则把权限规则写进 CLAUDE.md,每个接口都要独立校验后端必须再拦一遍
07

权限即视图

没权限的功能不该显示出来再报错。

主路径只有三到五步,每一步都要有出口定起点用户从哪进来,起点不同,他知道的信息不一样列主路径顺利情况下的每一步,控制在三到五步标判断点这里会不会有分支,两条路都要画超过五步是信号,要么拆任务,要么合并步骤补异常出口中途走了、失败了、没权限,各有落点画返回路径每个终点都要能回到稳定位置,不能是断头路画完路径再画一条情绪线,设计决定自然浮出来
08

画用户路径

把一次完整任务拆成有先后的几步,标出每步的出口。

状态遗漏的根源是它们不出现在需求描述里按元素列列表、按钮、输入框各有各的状态,别按页面混在一起写清触发条件「接口 500 或超时」可测,「出错时」不可测问满六句空、加载、失败、禁用、处理中、极值,输入类再加两句列完先自己扫一遍再动手,这时候加状态只是改一行表格
09

列状态清单

逐个组件问一遍会出现哪几种样子,再开始写。

新用户看到的第一屏几乎全是空的,这一屏决定他会不会走到第二步空的第一屏决定留不留下的一屏一句价值这里将来会有什么,对他有什么用一个主按钮唯一的下一步,别给三个选择一条捷径导入示例数据、从模板开始、连接已有账号进度感三步走到哪一步了,知道还剩多少做完用全新账号自己走一遍,是唯一能发现问题的方式
10

首次体验设计

第一次打开、什么数据都没有的时候,屏幕上有什么。

每多一个字段,就少一批愿意填完的人先砍字段逐个问「不填会怎样」,能推出来的别问标签放哪左标签、顶标签、行内、右对齐,各有各的场合出错怎么办容错分三个时机做,缺一个用户就会卡住五个省事的做法默认值、自动填充、分步、分组、手机键盘完成率、错误率、填写时间,三个数一起看
11

表单克制

每多一个字段,就少一批愿意填完的人。

公式:说明当前状况 + 引导措施,两段都要有说明当前状况发生了什么事,用用户听得懂的话,别暴露状态码引导措施他现在能做什么,给出路、给恢复途径只报状况不给出路的提示等于没写按强度选形式必须立刻纠正用弹窗,一般信息用全局提示,可看可不看用气泡形式按强度分三档,不要越级使用
12

提示语怎么写

说明当前状况加引导措施,不用感叹号,句尾不加标点。

2原则判断标准
3方法可以照着做的步骤

设计界面

布局、层级、颜色、排版、设计系统。

1认识视觉是怎么起作用的
用户先扫一眼,然后停在最显眼的地方。你决定哪里最显眼视觉层级大小、位置、留白、对比四样手段大小重要的做大,次要的做小。差距要拉开,相差两三个像素等于没差位置重要的放上面、放左边、放不用滚动就看到的地方。最有效,而且不增加视觉噪音留白重要的周围留更多空间,把它孤立出来。最被低估的一种,加空间比加装饰干净对比颜色、粗细、明暗拉开差距。要么做足要么别做,对比不明显反而让人困惑优先用位置和留白,其次用大小,最后才用颜色
01

视觉层级从哪来

大小、位置、留白、对比,四样东西决定用户先看哪。

颜色越省着用,它就越有效三个属性色相、明度、饱和度。做界面最常用的是明度四类角色主题色、中性色、语义色、点缀色,控制在五种色相以内怎么选主题色跟品牌一致、跟内容匹配、从参考里取或用工具生成几个常见问题别只靠颜色传信息,对比度至少 4.5:1暗色模式不是把颜色反过来记下具体色号并拉出深浅档,只记「蓝色」会慢慢走样
02

颜色基础

色相、明度、饱和度,以及界面里为什么中性色占九成。

中文没有字母的上下延伸,视觉密度更高照搬英文参数行距 1.4,直接套用到中文正文行与行粘在一起,读着累用中文自己的参数行距往 1.7 调,中英混排留空隙每一行能被单独看见,找下一行不费力界面上九成的内容是文字,排不好加多少装饰都救不回来
03

排版基础

字号、行高、字重、字距,中文排版跟英文不是一套参数。

间距的差别要能表达关系随手定11、13、14、15,一堆相近但不相等的值差别小到看不出故意,大到能被感觉到,页面有点乱却说不清一套固定值4 / 8 / 16 / 24 / 40 / 64,间距变成有意义的信号8 表示紧密相关,24 表示这是两个不同的组五到六个值就够用,定好之后间距不再是每次要做的决定
04

一套间距

定一组固定数值,别每个地方现拍一个。

层级来自差距,不来自级数七八个字号相邻只差 1 到 2px用户感知不到差别,只觉得有点不齐三到四级相邻至少差 1.25 倍一屏只有一个大标题,其余各归各位多数时候,加粗和变灰比加大字号更克制
05

字号阶梯

三到四级字号就够用,多了层级反而散。

一个页面上能被打断的次数有限,用完就没了每个模块一个色六个元素六种颜色,等于告诉用户这六个一样重要也就等于没有重点只留一个彩色只出现在该看该点的地方一眼就知道该点哪儿颜色是稀缺资源,用在所有地方等于哪儿都没用
06

一个强调色

只留一个彩色,其余全交给中性灰。

把两块内容分开时,先拉开距离,距离不够再用线画出来的分隔边框、分割线,效果立竿见影增加视觉元素,线用多了会失效,变成背景噪音让出来的分隔组内 8、组间 24,用间距表达分组不增加任何元素,分组一样清楚先删再加:把边框全删掉,分不清的地方再加回来,通常只要加回三成
07

留白优先

先试着删掉分割线和边框,用间距分区。

每多一条起始线,就多一次视觉停顿少几条轴先数轴上页面的左边界,把元素归到少数几条轴上选哪种对齐数字右对齐、正文左对齐,一个区块只用一种方式视觉对齐优先数值对齐了但看着没对齐,以眼睛为准圆形、引号、图标重心都需要微调这一步几乎不花时间,效果却很明显
08

对齐轴

整页元素归到少数几条轴线上,页面立刻干净。

组件不统一,页面再怎么调都像拼的每个页面各造一套圆角、字号、内边距全不一样,改一处要改七八个文件AI 每次只看到当前页面,没有全局视野,一定会自己造一套组件被复用圆角定完一次,后面几十个页面都不用再想新页面基本就是拼装,不再需要做样式决定组件先行把设计决定从「每次都做」变成「做一次」
09

先定组件后拼页

组件不统一,页面再怎么调都像拼的。

把散在各处的数值收成一组有名字的变量,样式就自动一致了设计令牌一组有名字的变量颜色主题色 1 个、灰阶 6 档、语义色 3 个间距4 的倍数序列,6 个档位字号字号加配套行高,4 个档位圆角与阴影圆角 3 档、阴影 2 档,多了会显得杂设计系统的价值在于约束,加得越多约束越弱
10

建一份最小设计系统

颜色、间距、字号、圆角,四组变量就能管住整个项目。

响应式不是压扁,是在特定宽度上换一套结构断点定几个先定主战场,三档就够:手机、平板、桌面断点处变什么表格变卡片、侧边导航变底部标签栏、多列按重要性重排别只是把多列堆成单列给 AI 的话让它逐类说明变化,先给方案,确认后再改代码两端都想做到一样好,通常两端都别扭
11

响应式怎么落

别把桌面端组件原样堆到手机上,先想清楚断点处的取舍。

2原则判断标准
3方法可以照着做的步骤

与 AI 协作

把前面的判断,翻译成 AI 能照着执行的东西。

1认识它擅长什么,不擅长什么
分界的标准不是难易,是有没有唯一正确答案交给它把描述变成代码、重构改名、解释代码、照着参考做有大量样本、做法收敛,它做得比你快留给你做什么不做什么、方案合不合适、取舍、验收取决于你的处境和标准,它不知道你不做的那些判断,它会替你做,而且做得像模像样
01

它会做的和不会做的

它能补全实现,补不上判断。分清楚分界,才知道你该管哪一段。

窗口装得下,不等于每一段都被看清开头系统提示、项目规则和你最新说的话,注意力最高中段塞在中间的关键约束经常不起作用,最容易被忽略越长越模糊,准确率渐进下滑,很难察觉结尾最近的对话和工具输出,也容易被看清重要的规则要么放最前,要么在当下这条指令里重申
02

上下文是怎么回事

它只知道你给它的那些,记忆不会自动跨会话延续。

同一句话该写在哪,取决于它要管多久约束CLAUDE.md,整个项目一直成立的规矩,比如组件必须实现四态、间距只用六个值规格docs/specs/模块名.md,某个模块的数据、状态、边界,比如评论两层楼中楼、软删除提示你打的那段字,这一次要做的具体事,比如把这个按钮挪到右上角这一层最容易被跳过,跳过之后决定就只活在对话历史里生成代码时三层同时生效,冲突时以下层为准
03

规格、提示、约束的分工

一次性的写规格,反复的写约束,临时的写提示。

四块缺一不可,最值钱的是最后一块数据有哪些实体、关键字段、彼此的关系,这块错了后面全错状态界面会出现哪几种样子,至少覆盖正常、空、加载中、出错边界超长内容、零条数据、并发修改、权限不足、网络失败未定项它只能靠猜的地方逐条列出来问你,不要自己替你决定这一块决定了要不要返工先要一页规格,同样的错误在二十行里三十秒就能看出来
04

先规格后代码

先让它写清楚要做什么,再让它写代码。

大任务的代价不在生成,在验证一步多大合适能被单独验证、你愿意读完它的输出、失败了不心疼竖着拆按一次完整的用户动作拆,不按前端后端数据库分层拆一步一确认做完就看一眼,别攒着三步一起验攒着看等于没拆每一步都是一个可回退的存档点
05

一次一件

拆成小任务,别一次要一整个应用。

形容词约束方向,对照物约束结果锚定哪几件事结构、密度、语气、代码风格,外加一个反面参考怎么给指名到具体部分,说清借什么、不借什么不说清楚,它会连功能一起抄让它先复述要求它说一遍打算借哪些、不借哪些,几秒内发现偏差项目内部的参考最强:没有解释空间
06

参考锚定

给它一个具体对照物,比形容词有效十倍。

三段各自管一件事,缺一段就得多返工一轮目标用户能达成什么状态、为什么需要,别写成技术任务最常见的失误:把目标写成「加一个 useEffect」约束技术栈、已有组件、必须遵守的规范、明确不做的验收标准可以逐条勾的清单,最好包含边界情况第三段最值钱也最容易被跳过:它同时是自检清单和收货依据
07

三段式提示

目标、约束、验收标准,缺一段就会跑偏。

多给一份无关内容,就少一分对关键内容的注意力该给什么项目约束、模块规格、相关文件、本次指令,留三成空白关键约束说两遍,防中间被忽略不该给什么整个仓库、完整报错日志、上个话题的历史、大段示例数据什么时候清空重来它开始违反规则、重复旧话、连续三轮改不对——重开自查标准:你都不确定用不用得上,那多半就不该给
08

上下文预算

该给什么、不该给什么,比给得多重要。

跟 AI 写页面,三步走,顺序别乱先出静态页确认样子:这一屏的静态结构,内容全用占位文本别让它顺手把数据和状态一起写了再接数据确认形状:拿真实样本换掉占位,看长度、空值、格式最后补边界确认兜底:加载中、失败、空数据、超长内容各看一眼每一步都便宜,才能每一步都敢改
09

从原型到代码

先出静态页确认样子,再接数据,最后补边界。

反复要说的规矩写进文件,但文件要保持薄哪些该沉淀会返工的技术规矩、全站统一的设计约定、明确不做的范围怎么写写成祈使句,标题分区,关键处补一句为什么描述性的句子不改变行为怎么防膨胀模型按概率遵守,写越长越没人看;控制在两百行内再上一层偶尔才用到的流程,做成可调用的技能文件过时的约束比没有约束更糟
10

约束沉淀

反复要重申的规矩,写进 CLAUDE.md 和 Skill。

2原则判断标准
3方法可以照着做的步骤

验证与迭代

上线前查一遍,上线后看数据。

1认识验证在验什么
下一层不成立,上一层的结论就没有意义有人用他们会不会回来、愿不愿意付钱——埋点、留存曲线、转化漏斗好用陌生人能不能自己走完——五秒测试、找三五个人试用并观察能用功能对不对,异常情况会不会崩——走查清单、真实数据压测、安全检查跳过第一层直接看数据,会拿到一堆解释不了的数字
01

能用、好用、有人用

三层验证,各自要看的东西不一样。

顶上一个代表方向,往下拆到能被单次改动影响的那一层一级指标 · 方向跟产品目标一致,随生命周期变,选「可改进」的数二级指标 · 定位对应主流程关键几步,用来定位问题出在哪一段三级指标 · 动作能被一次具体改动影响,拆到这一层就可以停结果指标只能复盘,过程指标才能抓手
02

指标体系怎么搭

从北极星往下拆到能被单个功能影响的那一层。

一个功能埋五个点,就能回答绝大部分问题曝光有多少人看到入口,分母是它开始有多少人点进来开始操作曝光到开始掉得多,问题在入口本身成功有多少人走完,你真正想要的那个数失败必须带原因属性:校验没过、接口报错、余额不足放弃中途退出的人停在哪一步这五个点连成一条漏斗,哪段掉得最狠改哪里
03

先埋点后上线

没埋点的功能,上线等于没上。

一个数能当北极星,要同时满足四条北极星代表用户真的拿到了价值代表价值不是「来了」是「拿到了」,完成一次真实任务才算数改得动这个季度做一件事,两周内能看到变化领先收入提前告诉你收入将来会怎么走,而不是跟随收入刷不出来一句话能讲清,靠拆页面、改口径做不上去指标越多,越容易挑出一个在涨的数,说服自己一切顺利
04

一个北极星

选一个指标代表产品在变好,其余都是参考。

判断产品行不行,只有真实行为记录算数小样本带偏它顺着你想要的方向,给出让你舒服的答案三个人里两个点了,你读出「六成」核对四条标准看行为不看表态、看路径不看单点、样本要有量级、是真实场景没有数据怎么办先埋点后上线、放一个小版本给真实用户、别用问卷代替行为自己人是「知道自己会用」的人
05

拿真实数据判断

小样本和自己人的感受都不算数。

首屏的信息传达,五秒就定生死找没接触过的人同事和已注册用户都不行——他们已经「知道这是什么」了严格五秒看一眼就收走,看久了就变成阅读测试五秒只够看完第一屏问三个开放问题这是什么、我能得到什么、我该做什么。别给选项,别提示三五个样本够用暴露问题的定性检查,不是给结论的定量依据答不上来,就是首屏没讲清
06

五秒测试

陌生人看五秒,能说出这是什么吗。

顺序固定:功能 → 体验 → 数据 → 安全,安全一票否决功能主流程走通 · 四态齐全 · 失败可重试体验全新账号走一次 · 窄屏看一遍 · 提示语能看懂数据关键事件上报 · 失败带原因 · 看板备好前面塌了后面不用看安全密钥不进前端 · 越权试不成功 · 输入做转义一票否决二十条以内、十五分钟能走完,才可能变成习惯
07

走查清单

功能、体验、数据、安全,上线前逐条过。

开发时用的是「刚刚好」的样例,真实数据可不是超长内容长标题、长评论、长昵称——布局会不会破、卡片会不会变形真实用户里一定有这种人,别赌没有零条数据刚上线、新账号——展示的是设计过的空态,还是留白和报错异常数据HTML、emoji、超长数字、缺字段——渲染错、接口崩压测不是测性能,是测数据
08

真实数据压测

用超长内容和零条数据各跑一遍。

AI 写代码又快又勤——安全检查也得跟上,三分钟三类高频坑密钥硬编码、越权访问、注入,先知道坑长什么样三分钟检查清单不管代码谁写的,上线前按清单过一遍别只删密钥——删掉的那份已经泄了为什么 AI 特别容易犯它学的「正常」恰好就是不安全的,三个原因都和工作方式有关安全这条线本来就该人来守,工具提速不等于质量提高
09

AI 代码的安全检查

密钥硬编码、越权访问、注入,AI 最常留的几个坑。

一个指标对所有人负责,等于对所有人不负责北极星只当裁判,不当任务新增激活数——加一个入口、调一个渠道核心任务完成率——改引导、减步骤次周留存——改唤醒、建使用习惯回来后的活跃——个性化内容、推荐每条路径一个指标、一组动作、一个责任人
10

北极星拆解

把一个总指标拆成几条可以分别下手的路径。

代码看输出,知识工作看过程验证代码跑测试、看结果、能不能 work输出就是证据测试通过即通过验证知识工作看过程、看输入、看引用、看推理输出本身证明不了什么90% 的数字也说明不了推理对不对让 AI 展示它的 proof of work,你才能相信它的答案
11

知识工作怎么验证

代码看输出,知识工作看过程。验证方式不同,产品就要为过程可见而设计。

2原则判断标准
3方法可以照着做的步骤

前线部署工程师

重新认识 FDE

先把这个角色说清楚:它是什么、不是什么、需要什么能力、在团队里扮演谁。

模型不稀缺,把模型变成结果才稀缺模型能做的Demo 漂亮能力开箱即用FDE现场翻译 + 交付客户需要的数据、权限、流程结果必须跑起来 FDE 的价值:把模糊需求变成客户团队能持续使用的系统
01

什么是前线部署工程师

驻扎现场、填平「模型能做的」与「客户需要的」之间的鸿沟。

都面向客户,但终点、计费、交付物决定了角色边界售前签约前赢单 · 幻灯片客户相信能成驻场外包按工时人走系统停交付人力咨询顾问给建议不背运行结果项目报告FDE签约后系统跑起来能力留客户FDE 不是销售、顾问或外包:它对结果负责,并把现场经验反哺产品
02

它和售前、咨询、驻场有什么不同

用一张对比表分清 FDE 的角色边界。

FDE 不是更深的专家,而是更宽、更会翻译、更敢担主人翁与叛逆对结果负责,敢推翻错误假设缺它:项目有人做,没人负责翻译业务结果把技术动作说成客户收益缺它:功能完成,价值说不清技术通才代码、接口、数据、云与企业基础设施缺它:问题看得见,现场解不了三层叠加才形成 FDE;只会写代码,仍然到不了现场结果
03

三种能力,而非一种

技术通才、翻译业务、主人翁与叛逆,三层叠加。

一个 FDE 同时连接四个世界,现场信息在这里汇合并回流FDE诊断 · 建造 · 反哺客户嵌入工作现场产品线把共性缺口做成能力销售用做出的结果重建信任组织培养能独立运转的团队真正的连接件不是传话,而是把现场问题变成可运行、可复用的结果
04

四个战场上的同一人

客户、产品线、销售、组织——四重身份的连接件。

选对战场

先筛问题,再进现场;理解机构约束,把验证范围收窄到能产生价值的切口。

先验证问题与方案的契合,再决定要不要动手具体痛点问题能被现场看见泛泛方向,无法验收经济性损失与收益可计算有痛,但不值得投入可行性数据、门槛、周期可确认数据不在手,方案落不了地三关不是评审流程,而是帮 FDE 拒绝无底洞
05

PSF:先问值不值得做

痛点具体性、经济性、可行性,三关不过别动手。

真实问题藏在工作现场,不藏在会议室里的需求里参与式观察跟着客户做真实工作先看动作,再听解释绕过翻译件直达痛点和数据源每转述一次就失真一次共同劳动并肩调试,获得真情报客户会在一起做事时放松影子工作法的产物不是访谈记录,而是可交付的问题定义
06

去现场,别在会议室

痛点只出现在工作现场,「影子工作法」是田野方法。

MVD 不减深度,只把验证范围收窄到能产生价值的切口真实数据直接接客户正在使用的数据样例成立不等于现场成立小范围深做只打一段流程,但做到端到端不要把 MVD 做成阉割版明确期限用周而不是半年验证价值期限越长,范围越容易膨胀MVD 的裁判不是 Demo,而是客户在真实流程里是否愿意继续用
07

最小可行部署

真实数据、缩小范围不缩深度、定死截止时间。

中国战场的部署约束,决定了 FDE 必须同时懂业务、合规和基础设施B/G 买单机构客户是主要需求主体决策链长,不能只对接个人央国企主引擎能源、金融、制造先进入核心场景业务责任人与采购链都要找到私有化与信创数据、算力、政务网有硬边界适配约束本身就是交付工作核心生产力从试点走入采购、交易和生产价值必须写进经营账本国内 FDE 的基本功,是在机构级约束里把结果真正跑起来
08

中国战场:B端、央国企与私有化

国内落地的主战场是政企,部署偏好私有化与信创,价值从试点走向核心生产力。

拿下信任

先选能成为灯塔的客户,再用真实结果、动手和诚实建立长期信任。

让系统活起来

上线不等于激活,用热修复、读旧写新、变革管理逼近真实使用。

把关系做长

用健康分做预警,按结果收费,从部门扩张到全网。

把打法复制

把每一次成功沉淀成打法手册,再产品化成平台能力。

把一次性的成功变成下一次可以直接调用的能力现场捕获记录坑、动作和决策规则趁交付结束前沉淀复用优先先翻手册,再重新设计成功项目也要复盘传播循环交付、沉淀、传播、获客把经验变成内容资产模板交接新人照着清单跑一遍降低交接和试错成本手册不是文档仓库,而是让交付质量随每一单变好的组织记忆
17

打法手册

让下一次交付更快的可复用能力。

同一个坑反复出现,就不该继续靠 FDE 手工解决现场问题重复缺口、连接器、工作流一次次交付变重FDE识别共性 · 反哺产品平台能力模板、连接器、评估集下一客户更快上手 交付越多,产品越成熟;产品越成熟,交付越轻
18

把交付变成产品

把现场学回来的反哺成标准能力。

不同公司、不同市场,反复出现的是同一条现场交付逻辑Palantir 起点从战场到训练营真实数据做出结果现场经验反哺平台国内政企样本进核心业务,不做 demo结果写进经营账本私有化与信创约束翻车实录千亿参数、200 万零上线钱花了但没有采纳流程 / 数据 / 范围先失守业内定义OpenAI、Ramp、LayerX 怎么说带着产品进现场的工程师不是会写代码的销售成功公式:接真实数据、挑窄流程、建评估、促采纳、持续反哺
19

一线实战案例

Palantir 起点、国内样本、翻车实录与业内定义。

同一套名字下面,四件事的难度差一个数量级该抄:现场出结果带真实数据几天做原型几周就能验证不需要平台底座也能起步抄不动:集成平台连接器、权限、评估口径沉淀成底座要数年工程投入没有它,定制部署会失控抄错:只改头衔把售前与客户成功改名 FDE成本不变,故事变贵考核口径一个字没动学不来的不是姿态,是支撑姿态的那层平台与纪律
20

什么时候不该学 Palantir

抄头衔最便宜也最坏;人进场却没有底座,就是贵一倍的外包。

先定组织形态,再招人FDE 团队四件事同时定,缺一条就退化汇报线挂产品或交付负责人,不挂销售编制单位两人一组,工程师 + 使命负责人考核口径复用资产与激活率,不背销售配额负载上限一个人同时能带活几家客户能被复制的不是英雄,是这四条约束
21

FDE 团队怎么组建

汇报线、编制、考核、负载上限——先定形态,再招人。

Agent 开发

先选对复杂度

先把复杂度压到最低:什么情况下根本不需要 Agent,需要时该从哪一级起步。

选能完成需求的最低复杂度确定性代码分支循环能写死就停在这模型调用只做判断或抽取就停在这Tool Loop下一步依赖中间结果才上Workflow有状态机与审批才上多 Agent要隔离或真并行才上每上一级都先回答:低一级为什么不够
01

先问这件事要不要 Agent

有大模型不等于 Agent,多步骤不等于多 Agent。先选最低的一级。

六域决定模型能不能交付Harness模型与业务环境之间的控制层Identity职责、权限与禁止动作Orchestration路径、依赖与人工节点Gate阶段准入与输出验收Recovery状态、重试与回退组件要可替换、可关闭、可消融
02

Harness:模型之外的工程控制层

模型负责判断,Harness 负责让判断变成可交付的结果。

判断归属层级再决定建不建L0 公开知识模型已内化,一行都别写L1 平台能力等平台,自建要标注待替换L2 组织流程信息不外露,团队核心杠杆L3 责任判断责任交不出去,必须机器执行补模型能力缺口的规则会随升级作废
03

哪些规则值得写进 Harness

规则不是越多越安全。只写模型造不出、责任交不出去的那两层。

自主度上界由验证能力决定模型自述完成措辞礼貌,无法判定看起来做完了机械判据测试变绿、产物存在、exit 0可信交付结果可被复查和回滚自主度才敢放开 验证容量不够时,先扩验证再谈自主
04

自主度的上限等于验证能力

能授予多少自主度,等于你能多便宜、多可靠地验证结果。

上下文工程

上下文是 Agent 唯一的工作记忆:装什么、怎么分层、怎么避免越跑越脏。

每一类来源都要声明信任与裁剪规则系统与安全规则SYSTEM:最高优先级,不可覆盖组织与项目规则ORGANIZATION,仅管理员发布用户输入与会话历史USER:能改任务,不能改权限检索与工具返回EXTERNAL:需标注来源与时间中间结果与记忆APPLICATION:可重算即丢弃上下文是预算分配,不是聊天记录
05

上下文里到底装了什么

十二类来源、六层信任,以及为什么窗口大不等于装得多。

噪音占比随步骤累积,不是模型变笨膨胀原始结果全量进上下文预算被历史提前吃掉稀释有用指令占比掉到 10%参数错误率开始上升腐坏纠正过的错误仍留在上下文重试消息继续推高膨胀焦虑模型草率收尾提前交差任务没做完就结束先量上下文噪音,再决定换不换模型
06

上下文是怎么一步步变脏的

稀释、腐坏、焦虑三种劣化,以及为什么 compaction 救不了焦虑。

理解意图交给模型,精确传递交给系统外置超 8000 字符存进 Artifact否则只传 3–5 个元素引用上下文只留 refId 与有界摘要摘要必须能追溯到原文按需取回outline、search 局部读取整段读回等于没外置绑定运行时直接注入参数模型搬 UUID 会截断幻觉精确数据走系统,不走模型
07

别让模型搬运数据

模型搬运 UUID 会截断、混淆、幻觉;让系统做管道,让模型做判断。

常驻的规则不是越多越安全Core每次 Run:目标与停止条件Scoped Rules按项目范围:目录与技术栈Phase Context进入阶段:契约与检查清单On-demand Reference触发时:专项规范与示例Artifact Data按需局部读取:大结果与日志给模型一张地图,不是一千页手册
08

分层加载与交接包

五层按需加载、结构化交接包,以及稳定前缀为什么能吃住缓存。

工具与环境

工具是契约,环境是能力边界。两者一起决定 Agent 能拿到多少真实反馈。

工具按任务切分,不按接口切分API 包装40 个端点就是 40 个工具选不准,改不动任务语义工具按任务重新切分与命名选得准,用得对契约声明风险、超时、幂等、输出裁剪错得起,恢复得了把模型推断不出来的东西全写进契约
09

工具是契约,不是 API 包装

工具描述决定选择准确率,输出裁剪决定上下文成本,错误契约决定能不能恢复。

能力上限由反馈决定,不由提示词决定内部环境反馈不公开、难验证质量悄悄下滑可验证反馈编译、测试、快照Agent 能力能验证的问题先被解决难题变得可交付 先修环境,再调提示词
10

环境反馈决定能力边界

环境是隐形质量杀手:它不崩不错,唯一的信号是输出质量轻微下降。

模型管判断,程序管循环声明依赖先画依赖图,找出无依赖部分并行取数共享上下文只取一次批量执行循环、过滤、重试交给代码一次性回报执行过程进 Trace 可回放同构批量应压缩成一次模型往返
11

批量与并行交给代码编排

逐个发起 LLM 往返时,延迟、token 消耗和跑偏概率都随 N 线性放大。

按你要的是发现还是执行来选MCP跨客户端动态发现能力代价:Schema 常驻类型化服务工具稳定业务操作与副作用代价:要写清契约CLI 与脚本编译、测试、迁移、健康检查代价:版本化维护动态发现用 MCP,可靠执行不用 MCP
12

MCP 与 Skill 的边界与成本

MCP 的成本是常驻的,Skill 的风险是供应链级的,两者都要按 Agent 设白名单。

状态与长任务

一次跑通不等于能交付:状态分层、中断恢复、副作用收据与多 Agent 的准入条件。

生命周期不同,就不能共用一个数组运行内状态当前步骤、预算、中断信号会话历史消息连续性与截断摘要流程检查点恢复、重放、人工暂停长期记忆跨会话偏好与已验证事实先分清恢复语义,再决定存在哪里
13

四类状态别混在一个数组里

一个数组装不下四种生命周期,混写的结果是既不能恢复也不能删除。

先定义完成,再设计恢复定义 Goal交付物、约束、验证方式分步推进每次只推进少量明确任务留下交接物计划、执行手册、审计日志进入终态阻塞或预算耗尽都要停交接物决定任务能不能跨会话活下来
14

长任务要有交接物和终态

上下文窗口一定不够用,撑住长任务的是文件系统上的交接物。

副作用要有幂等键、收据和明确阶段派发前记录意图,生成幂等键派发后记录已发出,等待确认结果确认写回结果,生成收据对账不确定时先查,不重放不确定就 reconcile,不确定的动作不许重来
15

回答不等于负责

回答错了可以重问;动作错了,邮件已经发出去、钱已经扣掉了。

多 Agent 是成本,不是默认值单 Agent一个上下文、一个责任主体代价:上下文撑不下时无从下手默认先走这条路Worker 池同构任务并行,彼此不协调代价:无层级时专挑小改动任务能独立并行才用协调者 + 专家规划、实现、验收各有归属代价:多一份 token 与延迟完成标准不同才值得拆分只在角色对应不同工程责任时才有价值
16

多 Agent 什么时候才值得

每多一个 Agent,就多一份 token、延迟、失败面和责任模糊。

评测与验证

先定义完成再写功能:评测集、四层指标、在线离线双轨,以及验证速度怎么追上生成速度。

没定义决策的优化,是在优化一个没定义的目标定义决策这套评估支撑哪个产品决策分层指标主要产出 / 安全约束 / 运维护栏选 Grader硬指标交给确定性判定单变量一次只改一个主变量进回归能力 Eval 毕业后守回归先回答决策,再选指标与 Grader
17

先定义完成,再写第一行代码

决策不定就调 prompt、换模型,跑得越快偏得越远。

都做对了,也可能是两种完全不同的工程水平结果层任务是否完成、输出是否可用偶然命中也算成功过程层规划是否合理、步骤是否稳定路径不可复现换批就崩效率层耗时、Token、工具调用次数贵的解与便宜的解同分风险层越权、误操作、安全隐患低频高危被平均分稀释四层一起看,才能区分可复现与运气
18

四层评测:结果、过程、效率、风险

结果对了不等于做对了,四层结构让路径质量可见。

Online 是告警信号,Offline 才是证据Online Eval生产 trace 采样,是 benchmark 不是 ground truth告诉你是否下降了Offline EvalCurated 数据集,带 ground truth告诉你改动是否真的改进只用一种只有 Online 无法验证修复;只有 Offline 看不见漂移一个在猜,一个在盲靠 ADLC 飞轮把生产 trace 变成下一版测试集
19

在线与离线两条腿

把生产评分当验收判据,是 Agent 团队最常犯的一类误判。

产出超过验证吞吐时,只有三个选项静态与类型秒级反馈,语法、类型、lint覆盖不到运行时行为单元测试秒级反馈,函数级行为happy path 盲区大集成与契约分钟级,真实依赖与契约环境不稳会误报端到端分钟级,浏览器与全链路慢,失败定位成本高人工评审小时级,只判机器判不了的吞吐最低,瓶颈本身不能默认发生:扩容、降速或降标准,必须显式选
20

让验证速度追上生成速度

没人声明放宽了什么,只是 review 从细看变成扫一眼。

安全、成本与上线

能跑之后的三件事: containment 与凭证边界、成本归因、上线指标与失败回流。

模型层只能降低概率,兜底在环境层沙箱边界限定文件系统与网络出口凭证最小权限按 Tool 和资源下发数据边界外部内容一律只是数据分级审批只拦高风险动作审计与身份AI-BOM 与可验证委托链能做什么由沙箱定,何时授权由审批定
21

沙箱、凭证与人机边界

模型层防不住的部分,只能靠文件系统、网络出口和凭证边界兜住。

先建基线再优化,用质量和安全做护栏预算Run 开始解析,软硬双限分层路由按能力与风险选模型缓存命中稳定前缀加确定性前置层成本归因拆到 Run、模型、上下文来源单位成功成本总成本除以成功任务数用质量、安全、稳定兜住降本动作
22

成本要能归因到每一步

拆不开的成本只能看涨跌,拆得开的成本才知道改哪里。

Demo 通过不是上线依据Demo 指标单次成功、流畅的参考答案重试与人工接管被藏起来上线指标成功率、All-pass@k、质量下限波动和长尾被显式暴露单位成功成本全部成本除以成功任务数降本必须过质量护栏先证明稳定,再谈规模化
23

上线看什么指标

Demo 只证明能力存在,上线要证明它在真实分布上稳定。

修系统结构,不是加一句 prompt 警告事故记录场景、期望与实际行为根因改结构,而不是加警告候选规则标 CANDIDATE 并限定范围回归验证离线 Eval 加灰度机械执行Gate 固化进 Workflow 或 CI沉淀不下来的失败会重复收费
24

从失败到工程资产

改一句 prompt 不算修复;变成 Gate、Validator 或回归测试才算。

生产运行

上线之后的运行纪律:故障先分类、恢复有分级、事件在安全点消费、发布是过程不是开关。

先分类,再计数,然后才谈熔断出错即重试限流和参数非法同等对待不可重试的错误被重试满次数分层分类API、工具、上下文、控制流各有映射只重试值得重试的那部分活性监控看门狗盯着不出水的「连接正常」卡死和结构损坏浮出水面错误到策略的映射表是运行时第一件资产
25

故障要先分类再计数

「出错就重试」把不可重试的错误也计了数;先分层分类,统计和熔断才有意义。

分级升级,逐级透明,条条有顶静默重试指数退避加抖动,前台后台区别对待降级与接续提升上限、断点续写、切备用模型暴露给用户附上已经尝试过的恢复动作全局兜底迭代上限、会话预算、连续失败升人工错误处理的边界是整个恢复循环,不是单次请求
26

恢复要有分级和熔断

三级恢复逐级升级、逐级透明;每条恢复路径的熔断上限要从生产数据里来。

三种策略只是三种对待安全点的方式事件循环取事件、推理、执行工具,回到边界安全点一段推理结束、一次工具返回取消式为紧急事件提前制造安全点队列式等自然边界,批量消费并行式独立会话轻量查询,标记后回写常态维持同步轨迹,打断是必要的妥协
27

事件只在安全点被消费

推理和工具执行中途不掐断:事件在循环边界排队,取消是提前制造安全点。

发布是一串闸门,不是一个瞬间开关式发布部署完成即全量生效故障面等于全部用户闸门式发布离线测试→影子→金丝雀→全面每级闸门都留着退路版本固定Prompt、模型、工具端点逐轮记录故障可复现才可归因闸门序列和回滚钩子在上线前就要存在
28

上线不是开关

把部署当瞬间的团队,把故障当惊喜的用户——发布该是一串有退路的闸门。

持续进化

让系统越跑越好而不越改越乱:归因认首错、评估集要养、经历变成学习、进化闭环有刹车。

主因取最早且能解释后续失败的那一个回放轨迹标出首个不可接受行为的步骤号与证据定位首错可能不报错,甚至不是工具调用归属根因观察通道缺失还是模型不会对症下药修 Harness、改流程或补数据转成回归同一条记录喂给重放用例归因记录同时是修复的工单
29

失败归因只认第一个致偏错误

端到端评估只说失败,归因要回答从哪一步开始失败——首个致偏错误才配当主因。

评估集要像产品一样迭代静态评估集构造完只使用、不维护分数上涨,现实脱节分层、防泄漏、失败回流活资产持续贴近真实任务分布改动决策有据可依 今天的线上失败,明天的回归用例
30

评估集本身要养

τ-bench 五处重设计、OSWorld 三百多个问题:每个可信基准都是养出来的。

记录与整理分离原始轨迹不可变,供审计与再分析单次分析本次成败、策略与经验草案跨轨迹归纳聚类对照,产出带证据表的知识迁移验证在未参与提炼的新任务上测效反思本身不是证据
31

保存经历不等于从经历学习

先存证据、后离线归纳,再用新任务验证迁移——三步缺一步都只是存档。

验证是否更强之外,限制谁能改什么证据与指令隔离不可信证据不进长期能力待验证与正式隔离新能力先住进不可服务真实流量的区安全机制不可自我修改验证器、门槛、审计、稳定版在提案权限之外保证来自被修改者够不着的那一层
32

进化闭环需要三道刹车

提示注入不能借道经验、退化不能借道验证器——自动进化外围的三条硬边界。