Prompt 迭代优化:别指望第一版就写对
讲清楚如何根据输出问题逐轮修改 Prompt。
相关工具
先接受一件事:第一版通常不会刚好可用
很多人写 Prompt 时最容易急。输入一句需求,等 AI 给答案,然后立刻判断“这个模型不行”或者“这条提示词没用”。但从 文中的提示工程案例看,Prompt 更像一个需要试跑的工作说明,不是一次写完就永远正确的口令。先写初版,运行,检查结果,再针对问题补条件,这才是更稳定的做法。
LLM 全教程里用一份椅子的技术说明书做例子:最开始只要求模型根据说明书写一段营销描述,结果确实生成了文案,但太长,也太像面向普通消费者的宣传稿。后来逐步加入“最多 50 个词”“面向家具零售商”“侧重材料和构造”“补充产品 ID”“输出 HTML 和尺寸表格”等要求,结果才越来越接近可交付状态。
这个例子很朴素,却很适合日常工作。我们让 AI 写文章、整理会议、生成 PPT 大纲、提取表格,常常也是先得到一个“差不多但不能直接用”的版本。真正有价值的不是收藏一条万能 Prompt,而是知道下一轮该改哪里。

先运行,再看问题,最后只改最影响结果的那一项。
看输出,不要只看顺不顺眼
检查输出时,别只用“好不好”“像不像 AI”来判断。这样的判断太粗,下一步很难改。更好的方式是把问题拆开:长度是否合适,受众是否对,重点有没有抓错,格式能不能直接用,有没有编造材料中没有的信息。
椅子说明书案例里,第一版的问题不是完全错,而是太长。于是第一轮优化只加了长度限制。第二个问题是受众不对,文案对消费者讲氛围,却没有面向零售商强调材料、结构和技术信息。于是下一轮补上受众和关注点。再后面希望用于网页,就继续要求 HTML、表格、字段和表名。
这种检查方式很适合工具站的教程写作。比如让 AI 根据 资料 生成一篇教程,第一版可能内容很全,但结构松;第二版可能结构好了,却有套话;第三版可能语气自然了,但例子不够。每一轮只盯一类问题,修改会更准。
先改限制,再改风格
很多人一看到结果不满意,就会继续加“专业一点、自然一点、逻辑更强、不要像 AI”。这些词有时能让语气稍微变化,但解决不了根本问题。输出太长,就写字数或条数限制;格式乱,就给字段和示例;重点跑偏,就补任务目标和读者;资料不足,就写清边界。
长度限制也要理解它的误差。LLM 全教程里提到,模型对词数和字数的控制不一定精确,因为它内部按分词器处理文本。你要求 50 个词,它可能给出接近但不完全一致的长度。实际使用中,可以换成更容易执行的约束,比如“输出 3 段,每段不超过 80 字”“列 6 条以内”“每条只写一句”。
风格当然也要调,但最好放在结构和事实之后。先让结果有用,再让它好读。否则你会得到一段语气很顺、事实却不稳的文字,这类内容最麻烦。

把“不满意”拆成具体问题,下一轮 Prompt 才知道该补什么。
受众错了,内容就会错位
同一份材料,面对不同读者,应该抽取不同信息。椅子案例中,普通消费者可能关心是否好看、是否舒适、放在家里是否合适;家具零售商更关心材料、结构、规格、可选配置和合同使用资格。如果 Prompt 没写清读者,模型就会选一个默认角度。
清华 DeepSeek 职场资料里的 RTGO 和 CO-STAR 框架都把角色、目标、上下文、受众、回应格式放进提示语结构。它们看起来名称不同,但落到工作里就是几句话:你是谁,给谁看,要达到什么效果,按什么格式交付。写清这些,模型才不会把面向老板的周报写成公众号口吻,也不会把给新手看的说明写成行业报告。
如果你不知道怎么补受众,可以直接问自己三个问题:这段结果给谁看?他已经知道什么?他拿到结果之后要做什么?这三个答案,通常比一句“写得专业点”更有用。
复杂任务要拆,不要一口气要最终稿
清华 DeepSeek 资料里的 PPT 案例不是直接让模型“做个 PPT”,而是拆成确认主题、收集资料、整理摘要表格、生成大纲、再生成核心流程图。可视化图表案例也要求先收集流程描述,再分析结构,生成 Mermaid 代码,最后校验语法。这种拆法值得学。
复杂任务最好分阶段做。比如写一篇教程文章,可以先让 AI 根据 资料 提炼目录和知识点;第二轮确认文章主线;第三轮写正文;第四轮检查事实和术语;最后再润色语言。每一步都有明确交付物,出错时也容易定位。
一次性要求最终稿的问题在于,模型要同时处理事实、结构、语气、格式、长度和边界。要求越多,越容易漏。拆开之后,每轮只解决一类问题,整体反而更快。
给格式,是为了让结果能继续流转
Prompt 迭代到后面,常常不是改内容,而是改交付格式。椅子案例最后要求把描述放进 `div`,尺寸放进两列表格,并给表格命名。这一步很像真实工作:写出来只是第一步,能放进网页、表格、文档或系统里,才算真的可用。
所以你在写 Prompt 时,要提前想下一步。要给同事看,就输出清单;要导入工具,就输出 JSON 或 CSV;要放进文章,就输出 Markdown;要做图,就输出 Mermaid;要做 PPT,就把章节、页面标题、页面要点分层写清楚。
格式越接近最终用途,人工整理越少。尤其是批量任务,格式不稳会让后面每一步都变成手工修补。
记录版本,比反复重写更有用
Prompt 迭代最怕没有记录。今天觉得这个版本好,明天换一份材料又忘了为什么好。比较实用的做法是留下四样东西:原始 Prompt、模型输出、哪里不满意、下一版改了什么。
记录不用复杂。比如 V1 输出太长,V2 加了长度限制;V2 虽然短了,但信息深度不够,V3 补了读者和关注点;V3 结构松散,V4 固定成“背景、要点、建议、总结”四块。几轮之后,你得到的不只是一篇文章,而是一套能复用的提示语写法。
这也是为什么不要沉迷“万能模板”。真正适合你的 Prompt,往往来自你自己的失败样本。失败样本越清楚,下一版越好改。

把每轮改动和观察结果留下来,后面才知道哪些写法真的有效。
可以直接套用的迭代改写法
当你拿到一个不满意的输出,可以按下面这段方式追问。它比“重新写”“再好一点”更明确。
请根据上一版输出做一次定向修改。
我不满意的地方:
1. 内容太长,读者不容易抓重点。
2. 更像宣传文案,缺少材料里的技术细节。
3. 输出格式不能直接放进网页。
请修改为:
1. 正文控制在 300 字以内。
2. 面向有采购需求的家具零售商,重点写材料、结构、尺寸和可选配置。
3. 输出为 Markdown,包含「产品简介」「关键规格」「适合场景」三部分。
4. 不新增说明书中没有的信息。这段提示词没有花哨技巧,只是把问题说具体。下一轮输出如果仍然不满意,再继续缩小问题:是长度没控住,还是受众仍然不准?是缺了字段,还是格式不稳定?这样改两三轮,通常就能得到比第一版稳得多的结果。
常见问题
Prompt 需要迭代几轮才算正常?
简单任务一两轮就够,复杂任务三到五轮很常见。关键不是轮数,而是每一轮都知道自己在修什么问题。
结果不好时,是换模型还是改 Prompt?
先看问题类型。格式、长度、受众、材料边界这类问题,通常先改 Prompt;复杂推理或能力不足的问题,再考虑换模型或拆任务。
要不要保存每一条 Prompt?
不用全部保存。建议保存高频任务的有效版本,以及失败后怎么改好的记录,这些比零散模板更有复用价值。