如何让 AI 做自我检查:把评价标准写进 Prompt
让 AI 先按事实、完整性、格式和风险边界检查答案,再输出修改清单,减少看似流畅却不能直接使用的结果。
相关工具
为什么要让 AI 检查自己的答案
生成完成不等于任务完成。AI 很擅长把句子写顺,却不一定会主动发现材料遗漏、格式不符或结论超出了证据范围。尤其是资料整理、方案写作和业务沟通,答案的问题往往不是“完全错误”,而是少了一个关键条件,或者把不确定的推测写成了确定事实。
因此,Prompt 不能只描述产出,还要描述检查方法。让 AI 在交付前回答:我是否完成了任务中的每一项要求?每个重要结论是否能在材料中找到依据?格式是否方便读者继续使用?有没有遗漏的风险、例外情况或待确认信息?这一步相当于给生成过程加了一道质量门槛。
资料中提到的评价标准、分步处理和迭代优化,本质上都在解决同一个问题:不要把第一版输出直接当成最终答案。先生成,再对照标准检查,最后根据问题修订,通常比不断重复一句“请写得更好”有效得多。

生成初稿后,对照任务标准检查问题,再回到修改环节并进行二次验证。
先区分生成任务和检查任务
很多 Prompt 只写了一个大任务:请根据材料写一篇文章,并检查是否准确。这样写的问题是,生成和检查混在了一句话里,模型容易把检查理解成一句客套话,生成完后只补一句内容已核对,而没有真正列出核对过程。
更稳妥的写法是把任务分成两个阶段。第一阶段生成初稿,要求内容结构完整;第二阶段暂时不要改写,先按清单逐项审查,指出证据不足、信息遗漏、逻辑跳跃和格式问题;第三阶段再根据审查结果输出修订稿,并说明哪些地方仍然需要人工确认。
分阶段并不意味着每次都必须发送三条消息。复杂任务可以分步调用,简单任务也可以在一条 Prompt 中明确顺序:先完成初稿,再输出检查表,最后给出修改后的版本。关键是让模型知道检查发生在什么时间、检查什么对象、发现问题后如何处理。
如果希望保留过程,可以要求 AI 输出问题清单和修改摘要;如果只需要最终文本,则可以要求它在内部完成检查,只输出最终版本和无法确认的事项。输出过程的多少取决于使用场景,但检查标准不能省略。
评价标准要写成可以判断的条件
“请保证质量”不是评价标准,因为质量没有被拆开。更具体的标准应该描述检查对象和通过条件,例如:每个结论都能在材料中找到对应信息;材料没有提到的数字必须标记为待确认;文章必须覆盖给定的五个问题;标题、摘要和正文不能互相矛盾;表格列名和每一行数据保持一致。
一个实用的检查框架可以分成五个维度。第一是事实准确,检查名称、数字、时间、因果关系是否有依据。第二是任务完整,检查用户要求的对象、范围和交付物是否都出现。第三是逻辑连贯,检查前提、结论和建议之间是否跳步。第四是格式合规,检查标题层级、字段、长度和代码格式。第五是边界清楚,检查推测、风险、例外和待确认信息是否被标注。
不同任务可以调整权重。资料摘要更重视事实和完整性,工作邮件更重视对象、行动请求和语气,方案写作更重视资源、风险、时间与验收。不要把所有检查项都写成同等优先级,否则模型会在不重要的格式问题上花很多篇幅,却漏掉真正影响结果的事实错误。

事实准确、任务完整、格式合规、语气合适和风险边界共同决定答案是否可交付。
让 AI 把问题分成严重程度
检查结果不应该只是一长串问题。可以要求 AI 将问题分成三类:必须修改的问题、建议优化的问题和需要人工确认的问题。必须修改通常包括事实错误、任务遗漏、格式不符合要求和可能造成误解的表达;建议优化包括段落顺序、例子数量和语句简洁度;人工确认则包括材料没有给出、权限不足或需要业务判断的内容。
严重程度还可以结合影响来判断。一个错别字可能不影响交付,但一个日期错误、金额错误或责任人错误可能直接导致执行失败。Prompt 中可以明确:优先处理会改变结论、影响决策或造成实际损失的问题,低影响的语言润色放在后面。
如果材料中存在冲突,也不要让 AI 直接替用户选择。应要求它列出冲突位置、各自依据、可能影响和需要确认的决策。这样做比强行生成一个统一答案更诚实,也更方便后续追溯。
检查之后要有修改动作
自我检查的价值不在于指出问题,而在于推动修改。一个完整的复核 Prompt 应该说明:发现事实问题时回到原材料核对;发现遗漏时补齐对应字段;发现逻辑跳跃时增加必要前提;发现格式问题时按模板重排;无法确认时保留标记并列入待确认清单。
修改时要注意保护原意。让 AI 修订文章,不等于允许它顺便改变结论、删掉限定条件或增加材料中没有的观点。可以加上明确规则:只修改检查清单中确认的问题,保留原文事实和范围;如果修改会改变原意,先说明原因,不要直接替换。
为了便于复盘,可以让 AI 最后输出一份简短修改摘要,包括问题、处理方式和剩余风险。这个摘要不是给读者看的宣传文字,而是帮助使用者判断这次修订到底做了什么。
把复核流程放进不同任务
写文章时,可以检查主题是否覆盖、事实是否有依据、段落是否重复、例子是否真的解释了概念。要求 AI 先列出缺口,再改写全文,能减少为了追求流畅而牺牲准确性的情况。
整理会议记录时,重点检查参会人、决定事项、待办、负责人和截止时间。若记录没有明确负责人,就标记为待确认,不要根据语气推断谁负责。对带有“尽快”“后续跟进”这类模糊表达的内容,也可以要求 AI 单独列出需要澄清的问题。
写工作邮件时,复核对象、目的、背景、行动请求和时间要求是否齐全。邮件不需要把所有讨论过程都写进去,但收件人应该能看懂为什么收到这封邮件、需要做什么、什么时候回复。检查语气时还要避免把明确请求改成空泛的礼貌话。
生成方案时,检查目标是否可衡量,步骤是否有负责人和交付物,风险是否有应对动作,时间表是否体现依赖,验收标准是否能获得数据。不同任务的检查项不同,但方法是一致的:先定义完成条件,再让 AI 对照条件复核。

按照事实、遗漏、推理、格式和修改清单逐项检查,必要时返回上一环节修订。
一份可以直接使用的自检 Prompt
可以把下面的模板接在任何较长任务之后。使用时,把任务目标、原材料和检查标准换成自己的内容。若任务风险较高,建议把检查结果单独保留下来,不要只看最后一版文字。
示例 Prompt: 请先不要润色,按照下面的标准检查刚才的输出。 一、事实:逐项核对名称、数字、时间和因果关系;材料没有提供的内容标记为待确认。 二、完整性:检查是否完成了任务目标,是否覆盖用户明确要求的对象、范围和交付物。 三、逻辑:检查每个结论是否有前提,建议是否与问题相关,是否存在跳步、矛盾或重复。 四、格式:检查标题层级、字段顺序、长度、列表和代码格式是否符合要求。 五、边界:区分事实、推测、建议和风险,不要把不确定内容写成确定结论。 请把问题分为必须修改、建议优化、需要人工确认三类,并说明依据。然后只修正已确认的问题,保留原意,最后输出修订稿和三条以内的修改摘要。
如果输出本身是表格,还可以增加:检查每一行是否使用相同字段,空值是否有统一表示,数字单位是否一致,比较维度是否混用。如果输出本身是代码,则要增加:检查语法、边界条件、输入校验和错误处理,并明确哪些行为没有在当前环境中实际运行验证。
不要把自检当成人工审核的替代品
自我检查可以减少低级遗漏,但它仍然依赖同一个模型和同一批输入,不能保证发现所有错误。尤其在法律、财务、医疗、安全和生产系统等场景,AI 的检查结果只能作为辅助,关键事实、关键数字和最终决策仍需要有权限的人复核。
比较稳妥的做法是把检查分成两层:第一层由 AI 做结构化复核,处理遗漏、格式和明显矛盾;第二层由人工检查材料来源、业务判断和高风险结论。这样既能节省时间,也不会因为一份看起来很完整的检查报告而放松警惕。
好的 Prompt 不会承诺答案永远正确,它会让错误更容易被看见、被定位和被修正。把评价标准写进任务,把问题分级,把修改范围说清楚,AI 才能从一次性生成器变成一个更可靠的协作工具。
常见问题
让 AI 自我检查时,应该要求它展示完整推理过程吗?
不必要求展示完整内部推理。更实用的做法是要求它输出可核对的检查项、问题依据、修改动作和待确认事项。
自我检查 Prompt 应该放在生成任务前还是后?
通常放在生成要求之后,并明确先生成、再检查、后修订的顺序。复杂任务也可以拆成多轮,让检查结果单独输出。
为什么 AI 说已经检查,却仍然会漏问题?
因为“检查质量”太模糊,模型缺少可执行的判断条件。把事实、完整性、逻辑、格式和边界拆成具体检查项,结果会更稳定。