如何评估 Prompt 效果:从“感觉不错”到可比较的检查指标
建立测试样本、评分维度和版本对比方法,让 Prompt 的好坏不再只靠印象判断。
相关工具
“感觉不错”不是评估方法
一个答案读起来流畅,不代表它完成了任务、事实准确或格式可用。评估 Prompt,要先写出什么算好,再用同一组案例比较不同版本。否则每次换一个材料、换一个心情,就可能得出完全相反的结论。
评估的对象也不只是某一次输出。一个 Prompt 可能在标准案例上表现很好,遇到缺字段、冲突信息或长材料就失效;也可能内容很准确,却没有按用户要求输出字段。要看整体稳定性,必须准备一组有变化的测试样本。
资料中关于模型评估、输出质量和迭代优化的内容,可以落到四个动作:定义标准、准备案例、运行对比、记录问题。评估不是为了给 Prompt 贴一个漂亮分数,而是为了知道下一次应该改哪里。

从任务完成度、事实准确性、格式合规性、表达可读性和风险边界评价输出。
先定义什么叫合格输出
评分之前先写合格条件。资料摘要的合格条件可能是覆盖指定主题、保留数字和限制条件、删掉重复背景;工作邮件的合格条件可能是对象明确、目的清楚、行动请求具体、时间要求完整;方案的合格条件则包括目标可衡量、步骤有负责人、风险有应对动作。
标准要尽量写成可以判断的句子。与其说“表达专业”,不如说“术语首次出现时解释,避免夸张承诺,结论与材料一致”;与其说“内容完整”,不如说“覆盖任务中列出的五个字段,缺失项标记待确认”。
还要区分硬标准和软标准。事实错误、任务遗漏和越权行为通常是必须修正的问题;句子是否更优雅、标题是否更有吸引力,可以作为建议优化项。所有标准都放在同一层,会让评分失去重点。
如果不同使用场景需要不同标准,可以建立基础评分表和场景附加项。这样既保持比较的一致性,又不会用一套规则硬评估所有任务。
准备覆盖变化的测试样本
测试样本不应只来自最容易的标准案例。至少包括正常输入、缺字段输入、长材料、冲突信息、边界情况和超出范围的请求。这样才能看出 Prompt 是否真的理解规则,而不是只记住了常见表达。
样本可以从真实历史任务中脱敏整理,也可以人工构造。真实样本能反映实际问题,人工样本方便覆盖极端边界。两者结合,比只用一组漂亮示例更可靠。
测试样本要固定版本。若每次评估都偷偷更换材料,结果无法比较。可以给每个样本编号,记录输入特征、期望结果和关键风险;修改 Prompt 后使用同一组样本运行,再另加一小组新样本检查迁移。
对于高风险任务,不要只准备文本样本。还要准备可能触发权限、隐私、冲突和不确定性的案例,检查模型是否会暂停、标记或请求确认。
用评分表替代一句“好不好”
评分表不必复杂。每个维度可以用通过、部分通过和未通过三个等级,再附一句问题说明。任务完成度看是否完成了所有核心要求;事实准确性看关键陈述是否有依据;格式合规性看字段、顺序和长度;可读性看读者能否理解和行动;风险边界看是否标记不确定和避免越权。
如果需要量化,可以给不同维度设置权重。高风险任务中,事实和安全应高于语气;内部头脑风暴中,发散和数量可能更重要。权重不是为了制造精确假象,而是帮助团队在意见不一致时说明判断依据。
评分后要记录具体问题,不能只记一个总分。总分上升但关键事实错误仍然存在,不能算真正改进;某个格式问题变差却不影响核心任务,也不应该掩盖整体质量提升。

旧版本与新版本使用同一组测试样本和评分表,比较改进项与退化项。
比较版本时要看改进和退化
修改 Prompt 后,不要只看一个最好的新结果。旧版本和新版本应该处理相同的测试集,再逐项比较哪些地方变好、哪些地方变差。新版本让文章更自然,却删掉了限制条件;或者格式更整齐,却开始补造缺失数字,都是需要记录的退化。
版本记录至少包含版本号、修改内容、修改原因、测试样本、结果摘要和已知问题。不要只写“优化了 Prompt”,要写“增加缺失字段处理规则”“把读者从普通用户改为内部运营人员”这类可追溯信息。
一次最好只改一类主要规则。若同时改变任务目标、角色、示例、格式和评分表,结果变化很难归因。先解决高影响问题,再逐步处理表达偏好,比较更清楚。
版本对比不需要追求每个维度都上升。真实任务有取舍,关键是确认改动符合当前优先级,并知道哪些场景仍然需要人工复核。
人工复核不能完全交给模型
AI 可以辅助评分,例如检查字段是否齐全、格式是否符合、某句话是否能在材料中找到依据;但涉及业务判断、隐含语气、事实来源和风险影响时,仍需要合适的人复核。
人工复核要有明确角色。熟悉业务的人负责判断内容和边界,熟悉表达的人负责可读性,使用结果的人负责是否真的能完成工作。一个人可以承担多个角色,但不要默认写 Prompt 的人就能判断所有维度。
为了减少主观差异,可以先让两个人分别评分,再只讨论分歧最大的案例。把分歧转化为评分标准的补充,下一轮评估会更稳定。评估本身也在帮助团队统一“什么叫可用”。
高风险输出即使评分很高,也不应直接自动执行。评分是质量信号,不是授权证明。关键动作仍需权限检查和人工确认。
一份 Prompt 评估模板
下面的模板适合评估一个新 Prompt 是否值得进入日常使用。把任务、样本和标准换成自己的内容即可。
示例 Prompt: 任务:评估下面这个 Prompt 在一组测试样本上的表现。 Prompt:<<<粘贴待评估 Prompt>>>。 测试样本:每个样本包含输入、期望结果和需要重点检查的风险;请不要只使用最简单的标准案例。 评分维度:任务完成度、事实准确性、格式合规性、表达可读性、风险与边界。每项使用通过、部分通过或未通过,并给出一句具体依据。 比较规则:如果有旧版本,请让两个版本处理完全相同的测试样本;分别列出改进项、退化项和仍未解决的问题。 输出结构:一、总体结论;二、逐样本评分;三、逐维度问题;四、版本差异;五、下一轮最值得修改的三项规则。 边界:不要因为答案流畅就默认事实正确;不能确认的内容标记待核验;不要把评分结果当成自动执行授权。
运行后不要直接根据总分改 Prompt。先查看失败案例,判断问题来自任务定义、材料、示例、格式规则还是评估标准,再针对原因修改。这样比不断增加“请更准确、更专业”的形容词有效。
建立一个轻量的评估闭环
可以把评估流程固定成七步:准备测试集,定义评分标准,运行多个案例,人工复核,分析问题,修改 Prompt,重新测试。每轮只解决少数高影响问题,避免为了追求一个分数把模板改得越来越复杂。
新版本通过基础测试后,还要用没有出现在测试集里的新案例验证。尤其要检查模型是否只记住了示例表面,而没有学会任务规则。如果新案例表现明显变差,说明需要补边界或重新定义任务范围。
评估记录可以很轻量,一张表就够:样本编号、版本、问题类型、严重程度、修改动作和复测结果。长期积累后,这张表会告诉你哪些问题反复出现,也能帮助决定哪些规则值得固化到模板中。
Prompt 评估不是一次性验收,而是把“好不好”变成可观察、可比较、可修正的工作过程。标准清楚,测试稳定,版本可追溯,AI 输出才真正有机会持续变好。

从准备测试集、定义标准到复核、修改和重新测试,形成持续改进循环。
常见问题
Prompt 评估一定要打分吗?
不一定。通过、部分通过、未通过加具体问题说明,已经足够支持很多团队的版本比较;量化分数只是辅助。
测试样本应该准备多少?
没有固定数量,重点是覆盖正常、缺字段、冲突、边界和超范围情况。任务越复杂,样本组合越需要丰富。
评估分数高就可以自动执行结果吗?
不可以。评分反映质量,不代表权限和事实绝对正确。高风险结果仍需应用层检查和人工确认。