如何给 AI 提供高质量原材料:先清理,再分层,再标注边界
从 资料、会议记录、表格和网页中整理出可用上下文,减少噪声、重复和无依据补写,让 AI 真正依据材料完成任务。
相关工具
资料不是越多越好
把一整份 资料 直接复制给 AI,再补一句“请根据资料写一篇文章”,看起来省事,实际往往会增加返工。原文件里可能有页眉、页脚、页码、重复标题、扫描识别错误、目录和正文混在一起的内容。模型看到了这些信息,却不知道哪些是事实,哪些只是排版痕迹。它当然可以继续写,但输出会把噪声也带进去。
资料的价值不只取决于数量,还取决于能不能被准确定位和使用。一个干净的三页摘录,可能比一百页没有结构的全文更适合回答具体问题。给 AI 提供原材料时,应该先问自己:这份材料要解决什么任务?哪些内容是直接证据?哪些只是背景?哪些内容过期、重复或与当前问题无关?
《LLM 入门资料》把总结、转换、推断和评估分成不同任务,这个思路也适用于资料准备。总结需要保留主题和关键事实,转换需要保留原意和字段,推断需要明确依据和假设,评估则要让结果能够对照标准。任务不同,材料的整理方式也不同。

先清理排版噪声,再按主题分段、标注来源,最后形成可以直接放入 Prompt 的上下文。
第一步:把排版噪声和事实分开
资料 转出来的文本常常不适合直接使用。页码、页眉、页脚和重复章节名会在每页之间反复出现;双栏排版可能让两列文字交错;表格里的行列关系可能被打散;扫描件还可能把数字、英文缩写和专有名词识别错。整理材料时,先处理这些结构问题,再谈内容改写。
清理不是把原文改得更漂亮,而是删除不会影响理解的排版痕迹,保留会影响判断的事实。页码可以去掉,但“第 12 章”如果有助于定位来源,就应该保留或单独记录;重复的页眉可以删除,表格中的单位、时间范围和统计口径不能随便删除;明显的识别错误应当标出来,而不是默默替换成一个看起来合理的词。
一个实用方法是先保留原始版本,再建立清理版本。原始文件用于回查,清理版本用于 Prompt。每次修改记录删掉了什么、修正了什么、哪些地方仍然不确定。这样做多花一点时间,却能避免在文章写完后才发现某个数字已经在清洗过程中被改掉。
第二步:按主题分段,不要只按页码切
页码是文件的物理结构,不一定是问题的知识结构。一个主题可能跨越两三页,也可能在同一页里和另一个主题并列出现。如果只按固定页数切割,模型拿到的片段可能缺少标题、定义或结论,回答时就容易把不同段落拼错。
更好的分段单位是一个相对完整的问题或观点:标题、定义、说明、例子和限制条件尽量放在一起。对于会议记录,可以按议题、决定和待办事项分段;对于产品文档,可以按功能、使用条件和异常处理分段;对于研究报告,可以按研究问题、方法、结果和局限分段。每个片段都要让人单独读得懂。
分段时最好保留层级信息。例如,在片段前写上“主题:监督学习”“章节:机器学习基础”“来源页:156-157”,而不是只留下几段没有标题的正文。标题不是装饰,它告诉模型这段话属于什么范围,也方便你在输出中追溯来源。

核心事实用于回答,必要背景帮助理解,明确边界负责限制模型不要把推测当成材料结论。
第三步:给每段材料加上来源标签
来源标签的作用不是让文章看起来严谨,而是让错误可以被追查。一个可用的标签至少可以包含文件名、章节或标题、页码,以及必要的版本或日期。对于网页材料,还可以记录页面标题和访问时间;对于会议记录,可以记录会议日期和参与范围;对于表格,可以记录统计口径和数据时间段。
标签要放在模型能够理解的位置。可以在每段材料开头写“来源:某书第 12 章,156-157 页”,也可以把多段材料整理成带有 source、section、page、content 字段的 JSON。关键是保持格式稳定,不要一会儿把来源放在段尾,一会儿又藏在文件名里。稳定的来源结构会让后续引用和复核更方便。
如果材料之间存在冲突,也不要替模型先做掉。可以并列标注“版本 A”“版本 B”,说明各自日期和来源,再要求 AI 先指出冲突,不能直接合并成一个新结论。资料整理的目标是保留判断所需的信息,而不是提前制造一个看似统一的答案。
上下文要分三层:事实、背景和边界
核心事实是材料直接给出的内容,例如数字、日期、定义、步骤和原文结论。它们是回答的地基,应该尽量保留原始表述、单位和条件。必要背景用于帮助理解事实,比如使用场景、读者、术语含义和任务目的。背景可以适当压缩,但不能让模型失去判断事实所需的条件。
明确边界则是告诉模型哪些事情不能做。常见边界包括“仅根据提供材料回答”“材料没有提到的内容标记为待确认”“不要改变原始数字和日期”“区分事实、原文观点和你的推测”。很多幻觉并不是模型看不懂资料,而是材料没有告诉它什么时候应该停下来。边界写清楚,回答就更容易保持可追溯。
三层内容不必每次都用相同标题,但最好在脑中分别检查。只有事实没有背景,回答可能准确却不适合读者;只有背景没有事实,回答可能流畅却没有依据;没有边界,模型可能把常识、猜测和原文混成一种口吻。把三层内容放在一起,才是可用的上下文。
材料不足时,要让 AI 说“不足”
资料任务里最危险的要求之一是“请完整回答所有问题”。如果材料只提供了部分信息,模型可能为了满足“完整”而补写缺失内容。更稳妥的要求是:先判断材料是否包含答案;如果没有,明确写“材料未提供”;如果只能做有限推断,就把推断和原文事实分开。
这不是让模型变得保守,而是让回答的可信程度有层次。可以要求输出时增加“依据”或“来源”字段,无法找到依据的结论不要写成确定语气。对于数字、日期、价格、政策和合同条款,尤其要保留原文中的限定条件,不能因为句子更顺就把“可能”“预计”“截至某日”删掉。
如果你确实希望 AI 补充外部常识,也要把这部分单独命名,例如“材料内结论”和“基于通用知识的补充”。两者分开,读者才知道哪些内容可以回到文件核验,哪些内容需要另外查证。资料边界越清楚,后续的人工审核越省力。
按任务准备材料,而不是把全文一股脑塞进去
做摘要时,重点材料是完整正文和标题层级;做字段提取时,重点是包含目标字段的段落和格式说明;做对比时,重点是两份材料中相同维度的内容;做方案时,还要补充目标、限制条件和评估标准。把所有资料都交给模型,并不会自动让它完成筛选,反而可能让重点被淹没。
可以把材料分成“必须参考”“可选背景”和“不要使用”三组。必须参考的内容直接放进上下文;可选背景只在确有必要时补充;明确不要使用的旧版本、重复文件或无关段落,最好从输入中删除,而不是希望模型自己忽略。对长任务,还可以先让 AI 建立材料索引,再按问题调用相关片段。
《LLM 入门资料》里关于文本总结、推断和转换的练习,都有一个共同前提:输入格式足够清楚,模型才容易稳定完成目标。材料准备不是 Prompt 之外的杂活,而是 Prompt 工程的一部分。输入越接近任务,输出越容易评估。
一份可以直接复用的资料输入模板
如果你经常处理 资料、会议记录或内部文档,可以先把材料整理成下面这种结构。它不要求复杂工具,纯文本也能使用:
任务:根据提供的材料,提取与“用户反馈问题”有关的事实,并按问题类型整理。
材料范围:只使用下方材料,不使用材料之外的数字、日期和结论。
读者:产品团队,用于下一次需求评审。
处理规则:
1. 保留原文中的数字、时间、产品名称和限定条件。
2. 删除页眉、页脚、重复标题和与任务无关的内容。
3. 如果不同来源存在冲突,分别列出,不要自行合并。
4. 材料没有提供的信息写“未提供”,不要猜测。
输出格式:Markdown 表格,列为问题类型、用户原话、出现频次、来源和待确认事项。
材料:
[来源:客户访谈记录,2026-07-18]
<<<
在这里粘贴已经清理并分段的材料
>>>这份模板的重点不在固定句式,而在于它把材料范围、证据边界和交付格式写了出来。换成总结、改写或对比任务时,只需要替换任务、处理规则和输出字段,其他部分可以保留。这样建立的小模板,比一份什么场景都想覆盖的长 Prompt 更容易维护。
提交给 AI 前做一次来源核验
材料整理完后,不要立刻开始生成文章。先做一次短核验:来源是否明确,内容是否完整,有没有重复或冲突,数字和日期是否保留,缺失信息是否标注,最终结果能不能回到原文。这个步骤不需要很复杂,但能提前发现最容易造成大问题的输入错误。
如果材料需要多人协作,还应统一命名和版本。文件名、章节名、页码和更新时间尽量使用同一套写法;修订后保留版本号,旧版本不要和新版本混在同一个上下文里。模型无法替你判断“哪个文件才是最新的”,除非你把版本关系写出来。
高质量原材料的标准很朴素:读者能看懂,模型能定位,审核者能回查。先清理,再分段;先保留事实,再压缩背景;先标出边界,再要求生成。做完这些,Prompt 不需要堆很多形容词,材料本身就会把回答带到更可靠的方向。

逐项确认来源、完整性、冲突、数字日期、缺失信息和可追溯性,未通过时先补资料再生成。
常见问题
把 资料 全文交给 AI 不是更完整吗?
不一定。全文可能包含页眉页脚、重复段落、目录和无关章节,反而增加模型识别重点的难度。建议先按任务提取、清理和分段。
资料清洗时可以直接改错别字吗?
明显的排版或识别错误可以修正,但数字、日期、专有名词和原文结论应保留原样或标记为待核验,并保留原始版本方便回查。
材料不足时怎样避免 AI 自行补充?
在 Prompt 中明确仅根据材料回答,要求材料未提供时写“未提供”,并把事实、推断和外部常识分开输出。