DeepResearch 完整实践:从一个问题到一份研究报告
用一个小型研究案例串起问题拆解、资料检索、文献整理、数据分析、结论写作和复核,让 DeepResearch 变成一条可以重复使用的工作流程。
相关工具
先选一个足够小、又值得回答的问题
综合实践不适合从“人工智能将如何改变世界”这样的宏大主题开始。我们选择一个更具体的问题:在资料整理和初步数据分析中,生成式人工智能能否减少重复劳动,同时保持关键事实的可核验性。这个问题有明确的工作场景,也包含效率和可靠性两个需要同时观察的结果。
它仍然不是一句可以直接搜索的答案,因此要继续限定对象和范围。研究对象可以是使用公开资料完成的小型研究任务,观察过程包括检索、文本整理和表格分析,不讨论模型训练、商业成本和所有行业的长期影响。范围越明确,后面越容易判断哪些资料相关。
一个小型研究从问题、资料、分析到报告,形成可重复的 DeepResearch 工作链。
把总问题拆成四个子问题
第一个子问题是事实问题:生成式人工智能在资料整理和数据分析中通常可以承担哪些工作。第二个是过程问题:这些工作需要经过哪些步骤,哪些环节仍然必须由人完成。第三个是比较问题:节省的时间、产生的错误和复核成本之间是什么关系。第四个是判断问题:在什么条件下使用它是值得的。
四个子问题对应不同资料。事实问题需要看工具能力和实际案例,过程问题需要拆解工作链,比较问题需要任务记录或小规模对照,判断问题则要综合效率、准确性和限制。这样拆分之后,研究不再依赖一篇文章给出全部答案。
为每个子问题建立关键词和来源路径
围绕事实问题,可以使用生成式人工智能、文献整理、数据分析、文本提取等关键词;围绕过程问题,可以增加数据采集、数据清洗、文本整合、数据可视化;围绕比较问题,可以加入准确性、错误率、复核成本、效率和可复核性。每组词都服务于一个子问题,不能只因为热门就全部加入。
来源也要分层。论文和专业资料帮助理解概念,工具说明和实际案例帮助了解应用,数据文件帮助观察具体结果,反面材料帮助识别限制。文中展示的网页采集、文件读取、长文本整合和数据分析任务,正好可以作为理解这些环节的参考,而不是直接当成普遍结论。
先建立一张小型资料表
资料表不需要一开始就很复杂,可以先设来源、类型、对应子问题、关键内容、可靠性判断和限制六列。每找到一份材料,就记录它准备支持哪个判断。若一份资料只是提供背景,就不要把它放进支持核心结论的栏目;若它与另一份资料重复,也要标记重复关系。
接着给资料做初步筛选。优先保留来源清楚、对象和时间明确、方法有说明、能够直接回答子问题的内容。对于只有观点没有依据的文章,可以作为线索,但不要让它承担事实证明。资料表的价值在于让研究者看见证据缺口,而不是让收藏数量不断增长。
先记录来源和用途,再把真正支持判断的内容提取成证据,避免资料堆积。
设计一个简单而公平的比较任务
为了观察效率和可靠性的关系,可以选取一组结构相近的小任务,例如从几份公开报告中提取日期、规模和变化比例,整理成统一表格,再根据表格写出一段趋势说明。比较时要尽量保持资料、任务要求和输出格式一致,否则得到的差异可能来自任务难度不同。
记录的指标可以包括完成时间、遗漏字段数量、数字错误数量、需要人工修改的地方和最终复核时间。这里不追求一次得到严格的实验结论,而是建立一个可观察的过程。小样本只能说明本次任务表现,不能直接推广到所有研究工作。
把 AI 的工作拆成可检查的步骤
第一步让 AI 读取并列出资料中的字段,先不急着生成结论;第二步要求它按统一格式整理数据,同时保留缺失和不确定项;第三步让它描述趋势和异常,区分观察与推断;第四步才让它根据已确认结果起草报告段落。每一步都保留输出,方便发现问题从哪里开始出现。
这种分步方式与 文中从数据读取到整合、分析和可视化的任务链一致。一次性要求 AI 从网页、文件和多个结论直接写出完整报告,看起来省事,实际上很难定位遗漏。任务越长,越要让中间结果可见。
核对数字、口径和引用三类关键内容
数字核对包括原始数值、计算结果、单位和小数位;口径核对包括对象、时间、样本和指标定义;引用核对包括来源身份、原文位置和是否真的支持当前句子。这三类内容一旦出错,文章即使语言流畅,也不能作为可靠研究结果。
核对时不要只看 AI 输出的表格。应随机抽取几行回到原始文件,也要重点检查看起来最符合预期的结果,因为确认偏误会让人忽略顺眼的错误。发现问题后,记录是读取遗漏、格式转换、计算方法还是解释阶段产生的。这样才能修正流程,而不只是改掉一个数字。
数字、口径和引用分别回到原始资料核对,确保研究结果不是漂亮但无法追溯的文本。
根据证据调整原来的假设
假设可以是“使用 AI 能够缩短资料整理时间,但复核成本会随着任务复杂度增加”。如果小型任务确实节省时间,同时出现一些字段遗漏,那么结果可能支持这个假设的一部分;如果复核成本并没有明显增加,也不能马上说所有任务都一样,而要检查样本和任务难度。
研究过程中调整假设是正常的。重要的是保留调整记录,说明原来的预期是什么、哪些证据促使你改变、现在的判断适用哪些条件。这样做比为了让结果看起来支持最初想法而选择性删除材料更可靠。
把结果写成一份短报告
报告可以分成六部分。第一部分说明问题和范围;第二部分介绍资料和比较任务;第三部分呈现过程记录和关键数据;第四部分讨论效率、准确性和复核成本的关系;第五部分给出结论和适用条件;第六部分说明样本、资料和方法限制。每部分都只保留与中心问题有关的内容。
结论可以写得克制一些:在本次小型任务中,AI 能够减少部分资料整理和格式转换工作,但输出仍需要对字段、数字和引用进行人工复核;任务越复杂,越需要分步处理和保留中间结果。这个结论足够有用,也没有超过当前证据能够支持的范围。
让读者能够复做这个案例
一份完整的研究实践应该保留问题卡片、关键词表、资料表、任务要求、原始数据、处理记录、结果表和最终报告。不是所有材料都需要公开,但研究者自己必须能够回到每一步,解释为什么选择这些资料、为什么使用这些指标、为什么得出这个结论。
文中提到的多种工具都能帮助降低整理和写作成本,但可复核性仍来自过程记录。只展示最终文章,读者无法判断结果是如何形成的;展示清楚的研究路径,即使案例规模不大,也能让判断更有可信度。
从一次案例形成可重复的工作模板
完成案例后,可以把稳定的部分沉淀成模板:问题卡片包含哪些字段,资料表如何记录,哪些指标必须复核,报告采用什么结构,AI 在哪个环节参与。模板不是把每次研究都做成同一个样子,而是减少重复设计,把精力留给真正不同的研究内容。
同时保留可以改变的部分。不同问题需要不同来源,不同数据需要不同处理方式,不同读者需要不同表达。DeepResearch 最有价值的地方,不是让所有研究看起来一样,而是提供一条清楚、可调整、能回到证据的工作路径。
一项完整研究从提出问题开始,也在复核中结束
回顾整个案例,研究经历了明确问题、拆分任务、设计检索路径、整理文献、采集数据、处理和分析、写作表达以及复核结论。AI 可以在多个环节提供帮助,但每一次帮助都需要被放在一个可检查的流程里。没有问题,资料无法聚焦;没有复核,结果无法建立信任。
这篇综合实践也为本专题最后一篇文章留下了入口:如何检查一项 DeepResearch 任务的质量。下一篇将把前面反复出现的准确性、完整性、可追溯性和边界意识整理成一张可直接使用的检查清单。
常见问题
综合案例一定要使用很大的数据集吗?
不需要。小型案例更适合先验证研究流程,但结论必须明确限定在本次任务和样本范围内。
研究过程中修改假设会影响可信度吗?
不会。只要记录修改原因,并说明新假设由哪些证据推动,调整本身就是研究过程的一部分。
为什么要保留中间结果?
中间结果能帮助定位遗漏、计算错误和解释偏差,也让研究者能够说明最终结论是怎样形成的。