模块2:高级 Prompt Engineering 与 Reasoning 技术学习目标掌握 2026 年主流的高级推理 Prompt 模式,深入理解其工作原理与适用场景;学会设计可量化的 Prompt 效果评估方案;最终能构建一个自适应的 Reasoning Pipeline,根据任务类型智能选择最合适的推理策略2.1 四大核心推理模式详解单纯依靠“把要求写清楚”的长 Prompt 已无法应对需要多步推导、外部知识获取或方案探索的复杂任务结构化推理模式通过显式地控制模型的思考过程,显著提升其逻辑严密性和任务成功率以下四种模式构成了现代 Agent 推理层的基石2.1.1 Chain of Thought(CoT,思维链)核心思想:诱导模型在给出最终答案前,先生成一系列解释推理过程的中间步骤这就像要求学生在考试时写出解题过程,不仅提高正确率,还让错误可追溯两种实现方式:· Few‑shot CoT:在 Prompt 中提供数个带有详细推理步骤的示例,然后提出新问题模型会模仿示例的格式和推理风格示例 Prompt 片段: 问题:一个农场有 15 只鸡和 9 只兔子,一共有多少条腿?推理:鸡有 2 条腿,15 只鸡共 15×2=30 条腿。
兔子有 4 条腿,9 只兔共 9×4=36 条腿总数是 30+36=66 条腿答案:66问题:一场音乐会门票 120 元,买三张打八折,一共要付多少钱?推理: 模型会自然地延续“推理:... 答案:...”的模式· Zero‑shot CoT:无需示例,只在问题后添加一句“让我们一步一步地思考”(Let's think step by step.)2026 年的模型对这一触发语极为敏感,能自动生成清晰的推理链条2026 年的改进——Auto‑CoT:手工编写示例耗时且不一定具备多样性Auto‑CoT 自动对问题聚类,并为每个聚类生成一个带有推理链的示范,再将这些示范组装到最终 Prompt 中这保证了示例的覆盖面和代表性适用场景:数学应用题、逻辑谜题、因果推断等有明确“推理路径”的任务2.1.2 Tree of Thought(ToT,思维树)核心思想:当一个问题存在多个可能的解决方向,且每一步选择都可能导向不同结局时,思维链的单线推进就容易陷入死胡同ToT 将问题求解看作一棵树的搜索过程——在每一步同时生成多个候选“想法”(Thought),评估它们的潜力,选择最有希望的路径继续深入,必要时回溯。
构成要素:1. 生成候选:给定当前状态,让模型一次性生成多个不同的“下一步思考”(例如 3~5 个)Prompt 需要明确要求多样性2. 状态评估:让模型对每个候选想法打分(如 1~10)或分类(“确定/可能/不可能”),判断其接近最终答案的程度可要求模型输出结构化评分理由3. 搜索策略:o 广度优先搜索(BFS):每层保留若干最优想法,同步向下扩展,适合最终答案要求覆盖全面性的任务o 深度优先搜索(DFS):先沿一条最有希望的分支走到底,若失败则回溯,适合有明确评判标准的任务2026 年的实现方式:不再需要复杂的树形数据结构硬编码,而是利用模型强大的函数调用能力你可以设计两个工具:generate_thoughts(state) 和 evaluate_thoughts(thoughts),然后通过 Agent 循环让模型自己维护搜索树,或直接用长上下文窗口一次性探索并记住结果示例场景:一个创意写作任务,需要构思小说情节走向ToT 可同时探索“主角出逃”、“主角卧底”、“主角妥协”三条故事线,评估戏剧张力,最终选出最优方案2.1.3 ReAct(Reasoning + Acting,推理与行动结合)核心思想:许多现实任务中,模型自身的知识是有限的。
ReAct 将推理(Thought)和行动(Action)交织在一起,让模型可以主动调用外部工具获取信息,再基于观测结果继续推理这是构建 Agent 最直接、最基础的模式固定循环格式:Thought: 我需要知道……才能……Action: 工具名称[参数]Observation: 工具返回的结果...(重复上述三步,直到得到足够信息)Final Answer: 最终回复给用户的内容示例:查询北京气温并推荐穿搭Thought: 我需要知道当前北京的气温才能推荐合适的穿搭Action: get_weather[北京]Observation: 晴,25°CThought: 25°C 天气温暖,可以推荐短袖与薄外套已具备回答所需全部信息Final Answer: 今天北京晴朗,气温25°C,建议穿着短袖搭配一件薄外套,体感舒适实践要点:· Prompt 必须严格规定格式,并明确说明“当你需要调用工具时,必须在 Action 后停止,等待 Observation”· 错误处理:当工具返回异常(如“查询失败”),必须将其作为 Observation 反馈给模型,模型通常会自行修正重试· 最大步数:必须设定循环上限,防止模型陷入反复调用工具的无效循环。
适用场景:所有需要与外部系统交互的任务,如信息检索、数据库查询、邮件发送等ReAct 是后续 LangChain、LangGraph 等框架中 Agent 循环的雏形2.1.4 Graph of Thoughts(GoT,思维图)核心思想:相比思维链的线性、思维树的树状分支,很多复杂的推理过程需要将不同的想法进行合并(Merge)、精炼(Refine)或循环迭代(Loop),形成一个有向图结构GoT 将思考建模为图上的操作,能够将多个子结论聚合成一个更高质量的洞察基本概念:· 节点(Thought):一个完整的想法、论据或数据片段· 边(Transformation):描述一个想法如何变为另一个想法,操作可以是生成、改进、合并、总结等典型应用——多文档摘要:1. 将每篇文档单独生成摘要(多个叶子节点)2. 将两份摘要合并成一份对比分析(合并节点)3. 基于对比分析提炼出核心发现(精炼节点)4. 最终输出一份整合报告2026 年的落地手段:手动设计“图结构”,然后由 LLM 按节点填充内容你可以编写一个调度器,按照图的拓扑顺序依次调用模型处理每个节点,将前驱节点的输出作为上下文传入与其他模式的关系:可以将 GoT 视为对 CoT、ToT 的泛化。
CoT 是一条链(线性图),ToT 是树(无合并的图),而 GoT 允许任意连接,更适合处理高度复杂的分析合成任务2.2 2026 最新 Prompt 设计模式除了上述基础推理框架,2026 年工程实践中还有若干组合强化模式,可以在不修改模型的情况下大幅提升输出质量2.2.1 Self‑Consistency(自洽性)做法:对同一个问题,以非零温度(如 0.7)多次独立调用模型(通常采样 5~21 次),得到多条推理路径和答案然后通过投票选出最一致的答案(分类问题)或取平均(数值答案)增强版——自适应自洽性:并非所有问题都需要大量采样先用一个轻量小模型或一次便宜调用判断问题的“模糊度”或“难度”只有高模糊度的题目才触发多次采样,从而在成本和准确率之间取得平衡示例:一道复杂的逻辑推理题,直接单次回答正确率只有 60%启用 9 次采样后,多数答案收敛到同一正确选项,整体准确率提升至 85% 以上2.2.2 Self‑Refine(自我精炼)做法:模拟人类“打草稿—修改”的过程模型先生成初稿,然后切换至批评家角色,指出初稿的不足并给出具体改进建议最后,原始模型根据批评意见生成修订版通常 2~3 轮即可收敛。
关键 Prompt 结构:· 初稿生成:系统设定为“创作者”角色,要求输出完整内容· 反馈生成:使用“你是一个严苛的审稿人,请指出以下内容中的逻辑错误、事实不准确、表述不清,并给出修改建议只输出批评意见,不输出完整修改版 · 终稿生成:将原稿和批评意见一同提供给模型,“请根据以下审稿意见修改全文”适用场景:商业报告、技术文档、复杂邮件等对质量和准确性要求极高的文本生成任务2.2.3 Plan‑and‑Solve(先规划后执行)与 ReWOO· Plan‑and‑Solve:对于步骤较多的任务,要求模型先输出一个完整的“计划”,再按计划逐步执行这能有效防止模型在长链任务中迷失方向Prompt 结构:“请先写出解决该任务的详细步骤计划,然后我们一步一步执行· ReWOO(Reasoning Without Observation):针对 ReAct 模式中每步工具调用都需要等待观测、无法并行的痛点,将“规划”与“执行”分离规划器一次性生成完整的工作流,其中包含所有需要的工具调用及其参数占位符然后,调度引擎批量并行执行这些工具调用,最后将全部观测结果汇总给模型进行最终推理这极大提升了响应速度。
ReWOO 示例:规划器输出:计划:步骤1:获取用户ID (无需工具)步骤2:查询用户所在城市: get_user_city(#UID)步骤3:查询所在城市天气: get_weather(#CITY)步骤4:综合以上信息给出建议随后系统并行执行步骤 2 和 3,所有结果返回后执行步骤 42.2.4 Algorithm of Thoughts(算法化思维)做法:将已知的人类算法(如分治法、动态规划、回溯法)用自然语言描述融入 Prompt,引导模型按照算法的结构去探索解空间,而不是盲目地自由联想这减少了搜索的随机性,特别适合有已知算法框架的复杂推理题示例:解决“最长递增子序列”问题时,在 Prompt 中描述动态规划的状态定义和转移方程,然后让模型遵循该框架进行实例化计算2.3 评估 Prompt 效果的量化方法仅凭“感觉回答好像变好了”无法支撑生产级迭代你需要建立一套可量化、可复用的评估体系1. 精确匹配度(Exact Match)适用于分类、选择题或要求输出固定格式的结构化数据可以直接比对模型输出与标准答案字符串是否完全一致对于 JSON 输出,可比较各个关键字段值2. 执行准确率(Execution Accuracy)这是 Agent 场景的核心指标。
不关心中间语言是否优美,只看任务是否真正完成例如:邮件是否发送成功?订单是否如实创建?数据库记录是否更新?记录每一次运行的工具调用序列和最终状态,计算成功率3. 一致性分数(Self‑Consistency Score)对同一输入多次运行,观察输出的答案、工具调用顺序或最终决策的稳定性如果同一问题 10 次运行给出 8 种不同答案,则说明 Prompt 需要更强的约束该分数常用平均两两相似度(如基于嵌入的余弦相似度)来衡量4. 人工评估标准化对于开放生成类任务(如总结、文案),仍需人工打分需建立:o 评分细则(Rubric):针对准确性、完整性、流畅性、安全性等维度,各制定 1-5 分的明确行为描述例如,“5分:所有事实均可验证,无任何添加;1分:存在严重影响理解的关键事实错误”o 多人独立评分:至少 3 人背对背打分,计算 Fleiss' Kappa 系数评估评分者间一致性Kappa > 0.6 表示可以接受,> 0.8 表示高度一致o 校准会议:定期让评估者一起讨论分歧案例,统一尺度5. LLM‑as‑Judge(用 LLM 做裁判)使用一个强大的模型(如最新版的 GPT 或 Claude)按照你的评分细则对另一个模型的输出打分。