← 所有书籍书籍 VII

验证与反思Verification & Reflection

捕捉模型的错误。

本书中有 32 种模式。 · 已更新

↓ download as png

何时使用每种模式

01. Evaluator-Optimizer 一个LLM生成;另一个评估并反馈;循环直到满足标准。 最佳适用: 单次生成的质量低于任务所需的标准。 权衡: 成本 = (生成器 + 评估器) x 迭代次数。 注意事项: 单次生成已经满足质量目标。

02. Self-Refine 迭代生成 → 反馈(同一模型) → 精炼,直到触发停止标准,没有单独的批评模型。 最佳适用: 相同模型可以针对明确的改进目标产生有用的自我反馈。 权衡: 强化相同模型的盲点(Reflexion 复制研究)。 注意事项: 有不同的模型系列可用,并且可以提供独立的批评。

03. Best-of-N Sampling 对N个候选输出进行采样,并通过奖励模型或评分器选择排名最高的。 最佳适用: 存在一个评分器或奖励模型,可以比生成器选择的候选人更好地对候选人进行排名。 权衡: 成本与 N 成比例。 注意事项: 没有可靠的评分器可用于在候选人中进行选择。

04. Reflection 让模型审查自己的输出,并在一个或多个回合中生成修订版本。 最佳适用: 一次性生成未充分利用模型,批评过程可以捕捉错误。 权衡: 经过一两次处理后收益递减。 注意事项: 模型在一次处理时已经产生正确的输出。

05. Confidence Reporting 在答案本身旁边展示代理对其答案的不确定性。 最佳适用: 下游代码或用户界面需要在每个答案上区分 '我知道' 和 '我在猜测'。 权衡: 校准是经验性的,并且会漂移。 注意事项: 信心标签将被用户界面和路由层忽略。

本书中的所有模式

Evaluator-Optimizer

×6

一个LLM生成;另一个评估并反馈;循环直到满足标准。

Self-Refine

×6

迭代生成 → 反馈(同一模型) → 精炼,直到触发停止标准,没有单独的批评模型。

Best-of-N Sampling

×5

对N个候选输出进行采样,并通过奖励模型或评分器选择排名最高的。

Reflection

×3

让模型审查自己的输出,并在一个或多个回合中生成修订版本。

Process Reward Model

×3

训练一个评分每个推理步骤的验证器,而不仅仅是最终答案。

Self-Modification Diff Gate

×3

通过一个单独的评论者角色来审查差异,限制代理对其自身代码或规则的编辑。

Prompt Variant Evaluation

×2

创建同一提示节点的多个变体,将它们作为批处理在共享数据集上运行,并让自动评估流程为它们打分,以便通过测量选择获胜的变体。

Dimensional Synthetic Eval Set

×2

通过枚举显式命名的维度上的元组并从每个元组中引导生成,而不是通过自由形式的LLM提示(这会导致模式崩溃)来生成评估输入。

Frozen Rubric Reflection

×2

将反思限制在一个固定的、手工编写的标准准则上,以便审阅者在每次运行时不能创造新的标准。

Reflexion

×2

让代理从过去的失败中编写语言课程,并在未来的情境中参考它们。

Self-Consistency

×1

在非零温度下多次采样相同的问题,并通过多数或判断进行聚合,以减轻幻觉现象。

Behavior-Pinning Test Before Agent Edit

×1

在代理编辑之前捕获可触及代码的当前行为作为黄金特征测试,负载值以确定性计算,仅将文本留给模型,作为回归门。

Blind Grader with Isolated Context

×1

在一个单独分配的上下文窗口中运行评估者,仅访问工件和评分标准,绝不接触生成代理的推理痕迹,以便评估者不会受到生产者框架的影响。

Checklist Partial-Credit Scoring

×1

针对每个长期任务,根据特定任务的分级检查点进行评分,而不是仅仅使用一个通过/失败的二进制结果,这样即使进展和回归未改变二进制结果,仍然会在报告中显示出来。

Cross-Reflection

×1

由与原始生成器不同的*其他*代理或基础模型执行的反思步骤,因此批评错误与生成错误解耦。

Generator-Critic Separation

×1

生成器代理负责生成草稿,批评者代理负责根据预定义标准对其进行评判,严格分离角色;批评者永远不生成。

Human Reflection

×1

反思循环,明确收集人类反馈(而非批准),以改进代理计划,区别于仅让人类说是/否的批准门。

Red-Team Sandbox Reproduction

×1

定期在每个版本的封闭沙盒中重新再现典型的对齐失败模式;将对齐回归套件视为部署门槛。

Stochastic-Deterministic Boundary (SDB)

×1

将LLM提案与系统动作之间的缝隙形式化为一个四部分合同——提案者、验证者、提交步骤、拒绝信号——以便合同本身,而不是代理的良好意图,来控制副作用。

Verify-Before-Cite Resolution Gate

×1

在生成后,将每个引用的权威与外部真实注册表进行核对,并在答案到达读者之前剔除或阻止任何不存在的引用。

Agentic Context Engineering Playbook

×1

将代理的系统提示和长期记忆视为一个结构化的、可按项寻址的手册,通过Generator/Reflector/Curator循环的小增量更新不断演变,从而使积累的战术抵御单一重写所导致的上下文崩溃。

Commitment Tracking

×1

从每个代理的轮次中提取声明的意图,形成一个结构化的账本,具有开放/已跟进/过期状态,使承诺与跟进之间的差距可见且可审计。

Darwin-Gödel Self-Rewrite

×1

一个代理重写自己的源代码,归档每个成功的变体,并从归档中抽样变异父代,而不是最新版本,利用归档多样性作为跳出局部最优的跳板。

Echo Recognition

×1

将人类消息的重复识别为强调或重新提问,而不是独立输入,以便代理在用户重复自己时不会产生近似重复的回复。

World Model as Tool

×1

让规划代理调用生成世界模型作为工具,在承诺采取行动之前推出假设的未来,将世界模型视为可调用的模拟器,而不是训练目标。

Confidence-Checking Workflow

始终要求代理在其输出的每个部分中陈述其信心,并识别哪些部分需要人工验证,就像对初级分析师的工作进行分类一样。

Modality-Conflict Arbitration

让每个观察通道发出自己的记录声明,将通道之间的分歧视为检测到的事件,并根据预先声明的每种声明类型的模态权威来解决,而不是依赖隐式融合的猜测。

Physical-Evidence Progress Gate

仅在重新感知世界确认子目标确实发生后,推进具身代理的任务状态指针,而不是基于尝试执行该动作的事实。

Planner-Executor-Verifier (PEV)

三元专业化,其中规划者制定计划,执行者执行计划,独立的验证者检查每一步的效果是否符合原始目标。