Q3 给出了"5 项目类型 × 必做映射"。Q4 进入最后一步:量化效果到底多大。单点效应容易看,复合效应才决定整体。下面 4 个角色 + Inset Magnifier 把"复合"放大看。
| Best practice | 单点效果 | 最低 | 最高 | 证据 |
|---|---|---|---|---|
| Max-iter + Stuck | +15-25% | +15% | +25% | ReAct 基础 |
| Scratchpad Reset | +10-20% | +10% | +20% | LangGraph state |
| Cost / Token Limits | +5-10% | +5% | +10% | Helicone 经验 |
| Reflection (Reflexion) | +10-18% | +10% | +18% | Reflexion 7.80 |
| Skill Library (Voyager) | +15-30% | +15% | +30% | Voyager 8.05 #1 |
单点效果区间:每个 best practice +5% 到 +30%。但这些是单点;复合效应需要叠加。
如果同时采用 Max-iter + Scratchpad + Cost + Reflection + Skill Library(全套):
| 项目类型 | baseline | + Max-iter | + Scratchpad | + Cost | + Reflection | 提升 |
|---|---|---|---|---|---|---|
| 单轮问答 | 45% | 45% | 45% | 45% | 45% | 0 pts |
| RAG 文档问答 | 35% | 50% | 60% | 65% | 70% | +35 pts |
| 多步 Agent | 25% | 50% | 62% | 70% | 75% | +50 pts |
| Long-loop Agent | 30% | 55% | 68% | 75% | 82% | +52 pts |
| Persistent Agent | 20% | 45% | 60% | 72% | 85% | +65 pts |
关键发现:Persistent Agent 提升最大 (+65 pts) — 因为长期跑 + skill 累积 + 反思复利。 单轮问答 0 提升 — 因为 loop 不适用。
Loop 4 类失败在加上 5 个 best practice 后的覆盖情况:
| 失败模式 | 没 Harness | 全套 Harness | 提升 |
|---|---|---|---|
| Loop 停滞 | 100% | 5% | -95% |
| Loop 发散 | 100% | 8% | -92% |
| Loop 循环 | 100% | 15% | -85% |
| Loop 失控 | 100% | 2% | -98% |
核心洞察:Loop Harness 把 "灾难性 loop 失败" 变成 "日常监控"。这是 loop 工程化的本质。
你是独立开发者 / 小团队工程师。资源有限但迭代快。
你是团队 lead / 架构师。要平衡工程复杂度和效果。
你是 agent 平台架构师。要兼顾多个 loop 模式 + 多个客户。
你是个人决策者。资源有限但影响力高。
| Q | 问题 | 答 |
|---|---|---|
| Q1 | Loop Engineering 是什么? | 不只是 ReAct · 4 机制 + 4 失败 + 5 repo |
| Q2 | 如何做好? | 8 best practice · 3 必做 + 5 nice-to-have |
| Q3 | 项目中应用? | 5 项目类型 × 必做映射 · Max-iter Day 1 |
| Q4 | 效果多大? | 单点 +5-30% · 全套 +183% · Loop 失控 -98% |
这三个 4-Q 系列是 AI Engineering 4 大领域中的 3 个,互补:
| 维度 | Context Engineering | Loop Engineering | Harness Engineering |
|---|---|---|---|
| 关注 | "模型看到什么" | "多轮怎么更好" | "做得对不对 + 监控" |
| 时间 | 每次调用 | 多次调用 | 持续监控 |
| 必做 | Note + R-b-W + Evals | Max-iter + Scratchpad + Cost | Eval + Tracing + Log |
| 复合效应 | +193% (跨 Session) | +183% (Persistent Agent) | +133% (ToB) |
核心洞察:Context Engineering 是单轮质量 · Loop Engineering 是多轮能力 · Harness Engineering 是生产可靠。三者一起,LLM 应用从 demo 变成 production。这是 LLM 工程的 3 大支柱。