HARNESS ENGINEERING · 4-Q REPORT · 2026-08-07 PART 2 OF 4 · RANKED LADDER
Q2 OF 4

如何做好
Harness Engineering?

8 best practice · Ranked Ladder · 哪些必做 / 哪些是 nice to have
ranking method · 3 维加权
1影响度 (50%) · 直接防哪一类失败 + 提升多少 % 可靠性
2实现成本 (30%) · 工具复杂度 + 维护成本
3可替代性 (20%) · 是否能用更简单方法达到类似效果

Q1 给出了"4 大组件 + 6 个 GitHub repo + 与 Context Engineering 互补"。Q2 进入下一步:具体怎么做?8 个 best practice 按"影响度 + 实现成本 + 可替代性" 3 维加权排序。

§1Ranked Ladder · 8 Best Practice

排名
Practice · 一句话
影响度
1st
Eval Suite (Day 1) Hamel 8.00
写 5-20 个 eval cases + 跑 baseline + 跑回归。任何 LLM 项目 Day 1 必做。是 harness 的起点。
★★★★★IMPACT
2nd
Tracing / Observability LangSmith / Langfuse
每次 LLM call 记录 prompt + response + latency + token cost。生产环境必备。决定你能不能发现问题。
★★★★★IMPACT
3rd
Log + Debug LangSmith Debug
失败 case 回放 + token 流向 + 上下文栈。决定 debug 效率。生产环境故障 30 分钟 vs 3 小时差在这。
★★★★☆IMPACT
4th
Regression Test in CI Braintrust
每次 release / prompt 改动 · 跑全套 eval + pass rate 比对 · 自动报警。防"改了一行 prompt 整个 app 崩了"。
★★★★☆IMPACT
5th
Production Monitoring + Alert Langfuse / Arize
实时监控关键指标 (latency / cost / pass rate / drift) · 异常自动报警。比 observability 主动一步。
★★★☆☆IMPACT
6th
Cost + Token Tracking Helicone
每 LLM call 成本追踪 · 模型 / provider 对比 · 成本下降趋势。决定你能不能控制预算。
★★★☆☆IMPACT
7th
RAG Metrics RAGAS 9K
RAG 应用专属 · faithfulness / relevance / precision 评分。如果你做 RAG,这比通用 eval 更准。
★★☆☆☆IMPACT
8th
Red Team / Prompt Fuzzing Promptfoo 5K
对抗 prompt injection · 越狱检测 · 边界 case 攻击。安全 / 合规场景必备。
★★☆☆☆IMPACT

§23 个必做 + 5 个 nice-to-have

必做 / nice Practice 何时做 投入产出比
必做 Eval Suite (Day 1) 任何 LLM 项目启动时 ★ × 5
必做 Tracing / Observability production 上线前 ★ × 5
必做 Log + Debug production 上线后 ★ × 4
nice Regression Test in CI 团队 ≥ 3 人 / 每月 release ★ × 4
nice Production Monitoring + Alert DAU > 1000 ★ × 3
nice Cost + Token Tracking 月成本 > $1000 ★ × 3
nice RAG Metrics 做 RAG 应用 ★ × 2
nice Red Team ToB / 合规要求 ★ × 2

§3代码示例 · LangSmith Tracing

生产环境必备的 observability 落地代码:

from langsmith import traceable
from langchain import ChatOpenAI

llm = ChatOpenAI(model="gpt-5")

# 1. 标记任何 function 为 traceable (自动记录 prompt/response/latency/cost)
@traceable
def answer_question(question: str) -> str:
    response = llm.invoke(question)
    return response.content

# 2. 调用时自动记录
answer_question("什么是 context engineering?")

# 3. 在 LangSmith dashboard 看 trace
#    - 输入 prompt 全文
#    - 输出 response 全文
#    - latency ms
#    - token 数量 / cost
#    - 调用栈 (嵌套 traceable 函数)
#    - 失败 case 重放

关键设计每个 LLM call 都该被 trace — 不只是失败 case。生产环境的监控是基于 trace 数据,而不是 LLM 是否崩溃。

§4代码示例 · CI Regression

把 eval 集成到 CI / CD:

# .github/workflows/eval-regression.yml
name: LLM Eval Regression
on: [push, pull_request]

jobs:
  eval:
    runs-on: ubuntu-latest
    steps:
      - uses: actions/checkout@v5
      - uses: actions/setup-python@v5
        with:
          python-version: "3.11"
      - run: pip install langsmith langchain

      - name: Run Eval Suite
        env:
          LANGSMITH_API_KEY: ${{ secrets.LANGSMITH_API_KEY }}
          OPENAI_API_KEY: ${{ secrets.OPENAI_API_KEY }}
        run: python scripts/run_evals.py

      - name: Compare Pass Rate
        run: |
          # 跟上次 release 的 pass rate 对比
          CURRENT=$(cat eval-results.json | jq .pass_rate)
          BASELINE=$(cat .baseline.json | jq .pass_rate)
          THRESHOLD=0.05  # 允许 5% 退化
          if (( $(echo "$BASELINE - $CURRENT" | bc -l) > $THRESHOLD )); then
            echo "❌ Pass rate dropped from $BASELINE to $CURRENT"
            exit 1
          fi
          echo "✅ Pass rate stable: $CURRENT"

关键设计:每次 PR / push 都跑 eval + 比 baseline,不允许 pass rate 退化 > 5%。这是把"context engineering"和"harness engineering"结合起来的工程实践。

§5所以 · Q2 答案

8 个 best practice · 3 必做 + 5 nice-to-have。
必做:Eval Suite (Day 1) + Tracing + Log/Debug
复合效应:综合提升 +60-90% 任务可靠性 + 故障响应时间 -70%。
Harness Engineering = 可测量 + 可监控 + 可回归的工程。
— Q2 答 · Hermes Agent · 2026-08-07

§6下一个问题

Q2 给出了"8 best practice + 3 必做 + 5 nice + 代码示例"。Q3 进入 项目中应用 — Hairline Area · 5 种典型项目 × 4 时间窗 · 何时应用哪个 best practice。

02 / Q2