Gimbo's Universe / Code with Claude 伦敦 2026 / ② · 工艺:prompt · 模型 · 思考
§ 现场笔记 · 第 ② 章 / 共 6

能力来自工具与 eval
不是把 prompt 写得更长。

五场最「手上功夫」的讲座:prompting 是对着 eval 调试、选模型按「每个成功结果最便宜」、思考是 effort 杠杆不是开关、能力曲线怎么骑、以及平台层(缓存+上下文工程)怎么把成本砍一个量级。

5 主题:The craft 来自 Code with Claude · London 2026
04

Getting more out of the Claude Platform

Puneet Shah · Anthropic 平台团队

模型之上的平台层——prompt 缓存、上下文工程、成本/智能权衡——才是把 demo 变成生产 agent 的东西。现场把一个 agent 从 ~£31 砍到 ~£11,智能不掉。

  • Prompt 缓存是第一要务:输入打 9 折 + 限额翻倍(命中 80% ≈ 5× 有效限额) + 更低首字延迟;先知道你的缓存命中率(控制台现在能看,还能看「为什么缓存断了」——经典 bug 是系统提示里塞了时间戳)。
  • 上下文工程 = 决定给模型看什么;永远去读 transcript 看模型实际看到了什么。
  • 三招:tool search(用到才加载 schema,Lovable −10% token)、程序化工具调用(Claude 写 Python 调工具+先清洗再进上下文,Quora 砍掉 HTML 噪声)、compaction(到阈值 ~400K 就摘要下移,近乎无限上下文)。
  • advisor 策略:廉价执行器(Sonnet/Haiku)只在难case 调 Opus「顾问」,Pareto 最优。
  • demo:Sonnet 4.6 + Opus 4.7 顾问,抓出一个 Sonnet 标了绿的「西瓜合同」(外绿内红)的尾部风险。
数字缓存 9 折;80% 命中 ≈ 5× 限额;demo £31→~£11;compaction 阈值 400K。新发布:自动 prompt 缓存、Claude Platform on AWS。
金句“如果这一场你只记一件事,记住 prompt 缓存。”
So-what先量缓存命中率,再用 tool search + 程序化调用 + compaction 砍上下文,只把难case 经 advisor 路由给贵模型——合起来约 10× 降本而不丢智能。
看原片 →
05

The prompting playbook

Margot Vanlaer · Anthropic Applied AI

Prompting = 对着 eval 调试:先清一般卫生,再逐个攻 failure mode;模型越聪明,旧的防御性指令越有害,能力得来自工具/harness 而不是叫它「更努力」。

  • 先建 eval:控制case(必过)、边界case(把过去的失败编码进去防回归)、能力上限case(交给人或拒答)。
  • 迁移失败两种因:新模型有能力但行为变了(可 prompt 修) vs 新模型更弱(修不了)——eval 区分两者。
  • 卫生:删冗余、别告诉它「你是人」、用 XML 分清 角色/准则/政策/数据;「你分不清,模型也分不清」。
  • 「指令不增加能力」:要算 proration 就给 calculate 工具;一边倒的规则(升级很贵)会让它拒绝该升级的——把两边权衡都讲清楚,让它判断
  • 确定性规则就用 Python 数违规,别用 LLM 评委。
  • 爬坡结果:赢家是把一个大 prompt 拆成「生成-评估-修复」三段小循环,过了全部case,token 还更少。
数字5 个测试case(电信客服 bot);升级一次 ~$8;排班 8 员工×5 次;自适应思考方案 ~3× token/~100s。模型:Sonnet 4.6、Opus 4.7。
金句“幻觉的反面也会发生——模型会把它其实掌握的信息藏起来。”
So-what把 prompt 当成 eval 驱动的调试:撕掉过时的防御补丁,把能力搬进工具/harness,约束类任务优先用小型「生成-评估-修复」循环而不是一段巨型 prompt。
看原片 →
06

The capability curve

Jeremy · Anthropic 研究团队 PM

12 个月里 Claude 从初级长到资深工程师,增益集中在规划、纠错、长程连贯。建议是骑曲线、别押注单个模型:靠 eval、砍脚手架、给模型留出余地。

  • 三类增益驱动自治:行动前会规划(给高 reasoning effort,而不是硬塞结构)、纠错(doom-loop 基本解决,用 test-time compute 换路子)、持续注意(连贯到 ~1M token,不必切碎任务或在 200K 处盯着)。
  • 更大胆:把整个代码库交给它,别预先限制范围。
  • 「eval 是 AI 时代的单测和回归测试」:建匹配真实流量的 eval,不是学术 benchmark;警惕饱和的 eval(Opus 4.7 已 ~90% 就该抬高标准)。有好 eval 的团队换新模型最快 = 竞争优势。
  • 砍脚手架:把「缝合怪 prompt」(~3000 行给旧模型的旧补丁)每次发版都审一遍、用 eval 验证最小 prompt 仍然能跑。
  • 给余地:自适应思考、调高 effort、用 auto mode、闭合 agent 循环让它自查自改。
数字SWE-bench Verified:Sonnet 3.7 ~60%(去年)→ Opus 4.7 87%(~3× issue);「Mythos preview」已把它刷饱和;Bun 引擎被 Claude ~1 周重写成 Rust、~100% 测试通过(创始人不会 Rust)。
金句“Evaluation 就是 AI 时代的单元测试和回归测试。”
So-what建可信、未饱和、贴合你用例的 eval,这样每个新前沿模型都能快速换上,然后撕掉过时脚手架、放手让模型自己思考和长跑。
看原片 →
10

Picking the right model

Lucas · Anthropic Applied AI

公开 benchmark 只是方向。正确的选法是建一个私有小 eval,优化「每个成功结果最便宜」而不是每 token 最便宜;有了 eval 再用 effort/思考/缓存/上下文工程去移动成本-质量前沿。

  • 三支柱:模型质量、延迟、成本,eval 围三者建。
  • eval = 一组任务(输入+成功标准);既评最终答案也评过程;LLM 评委 + 确定性代码评分并用。
  • 失败模式:把噪声当信号(每任务多跑几次)、把基建问题当模型问题(读 transcript 区分)、悄悄饱和(用反馈回路保持数据代表真实流量)。
  • 读你的 transcript:Claude 曾在某 benchmark 拿高分,只因为它去翻了之前试验的 git 历史抄答案。
  • 更聪明的模型常更快、更省 token(回合更少):codefix Haiku 4.5 不思考 92% → 开思考 100%。
  • 移动前沿:prompt 缓存(缓存前缀约 1/10 输入价 →「Opus 质量,Sonnet 成本」,命中率冲 80–90%,把消息数组当 append-only、别放时间戳) + 上下文清洁。
数字markdown 替 JSON + 简化时间戳 = token −66.4%;web 搜去重 = 输入 −77% / 成本 −65% / 准确率 +9%;缓存 = 1/10 输入价。
金句“对你的用例最合适的模型,是「每个成功结果最便宜」的那个。”
So-what把人力投到一个会评过程也评结果的私有小 eval 上,横扫 模型×effort×思考,再用 prompt 缓存 + 精简工具响应腾出预算,然后才去碰复杂的多 agent 编排。
看原片 →
15

The thinking lever

Alexander Bricken · Anthropic Applied AI Research

测试时计算(test-time compute)是智能的杠杆:让 Claude 在回答前多花 token 思考,能稳定提升难题表现。正确的用法是 effort + 预算 + 自适应思考,而不是一个粗暴的 on/off 思考开关。

  • 两条扩展轴:训练时计算(更大模型) + 测试时计算(更多推理 token),都涨性能。
  • 测试时计算拆三块:思考空间(草稿纸)、工具调用(连接世界)、文本输出。
  • 两个用户级旋钮:effort(low/high/max,拿智能换速度/token) + 预算(硬上限,如 max-token 或 task budget)。
  • 推理演化:前置思考 → 交错思考 → 自适应思考(Claude 自己决定何时/要不要思考,可能不思考),自适应是 Pareto 最优。
  • 思考开关是 effort 的糟糕代理——关掉只是删掉一种能力(类比:给队友搜索工具、让他自己决定何时用,而不是禁掉他的内心独白)。
  • 档位建议:max 只给真·难题(收益递减);extra-high 是 Claude Code/Claude.ai 默认;medium/low 给分类/摘要/抽取。需要任何智能时,宁可大模型低 effort,也别小模型高 effort。
数字内部 agentic 编码基准 ~刚到 80%;low effort ~50s/~4600 输出 token,high ~2×,max ~10×;METR 式:最新模型能处理 ~16 小时人类工作(50% 准确)。
金句“拿不准的时候,就上 extra-high。”
So-what别把思考当 on/off——用一个硬 eval 集挑模型和 effort 档,默认 extra-high,只在你验证过确实划算的真·难题上才上 max。
看原片 →