Gimbo's Universe / Code with Claude 伦敦 2026 / ① · 愿景与组织
§ 现场笔记 · 第 ① 章 / 共 6

当编程不再是瓶颈,组织得重写。

开场 keynote 立的总框架,加上三家把 AI 织进团队的现身说法:能力指数级抬升、采用却线性,于是为保护工程带宽建的老流程会悄悄失效——要敢审、敢杀、敢 Claudify,并为下一个模型设计。

4 主题:Vision & the AI-native org 来自 Code with Claude · London 2026
01

开场 Keynote

Boris Cherny 等 · Anthropic

能力指数级、采用线性——开发者的活,就是补上中间那道越张越大的差。整场用三层叙事串起来:模型(地基) → Claude 平台(规模化 agent) → Claude Code(每个开发者)。

  • 「计算器手感」回来了:从想法到能跑的程序之间的距离,又一次在坍缩。
  • 为下一个模型设计,不是现在这个;更难的 eval 是探测指数曲线在动的方式(以前会失败的任务开始通过 = 发车信号)。
  • 脚手架(loop/指令/工具)会拖住更聪明的模型;通用原语(文件系统/沙箱)走得更远。
  • 「advisor 策略」:小模型当执行器,遇到难case 调大模型要建议。
  • 新发布:自托管沙箱(Daytona/Cloudflare/Vercel/Modal) + MCP tunnel(内网 MCP 走隧道,不出公网);外加多 agent 编排、outcomes、dreaming。
  • 从「我 prompt Claude Code」转向「让 Claude 去 prompt Claude Code」,越来越多代码异步化。
数字平台 API 调用量同比 ~17×;人均每周用 Claude 20+ 小时;12 个月 8 个前沿模型;Mercado Libre 2.3 万工程师 / 50 万+ PR review / 目标 Q3 90% 自主编码。
金句“能力已经到了,剩下的差距是我们把它用起来有多快。”
So-what把架构和 eval 建成「下一个模型一来就自动吃红利」的样子;自托管沙箱 + MCP tunnel 让在自己 infra/数据上跑 agent 变得现实。
看原片 →
03

Running an AI-native engineering org

Fiona Fun · Anthropic(带 Claude Code / Cowork,前 Meta/Microsoft)

当编程、写测试、重构都不再是瓶颈,为保护稀缺工程带宽而建的团队规范会「悄悄失效」——纪律是持续追问每条流程还服不服务于它的目的,并给「杀掉旧流程」明确许可。

  • 新瓶颈:验证(对不对)、谁来 review、维护成本。
  • 「建造便宜,争论昂贵」——直接生成 3 个 PR 版本,而不是开会白板;少写设计文档。
  • 「shift left」:比你抓 bug、比她抓 bug 更好的,是自动化在源头就抓住。
  • 人留在环里的地方:法务、风险/信任边界、产品品味;Claude 接管风格、lint、明显 bug、spec 漂移(把 spec 签进仓库)。
  • 招两种人:有产品感的创造型 builder + 深系统专家;产品感靠 dogfood + 和客户聊出来。
  • 每个 manager 先当回 IC;新的「真理之源」是代码本身,把 spec 变成 skill 签进仓库。
数字信号:入职到第一个 PR 的时间、对队友的成本、PR 周期(拆成漏斗各段看)、Claude-assisted commit 占比。宣布 Claude for small business / Cowork / Claude Design。
金句“过去对你有用的,现在不一定了。”
So-what定期审你那条最「收税」的流程,问它还服不服务目的——不服就杀掉或 Claudify;编程便宜之后,把筹码压到验证与自动化上。
看原片 →
07

Designing with Claude: From prompt to production

Dan Carey · Anthropic Labs(Claude Design)

3 个人 ~10 周做出 Claude Design:用原型代替 PRD,把「聊用户 → 设计 → 上线 → 读反馈」的循环跑了 50–100 遍。Claude Code 让工程变快后,瓶颈挪到了「搞清楚该做对的那件事」。

  • Anthropic Labs 是「下注工厂」:十几个小队探边界,能成的加倍下注,不成的折叠;每 1–2 天发一次。Labs 孵出了 Claude Code、Design、MCP、Skills、Claude-in-Chrome。
  • 原型 > PRD:文档不精确(两个读者想象出两个产品),原型具体可感;他们没写 PRD/愿景/OKR。
  • 起点:一个人、一个周末、一段录屏(Agent SDK 上的薄 IDE,复用一个 Claude Code skill)→ 发 Slack → 社区反馈成了 roadmap。
  • 小团队、角色融化:从单人(「你和你的好兄弟 Claude」)起步,「扩张 300% 到三个人」;工程师聊用户、PM 写代码、设计师做分析。
  • 每个循环步骤都优化、常让 Claude 干:一下午做出反馈聚类工具,把反馈对到 trace 上、一键应用修复。
  • 反直觉:做「快成了」的原型,不是「已经成了」的——下一个模型可能补上工程补不了的(Opus 4.7 就修好了早期原型的问题)。
数字~10 周从想法到上线;循环跑 50–100 遍;团队 3 人(最多 5);周五上线到周一发了 62 项改进;全平台 token 上限翻倍。
金句“你不会想做那个「已经成了」的东西,你要做那个「快成了」的。”
So-what用当天就能做出的 Claude 原型替掉 PRD,团队保持小而角色融化,并在 24 小时内真发一个用户需求来暴露你流程里的瓶颈。
看原片 →
18

From one person to 80

Yoav & Gabrielle · Base44(vibe-coding 平台,被 Wix 收购)

从一人到 ~80 工程师还保持速度:用 Claude Code 把重流程换成极简的实时 prompt 和 skill;evals/QA/实验这类复杂系统,等时机真到了再 all-in。

  • 不写入职文档:新人跑两个 prompt——「扫所有 commit,告诉我每个人在乎什么」+「给我这个组件的 mermaid 图」,Claude 保持它常新。
  • 从创始人累积的历史 PR 评论里蒸馏出他的 review 规则,几天重跑一次,复制他的标准。
  • 生产质量信号:agent 好用时用户沉默、坏了用户「变得很吵」→ 廉价模型逐条分类挫败感 → 每个 agent 版本在小比例用户上 A/B。
  • 实验规模化:把 Claude 接到 Statsig MCP,分析最近 ~100 个实验 + 对应 PR,蒸馏出实验准则;GitHub bot 给每个 PR 判定(直接发/灰度/A/B)。
  • Evals 故意推迟,到点再 all-in:做了「用户模拟器」(Stagehand 在 CI 里驱动真实 Base44 实例),子部分失败不算 eval 失败,而是把拒绝喂回让 agent 修。
  • QA 做成 skill:把常见流程包成 skill + CLI 工具 → 一个元 QA skill;PR 一开,agent 出测试计划、测、带截图回报(~80% 能行)。
数字平台 2024 年底上线;2025 年 4 月已盈利;被 Wix 收后 2→15 工程师,再一夜合并 40→80;QA agent ~80% 有效。
金句“东西都正常时用户什么都不说;一旦开始坏,用户就变得非常非常吵。”
So-what别过早造编排/eval/QA 机器;从已有产物(commit、PR 评论、历史实验)里用 prompt 和 skill 蒸馏准则和品味,重系统等规模真逼到了再上。
看原片 →