Gimbo's Universe / Code with Claude 伦敦 2026 / ④ · Managed Agents 与基础设施
§ 现场笔记 · 第 ④ 章 / 共 6

瓶颈是基础设施
不是智能。

智能跑赢了周边设施。三场讲 Claude Managed Agents:用 agent/environment/session/events 四个原语搭生产级 agent、自托管沙箱 + MCP tunnel 把私有算力和数据留在自己边界内,以及 Memory + Dreaming 的组织级自学习。

3 主题:Agents & infra 来自 Code with Claude · London 2026
11

Memory and dreaming for self-learning agents

Ravi · Anthropic(API Knowledge 团队)

两个新功能:Memory(文件系统式的记忆库,agent 跨任务、跨 agent 读写,把学到的东西带下去)+ Dreaming(离线进程,分析过往会话来全局整理和调和记忆)= 组织规模的持续自学习。

  • 时间线:MCP(2024)→ Claude Code + Agent SDK(2025)→ Skills(2025)→ Managed Agents(上月);主线是 agent 在越来越长的时间跨度上工作。
  • 记忆建成文件系统是刻意的(「让它发挥」);Opus 4.7 在文件系统式记忆、以及判断该存什么、怎么组织上是 SOTA。
  • 多 agent:共享记忆库有只读 scope(全组级、不常更新)和读写 scope(per-task),形成层级;乐观并发控制防止互相覆盖。
  • 企业:版本控制/审计轨迹、版本 diff、按 agent 归因写入、独立 Memory API(CRUD + 导出/脱敏)。
  • 规模上的问题:记忆更新局部最优但全局不优(重复、碎片、各 agent 独立地重犯同一错)。Dreaming(研究预览):解耦的反馈回路,分析 transcript + 现有记忆,产出一份经核验、组织更好的记忆快照。可按需/每晚/每小时/事件触发。
  • Dreaming 本身建在 managed agents 上(派并行子 agent 分析 transcript);在热路径之外 = 不加延迟,是一种 test-time compute。demo:SRE 值班分诊,Dreaming 在 ~5 个会话里发现「CPU 飙升后 ~60s 告警」的重试模式。
数字Rakuten 生产 agent 首过错误 −97%;Harvey 法律基准完成率 6×;Wise Docs 用跨会话记忆减少常见问题;METR 2025:agent 任务长度每 ~7 个月翻倍。模型:Opus 4.7。
金句“Dreaming 是从今天的记忆,通往组织规模记忆的那座桥。”
So-what跑多 agent 系统就用带 scope 的共享记忆 + 定时 Dreaming,让 agent 互相从对方的 transcript 学、别再重犯同样的错——还不碰延迟敏感的主循环。
看原片 →
13

How to get to production faster(Managed Agents 面板)

Michael & Harrison · Anthropic + Vercel/Modal/Daytona/Cloudflare

模型智能跑赢了周边基础设施——更长时跨 agent 的瓶颈现在是 infra,不是智能。Claude Managed Agents 给出可组合、生产就绪的原语(基建、agent 原语、可观测),让团队建产品而不是建管道。

  • 能力弧:Claude 3(短任务、每个工具都要批准)→ Opus 4 + Claude Code(驱动整个 feature、提 PR)→ Opus 4.7(清空 backlog、醒来就是可合并 PR)→ 不久:几小时干几个季度的活、成群 agent 跑完整 M&A 流水线。
  • agent 要更多:安全凭据、内部系统、私有仓库、agent 自己的身份/鉴权;交互从对话文本转向面向结果 + 可恢复会话。
  • 头号阻碍(他们的调研):上下文/记忆、基础设施(第一阻碍:可靠/可扩展/安全/延迟)、可观测。
  • 三步起步:定义 agent → 定义 environment(沙箱+网络白名单+预装包)→ 起 session,用事件流观测。事件分类:user/agent/session/span。
  • 新发布:自托管沙箱(在自己 VPC 里跑工具;Cloudflare/Daytona/Modal/Vercel)+ MCP tunnel(研究预览,把私有 MCP server 经安全隧道暴露给 Claude,不走公网)。
  • 面板:各家 infra 哲学不同(Vercel fluid compute;Modal 自有调度器、GPU 沙箱;Daytona pause/resume/fork;Cloudflare 毫秒级 isolate)。共同难题:身份沿 agent 链传递、出口过滤、可恢复性、同步↔异步翻转。
数字模型:Claude 3、Opus 4、Opus 4.7;DoorDash 在 Modal 上;Modal 几分钟起几十万沙箱;Cloudflare isolate 毫秒级;MCP tunnel = 研究预览。
金句“提升能力的瓶颈,其实是这些模型周围的基础设施,而不是智能本身。”
So-what别再手搓 agent 循环/沙箱/状态恢复/鉴权——组合 Managed Agents 原语,用自托管沙箱 + MCP tunnel 把私有算力和数据留在自己边界内,让 Claude 来编排。
看原片 →
14

Build a production-ready agent(workshop)

Anthropic 技术员 · Managed Agents(与 13 同团队的动手版)

从一个 starter 仓库出发,用四个原语在今天就能搭一个可部署的多 agent、带 outcome、带记忆的生产级 agent——不用自己造循环、存储、沙箱、鉴权。

  • Managed Agents = 一组任意 API key 可用的端点;Anthropic 负责电脑访问、凭据 vault、MCP 鉴权注入、工具调用 harness、重试/纠错、记忆/上下文、多 agent、可观测。
  • 四原语:agent(模板:提示/skill/工具/MCP/逐工具权限)、environment(沙箱:网络+包+自托管选项)、session(一段对话,可含仓库/文件)、events(事件流)。
  • 现场:做一个虚构 M&A「deal」web app,用 Anthropic SDK 手写 sessions.list/get,Bun 本地跑;较难的 streaming 端点交给 Claude Code(自带 Claude API skill)写——「Claude 帮你造你自己的 Claude」(也老实说 Claude 偷懒了、得催它做完)。
  • outcomes demo:给评分 rubric 评三家虚构公司,Claude 迭代自评直到满意。
  • 多 agent demo:主 agent 派 4 个子 agent(各有人设/上下文),控制台里每个是独立横轨、带逐工具计时,方便 debug。
  • 凭据 vault 注入 MCP token,「永不进入 Claude 的上下文」;版本化 agent 可回滚、记忆库可编辑。
数字Opus 4.7(长生成偏慢);工具:Anthropic SDK、Bun、Claude Code + Claude API skill、公开 starter 仓库、CLI、cookbook;多 agent ~两周前发布。
金句“Claude 能帮你造出你自己的 Claude。”
So-what今天就能交付一个生产 agent:接好 agent/environment/session/events 四个原语,大部分集成让 Claude Code(带 Claude API skill)替你写。
看原片 →