「我在沙发上写代码。」
有人电脑锁屏、插着电留在工位,人不在,PR 却一直在 land。同事以为他忘拿电脑,连着几天都这样 —— 一问:「我用 remote control 从手机指挥。」现在他一半的工程在手机上做。
同一周,两支都来自 Claude Code 创造者团队的视频 —— 团队的「一年回望」,和 Boris Cherny 的「未来判断」。 两份完整字幕读完,我发现它们其实在讲同一件事:这一年所有的工程,本质是在把人类一步步、安全地移出信任链 —— 机器自己写、自己测、自己改,还被证明比人更安全。而当人退到无可再退,Boris 给了最后一问的答案: 连「品味」也保不住,剩下的只有价值观。这一篇分三幕走完:退场 · 为什么敢退 · 退场之后。
下面整篇,把这两支当作同一个故事的两端来读:团队那支是这一年人怎么退场,Boris 那支是退到尽头还剩什么。
退场不是一次性的,是一层层发生的:工程师交互的对象一路往上跳、模型替人做得越来越多、专业身份的边界融化、连维护性的杂活也交了出去。这一幕把四层退场摆清楚。
这是两支视频真正共用的脊梁:工程师交互的对象一直在往上跳一层 —— 而 Boris 那句「我的工作是写 Loop」正好是这条线的最新一格。
「有源代码,人坐下来一行行写。」沿用了几十年的默认形态。
「我不写源码了 —— 我跟一个 agent 说话,它替我写。」对象从代码变成了 agent。
「我不跟 agent 说话了 —— 我跟 Loop / routine 说话,它替我提示 Claude。」这正是 Boris #08 的「写 Loop」。
两支视频拼起来能排出一条干净的模型线 —— 关键不是型号,而是模型每聪明一档,人要做的功夫就少一层:提示工程 → 上下文工程 → 上下文极简;Plan Mode → Auto Mode。
代码门槛塌了,角色就开始融化 —— 这是「身份」的退场:不再有纯粹的工程师,大家都成了 builder。一个亲历,一个理论。
Agent SDK 是第一步,但「拿它干嘛」一开始并不明显。routines 是它第一个真正显而易见、跑通了的杀手级用法 —— 让 Claude 常驻监听、主动接管,人退出日常维护。
有人 ship 了个小功能,留了个没注意到的边界 case,有人报了 bug,他打算当晚去修。结果他的 Claude 说:另一个 Claude 已经修好了。 一问才知道:那位同事有条 routine,专盯「5 小时内没人回的 bug 报告」,自动生成修复、提 PR,容易验证的直接 merge。 「现在 Claude 老这么跟我说 —— 总有别人的 Claude 已经在弄了。」
退场到底长什么样?字幕里这些具体到有点好笑的画面,比任何框架都说明问题。
有人电脑锁屏、插着电留在工位,人不在,PR 却一直在 land。同事以为他忘拿电脑,连着几天都这样 —— 一问:「我用 remote control 从手机指挥。」现在他一半的工程在手机上做。
团队里的设计师开始提 PR,他第一反应是「天哪,设计师为什么在发 PR?」点开一看,代码居然挺好,「行吧,那大概没问题」。现在这事已经完全正常。
Twitter 上有人用 Claude Code 养番茄 —— 接摄像头盯着、自动调营养,几周后结果了,Claude 说「我们的努力没白费,太治愈了」。Boris 看到就知道:它开始破圈了。
Boris 有洁癖:代码库只许函数、不许 Class。工程师周末偷偷塞 Class,他周一逮到就撤。后来模型自己也写 Class —— 「那也许我这执念本来就挺蠢的」。
撒手不是靠胆子。人敢退,是因为这一年补上了一整套让「机器值得信任」可被证明的机制 —— 验证、安全 classifier、把错误写进记忆。这也正好补上了 #08 里 Boris 只给了哲学的那块(「编程是 AI 安全干净的培养皿」)。
一提验证,大家想到单元测试、lint、type check —— 但那些早就自动化了。对 agent 来说,验证是另一件事:它能不能把东西真的「跑起来」。这才是敢撒手的前提。
Opus 4 时代,有人随手把它接上、丢下这句话 —— 它真的开了一个小 Claude CLI,测了自己刚写的功能。现在这成了日常:loop 挂着 iOS / Android 模拟器、桌面机自己验证。
一个工程师写了条「桌面开发 skill」:Claude 自己起本地 app,用 computer use 点界面、调新功能、测边界,出错就修了再测。卡在 staging 时它会去读 Slack —— 看是不是环境挂了、别人有没有踩过 —— 再把经验写回这条 skill。
从 Plan Mode 到 Auto Mode 那一跳,背后是一整套可证明的安全工程。
一年半前只有权限弹窗:跑个工具问你 yes/no。但人性是 —— 当你 99% 都点同意,眼睛就开始打滑。所以结论很反直觉:Auto Mode 比逐条读弹窗更安全 —— 你只把注意力留给真正重要的那一两件事。
收集几千份完整 agent 轨迹 + 权限请求,让独立模型(classifier)判安不安全 —— 极准。再请红队来 prompt injection、攻代码库,做成 eval 确保全被拦;内部再攻一轮、再补。于是它防的不只是野外现有漏洞,而是他们能造出的最聪明的攻击。
「每次 Claude 犯错,我不让它改一次 —— 我让它写进 CLAUDE.md,或做成一个 skill。」区别是:纠正一次下次还犯;写进记忆,它永远就这么做了。 「能做到这点,Claude 就能一直跑下去(run forever)。」—— 这就是为什么 loop 不会越跑越歪。新人上手从「几周」变「两天」也是同一个原因:不问人,问 Claude,因为查库早被写成了 skill。
Boris 在 #08 给的是哲学 —— 编程对错清晰,是研究对齐的完美培养皿;团队这支给的是机器 —— classifier + 红队 + eval,把「Auto 比人安全」做成了能证明的事。 两块连起来正是这一幕的总论点:正因为编程是干净的培养皿,才长得出这套让「把人移出信任链」成立的安全机制。 ← 回看 #08 的「培养皿」论
人退到无可再退,那还剩什么?这一幕是两支视频的合龙点,也是这篇专题真正想留下的问题 —— 先看退场推到组织尽头是什么样,再看连「品味」也退场之后,人手里到底剩下什么。
团队那支用一个 90 年代《哈佛商业评论》的案例收尾 —— 我觉得是整支里最该抄给每家公司的一段。
不是在纸质流程旁摆台电脑 ——
是把文件柜扔掉,
让电脑坐到正中央。
到这里两支视频表面打架、其实是接力:团队说现在拼的是品味,Boris 说品味也快不是你的了。这是退场的最后一格。
现在拼的是品味。
但品味,也快不是你的了。
门槛塌了 → 有品味、有好奇心、爱端到端的人胜出。
模型已有 ~20% 想法是好主意,3–6 个月后多数都会是 → 品味这道 alpha 也会消失,只剩价值观。
交互对象往上跳两级(源码→agent→loop)、模型替人做更多、专业身份融化、维护杂活交给 routines —— 每一层都是一次退场。
验证从「跑 lint」变成「run the thing」;classifier + 红队 + eval 证明Auto 比人更安全;错误写进 CLAUDE.md 让 loop 永远跑不歪。
留给人的从「会做」变成「想让它成为什么」 —— 教模型怎么做一个好模型,像教孩子做个好人。
这篇是一组 /ideas 的压轴。把它和「几个人的公司」「Agent 运营公司」「Boris 写 Loop」串起来看,是同一个故事的不同层面 —— 人正从一个个位置上退场。
一支朝后看打地基,一支朝前看下赌注。分开看是两条新闻,放一起看才是一条 —— Claude Code 的这一年,和它的下一步。