Anthropic 发了一份官方 playbook:《Building effective human-agent teams》,讲人和 agent 怎么混编成一个团队。我把它先后交给两个 AI:先让 ChatGPT 当 doer——把 playbook 翻译成我所在行业(制造业供应链)的一张完整混编蓝图,9 类 agent、一张 roster、四级权限、三阶段落地;再让 Claude 当 verifier——把蓝图连同原文一起摆在它面前,只问一个问题:这套东西怎么活下去?它问出了七个补丁。你现在读的这篇文章,生产方式本身就是原文第四课(执行和验证分开)的一次演示——人出题、定角色、做裁决;两个 agent,一个画图,一个挑刺。
原文第四课里最锋利的一个设计叫 doer-verifier:一个 agent 干活,另一个 agent 批卷,执行和验证永远分开——agent 不能给自己打分。我读这篇文章的时候突然意识到:读文章这件事本身,也可以这么干。
我把原文丢给 ChatGPT,只给了这一个方向。它交回来一份 15 页的方案:总体原则、人保留什么、9 类 agent 各就各位、一张人机并列的 roster、一天的工作节奏、四级权限、三阶段落地路线。生成模式全开,盖了一座完整的城。
然后我把这 15 页连同原文一起交给 Claude,角色设成 verifier:不许重画蓝图,只许挑生存问题。它的第一句判断是:这张蓝图拿走了原文的架构,没拿走原文的纪律——然后给出七个补丁。
先把结论放这:两个 AI 的产出差异,不是模型能力的差异,是我派给它们的角色的差异。同一篇文章,doer 读出组织架构,verifier 读出生死条款。这恰好就是原文反复讲的那件事:生成和验证是两种不同的工作,必须由不同的座位来做——而出题和裁决的座位,还是人的。
先把原文完整摆一遍——它开头一句就是判断:过去两年我们默认的 AI 用法是「单人游戏」,一个人对着一个聊天窗,聊完就散。Anthropic 内部已经不长这样了:agent 住进了 Slack 这类工作真正发生的地方,同时和多个人协作——一队人定战略,Claude 执行。让这件事成立的是三个此前一直缺位的技术前提:
agent 记得团队的目标,并朝着目标持续调整自己的执行——不再是每次对话从零开始的金鱼。
agent 的账号不挂在任何一个人类名下。这一步把它从「某人的工具」变成「团队的成员」——有自己的身份,也有自己的权限边界。
agent 能持续读到组织的公开讨论和文档,自己学会这家组织怎么运转——而不是靠人把上下文一勺一勺喂进对话框。
文章的主体是四条从内部实践里长出来的经验,每条都带做法清单和真实案例:
全文最锋利的一句话:「如果没写下来、agent 够不着,它就不存在。」人类靠隐性知识和茶水间闲聊补位,agent 没有这个通道。做法:公司层面选定少数几个安全边界(而不是逐条纠结「这个要不要给它看」)、新渠道默认组织内公开、每个决策落进 channel/文档/纪要、写文档时把 agent 当第一读者——原文说 agent 已是团队文档的「主要消费者」。
解法是一份「共同名册」(roster):人和 agent 并列在同一张表上,各自的任务、边界、工具写清楚;agent 的专长用 skill 文件定义;人和 agent 在同一条共享线程里干活,谁都能接手别人放下的活。
光派活,agent 永远是被动的。要让它从「执行者」变成「主动的支援者」,它得知道团队在朝哪走。顺序很讲究:人类先讨论、辩论、写下来一个有野心的目标——吵架的部分是人的活;然后把北极星共享给 agent,并显式点名哪些 agent 有权主动建议新工作流——主动权是授予的,不是默认的。
全文最重的一条,核心一句:「按 agent 已证明的可靠度,按比例授予自主权。」分三阶段:早期逐份人审 + 让验证者 agent 检查执行者的工作(agent 不给自己批卷),顺手把审查标准沉淀成任务验证清单;中期让 agent 复盘自己的失误,并按任务类型追踪它在哪类活上挣到了自主权;后期某类任务重复成功后按类型扩权,同时教 agent 把人类注意力当稀缺资源,给日工作量设护栏。
四条经验下面还压着两根更结构性的梁。其一,信任第一次被工程化了:不是「敢不敢放手」的开关,而是一部按任务类型计量、可升可降的梯子——公司第一次需要给 agent 建一套试用、考核、转正、扩权、降级的「人事制度」。其二,稀缺资源换位了:agent 产能近乎无限之后,全系统最稀缺的资源变成人的注意力——所以提问要批量、沟通要限量、人的高质量时间要在日历上圈起来;而且护栏有双重目的,防 agent 刷屏,也防人的技能空心化。
文章结尾自己揭了谜底:「这些模式没有一条是新的。」目标清晰、角色明确、强文档、质量门、错误变学习——健康团队的老功课。变化在「必需」两个字:人类团队里文档烂一点靠隐性知识兜得住,agent 只有写下来的才存在。AI 把好管理从一种美德,变成了一个接口。文末附五问自检:信息是否公开可搜索、能否一口气写出团队名册、每个成员是否有趁手工具、关键产出有没有评分标准、团队有没有一颗北极星。
这篇原文我另写过一篇逐层深拆(做法清单和案例全展开):《公司缩到几个人之后,剩下的座位坐的是 agent》。这里摆的是全骨架——因为接下来两个 AI 的分歧,每一处都要对回原文。
ChatGPT 抓住的核心一句是:不要把 agent 当成每个人私下的「个人助手」,要把它当成团队 roster 里的正式成员。传统模式是 planner 自己看 forecast、库存、PO、供应商邮件,再问 AI 帮忙写封邮件——还是单人游戏。它给的目标换了量级:让整个部门拥有一个持续运转的供应链神经系统。人负责目标、判断、取舍和关系;agent 负责持续扫描、整理、提醒、执行、验证,并形成共享记忆。
人保留什么,它划得很清楚:经理设北极星、定「哪些活可以交给 agent、哪些必须人批」;planner 仍是自己那组供应商和品类的 portfolio owner——判断 forecast 可不可信、决定要不要提前下单/加急/空运、维护供应商关系、和销售生产财务做 trade-off;采购管谈判和合同;需求端(销售/客服)提供真实需求信号;财务定现金流和库存金额的约束。agent 做前置,人做商业判断。
然后它把 agent 排出了九个岗位:
总控台。每天自动扫缺货风险、未确认 PO、ETA 延迟、低于安全库存、临期品、供应商响应变慢,早上发一份今日 Top 10 风险简报——影响、原因、建议动作、负责人、截止时间。让团队从「各自找问题」变成「看同一张风险地图」。
专盯库存两头着火:缺货和过剩同时存在是制造业的常态。算 projected stock cover,对比 forecast、open PO、lead time,建议取消/推迟 PO、加急、partial shipment、临期品优先消化。
供应商追踪专员:PO 发了没、确认了没、ETD/ETA 对不对得上承诺、响应时间有没有变慢,草拟 follow-up 邮件、每周供应商状态报告。邮件由人审后发——供应商沟通里有语气、关系和承诺风险。
盯操作闭环:Requisition → PO → 审批 → 确认 → 发运 → GRN → Invoice。抓的全是流程断点:建了没批、批了没发、确认数量对不上、货到了没 GRN、ETA 过了系统没更新。价值:消灭「我以为别人已经处理了」的灰色地带。
守需求和供应的交界:forecast 暴涨暴跌、actual 连续偏离、promo 没反映、停产 SKU 还在产生需求。它不预测未来,只不让错误 forecast 静悄悄进入 supply plan。
给生产计划做体检:产能、换线损耗、原料/包材齐套、QA release 时间、冻结窗口、MOQ。提醒「这批排产原料 ETA 晚于生产日期」——最终调整还是人和工厂定。
会前备齐风险与决策事项,会中记谁负责什么、哪些决策被确认,会后出 action list 和决策记录。核心价值不是写纪要,是把团队记忆变成可搜索、可追踪、可复用的资产——正是原文 Lesson 1。
查 lead time 过期、MOQ 异常、safety stock 不合理、UOM 错误、参数常年没更新。它自己点破了要害:ERP 参数错了,agent 再聪明也输出错建议。
照搬原文的 doer-verifier:库存 agent 给补货建议,它查违不违反 MOQ/lead time/资金上限;供应商 agent 草拟邮件,它查有没有过度承诺。供应链的任务大多有明确检查标准,天生适合分开批卷。
然后是那张最像原文 Lesson 2 的东西——人机并列的编制表,每个人类角色配哪些 agent:
| 人类角色 | 搭配的 agent | 主要分工 |
|---|---|---|
| 供应计划经理 | Control Tower / S&OP | 设方向、看整体风险、做升级决策 |
| Supply Planner | Inventory / Supplier Follow-up / PO 对账 | 管品类、供应商、补货和异常 |
| Demand Planner | Forecast Exception | 管需求变化和 forecast 异常 |
| 生产计划员 | Production Constraint | 查产能、物料、排产限制 |
| 采购 | Supplier Performance | 供应商表现分析、谈判材料 |
| 物流协调 | Freight / ETA | 追运输、清关、延误 |
| 财务伙伴 | Working Capital | 库存金额、过剩库存、现金影响 |
| 数据/系统 Owner | Master Data | 数据质量和系统参数 |
| 资深计划员 | Verifier | 建审核规则和自动检查机制 |
一天的节奏,它也排好了:
权限,它切成了四级——并且给关键商业动作(加急费用、空运、大额 PO、取消订单、客户分配、forecast override)永久保留人批:
读数据、总结风险、生成报告。刚开始都在这。
可以草拟邮件、PO 建议、纪要、行动项——全部需要人审。
规则内执行低风险任务:更新 tracker、标记风险、提醒负责人、创建待审批 request。不能自动向供应商、客户或财务作出任何承诺。
只有验证过的任务才自动化:常规 PO follow-up、周报生成、master data 异常工单、逾期行动提醒。agent 可以推动流程,但不能独立承担商业责任。
落地路线分三阶段:先做 3 个(Control Tower + Supplier Follow-up + Inventory——解决「不知道哪里快出事,知道时已经太晚」这个最痛的事);稳定后加 Verifier 和 S&OP(团队从「AI 帮我做事」变成「AI 帮我们形成节奏」);最后写下北极星让 agent 主动——「让团队提前 4–12 周看到问题,而不是在问题发生后补救」。终局模型:人是指挥层、判断层、关系层;agent 是感知层、执行层、记忆层、验证层。planner 的一天从「查数据→找异常→写邮件→催货→救火」变成「看风险地图→判断优先级→做 trade-off→审核关键输出→改进系统规则」——从 executor 变成 orchestrator。
公道话先说:这张蓝图把原文的 Lesson 2(roster)做到了极致——每个 agent 有岗位、有权限、有输出物,人机并列一张表,四级权限甚至比原文的三阶段更细。作为一张「混编长什么样」的图,它几乎无可挑剔。问题恰恰在于:它只回答了「长什么样」。
verifier 的开场判断:ChatGPT 搬走了原文的名词(roster、north star、doer-verifier),但原文真正的重量在动词上——划边界、挣信任、审产出、护注意力。这些动词决定这套系统是活的还是一张挂在墙上的组织架构图。七个补丁,每个都对回原文的某一课,也对回我自己业余搭单人版舰队时踩过的坑:
原文 Lesson 1 是双面的:默认公开,加公司级安全边界。蓝图只拿走了「信息要写下来」,完全没画反面:供应商报价底线、客户合同、谈判策略,哪些不能进 agent 的工作区?更锋利的一层:那个天天读供应商邮件的 Follow-up Agent,读的是不受信输入——一封外部邮件里藏一句指令,就可能把 agent 带偏。还有「独立凭证」:听起来是技术细节,落到制造业是 IT 要给 agent 办工卡——service account、权限审计、「这封邮件法律上算谁发的」。
9 个 agent 每天跑,就是 9 个会静默死掉的承诺。Control Tower 每天发 10 条风险,第三周就会撞上简报疲劳——没人读的简报比没有简报更危险,因为它制造「有人在盯」的假象。数据管道断了,agent 不会喊疼;输出会漂移;采纳率会阴跌。原文的信任梯之所以能转,是因为始终有人在记录、复盘、升降级——那个「有人」本身就是一个新岗位,蓝图的 roster 里没有它。
L1→L4 的梯子画得很好,但每一级之间的门槛是空的。原文的原话是「按已证明的可靠度,按比例授予自主权」——每个词都是刻度:连续多少周零事实错误才升 L3?抽查通过率跌破多少降回 L2?没有写死的判据,结果只有两种:永远停在 L1(不敢放),或者一步跳到 L4(懒得审)。还有一层更日常的:「人审后发送」如果没有字段级的审核清单(审哪几个字段、什么算 fail),三周后人审必然退化成橡皮图章——自动化偏见是真实的人性。
原文文末的五问(信息可达、名册清晰、工具到位、产出有评分标准、北极星对齐)是一个现成的季度审计工具,蓝图没接。再加三个数:风险提前发现的周数(北极星里自己写了 4–12 周,那就量它)、agent 建议采纳率、false positive 率。采纳率阴跌是信任在流失的最早信号,比任何回顾会都早。没有这三个数,「第二阶段加 Verifier」永远不知道该不该开始。
蓝图自己都写了:「ERP 参数错了,agent 再聪明也输出错建议。」那它就不该是第 8 号 agent——lead time 过期、MOQ 异常没清掉之前,Inventory Agent 的每条建议都是噪音。还有一个更土、更真实的前提:很多制造业的 ERP 没有开放 API,数据住在 Excel 和邮件附件里。原文 Lesson 2 说每个成员要有「趁手的工具」,翻译到制造业是:第一步工程不是设计 agent,是给 agent 修一条可靠的数据出口。先修路,再上岗。
「促销计划必须记录、客户优先级必须落文档」——这些规则约束的对象是销售和客服,不是供应链自己。Forecast Exception Agent 瞎不瞎,取决于隔壁部门肯不肯写。原文的语境是全公司一起转;单部门推进时,边界上全是断层。这是变革管理,不是技术:要去谈,要给交换——比如先让 agent 替销售干点活,再要求销售为它写字。蓝图把它当成供应链内部立几条规矩就能解决的事,这是它最天真的一页。
「先做 3 个」已经比 9 个克制,但 3 个只读 agent 各发各的报告,不如 1 个 agent 把一环走完:感知 → 草拟 → 人审 → 写回 → 复盘。原文的信任梯也是这么爬的:从「读 backlog 打分」到「独立处理 500 个 bug」,是一条线爬上来的,不是三条线同时铺的。22 节的完整模型很漂亮,但那是第 18 个月的形态,不是第 1 个月的。蓝图画得越完整,越要警惕一种病:把「全部建成」当成开始使用的前提。
七个补丁排在一起,能看出它们其实是同一句话:ChatGPT 回答了「混编长什么样」,原文真正教的是「混编怎么活下来」——边界、心跳、判据、度量、地基、邻居、一环。这七样没有一样出现在组织架构图上,但第三个月还活着的系统,靠的全是它们。
蓝图是承诺,
活下去才是团队.
这场双 AI 实验里最值得带走的,不是那张 9-agent 编制表,也不是七个补丁,而是这个结构本身:同一份材料,给 doer 读出架构,给 verifier 读出生死。以后读任何一份「方案」,都值得跑一遍这个流程——先让一个 AI 盖楼,再让另一个 AI 验收,而你坐在原文说的那个位置上:出题,定角色,裁决。
「供应链 AI Agent」这条线走到第三篇,和「公司的形态」那条线在同一个路口汇合了:公司在缩小,座位在换人,而不管团队里坐的是人还是 agent,让它活下去的东西从来没变过——写下来、定角色、立目标、验产出、给每个承诺配一个盯着它的人。Anthropic 把这些写成了 playbook,ChatGPT 把它画成了编制表,Claude 把它问回了地面。剩下的那一步,哪个 AI 都替我走不了:去上班,把一环跑通。
写完才意识到,这篇文章自己就是证据:doer 和 verifier 的差异不在智商,在座位。让同一个模型既画蓝图又挑自己的刺,它会温柔得多——分开两个座位,刺才扎得进去。这和原文「agent 不给自己批卷」是同一条物理规律。我的下一步很具体:把七个补丁里的 #03(升级判据)和 #04(三个数)喂回我自己那条 PO 试点的一环里——蓝图我已经有了,现在补纪律。
—— 这是「供应链 AI Agent」专辑第 3 篇,也是「AI 学习记录」第 6 篇。看到什么、动手改了什么,都收在这里。