← Gimbo's Universe / Ideas / 两次模拟,一条火线
复盘 · 供应链 × AI Agent · 原创

两次模拟,
一条火线.

两周里我做了两次供应链模拟。第一次从「帮我模拟一个分销商」一路问到「公司是什么」;第二次把我自己的日常工作做成缩微模型,接上一个模拟的 ERP,跑通了 27 条断言。复盘这两次,我发现自己真正想要的答案只有一个:认知变免费之后,我的专业值钱在哪一段。而回答它的方式,不是第三次模拟——是把一个真实的供应商接上火线。

身份
新西兰医疗分销 · 供应链计划员
时间线
2026.05.30 → 2026.06.12 → 进行中
形式
复盘 + 下一步实验设计

望远镜:从补货
问到「公司是什么」

起点很朴素:「帮我模拟一个分销商的供应链。」3 个客户、1 个仓库、3 个供应商、9 个 SKU,三种库存策略加月度 MRP——一个晚上,沙盘就立起来了。但真正的旅程是接下来的追问。

第一跳是「能不能用 AI Agent 运营它」。按部门把岗位换成 agent,画出来一看——这只是换芯的旧公司,一张自动化地图。关键转折在第三步:自动化 ≠ AI 原生。三种模式的根本区别不在自动化程度,而在你管理的对象:管人 → 管流程 → 管目标函数

顺着这条线推到底,推出了一串我至今还在反刍的东西:三流从流水线塌缩成「力场」;一个核心优化器 + 一圈边缘 agent,人只在最顶(定义「好」)和最底(搬货);把库存压到近零做出负现金周期,分销商悄悄变成一台资本效率机器;以及最重要的一条——价值的 80% 藏在异常里,我们建模时假设掉的「无差异」,恰恰是最难也最值钱的部分。

那一晚的产出是 deck、研究报告、十几张图。验证方式是推演自洽——逻辑闭环了,但没有任何东西真的跑起来。它产出的是信念

洞察 01

自动化 ≠ AI 原生

人+Agent 只是换芯;AI 原生是把「定目标 + 协调」显式设计出来。协调从「开会自然涌现」变成必须工程化的东西。

洞察 02

三策略 MRP 是对人脑带宽的妥协

把 SKU 归成三类、按月跑一次,是因为人没法逐 SKU 连续调参。认知免费后,这个妥协会溶解。

洞察 03

Owner = 央行行长,不是店长

不审批每个决策,只设「利率」(目标权重 / 风险偏好 / 约束),看总量,稀少而高杠杆地调。

洞察 04

价值的 80% 藏在异常里

这条后来被行业验证了——已经有公司把「异常」做成了主战场:不替换 ERP、从邮件 / PDF 的脏入口进、detect → recommend → execute。

扳手:把愿景
拧到地面上

十二天后我又开了一局。但这次方向反了:不再往上问「是什么」,而是往下问「今天能不能跑」。三步,一步比一步重。

第一步,把我自己的工作做成缩微模型。虚构一家新西兰医疗器械分销商:3 家医院客户、3 个海外供应商、9 个 SKU、FCST / Min-Max / BTO 三种补货策略,连 P2P 九步状态机(下单 → 确认 → 分批发运 → 收货 → 三方核对 → 付款)都按真实粒度建出来——批号、效期、FEFO、三方核对容差公式、5 个工作日跟催规则,全是我每天摸的东西。

第二步,把行业标杆克隆成能跑的软件。把那家做供应链 AI agent 的公司(代号 Vela)的产品逻辑完整读完,照着做出一个本地能跑的 Action Center:AI 从非结构化邮件里抽取订单 / PO 确认 / 物流动态,对照主数据校验,给出建议,人审批,agent 执行回写,全程审计留痕。

第三步,接上(模拟的)ERP 跑场景。用一个模拟 Dynamics 365 OData 数据面,把 7 个 SO/PO 场景从头到尾跑了一遍——BTO 背靠背、缺货分批、供应商延误级联打穿医院承诺、发票价差被容差规则拦下……每个场景都以等效 OData 调用执行、以断言验收。

27/27 条断言通过
7 个场景 · 0 失败

验证方式从「推演自洽」变成了「assertion 跑通」。

第一次模拟产出信念,第二次产出证据:一套可重复运行、可以挂进 CI 当回归测试的 artifact。还有一份 FDE 视角的生产化差距清单——离真实上线差的是工程(集成、评测集、审批矩阵),不是概念

一次向上,一次向下

第一次 · 05.30望远镜
第二次 · 06.11扳手
方向
向上爬抽象阶梯,问到企业理论
向下落操作粒度,落到容差公式和工作日
对象
一个抽象的分销商
我自己工作的等比例镜像
产物
Deck、研究报告、思想图
带公式的工作簿、能跑的代码、断言、审计日志
验证
推演自洽(逻辑通)
断言跑通(机器说了算)
回答
「这件事的尽头是什么」
「那个尽头,今天能不能开始跑」
产出物性质
信念
证据

我到底在找
什么答案?

把两次摆在一起看,我在找的其实是同一个问题的三张脸。

第一张脸:可行性。愿景离今天有多远?这层已经答完了——不需要等 AI 原生公司,一个风险优先、非侵入、从脏入口进的 agent 层,今天就能搭在现有 ERP 上。差的是工程,不是概念。

第二张脸:我自己的位置。这才是真问题。第二次模拟里我反复算一张三种编制的损益表:满编 8 人 / 混合 5 人 + Agent / 极简 1 人 + Agent + 3PL——我在反复计算的,其实是「这门生意最后剩下哪个人,那个人是不是我」。

A被增强的计划员

用 agent 把自己的日常做快十倍。最稳,但天花板是「一个更高效的岗位」——而岗位本身正在被重新定价。

B做部署的 FDE

把「会建造异常处理机器」带到别人的现场。领域知识 × 工程能力的交叉点,两次模拟实质上都在为这个身份攒作品。

C定目标的 Owner

用 agent 跑一家小分销生意,自己只管目标函数和异常。最远,但第一次模拟已经把它的形状想清楚了。

第三张脸:认知免费后,
我的专业值钱在哪一段。

第一次模拟的回答是:值在定义目标和处理异常。第二次模拟做的事,就是亲手验证我有能力建造处理异常的那台机器——而不只是当机器里的一个环节。这是从「被自动化的对象」到「做自动化的人」的身份翻转。十几年的供应链经验,正在从「岗位技能」被转译成「可携带的资产」。

两次模拟的共同盲区,
和一条火线

两次模拟有个我必须诚实面对的问题:它们都是我自己出题、自己阅卷。仿真里的邮件是干净的、规则是我定的、断言必然通过。缺的最后一块证据,是真实世界的脏数据 + 真实组织的信任——这两样东西,模拟永远给不了。

所以第三步不是第三次模拟,而是一次真实工作里的试点。切法很克制:一个供应商 × PO 确认段(确认追踪、跟催、交期回写建议)——整条 P2P 链里我完全拥有、风险最低、频率最高的一段。不碰付款,不对客户自动发信,抽取永远不允许「发明」一个 PO 号。

供应商怎么选?四个标准:走邮件沟通(脏入口才是 agent 的主场)、月单量适中(够出数据,坏了不疼)、行为上「烦人」(确认慢、常改期——痛点可见,ROI 才算得出来)、关系友好非关键(试点出纰漏不伤大局)。

W0 · 基线

量现状

手工记两周:开放 PO 数、平均确认时长、改期未回写次数、每周耗时。没有基线就没有 ROI 故事。

W1–4 · Shadow

只看不动

agent 每日 digest:已确认 / 该跟催 / 邮件与系统不一致。ERP 仍全部我手工操作,逐日记录「建议 vs 我实际」吻合率。零权限、零风险,今天就能开始。

W5–8 · Assisted

它动手,我扣扳机

过了准入门槛(抽取 ≥95%、吻合率 ≥80%)才升级:跟催邮件它起草、回写内容它备好,我点确认。execute 留给人,也已拿走七成价值。

W9+ · 白名单

例行自动

例行跟催自动发;小幅无冲击的改期自动回写;异常永远留人审。然后横向加供应商,或纵向延伸到三方核对。

≥80%
建议吻合率 —— agent 的建议等于我实际会做的
−50%
平均确认时长 —— 跟催从「想起来才追」变成 SOP
≥95%
系统交期准确率 —— ERP 日期 = 供应商最新承诺
≥2h
每周省下的小时数 —— 六周后用数据说话

信念 → 证据 →
信任.

第一次模拟产出信念,第二次产出证据,第三步要赢的是信任——而信任不在沙盘里,在真实组织和真实邮件的混乱里,按动作类型一个一个赢回来

从「怎么补货」问到「公司是什么」,再从「公司是什么」落回「周五先选哪个供应商」——这条来回,可能就是这个时代把专业知识转译成新资产的标准路径:先想清楚,再造出来,然后接上火线。

这篇文章的下一篇,应该是六周后的那张数据表。