Gimbo's Universe / Ideas / 从 Chat 到 Agentic
§ 读书会分享 · HOW TO WORK WITH AI · 2026.05

从聊天框,
走到后台。

2026 年 5 月 3 日,我在奥克兰一个线下读书会做了第三场 AI 主题分享。 18 页 deck,准备了断续三周,讲的是我用 Claude 的五个月—— 从一个个聊天,长成一个有结构、能调用、可复用的工作台。

deck 顺完了,有问题,但气氛偏闷。Q&A 集中在「AI 会取代我吗」, 没有人问「那个东西是怎么搭的」。所以这篇文章把两样东西放在一起: 我准备的那 18 页,和当晚回家写下的那份复盘。前者是我想讲的,后者是房间实际给我的。

分享于 2026.05.03 线下分享 · 约 20–30 人,多数非技术背景 源材料:18 页中文 deck + 当晚复盘 HOW TO ___ 系列 9/11
当时的分享封面:从 Chat 到 Agentic,Claude 五个月使用体验的第一页
当时的封面 · DECK P12026.05.03

我讲的是怎么搭,他们想问的是会不会被取代

开场我抛了一个问题:如果 AI 已经具备「博士级智商」,为什么大多数人用它, 只能拿到 20–30% 的效率提升?

我准备了两个会被想到的答案,然后都否掉:是工具不够强吗?不是—— 现在的模型早已超过绝大多数白领的知识广度。是用得不够多吗?也不是—— 每天用三小时和用三十分钟,差别没有你想的大。 真正的答案是使用模式错了:还把它当聊天工具,而不是团队成员。

这个开场我自己很喜欢。但事后回看,它也埋了那天最大的错位—— 我讲的是「怎么把它当队友」,而房间里的主导情绪是焦虑: 担心被替代,而不是好奇能用它做什么。 当我说「我已经跑了 130 多次会话」的时候,他们听到的可能是「我已经被甩开五个月」。

大多数人卡在前两个

deck 的核心对比只有一页:Chat AI 像一个传统实习生—— 核心功能是信息综合与研究,每个任务都要你手动提示,产出是文字和答案, 效率提升 20–30%;Agentic AI 是核心队友——核心功能是自主行动与授权执行, 定时启动、在后台主动跑,产出是已经完成的任务和多步流程,效率提升 2×–10×。

差距不是线性的——是数量级的。 Deck P3 · 核心对比

顺着这个对比,我给了一个更好用的心智模型:AI 在你身边能扮演四种角色。 前两种在聊天框里就能完成,后两种必须走出聊天框。

1

微任务工Microtasker · Chat

处理零碎小活:润色一封邮件、改一个标题。它替你省几分钟。

2

陪练 / 镜子Companion · Chat

头脑风暴的搭子,帮你把模糊的想法说清楚。它替你把话想明白。

3

受托人Delegate · Agentic

交给它一块独立的工作,它自己跑完,把成品交回来。它替你完成一件事。

4

核心队友Teammate · Agentic ★

主动型的一等公民,撬动的是整个系统,不是单个任务。它替你运行一套流程。

我在这一页停了很久,因为它是整场分享唯一一个「你现在就能给自己定位」的东西。 大多数人卡在 01 / 02,真正的杠杆在 03 / 04。

一百三十次会话,长成一张工作台

讲完模型,我把自己的数字摊开——这是整场分享我唯一有把握的部分,因为它是我亲手跑出来的。

总会话
~130

网页版 + 协作版 + 代码版,三栈合计,2025.12 → 2026.05。

活跃项目
8

工作流自动化 · 个人系统 · 长期创作 · 技术实验 · 设计基础设施。

单项目峰值
20

TennisBuddy,仅 4 月一个月就跑了 20 次会话。

另外还有一条不太起眼但后来最有用的资产:6 个设计系统库。 八个项目横跨工作、学习和生活——一套多 agent 的工作流系统、周月复盘、写书、 TennisBuddy、投资研究、邮件流优化、个人理财、设计基础设施—— 全都住在同一个工作台里。AI 不是某一个工具,是基础设施。

CLAUDE 发布节点 1/12 协作版预览 2/5 OPUS 4.6 · 1M 3/6 MARKETPLACE 4/9 协作版正式版 4/16 OPUS 4.7 30+ 40 8 48 1 12 月 → 1 月 Chat → 协作版 2 月 工作流爆发 3 月 项目重构 4 月 多元化峰值 5 月 沉淀 纵轴 = 当期会话数 · 2/13 单日峰值 17 次
示意图 · 数据依当时 deck 的五阶段与双时间线 2025.12 → 2026.05

这张图我在现场是分两页讲的,一页是我的五个阶段,一页是同期的产品发布节点。 叠在一起看,结论有点刺眼:工具变强的节点,几乎正好对应我使用强度的跃升。 1 月 12 日协作版一放出来我就切了过去,月底就有了第一个跑在本地的代理; 2 月百万上下文之后,出现了单日 17 次会话的爆发;4 月正式版落地,那个月 48 次。 这不是巧合。

3 月只有 8 次,是因为在做重构——把第一个代理项目正式搬进工作台的目录结构里。 5 月只有 1 次,是因为在做沉淀:把过去 90 天梳理成一份单页参考,和这场分享。 低谷不都是停滞,有些低谷是在整理。

Case 01 · 第一个真正 agentic 的项目

起点是我自己的供应链计划工作:每个月要手动跑一遍的那套流程,被我整个搬进了后台。 它是四个代理协作——一个管计划与库存阈值,一个管订单与物流跟踪, 一个管三方对账与异常追踪,再加一个总调度负责风险预警和状态总览—— 外挂 5 个 skill 模块,全自动月度运行,前后三十多次迭代会话才稳下来。

它不是一次做成的。三十多次迭代里,大部分不是在加功能,是在把「上次它做错的那一步」写进规则。 agentic 的门槛不在第一次跑通,在第七次之后你还愿不愿意继续修。

先给系统打三根锚

我自己的路径是野路子,所以 deck 里我引了一套更成型的方法: 前亚马逊 AI 负责人 Alli Miller 在一次访谈里讲的三步法。 它最打动我的地方是顺序——先文档,再技能,最后才是自动化。 大多数人的顺序是反的,一上来就想让它自动跑。

1

三份底层文档Context Docs · ~60 min

个人核心准则(价值观、性格底色、决策框架)——让 AI 的输出像你,而不是像默认的 AI; 年度战略目标(年 / 季 / 周目标、习惯、关键指标)——让它帮你筛机会,不被无关任务塞满; 业务战略文档(价值主张、目标客户、不服务的人、过往失败)——让它给决策建议,而不是列一堆优缺点。 操作建议很具体:在日历上锁一小时,让它反过来采访你。

2

模块化技能Modular Skills

把每次都要重复的提示词,变成一个可调用的技能:一份大约 200 行的 .md 文档, 长指令 + 配套资源,放在独立文件夹里。她举的例子很实用——品牌音调、 滤除「AI 感」词汇(屏蔽 game-changer / delve / unleash)、PR 流程、合同审查红线。 纯文本的好处是跨平台:换一个模型也读得懂。

3

主动工作流Proactive Workflows

这一步是分水岭:你睡觉时,100 个智能体在替你工作。 她的数字是 36 条主动工作流、约 100 个智能体、0 次人工触发,每天 06:00 自动唤醒。 清晨简报流的时刻表是:04:00 抓行业新闻 → 05:00 扫日历与客户 → 06:00 合成简报 → 07:00 邮件提醒 → 08:00 你睁眼就是一个完美开局。

三步法给的是「搭什么」,工具阶梯给的是「在哪儿搭」。我把手上这套生态排成了四级跳, 按任务复杂度往上爬——大多数人停在 L1,真正拉开差距的人常驻 L2–L4。

工具阶梯 · Tool Ladder
  1. 网页版 — 单线程对话,研究、问答、写作。入门 · Chat。
  2. 协作版 — 本地文件交互,自主调用工具(建文档、发邮件)。中等自主。
  3. 代码版 — 构建自定义软件、深度数据检索、复杂代理工作流。高控制。
  4. 浏览器扩展 — 「接管」鼠标,跨网页自动执行(订票、填表单)。最高自主。
爬塔不是越高越好。选层的依据是任务复杂度,不是你想显得多前沿—— 一封邮件用 L4 去跑,是把简单的事做复杂。

最后一页讲分工:哪些事可以放手,哪些必须留一道人工闸门。判断轴有两条—— 风险高低和你自己在这件事上的专业度。

放手
低风险 · 你懂 · 完全授权
  • →日常排版、格式整理
  • →资料搜集与初步归类
  • →AI 是执行者,你只看结果
留闸门
高风险 · 必须人审
  • !你暂时不熟的领域:先听后定
  • !合同初审、战略判断:你能识别废话,它只是加速器
  • !高风险 + 你也不懂 = 别用

这张四象限里,唯一一个我在 deck 上直接画了叉的格子是「高风险 + 低专业度」—— 你既扛不住后果,又看不出它哪里错了。最终的判断权必须留在你手上。

五个月,五件带得走的事

1

上下文 > 提示词

我花在打磨 prompt 上的时间越来越少,花在喂上下文——个人准则、目标、业务背景——上的时间越来越多。

2

把抱怨变成技能

每一件让我烦的小事,都先问一句:能不能把它做成一个可复用的小流程?五个月之后,我有了一个技能库。

3

一个项目,启动整个体系

那套工作流系统跑通之后,复盘、写书、理财、设计系统,全按同一套方法论搭了起来。第一个真的很难,第二个开始就是复制。

4

设计系统不是装饰

强制套用那 6 个设计系统库,让输出有了「我的味道」——而不是千篇一律的那种一眼可辨的 AI 灰。

5

沉淀 > 冲量

5 月我只跑了 1 次会话,但把过去 90 天梳理成了一份单页参考。沉淀的那一刻,方法论才真正成立。

收尾我给的是这一句:最大的变化不是工具,是我看待「工作」的方式——从执行任务,变成搭建系统。 并且给了三件回家就能试的事:找一个安静的小时聊一次自己、挑一件每天有点烦的小事做成流程、 让其中一个真的自己跑起来。先让一个跑起来,再慢慢加。

气氛不好,不等于失败

回家之后我写了一份复盘。写下来的第一件事是位置:讲到项目矩阵那页,我开始感觉房间在游离; 讲到双时间线和那张单页参考,听众的眼神是「看的多,消化的少」。 走出会场时是一种钝感——我准备的内容跟他们的需求错位了。

把三场分享排在一起,形状就清楚了:2025 年 11 月讲的是技能(怎么写提示词), 我和听众几乎齐平;2026 年 2 月讲的是战略(AI 时代的人机分工),距离开始拉开; 2026 年 5 月讲的是实践(我的五个月),拉开很多。 每一场我都比上一场更深,但听众基本没动。

三场还共享同一个缺陷:tell,don't show。11 月讲框架,没让大家试一次前后对比; 2 月讲数字,没让大家看一个代理真的跑五分钟;5 月讲 130 次会话, 没让大家看它接管浏览器的那一瞬间。全是用概念解释概念。 听众离开时多了知识,但没多 agency。

这三场分享,首先是我自己学习的截稿日,其次才是给听众的。 2026.05.03 · 当晚复盘

承认这一点之后,听众的角色反而清楚了:他们是目击者——见证我某个时间点的状态; 是回声——他们的反应反过来变成我下一阶段思考的输入; 是种子盘——少数人会真的被点燃,多数不会,而我不必为多数负责。 那天我下意识还背着「应该让他们获得什么」的包袱,这个错位才是气氛不好的真正源头。 不是 deck 出了问题,是我对这件事的定位还没想清楚。

所以我给自己留了两条:一,接受 deck 是沉淀容器,不是说服工具; 下次做每一页之前先问「这一页是我真的需要它来理清,还是因为它好看?」。 二,注意「自我表演」陷阱——用最炫的方式展示学了多少,会慢慢取代用最清晰的方式整理学了什么。 半年自检一次:我是为了消化得更深,还是显得更高级?

⚠ 诚实的边界

这一节引用的那份复盘,初稿是我让 AI 起的,用了第一人称。 真正让它成立的是我后来自己改过一遍——把不像我说话的地方改掉,把没说到位的地方补上。 改完之后它才真正属于我。这既是记录,也刚好是第 04 节那道「人工闸门」的一次实操: AI 可以起草你的自省,但不能替你自省。

我和这个房间的相对位置在变。

那天我最想留给房间的是一句话:你不需要成为程序员,你只需要成为系统的架构师。 我现在仍然相信它——四个角色、三步法、四级跳,全都指向同一件事: 你的工作从「把任务做完」挪到「把流程搭好」。

但那天真正留给我的是另一句。气氛不好不等于失败,它只是一个信号—— 我成长了,我和这个房间的关系需要重新校准。承认这一点,比修复气氛重要。

复盘的最后我给六个月后的自己留了四个问题,现在照抄在这里:

Q1我还在 learn in public 吗?还是停滞了?
Q2我整理的方式更清晰了,还是更花哨了?
Q3那天没听懂的人里,有没有谁后来真的回来问我?
Q4如果做第四场分享,我现在最想消化的主题是什么?

后来我又站上去讲了两次。所以这四个问题里,至少第一个的答案是「还在」。

本文是「HOW TO ___ · 读书会分享」系列的第 9 场(共 11 场),分享发生于 2026 年 5 月 3 日,内容整理自当时真实的分享材料。全系列按最初分享的时间排在 Ideas 时间线上。