分拣员
SORTING一句话
来了一堆杂七杂八的事,先看是什么类型,再扔给对应的人或通道去办。
人类工作原型
医院导医台分诊、客服工单分配、总编审稿派发、收发室分信件。
AI 时代的变化
LLM 路由 / embedding 分类 / 特征识别可以把分诊做到 90%+ 准确率,耗时从分钟降到秒。但 「边界 case + 模糊分类 + 最终归属」 仍必须由人守——必须设一个"不知道归谁就扔给主管"的兜底通道。
WORK MODES × AI · BUILD-IN-PUBLIC
WORK MODES × AI · BRAIN AS A TPS=3 MODEL
AI 已经能干绝大多数事。人该做的只剩一件:让大脑输出。 真实工作不是「一个输入一个输出」——它是多个输入聚成一个产出、是长项目里一节接一节。我们把所有人类工作抽干,还原成 5 种基础模式。 任何岗位、SOP、复杂业务流,都是这 5 件事的排列组合 + AI 协作。
把那段自言自语放前面——所有结论都从这里长出来。
突然发现一个神奇的,或者很好的方式,就是去写作。当前 AI 能干绝大多数事情后,人应该做的事情,就是去让自己的大脑输出。
如果大脑是一个 agent 的话,差不多就是每分钟 200 字,一小时 1 万字的,也就是 TPS 是 3 的一个 AI。这是一个很有意思的话题。如果是纯写作的话,一个人每分钟都写不出 200 字,比如刚才这段差不多也就花了两三分钟的时间。
但好消息是,这个写作方式,我开始写了,也以后产出了,在这个方向上,是有很多的尝试。
而且,人还会有注意力的不集中,人的上下文也是有限的。你不可能记着一本书的全部内容,你需要先花两小时,或者三四小时看一本书。这样的话,也就是产生一个巨大的效率对比。人的效率是 tps/s,但是输入时间,比如是 2 小时 1 本书,产出一个一个书评,差不多 5 小时。但是 AI,只需要 100 TPS,也就是 10 秒,加上各种时间,也就是 1 分钟。差不多 1:300 的一个效率对比。
这只是我们面对基础的数据对比。如果是 10 本书,100 本书呢,这个上可以变成无限大的效率对比。
但真实世界里的工作不是这样一个输入一个产出。这个也是我要研究的话题。
正常人类的工作,都会聚焦到:多个输入一个产出,一个标准下的多个产出,或者一个产出接一个产出。当我们在一个长的项目的维度上,产出之间是关联的,关联的过程中,逐个逐个的,让整个项目,更加清晰。
这个地方,涉及到了项目管理的基础知识和需求,包括系统的方法论。实际上,我一直在研究和探讨,人类的工作,或者正常的企业内的工作,可以分为多少种不同的方式。哪些方式,会高度被 AI 替代,哪些不容易被 AI 替代?想到了前些天看到的一个消息是,人类工作的拆分。是不是和这个就已经囊括所有的内容了呢?
— 2026.08.19 思考流,记录单步效率差是巨大的。但真实工作的结构让这个差变得有意义。
| 动作 | 人(脑 · TPS=3) | AI(agent · TPS=100+) | 比例 |
|---|---|---|---|
| 读一本 10 万字书 + 写一篇书评 | 5 小时 (输入 2h + 输出 5h) |
≈ 1 分钟 (10s 阅读 + 10s 输出 + 上下文装配) |
1 : 300 |
| 10 本书横评 → 一份报告 | 50 小时 (一本书 5h × 10) |
≈ 10 分钟 (10 本并行 + 整合) |
1 : 300 |
| 100 本书知识图谱 | ≈ 500 小时 (两周不眠不休) |
≈ 1.5 小时 (含分类+去重+入库) |
1 : 300+ |
但这都是「1 输入 1 输出」的最理想情况。真实工作的结构是 多输入聚合 / 链式产出 / 长项目累积。所以光看 1:300 没意义——AI 在这种结构里被多次调用、上下文碎片、跨链路状态保存,所以真实工作里效率差比 1:300 略低。 不过即便乘一个 0.1 的折扣系数,仍是 1 : 30 起。这正是「5 种模式」要研究的问题:在哪个模式里调用 AI 收益最高、在哪个模式里需要人守门。
中央是一个项目;周围是 5 种基础动作;每个动作上都标着 AI 干多少、人守多少。
怎么看这张图:每个外圈节点下方的双色条 =「AI 干多少 / 人守多少」。5 个比例不一样,且不是越右越好—— 分拣员的 15% 人守是绝对必要的(兜底通道、模糊分类、最终归属),调参的 40% 人守同样不能少(目标函数定义、止损条件)。人守的比例不是"AI 不够强",是"这件事本就不该让 AI 完全接手"。
每种模式:人版原型 + AI 时代变化 + 协作维度(人守哪、AI 干哪)。
来了一堆杂七杂八的事,先看是什么类型,再扔给对应的人或通道去办。
医院导医台分诊、客服工单分配、总编审稿派发、收发室分信件。
LLM 路由 / embedding 分类 / 特征识别可以把分诊做到 90%+ 准确率,耗时从分钟降到秒。但 「边界 case + 模糊分类 + 最终归属」 仍必须由人守——必须设一个"不知道归谁就扔给主管"的兜底通道。
活太大一个人吞不下,切成小块分头做,或者一人做一道工序,最后拼起来。
富士康组装手机、几十人团队同时翻译一本大部头、调研报告按章节分头写再汇总。
单点脑力瓶颈被 AI 抹平——并行不再是组织学问题,是 prompt 工程。但 「拆分粒度 + 强标准格式 + 合并验收」 三件事仍要人。拆得不够解耦会相互干扰;格式不强制会让合并时格式风暴;合并时谁签字收。
一个人负责做,另一个人专门拿放大镜找茬,自己不能当自己的裁判。
程序员写代码与 QA 测 Bug、编辑写稿与校对找错字、出纳记账与会计核账。
AI 既能做也能审。但 「做的人和审的人必须是独立的视角」——同一模型同一 prompt 会产生"自我合理化"幻觉。最低成本是 同款 AI + 不同的 system prompt(verifier agent);更高成本是不同模型。
不管中间改多少遍、试多少错,只要达不到最终标准就继续死磕,直到跑通或超时放弃。
算法调参、修机器排查故障、写文案根据老板反馈反复改稿、科学实验反复试错。
AI 既是被调参对象也是调参者。但 「什么算彻底成了 + 最多试几次就止损」 必须由人定义——前者是目标函数,后者是时间预算。AI 在没有清晰目标时会把"看起来更接近"无限迭代下去,浪费 token 也浪费决策。
需求不好量化、谁也没绝对把握时,那就多出几套方案,拉出来比比谁更好。
广告公司给客户出 5 套视觉提案、电影选角试镜、产品做 A/B 测试、多方案竞标。
AI 可以 N 套方案且成本极低。但 「评判标准」本质是品味和不确定性——AI 能给评分但给不出"为什么这个打动了那个人"。最终拍板必须是 真人 + 真实场景反馈(用户、客户、读者)。
现实中没有任何复杂职位只干 5 种中的一件;高阶工作都是 5 模式的嵌套链条。
以 「写一本好书 / 做一款爆款产品」为例,7 步流程里嵌套了 5 种模式:
关键观察:AI 参与度和人参与度不是零和——它们在不同阶段此消彼长。质检(写作)阶段是 AI 参与度最高的(写作 agent 并行 + verifier 独立审),但人守的"标准定义"仍然关键;调参(运营)阶段人参与度最高,因为要拍板"放弃这条线、改那条线"。
几个真实岗位拆开看,每一层都是一个或多个 5 模式。
分拣(需求池分类)→ 赛马(多个产品方案对照)→ 流水线(PRD 拆解给设计/开发)→ 质检(UAT)→ 调参(上线后改指标)。五个全用,主战场是 分拣+赛马——AI 最难替代的就是「判断这个需求该不该做」。
分拣(导医台分诊)→ 流水线(检查+化验+影像)→ 质检(上级医师复核)→ 调参(治疗方案反复试药+复诊)。AI 在 流水线 优势巨大(影像识别+文献比对),但 分诊兜底 和 调参止损 必须由人——尤其是「不要再试了,放弃治疗」这种决策。
分拣(稿件分类:诗歌/小说/工具书)→ 赛马(选题对照市场)→ 流水线(多稿并发编辑)→ 质检(校对+三审三校)→ 调参(改稿到读者满意)。AI 几乎可以做完所有执行动作,但 选什么做 和 改到什么程度 仍要人。
分拣(客户问题归类)→ 赛马(3 套方案对照)→ 流水线(PPT 拆章节做)→ 质检(PPT 试讲给同事听)→ 调参(客户反馈改稿)。最值钱的不是做方案,是 分拣 阶段识别「客户嘴上说的问题 vs 真实的问题」——这是 AI 替代最少的一环。
规律:每个高价值岗位的 分拣 + 赛马 + 调参 三环都重人——这是「品味 + 判断 + 决策」的组合。流水线 + 质检 两环可以交给 AI 主导。所以 「值钱的人」从「会做」迁移到「会判断」。
5 模式覆盖了大部分工作动作,但还有几件事在这套分类轴上找不到位置。
决定 5 种怎么编排。项目经理、指挥家、CEO——他们主要在选「下一步走哪条模式」,而非亲自执行。这是 5 模式之上的更高层,可能要再加一个 M-06。
把 AI 的产出翻译成别人听得懂的话。销售、汇报、公关——商业层的关键。AI 能做内容,但 把内容变成"对方会买"的叙事,目前仍是人。
说"不行,重做"。在 AI 给出结果后由人最后一道防线拒绝。法务、合规、品牌安全——5 模式都不够,必须加一个"否决者"维度。
留作下一步研究:协调者(M-06)+ 讲故事 + 守门人,是 5 模式之上还缺的三块。它们的共同点是——都是 AI 时代反而增值的人的能力。未来 5 年,谁能在「AI 干完执行之后」做这三件事,谁就是被需要的人。
让 AI 做 SOP、让人做决策。这是 AI 时代的工作分工底层逻辑。
LLM 自动分类 + 兜底通道。识别 → 打标 → 分流。
agent 并行 + 强标准格式。拆碎 → 并行 → 合并。
同款 AI 不同 prompt,或不同模型。产出 → 挑错 → 拦截。
N 套方案 + 真实用户反馈。多头 → 评判 → 选优。
目标函数 + 时间预算。尝试 → 看差 → 调整。
决定下一步走哪条模式。M-06,留作下一步研究。