人在 Agent 时代的不可替代性

——「人 × Agent 协作」系列 · 第 7 篇(终章)

人在 Agent 时代的不可替代性

——「人 × Agent 协作」系列 · 第 7 篇(终章)

人的注意力被重新分配

六篇下来,我们讲了一个看起来很"去人化"的故事。

AI 队员每天处理 285 个 case、关闭 17 条幻觉工单、提醒 112 条超时工单(第 1 篇)。AI 把不该占用人的机械工作接管了(第 2 篇)。AI review 把 5000 行 diff 压缩成几个需要人判断的头部问题(第 3 篇)。自动化、AI、人组成三角,AI 处理不了就显式转人工(第 4 篇)。共享环境让人不用再搭环境就能验收(第 5 篇)。门禁驱动连"测试通过"这件事都由机器管了(第 6 篇)。

读到这里,一个自然的疑问会冒出来,而且它必须被正面回答:

当 AI 能写代码、能 review、能管控流程、能准备环境、能跑门禁——人,还剩下什么?

这一篇,就是来回答它的。答案和"人会被淘汰"那种流行的悲观相反——它是一个读完整个系列之后才会浮现的、甚至让人振奋的发现。

先排除一个错误的二元对立

在回答"人剩什么"之前,必须先排除一个根深蒂固的思维陷阱。

很多人把人机关系理解成一个零和博弈:AI 多做一点,人就少做一点;AI 强一分,人就弱一分。顺着这个逻辑,"人不可替代"就只能被论证成"有些事 AI 永远做不到"——于是大家拼命去找那个"AI 做不到的事",比如"创造力""同理心""战略眼光"。这种论证是脆弱的,因为 AI 的能力边界在不停移动,今天"做不到"的,明天可能就做到了。

我们这六篇建立的图景,完全是另一种逻辑。

回看全系列,你会发现一个反复出现、贯穿始终的设计原则:

自动化的目标不是减少人的参与,而是把人的参与推迟到真正需要判断的节点。

这句话的关键落在最后五个字:"真正需要判断"。它隐含着一个前提:存在一类工作,是人独有的、机器无法代劳的,那就是"判断"。 自动化做的所有事——接手机械工作、压缩 review、管控流程、准备环境、跑门禁——本质上都是在清场:把不需要判断的杂事扫干净,让那件"只有人能做的事",能在一个干净、专注、信息完备的现场被完成。

所以,正确的提问方式应该换一下。别问"人还剩什么",而要问:"当所有不需要判断的事都被清走之后,人真正要做的判断,到底是什么?"

三个不可替代的判断

我们的实践给出的答案,是三类判断。它们之所以不可替代,并非因为 AI"暂时"做不到——而是因为它们本质上就不属于机器:哪怕 AI 再进化十代,这几件事依然不会变成它的能力。

判断一:业务正确性的最终裁决

第一类,是 G5 那道门禁代表的——业务正确性的最终判断

回忆第 6 篇的 G1–G5 门禁。G1 到 G4,全部可以由机器或 Agent 完成:代码有没有破坏、环境是不是对的版本、通用正反例对不对、工单特有的边界例对不对。但 G5——"这个产品行为,到底符不符合真实业务预期"——这道门,永远是人。

为什么?因为"业务预期"是一个无法被完全形式化的东西。

第 6 篇的 HAR-6230 事件已经暗示了这一点。机器门禁能检查"正例是否通过、反例是否被拦",但"什么算正例、什么算反例、这个边界场景到底该怎么判"——这些定义本身,是人给的。机器只能执行人定义的规则,它无法判断"这个规则本身,在真实业务里是不是仍然合理"。

真实业务是会变的。一个去年合理的审核规则,今年可能因为新政策、新业务模式、新客户场景而变得不合理。这种"规则本身需要被重新审视"的判断,机器做不了——因为机器没有业务语境。它不知道某个客户为什么这么填单,不知道某类费用为什么这个月突然变多,不知道某个审核结果放出去之后,会在客户那里引发什么连锁反应。

这些,只有浸泡在业务里的人知道。G5 把最终拍板权交给人,原因不在于机器不够聪明,而在于业务正确性的最终锚点,在人的经验里,不在代码里

判断二:工程取舍与价值优先级

第二类,藏在第 3 篇的 review 和第 4 篇的三角管控里——工程取舍和价值优先级的判断

第 3 篇里,AI review 会给出 🟠 强烈建议和 🟡 建议优化。但"要不要改""先改哪个""这个 🟠 在当前版本里值不值得拦截"——这些取舍,是人的。AI 能告诉你"这里有个问题",但它无法告诉你"在有限的时间和人手里,这个问题该排第几优先级"。

第 4 篇里,AI 能把工单转给某个 PM。但"这个需求要不要做""排到哪个迭代""和另一个需求冲突时谁让步"——这些价值排序,是人的。AI 能根据归属表做出合理转派,但它无法判断"这个需求背后的业务价值,值不值得现在投入"。

这类判断的共同特征是:它们都需要在多个维度之间权衡,而这些维度的权重,取决于组织当下的战略、资源、风险偏好——这些东西是流动的、情境化的、无法被写死的。

机器擅长在给定目标下寻找最优解。但"目标本身是什么""目标之间谁优先"——这是人的领域。一个 AI 可以极其高效地实现你给它的目标,但它无法替你决定"这个目标该不该要"。这就是为什么,无论 AI 多强,"做什么"和"不做什么"的决策,始终留在人手里

判断三:异常的定性,与边界的划定

第三类,是最隐蔽、也最深刻的一类——它藏在第 4 篇那条铁律里:AI 处理不了,必须显式转人工。

回忆那条铁律:AI 遇到自己判断不准的事,必须显式上报,不能静默吞掉。但这里有一个更深层的问题:AI 怎么知道自己"判断不准"?

答案是:AI 不知道,至少不能完全知道。AI 能识别"超出我 prompt 边界"的情况——比如它找不到对应的业务域 PM。但有些异常,是模糊的、边界地带的、需要定性判断的。一条工单,既像是规则问题,又像是模型问题,还掺杂着客户使用不当——这种"说不清楚到底属于哪一类"的异常,AI 会倾向于归到某一个它能处理的类别里。但正确的做法,往往是人重新审视这个异常本身:它是不是暴露了一个我们之前没考虑到的产品缺陷?它是不是意味着某条规则需要被重新设计?

这种"对异常本身定性"的能力,是人独有的。机器处理的是已经被定义好的异常("这是规则问题""这是模型幻觉");人处理的是还没被定义的异常("这个东西有点不对劲,但它到底是什么,我得想想")。

而"边界划定",是这类判断的另一面。第 4 篇讲的白名单原则——"AI 只能做被明确允许的事"——这个允许列表本身,是人划的。什么时候该扩大 AI 的权限、什么时候该收紧、哪些事可以放给 AI 自主决策、哪些事必须人拍板——这些边界的划定,是持续不断的、需要人对业务和组织有深度理解才能做出的判断。AI 不会自己申请扩大权限,也不会自己意识到"我正在越界"。边界,永远是人划的。

一个反直觉的结论:人没有变少,人变贵了

把三类判断放在一起,你会得出一个和直觉相反的结论。

很多人担心"AI 时代人会变闲、变多余"。但这六篇的图景显示的,是完全相反的趋势:人做的事没有变少,而是变贵了。

回看第 1 篇那个 AI 队员的早晨。他处理了 285 个 case 的分析、112 条超时工单的核查、17 条幻觉工单的清理。这些事,以前要么没人做(积压着),要么是低级别员工在做(而且做得不好)。AI 把它们接管之后,人的时间被释放出来,全部投入到了那三类判断上

结果是什么?结果是,同一个工程师,在 AI 协作模式下,做的判断比以前更多、更深、更关键了。以前他可能 80% 的时间在写代码、搭环境、看 diff、跑测试,只有 20% 的时间在真正思考"这个设计对不对""这个业务逻辑合不合理"。现在,机械工作被 AI 接管,他 80% 的时间都用在了判断上。

这不是"人被边缘化",这是人被重新中心化——只不过中心的位置,从"执行"挪到了"判断"。

Cloudflare 那个数据,是这个结论最好的注脚:工程师只在 0.6% 的情况下 override AI[^cf]。这不是说人只发挥了 0.6% 的作用——恰恰相反,正是因为 AI 把 99.4% 的机械判断扛走了,人那 0.6% 的 override,才成为了整个系统里含金量最高、最不可替代的决策。少而精,重而准。

[^cf]: Cloudflare 工程博客《Orchestrating AI Code Review at scale》,2026-03-10 至 04-09 共 30 天:48,095 个 MR 中 break glass 288 次(0.6%)。https://blog.cloudflare.com/ai-code-review/

人在这个体系里的新角色:裁决者、定调者、边界守护者

如果要用三个词概括人在这个体系里的新角色,那就是:

裁决者(G5)。 在所有机器门禁通过之后,做业务正确性的最终判断。这是整个质量体系的最后一道闸,也是最权威的一道。

定调者(目标与优先级)。 决定"做什么、不做什么、先做什么"。AI 在给定目标下极其高效,但目标本身,始终由人定调。

边界守护者(白名单与铁律)。 划定 AI 能做什么、不能做什么;在 AI 处理不了时,承接那些被显式转交回来的异常。边界不是一次划定的,而是持续守护的。

这三个角色有一个共同的底色:它们都是"判断密集型"的,绝非"执行密集型"。 这正是人的注意力最擅长、也最该被投入的领域。整套协作模式的设计,本质上就是一台精密的机器,它的全部目的,是把人的注意力,从执行里榨出来,灌注到判断里

为什么"防御性信任"反而让人更安心

讲到这里,可以回应一个很多人心里的隐忧:让 AI 做这么多事,人不危险吗?

第 4 篇我们已经给出了答案的工程层面——三角结构、白名单权限、显式转人工的铁律。这里想再补一个心理层面的回答。

让 AI 做这么多事之所以不危险,恰恰因为我们从一开始就不信任 AI。整套体系建立在"防御性信任"之上:我们假设 AI 会犯错、会越界、会遇到搞不定的事,并为每一种情况都建好了兜底——review 治理代码产出、门禁治理执行产出、铁律保证异常不被吞掉、白名单保证权限不失控。

这种"不信任"带来的,反而是最大的安心。因为你不需要时刻盯着 AI——你知道它会在边界内工作,知道它搞不定时会显式告诉你,知道每一层都有另一层在验证它。你可以放心地把执行交给它,正是因为你确信,判断始终在自己手里。

这是一种新型的、健康的人机关系。它既非"人指挥机器"(太累),也非"机器取代人"(太危险),而是第三种:机器执行,人判断,两者被一套精密的结构编织在一起

写在最后:回到那个早晨

系列开篇,我们从一个 AI 队员的早晨讲起。现在,让我们回到那个早晨,但换一个视角再看一遍。

小布那天处理完所有巡检,把 112 条超时工单的清单发给了工单负责人。清单第一行是一句加粗的总结:

本轮共有 112 条超过 5 天未更新的工单……仍有 W 条需要人工关注。

开篇的时候,我们关注的是 AI 做了多少——6486 条扫描、285 份分析、17 条清理。但现在,经过六篇的拆解,你应该能看到这句话里真正重要的东西

重点不在那 112 条被处理了,而在那 W 条被保留了

AI 没有把所有事都做完,也没有假装自己能做完。它把能做的做了,把不能做的,干干净净地标出来、说明原因、交回给人。那 W 条"需要人工关注"的工单,就是人在这个体系里不可替代性的具体化身——它们是 AI 主动让出的空间,是判断发生的地方,是人之所以为人的所在。

这就是这套协作模式想说的全部:

AI 把世界整理得井井有条,然后把那些真正需要智慧的决定,恭恭敬敬地留给了人。

这不是人被边缘化的故事,恰恰相反——这是人,第一次有可能把全部的注意力,都投入到那件只有人能做的事上的故事。

七篇完结。谢谢读到这里。

一句话结论

人在 Agent 时代不会被取代,只会被重新中心化——做三类不可替代的判断(业务最终裁决、价值优先级、异常定性与边界划定);整套协作模式的目的,就是把人的注意力从执行里榨出来,灌注到判断里。