AI 都能干了,我们还能干啥

几个月前那个周二早上,老张心里冒出过一句话。
那天他看到阿行发来的累计报告:285 批分析,提醒了 112 条超时工单,归档了 17 条异常记录。这些是几个月的累积——他盯着那些数字,心里说不上哪里不对劲,最后那个不对劲凝结成了一个让他自己都意外的念头:
"如果它能长期稳定地做这些事,那我们这帮人,到底还干什么?"
当时他把这个念头压了下去。他是技术 TL,不是科幻小说读者,他知道"AI 取代人"这种话太廉价。
但现在,七篇走下来,阿行能干的事越来越多——接手了人扛不住的机械工作,AI 帮人 review 了代码,三角结构管住了流程,共享环境让人不用搭环境就能验收,门禁驱动守住了质量,进化闭环让 AI 越用越好。
老张觉得,是时候正面回答那个被他压了几个月的问题了。
AI 都能干了,我们还能干啥?
先排除一个错误的思路
老张一开始想用"AI 永远做不到的事"来回答这个问题——只要找出几件 AI 做不到的事,人就有价值了。
但他很快发现这条路走不通。
因为 AI 的能力边界在不停移动。今天 AI"做不到"的事,明天可能就做到了。如果你靠"AI 做不到 X、做不到 Y"来论证人的价值,那你的论证是脆弱的——迟早会被推翻。
老张换了角度。他不问"AI 做不到什么",而是问:"这七篇里,阿行每一次做完事之后,最后拍板的是谁?"
顺带提一个相关的信号:2026 年发布的 CooperBench 研究在 600 多个协作编码任务上观察到,两个 coding agent 协作时,平均成功率比由单个 agent 完成两项任务低约 30%。研究把主要问题指向沟通失真、承诺偏离和对同伴计划的错误预期。它没有直接比较“人 × Agent”和“Agent × Agent”,也不能证明人类介入一定更优;但它至少提醒我们:增加 Agent 数量并不会天然带来更可靠的协作。
答案始终指向同一个方向:最终拍板的责任,在人。
阿行分析完 case,是工程师决定改不改代码。AI review 完代码,是老张决定合不合入。阿行转派工单,是产品经理决定接不接。门禁跑完五关,第五关是老张做业务验收。
阿行把所有能算的都算清楚了,把所有能处理的都处理完了。然后那些它实在判断不了的、需要人拍板的——它干干净净地交回到了人手里。
老张想明白了一件事:人的价值,不在于"有些事 AI 做不到",而在于"有些判断,必须由承担责任的人来做"。
三种人不可替代的判断
老张把"人不可替代的判断"梳理成了三类。他发现,这七篇里,每一类都出现过。
第一种:业务正确性的最终裁决。
还记得第 6 篇那次差点出事吗?门禁的前四关,全部由阿行和自动化完成。但第五关——"这个功能,真的符合业务预期吗"——在当前责任设计里,必须由老张这样的业务责任人签字。
为什么?因为"业务预期"很难被一次性写死,它会随着客户、市场和政策变化。Agent 可以根据已有目标和证据提出判断,但"这个规则本身,在今天的真实业务里是否仍然合理",最终要由承担结果的人确认。
第二种:做什么、不做什么、先做什么。
阿行能告诉你"这里有个问题",但它没法告诉你"在有限的时间和人手里,这个问题该排第几优先级"。阿行能把工单转给某个产品经理,但它没法判断"这个需求背后的业务价值,值不值得现在投入"。
阿行可以给出排序建议和初步判断,但目标之间的优先级取舍——尤其是涉及资源投入和风险接受的决定——最终责任在人。它极其高效地执行,但这个目标该不该要,得人拍板。
第三种:对"没见过的异常"定性。
还记得第 4 篇那条铁律吗?阿行搞不定的事,必须显式转人工。但有些异常,是模糊的、边界地带的——它既像规则问题,又像数据问题,还掺杂着用户使用不当。阿行会倾向于把它归到某一个它能处理的类别里,但正确的做法,往往是人重新审视这个异常本身:它是不是暴露了一个我们之前没考虑到的产品缺陷?
机器处理的是已经被定义好的异常。人处理的是还没被定义的异常。
一个反直觉的结论:人没有变少,人变贵了
老张把三类判断放在一起,得出了一个和直觉相反的结论。
很多人担心"AI 时代人会变闲、变多余"。但这七篇的故事,显示的是完全相反的趋势:人做的事没有变少,而是变贵了。
回看阿行接管之前。那些 case 分析、工单核查、无抓手记录清理——以前要么没人做(积压着),要么靠轮值的人零散处理,质量和持续性都难保证。阿行把它们接管之后,人的时间被释放出来,可以更多地投入到那三类判断上。
结果是什么?老张发现,同一个工程师,在阿行协作下,做的判断比以前更多、更深、更关键了。以前他可能大部分时间在执行——写代码、搭环境、跑测试——只有少部分时间在真正思考。现在,机械工作被阿行接管,他可以把更多注意力用在判断上。
还记得第 3 篇提到的 Cloudflare 数据吗?他们的工程师在 48,000 多个代码合入中,只在 0.6% 的情况下需要 override。这不是说人只发挥了 0.6% 的作用——恰恰相反,正是因为 AI 把大部分检查扛走了,人那 0.6% 的 override,每一次都是含金量最高的判断。少而精,重而准。
老张说,这不是"人被边缘化",是人的工作重心从执行转向了负责拍板——只不过中心的位置,从"执行"挪到了"判断"。
老张给自己的三个新角色
老张后来把自己在阿行时代的角色,重新定义了一下。
裁决者。 在所有机器门禁通过之后,做业务正确性的最终判断。这是整个质量体系的最后一道关,也是最权威的一道。
定调者。 决定"做什么、不做什么、先做什么"。阿行在给定目标下极其高效,但目标本身,由老张定调。
边界守护者。 划定阿行能做什么、不能做什么。白名单是人划的。阿行处理不了时,承接那些被显式转交回来的异常。
这三个角色有一个共同底色:它们都是"判断密集型"的,而非"执行密集型"的。 这正是人的注意力最擅长、也最该被投入的地方。
为什么老张最终安心了
回到那个让他不安了几个月的问题。
老张现在能回答它了。
他不再担心"阿行什么都能干,人怎么办"。因为他想明白了:阿行干的,有执行,也有大量初判——判断根因、判断归属、判断严重级别。但有一类事情它接不住:设定目标、授权边界、对高风险和不可逆的事项承担责任。 这些,必须由人来拍板。两者不是竞争关系,是分工关系。
而且,让老张真正安心的,是第 4 篇那条铁律在起作用。
阿行不是无所不能的,它会遇到搞不定的事,也可能误以为自己已经做完。因此老张不只依赖阿行主动承认失败,还依赖超时扫描、结果断言和审计日志,把没有被主动上报的异常也捞出来。
这是一种"防御性的信任":不是无条件相信阿行会做对,而是相信一旦它超出边界,系统会触发可审计、可追责的升级路径。老张敢让阿行干活,不是因为他相信阿行无所不能,而是因为他已经为阿行"搞不定"的部分建好了通道。
回到那个周二早上
故事讲完了。让我们回到几个月前那个周二早上。
老张那天看完阿行的清单,想了很久。清单最后一行是一句话:
"本轮还有 2 条工单需要人工关注,原因如下……"
那时候,老张还没想明白这句话意味着什么。他只觉得"说不上哪里不对劲"。
现在他想明白了。
那 2 条"需要人工关注"的工单,就是人在这个体系里不可替代性的具体化身。 它们是阿行主动让出的空间,是判断发生的地方,是人之所以为人的所在。
阿行把世界整理得井井有条。然后它把那些真正需要智慧的决定,留给了人。
老张现在的回答,和几个月前不一样了。几个月前他问"我们还能干什么",带着焦虑。现在他能平静地回答:
我们干的,是那些 AI 整理完世界之后,留给我们的、真正需要判断的事。
不多。但每一件,都重要。
八篇完结。谢谢读到这里。
一句话结论
人在 AI 时代不被取代,而是被重新中心化——做三类判断:业务最终裁决、目标优先级、异常定性;AI 把执行扛走,是为了让人的注意力能全部投入到判断上。
参考来源
- CooperBench: Why Coding Agents Cannot be Your Teammates Yet — 600 多个协作编码任务中,双 Agent 协作的平均成功率比单 Agent 基线低约 30%。
- Cloudflare:Orchestrating AI Code Review at scale — 本文引用的 48,095 个 MR 与 0.6% break glass 数据来源。