← Essays·ZH·PARADIGM·4 min read

六十个小时

一个人已经可以在一天里让多个智能体合计运行六十多个小时。机器扩张了执行时间,人的注意力没有随之变多,责任却没有因此减少。

2026.07.21Zeqaro

今年六月,OpenAI 公布了一组内部数据。在每天使用 Codex 的员工中,最重度的那一小批人,会让多个智能体一天合计运行六十多个小时。一个在查资料,一个在改代码,另一个在测试,它们同时往前走,于是六十个小时被装进了同一个人的一天。

这不能直接换算成人类的六十个工时。机器运行一个小时,不等于人认真工作一个小时,这组数字也只来自一家公司内部。不过它还是记下了一件正在发生的事:过去,任务一件一件等着人去做;现在,它们可以绕开人的生理时间,同时发生。

前几天,我发布这个网站的第四篇文章。日期和内容确定以后,我在对话框里敲下一句:“好的,那你操作吧。”Codex 改了文件,检查页面,把变化同步到 GitHub,过了一会儿告诉我,已经发布完成。中间那些步骤不是我做的,文章却仍然算在我名下。

这已经不只是把工具拿在手里。工具通常等人推动,智能体接到一个结果以后,会自己补上通往结果的过程。它决定先做什么,调用什么,在哪里检查,遇到问题以后怎样继续。人交出去的除了力气和时间,还有一部分原本需要自己守在里面的过程。

机器在人离开以后继续运行,并不新鲜。服务器和流水线早就可以做到。不同之处在于,以前要由人事先写清每一步,机器沿着固定的路反复执行;现在,人只说想去哪里,路上的许多选择由它临时作出。六十个小时之所以值得注意,不是因为机器从此不眠,而是那些过去会被算作“人在工作”的判断,也开始出现在机器的运行时间里。

这种变化很容易被理解成一种新的能力。一个人像是突然有了一支随叫随到的队伍,可以把几件事同时推下去。可最先增加的是能够同时开始的任务,不是能够同时理解的结果。四个智能体可以一起工作,一个人仍然只能一件一件地看。

多出来的时间,最后都会挤到验收这里。看得仔细,六十个小时省下来的时间会重新堵住;看得快,就只能相信那些摘要、测试结果和“已完成”。检查也可以交给另一个智能体,只是这样一来,人看到的就不再是事情本身,而是机器对另一台机器所做事情的概括。

斯坦福今年的 AI 指数收录了一项测试智能体操作电脑的基准。最好的成绩已经从大约百分之十二升到百分之六十六点三。这个数字不能代表所有现实任务,却能说明它们现在所处的位置:能力已经足以让人依赖,失误仍然多到不能放手不管。

人偏偏不擅长长时间监督一个大多数时候都能做对的系统。它要是频繁出错,我们会逐项核对;它连续顺利完成几十次以后,检查就容易变成确认。先看结果在不在,再看页面能不能打开,最后扫一眼测试是不是绿色。没有明显问题,心里便会自动补上一句,中间大概也没问题。

信任很少是在某一天郑重交出去的。更多时候,它由许多次没有出事的经验慢慢攒成。每一次顺利完成,都在教人下一次少看一点。等到真正需要接手时,人可能已经不熟悉那个过程,也不知道该从哪里查起。

“已完成”本身并没有撒谎。它只表示机器走完了自己的步骤。但人很容易把它读成另一层意思:这件事已经不需要我再操心。过程被压缩成三个字以后,重新打开它、理解它,反倒成了一笔额外的成本。

效率省下来的时间,也很少原封不动地回到人手里。电子邮件省掉了信件在路上的日子,后来并没有让人少通信,只是让收件箱变得更满,让回复的期限从几天缩到几小时。工具先降低一件事的成本,接着改变大家对这件事应该做多少、做多快的看法。

如果一个人能够调动六十个小时的智能体任务,他未必因此得到多出来的三十六小时。更可能的是,六十个小时逐渐成为别人对他的新预期。昨天还算提前完成的工作,过一阵就成了正常速度;没有同时启动几个任务,反而像是没有把工具用好。

这种压力不只来自公司。一个人独自做事,也会很快习惯新的速度。这个网站最初只用两个小时就搭了出来。以后再遇到一件本来要做几天的事,我很难假装自己不知道它可能在几个小时里完成。机器改变的不只是我能做多少,也在悄悄改变我愿意等多久。

可速度提高以后,责任并没有跟着变轻。智能体可以重试,可以补一份解释,也可以再叫一个智能体来复核。它不能替谁承受错误带来的损失。最后仍然需要一个人说,我看过了,我接受这个结果。如果这个人只见过最后一页报告,他负责的东西越多,真正知道的反而可能越少。

回到那句“你操作吧”,里面其实混着两件事。一件是允许它替我执行,另一件是允许它在中间替我作出许多小选择。这两种权限很难彻底分开。每一步都回来问我,事情就没有真正交出去;一句都不问,我又只能从最后的结果猜测它走过的路。

所以现在更难回答的,已经不是哪些工作可以交给 AI。更难的是,一件事以我的名义完成以前,我至少应该知道多少。把全过程重新做一遍,失去了交付的意义;只看最后有没有交出来,又不足以承担结果。这条线不会由模型替人画好,也不可能对所有事情都画在同一个地方。

第四篇文章顺利上线,没有出错。这一点很重要。失败会让人收回权限,成功才会让权限一点点变大。人未必会在某一天突然把工作全部交出去,只会在一次次顺利完成以后,少问一句,少看一步,再把下一件事也放进去。

那次对话的最后,Codex 告诉我,文章已经发布并同步。机器的那一段工作到这里结束了。文章却从这一刻起,算在我名下。

Filed under PARADIGM.