OpenAI的3倍生产力泡泡:不是AI变强,是花钱让机器熬夜瞎忙
OpenAI内部观测数据显示,研究团队每1天人类科研劳动可调度智能体完成3.1个机器工作日,被解读为科研效率提升3倍。但该口径统计的只是Agent运行时长,五个月内研究员日均推理成本从14美元涨到601美元,超半数任务仍需人工返工。

看到OpenAI发布的内部观测数据说:“In terms of a standard 8 hour workday,as of mid-August,in total,the research organization uses 3.1 agent-workdays of effort for every workday of human labor.”
这句话的意思是:以标准8小时人类工作日为计算基准,截至8月中旬,OpenAI研究团队中,每1天的人类科研劳动,可对应调度AI智能体完成3.1个机器工作日的工作量。
“AI三倍生产力”的泡泡由此吹出。
这个数字迅速被简化传播,解读为AI把科研效率提升3倍,甚至被当作AI自主加速科研的有力证据。
但如果仔细拆解指标口径,就会发现这个结论,存在一个巨大的逻辑漏洞。
3.1倍统计的是Agent的运行时长,不是高质量的科研产出。它衡量的是算力机器跑任务的时间,而非有效成果。
人类研究员一天工作8小时,而AI可以全天候并行运行多个任务。这个倍数本质不是人类思考能力变强,而是人上班期间,同时调度多组AI轮班,相当于花钱购买数字劳动力的夜班。
这更像一座24小时运转的工厂,人类只负责白班监督,机器承接剩下两班。所谓3倍科研生产力,只是买下AI的三个夜班。
这套模式的代价是持续飙升的算力开销。数据显示,短短五个月,研究员日均推理成本从14美元涨到601美元,涨幅接近40倍。头部10%的研究员单日算力消耗超过7000美元,年化成本可达250万美元。
传统工业设备属于一次性资本投入,而AI推理是可变运营成本,Agent每多跑一分钟,账单就增加一笔。所谓生产力提升,建立在持续烧算力的前提之上,一旦削减预算,这套并行产能会立刻消失。
更关键的是,Agent产出存在很高缺陷率。耗时4到8小时的Agent任务,超过一半都需要人工介入修正。
研究员的工作重心随之转移:不再专注构思研究方向、设计核心实验这类创造性工作,大量精力用来排查AI夜间运行产生的错误、校验半成品、修复机器留下的漏洞。
机器工时看似翻三倍,扣除返工与人工校验成本,实际有效产出远达不到宣传的水平。
所以就会看到:同行都在全天候调度Agent跑实验,一旦停下机器,实验迭代速度就会落后。这种环境倒逼团队持续维持Agent不间断运行,哪怕大量产出只是需要返工的半成品。
这不是技术成熟带来的效率质变,是行业竞赛催生的算力消耗。
科研的核心瓶颈不是实验运行时长,而是方向判断、方案取舍、结论校验这类无法自动化的思考环节。Agent可以批量执行工程类任务,却不能独立判断一个研究方向是否具备价值。单纯堆砌机器工时,不等于科研突破速度同比例上涨。
OpenAI鼓吹的3倍AI科研生产力,本质是一场偷换概念的算力营销。资本与舆论刻意混淆机器运行时长与有效科研产出,把AI通宵的无效空转、高缺陷半成品,包装成颠覆性的效率革新。
所谓的生产力飞跃,不过是砸钱换机器工时的低效内卷。天价算力堆出的虚假三倍数据,终究只是自欺欺人的行业噱头。而设计优良的智能体,消耗的算力要低得多。
只要AI仍需人类高频兜底返工,这组光鲜的数字,就只是一场徒有其表、耗资巨大的机器加班闹剧。
作者 | ToBeSaaS
本文由人人都是产品经理作者【ToBeSaaS】,微信公众号:【ToBeSaaS】,原创/授权 发布于人人都是产品经理,未经许可,禁止转载。

起点课堂会员权益




那个3倍的说法确实有现实基础,毕竟AI并行跑任务确实能覆盖人类非工作时段,但这个统计完全把无效空转和返工成本剔出去了,本质是算力军备竞赛的数字营销,拿来对外宣传还行,真当科研效率的提升就有点自欺欺人了。