AI 能在几分钟内完成过去需要数小时的生成任务,但许多人使用它之后并未获得更多从容,反而要持续核验结果、处理错误并承担更高的产出预期。这种落差说明,效率不能只计算生成速度,还要把判断成本、心理负担和组织目标的变化纳入同一本账。

2026 年 9 月 8 日,外滩大会发布「AI 科技人文十问」。往年这种榜单的提问权属于院士、CEO、AI 实验室;今年第一次,把问题交回了普通人。
排在第一位的问题来自一位 37 岁的公司白领,张珺:
「都说 AI 让效率变高,为什么我们反而更累了?」
这句话值得停下来想:它不是一个程序员的抱怨,也不是某个算法的 bug。它横跨打工人、学生、创作者、管理者——所有人都在用 AI,所有人都在说"更累了"。
把 2026 年几组调查并排看,这是个自相矛盾的结论:
三条曲线同时发生,说明这不是"工具不好"也不是"你不会用",而是我们对"效率"的记账方式失效了。生成变便宜后,真正贵的东西露了出来,而看板、KPI、心智模型还停在"内容稀缺"的年代。

标题那句"效率变高却更累"是现象不是问题。要回答它,得把它拆成几个可独立解释的机制:
| 机制 | 表面症状 | 卡住的环节 |
|---|---|---|
| ① 期望-现实鸿沟 | 省了 11 小时,组织没变强 | "省的时间"被 botsitting 吃回去,没进真实产能 |
| ② 反复核验的认知税 | 用 AI 后脑子更累 | 判断输出对不对成了新长尾,且没被工具化 |
| ③ 认知负载激增 | 每天脑雾、要整晚恢复 | 监控/整合 AI 输出本身成了 extraneous load |
| ④ 稀缺资源转移 | 工作强化、产出预期被抬高 | 瓶颈从"生成"换到"判断",KPI 还数产出量 |
| ⑤ 宏观好、微观累 | 公众普遍焦虑 | 效率是中心化的(公司省了钱),损耗是分布式的(个人更累) |
五者共享根本原因:我们把"内容生成"当瓶颈,而它已不是瓶颈。 生成便宜后,稀缺资源从"做出来"换成"判断对不对",但度量还在数字数、KPI 还在看产出、成本模型还没算"验"的钱。
Glean Work AI Index 2026(联合 Stanford / Berkeley / Harvard,6000 名知识工作者)给出了一组刺眼的对冲数据:
Foxit 的一个明确的拆解:高管自评每周省 4.6 小时,但花 4 小时 20 分做校验,净得 16 分钟;终端用户直接净亏 14 分钟。

原因就在这里:"生成带宽"暴涨,"判断带宽"没动。 我们把"省的时间"默认当成"多出来的产能",但它其实先被"核验"抵扣了。这不是你的问题,是账本结构的问题——它只记生成、不记核验。期望-现实鸿沟模拟器见文末 GitHub,可以拿自己和 Foxit / Glean 的数字对一对。
BCG 的「AI brain fry」研究(HBR,2026-03,1488 名美国员工)把"高监管强度"量化了:
关键机制:AI 把"生成"压到近零成本,但**"判断这条输出对不对"是新长尾**——而且这环几乎没被工具化。你以为自己在"用工具提效",实际上在"替工具做质检",而质检的精力成本没人替你记账。
解法不是"少核验",是给核验设上限、排期、分清"值得验"和"直接弃"。

MIT Media Lab 的「Your Brain on ChatGPT」(Kosmyna 2025,EEG 监测 54 人)给了一个反直觉结论:被动依赖 AI 写作的人,脑连接强度下降、ownership 感降低,研究者称之为 cognitive debt(认知债)——你没在思考,只是借了未来的认知力。
Getsolved 针对 3000 名 18–29 岁、每天用 AI 的白领调研(2026-06)更贴近日常:
认知科学给的机制是 Sweller 的认知负载理论:监控、核验、把 AI 碎片整合成自己的东西,本身就是 extraneous load(外在认知负载),会挤占真正用于思考的负载空间(Human Clarity Institute 503 样本、Sun & Liu 2026b、Zhang et al. 2026 等一致指出这一点)。
解法:把"认知负载"当成和电量一样的资源预算,设每日上限——而不是默认 24 小时待命式地旁置自己的脑子。
UC Berkeley Haas 做了 8 个月民族志(约 200 人科技公司),记录到两个现象:intensification(工作强化) 和 workload creep(工作量无形攀升)——AI 没让人少干活,而是把"人+AI"组合能做的事的上限抬高了,所有人的活都变多了。
落到数字上:
瓶颈从"生成"换到了"判断"。这里讲所有人的"判断稀缺"——你会用 AI 写周报,但老板现在要你一天产出三份不同视角的周报,因为"你有了 AI 应该更快"。稀缺资源转移了,KPI 没跟上。

解法在组织层:把"判断工时"写进 KPI,而不是只看产出量;给"思考"留时间,而不是把"快"当唯一指标。
把视角拉远,会看到一个不对称结构:
Gallup:仅 18% 的 14–29 岁年轻人对 AI 乐观;Economist/YouGov 超 70% 美国人认为 AI 发展过快(共和党 68% / 民主党 77%);Gallup 3 月民调 71% 反对在本地建数据中心。
这就是为什么"宏观变好、微观变累"的体感如此割裂:被衡量的永远是中心化的效率,没人把"你累不累"设为一等公民指标。 Solitaire Bliss 对 1499 名定期 AI 用户的调研(2026-06):2/5 在重 AI 工作日后"脑衰竭",45% 被过量信息压垮,34% 觉得更累。
守底线只有一条:把"累不累"当成 AI 落地的验收项,和"快不快"并列。否则效率叙事会一直掩盖损耗。
你没变轻松,只是把成本从"做"搬到了"查",而后者没被记账,还被"省 11 小时"的叙事盖住了。 五机制是同一总根的五重投影——稀缺资源从生成转向判断。
三层同时成立:个人决定下限,团队决定流程,组织决定你敢不敢说"我累了"。

个人层
团队层 4. 用产出量考核 AI 贡献:Workday 40% 时间花核验却不算产出。解法:核验工时显式计时,与生成节省对冲后再谈 ROI。
组织层 7. 抬高产出预期不设上限:Upwork 81% 抬高、71% burnout。解法:预期增幅与"判断工时"预算同步,封顶。
过去十年"提效"叙事都围着"让人更便宜地生产内容"转,因为内容贵。现在内容便宜了,贵的是判断。但工具链、KPI、成本模型全围着"内容贵"建,于是出现"省 11 小时却只 13% 组织见增益、70% 公众觉得过快"的荒诞组合。
两段纯标准库 Python(期望-现实鸿沟模拟器 / AI 文本认知负载检测器)和完整数据来源清单,我都整理成了代码文件,放在 GitHub:github.com/beverlyLee/ai-passage/tree/main/2026-09-13-全民效率悖论/code
如果有用,点个收藏——有人问"上了 AI 到底省没省",把「5 机制 + 9 坑」甩过去。顺手赞让更多人看到。 跑完欢迎把你的净增益小时数和botsitting 占比贴评论区——不同岗位这两个数字能差多少,欢迎交流.
ubuntu18.04应用图标怎么放到桌面?
SafeDB MCP 如何通过策略层提供只读数据库访问?
Claude Code 与 Codex 交叉进行代码审查是否优于单模型审查?
Codex 是否适合在规划和验证阶段使用 xhigh、实现阶段使用 high?
多数据库 SQL MCP Server 能否同时支持 Oracle、PostgreSQL、SQL Server 和 MySQL?
Database Query MCP Server 如何只读查询 MySQL、PostgreSQL、MSSQL 和 Oracle?