Stanford AI Index 2026 收录的 Vibe Code Bench v1.1 显示,领先模型在端到端 Web 应用开发上的准确率仍只有约五成。报告图表中 Claude Opus 4.6 非思考模式为 57.57%,GPT-5.2 与 Claude Opus 4.6 思考模式均为 53.50%,Claude Sonnet 4.6 为 51.48%。这说明前沿模型已有完整交付能力,但远未达到可以不验收的程度。
Vibe Code Bench 关注模型能否从自然语言要求出发,自主构建一个完整、可运行的 Web 应用。它衡量的是软件交付结果,而不是只补全一段代码、回答仓库问题或修复预先定位好的缺陷。
这种任务通常要求模型同时处理界面、交互、状态和项目结构,因此比独立函数生成更接近“从零做出应用”。但它仍是受控基准,不能覆盖生产系统中的身份认证、迁移、监控、团队协作和长期维护。
| 模型 | 图表准确率 | 可作出的有限判断 |
|---|---|---|
| Claude Opus 4.6 非思考模式 | 57.57% | 该快照中最高,仍有四成以上任务未成功 |
| GPT-5.2 | 53.50% | 与 Opus 思考模式相同 |
| Claude Opus 4.6 思考模式 | 53.50% | 更长推理未在此榜单中带来更高总分 |
| Claude Sonnet 4.6 | 51.48% | 与领先组差距有限 |
| GPT-5.4 Mini | 47.97% | 接近一半任务成功 |
| GPT-5.2 Codex | 37.91% | 不能据此否定其在其他编码任务上的能力 |
| Gemini 3.1 Pro Preview | 32.03% | 端到端结果低于其通用能力印象 |
报告将这些成绩视为模型差异明显、任务依然困难的证据。图表与附近叙述存在轻微数字差异,可能来自榜单更新或版本整理,因此引用时应保留版本和日期,不应把小数点差距当成永久排名。
思考时间增加不保证端到端结果改善。应用开发需要正确理解需求、选择实现方式、操作文件、运行项目并根据反馈修复问题。更长推理如果没有接入可靠的浏览器验证、测试和错误反馈,可能只增加解释或走向错误方案。
非思考模式在这张图上领先,也不代表所有项目都应关闭推理。正确做法是把推理模式当作实验变量,在相同任务、预算和工具条件下比较通过率、耗时和成本。
Vibe Code Bench 衡量从零构建应用,RubberDuckBench 衡量结合代码库回答开发问题,Terminal-Bench 关注终端环境任务,SWE-bench 则更接近真实仓库缺陷修复。一个模型可能在某类基准领先,在另一类任务中落后。
模型名称也不能与代理产品直接画等号。底层模型、系统提示、可用工具、沙箱、上下文管理和重试策略都会改变最终结果。GPT-5.2 Codex 在这张应用开发图表中的成绩,不能直接代表 Codex CLI 处理已有仓库修复的效果。
Vibe Code Bench 的关键结论不是 Claude Opus 4 或 GPT-5 谁永久更强,而是即使领先模型也只完成约一半端到端任务。AI 可以加速原型和实现,但正式交付仍需要可执行验收、人工审查和明确的回滚边界。
高质量编程 Prompt 要具备哪些关键要素?
追踪 Claude Code 用量及文件修改过程
Claude Opus 4、GPT-5 等 AI 编程助手在 RubberDuckBench 上表现如何?
Claude 与 GPT 模型家族的代码生成能力如何与人类程序员比较?
从线性 Agent 到流程图:用 LangGraph 编排分岔、循环与暂停
最新版Ubuntu 17.10与Windows 双系统安装、配置与美化详细图文教程