过去评价大模型,常见说法是能力、速度和成本构成“不可能三角”:模型越强,通常需要更多计算;追求更低延迟,需要投入更多硬件;压低价格,又可能牺牲能力或服务质量。但到 2025 年,模型架构、推理芯片和服务软件同时演进,使三个方向在一段时期内共同改善。问题不再是三者能否在任何条件下同时最优,而是同一个可比口径下,性能边界是否整体向外移动。
《2025 企业数智化年度指南》把“更强、更快、更便宜”列为年度观察之一。报告援引综合智能指数和公开基准,认为前沿语言模型在理解、生成与复杂任务处理方面明显提升。其列举的数据称,从 2024 年末到 2025 年 11 月,主流模型的综合智能指数由约 20 至 30 分普遍提高到 50 至 70 分。
报告同时引用斯坦福人工智能指数相关结果:MMMU、GPQA、SWE-bench 等基准在一年内分别出现 18.8%、48.9% 和 67.3% 的成绩提升。不同基准考察多模态理解、研究生级问答和软件工程任务,不能简单合并为一个“智力分数”,但共同说明模型处理高难度任务的能力边界在扩大。
价格方面,报告比较了不同年份、相近能力区间的模型。2023 年智能指数约 21.5 的模型,每百万 Token 推理价格为 37.5 美元;到 2025 年,即使智能指数达到 44 或更高,一些模型的价格也低于 0.1 美元。速度方面,报告称 2023 年初语言模型普遍低于每秒 50 Token,到 2025 年下半年,部分模型达到或超过每秒 700 Token。
首先是模型效率提高。混合专家架构只为每个 Token 激活部分参数,在维持较大总参数容量的同时控制单次计算量。知识蒸馏把大型模型的部分能力迁移到小模型,稀疏化和低秩方法减少冗余计算,训练数据治理则让相同训练预算产生更高质量的模型。
其次是推理精度下降。模型可以从 FP16、BF16 进一步转向 FP8、FP4 或整数格式,权重占用更小,显存带宽压力更低,单张加速卡能够承载更大批次。只要量化校准和敏感层保护得当,性能提升可以大于精度损失,从而同时改善吞吐与成本。
再次是硬件与系统协同。新一代加速I器提供更高低精度算力、更大高带宽内存和更快互连;连续批处理、分页式 KV 缓存、前缀缓存、算子融合和投机解码则把硬件峰值转化为实际 Token。过去被内存碎片、通信等待和小批次浪费的资源,逐渐变成可交付产能。
最后是市场结构变化。模型供应商增加、开源模型成熟、云平台竞争和应用规模扩大,共同压低了 API 单价。价格下降不完全等同于底层成本同比下降,也可能来自短期补贴、定价策略或规模换市场,因此企业不能只用公开标价推断供应商的长期经济性。
综合榜单能提供趋势,但不能代替业务评测。一个模型在数学和代码上提高,不代表它在合同审查、客服分类或中文行业术语上同样提高。基准还可能受到训练数据污染、提示模板和采样参数影响。所谓更强,应当定义为在目标任务上,以相同输入、相同工具权限和相同质量门槛获得更高成功率。
推理模型还会通过生成更长的思维过程换取更高正确率。若只比较最终分数,它确实更强;若同时计算延迟和输出 Token,优势可能需要重新评估。企业应记录一次任务的总输入、总输出、重试次数和人工返工,而不是把单次回答的准确率当作完整价值。
跨年份比较还要防止基准漂移。测试题更新、评分器更换、工具调用开放程度和上下文长度变化,都会让新旧成绩失去直接可比性。可靠结论应尽量使用相同版本的数据集与评分流程,并同时保留当时可购买模型的原始结果。
每秒生成 Token 是用户可感知速度的一部分,但首 Token 延迟同样重要。实时聊天希望尽快看到开头,批量摘要则更关心总完成时间。高并发服务还要观察排队时间和尾延迟;平均值很好看时,最慢的百分之一请求仍可能超出服务等级。
每秒 700 Token 的成绩通常对应特定模型、硬件、批次、输入输出长度和服务配置。小模型在短上下文下可以很快,超大模型在长上下文和严格延迟约束下未必达到同一速度。因此,该数字适合证明技术上限正在提高,不适合直接作为所有应用的容量规划参数。
速度也可能快到超过实际需要。阅读型应用每秒几十 Token 已能满足多数用户,继续提高单用户速度未必创造同等价值。此时更有意义的优化是承载更多并发、减少功耗或降低成本。把性能资源投向真正的业务瓶颈,才是“更快”的经济意义。
每百万 Token 价格低于 0.1 美元,展示了公开 API 的价格下限,但不同供应商对输入、输出、缓存读写和批处理分别定价。推理模型输出更长,代理任务还会多轮调用模型与工具。即使单位 Token 下降十倍,总 Token 增长二十倍,单个任务仍会增加。
自建推理也不能只计算 GPU 采购价。设备折旧、电力、机房、网络、存储、软件维护、值班人员和为峰值预留的空闲容量都属于总拥有成本。若利用率不足,理论上很便宜的硬件会因大量闲置而产生很高的单位 Token 成本。
正确指标应是每个成功任务成本。它把模型调用、检索、工具执行、失败重试、质量抽检和人工接管统一到业务结果上。对于客服,可以计算每次有效解决的成本;对于编程代理,可以计算每个通过测试的变更成本;对于文档抽取,则计算每份达到字段准确率要求的文档成本。
技术进步让整个帕累托边界向外移动,但在同一代技术和固定预算内,权衡仍然存在。提高批次可增加吞吐并降低单位成本,却可能增加首 Token 延迟;使用更激进的量化能提速降本,却可能损害复杂任务质量;延长推理可提高正确率,却会消耗更多时间和 Token。
所以“不可能三角实现”更准确的含义是:今天某些较便宜、较快速的模型,能力已经超过两年前更昂贵、更慢的模型。它不是说任意一个当前模型都能同时获得最高能力、最低延迟和最低价格,也不是说三项指标从此不再需要取舍。
实际部署可以采用分层路由。高频、规则清晰的任务先交给小模型,困难请求再升级到前沿模型;稳定系统提示词使用前缀缓存,长文档先检索和压缩;代理则设置步骤、重试和总 Token 上限。这样才能把行业层面的能力提升和价格下降转化为企业自己的成本优势。
从跨年份比较看,大模型确实出现了更强、更快、更便宜同时发生的阶段:公开基准能力上升,部分模型生成速度大幅提高,相近甚至更高能力的 API 单价显著降低。模型架构、低精度计算、推理芯片、服务软件、开源生态和市场竞争共同推动了这一变化。
但三者的权衡没有被永久消除。报告中的指数、每秒 Token 和每百万 Token 价格分别来自特定口径,不能拼成对任意业务都成立的承诺。企业需要固定质量与延迟条件,用每个成功任务成本做验证。只有在真实工作负载上同时提高成功率、缩短等待并降低总成本,才算真正实现了自己的“更强、更快、更便宜”。
我如何借助 AI 并行推进内容、课程与产品开发
MCP 客户端应如何检查 Server 声明的 Tools、Resources 和 Prompts 能力?
Codex 是否支持 MCP 的 notifications/tools/list_changed 通知?
Agent 平台如何接入多家大模型:Provider 槽位架构解析
MCP Server 如何在用户权限或功能开关变化时主动发送 tools/list_changed?
AspNetCoreMassTransit Courier实现分布式事务的详细过程