Kimi K3 的公开编码基准成绩有哪些?

作者:袖梨 2026-09-12

Kimi K3 已公开的编码相关基准成绩包括:Terminal-Bench 2.1 为 88.3,DeepSWE 为 67.5,SWE Marathon 为 42.0,Program Bench 为 77.8;在 Frontend Code Arena 中以 1679 分获得第一名。前四项由第三方汇总页标注为 Moonshot 模型卡报告数据,Frontend Code Arena 则来自第三方盲选排名。理解这些数字时,必须同时看测试对象、评分口径和来源,不能把不同基准的分数直接相加或比较高低。

五项编码相关成绩一览

基准Kimi K3 成绩主要考察内容来源性质
Terminal-Bench 2.188.3多步骤终端操作与工具使用厂商报告
DeepSWE67.5软件工程任务厂商报告
SWE Marathon42.0长周期软件开发工作厂商报告
Program Bench77.8程序合成厂商报告
Frontend Code Arena第一名,1679 分生成前端界面的盲选偏好第三方排名

这里的“厂商报告”不是说数据无效,而是说明评测配置、Harness 和提交条件由模型发布方披露。第三方排名也不天然代表全面能力,它可能只覆盖一个较窄的任务类型。公开分数最适合用来确定值得复测的方向。

Terminal-Bench 2.1 的 88.3 说明什么

Terminal-Bench 2.1 关注模型或 Agent 在终端环境中完成多步骤任务的能力,包括理解目标、调用命令、处理工具输出和持续推进。88.3 表明 Kimi K3 在公开配置下表现较强,尤其值得用于命令密集型和 Agent 编程场景。

不过,终端任务成绩不仅取决于模型推理,也会受 Agent Harness、可用工具、超时、重试策略和权限设置影响。将这一分数迁移到真实仓库时,还要测试依赖安装、长命令、交互式程序、权限拒绝和错误恢复。

DeepSWE 的 67.5 如何理解

DeepSWE 面向软件工程任务,比独立算法题更接近在代码库中定位问题、修改实现并满足测试。67.5 可以作为 Kimi K3 处理仓库级任务的能力信号,但无法直接等同于“67.5% 的任何缺陷都能修好”,因为具体分数含义取决于基准版本和评分规则。

真实项目通常还有私有依赖、历史约束、构建环境和未被测试覆盖的业务规则。团队复测时应保留失败类型:是没有找到相关文件、修改方向错误、工具运行失败,还是测试通过但引入了副作用。只有失败分类才能指导 Harness 改进。

SWE Marathon 的 42.0 代表长周期能力

SWE Marathon 关注更长周期的软件工作。相较一次生成函数,长任务需要维持目标、跨多轮修改、管理上下文并在局部失败后恢复。42.0 的绝对值不能与 Terminal-Bench 的 88.3 对比,因为两者任务难度和计分体系不同。

这一成绩说明长周期能力仍有明显提升空间。使用 Kimi K3 承担大型任务时,应把目标拆成阶段,保存中间验收状态,并限制无效重试。Agent 运行时间更长,不代表它一定保持了正确方向。

Program Bench 的 77.8 看什么

Program Bench 更偏向程序合成,即根据规格生成满足条件的程序。它能反映代码生成、约束理解和逻辑实现能力,但对真实开发中的依赖管理、代码审查、迁移与部署覆盖有限。

如果团队主要用 AI 编写独立函数、数据转换或算法实现,这项成绩有较高参考价值;若任务集中在大型服务改造,则应把仓库级测试和工具调用表现放在更高权重。

Frontend Code Arena 第一名意味着什么

Frontend Code Arena 采用盲选方式,让开发者在不知道模型身份的情况下比较生成界面。Kimi K3 以 1679 分位列第一,说明它在当时的前端生成偏好评测中获得较高认可。盲选能够降低品牌影响,比模型自评更接近用户对成品的直观判断。

但“更受偏好”不等于代码在所有维度更优。界面视觉、初始完成度和交互观感容易影响选择,而可访问性、响应式边界、维护性、性能和安全未必被充分检查。因此,前端项目还应配合自动化测试、视觉回归、键盘操作与移动端验收。

还有哪些非编码成绩

同一来源还列出 GPQA Diamond 93.5、BrowseComp 91.2、DeepSearchQA 95.0 F1,以及 MMMU-Pro 81.6 和 83.4。这些分别涉及科学推理、多跳网页研究、搜索问答和多模态推理。它们可以帮助理解 K3 的通用能力,但不应被包装成编码成绩。

在 Agent 编程中,这些能力可能间接有用,例如检索文档、阅读设计图或理解技术说明。不过,最终仍需通过代码是否构建、测试是否通过和需求是否满足来验收。

为什么不能直接用排行榜选模型

首先,基准版本会更新,旧分数与新版本可能不可比。其次,模型的温度、思考强度、上下文、工具预算和 Harness 都会改变结果。再次,厂商通常选择适合展示模型优势的配置,这在行业中很常见,但用户仍需独立复测。

第三方聚合指数也会随纳入模型、权重和评分方法调整。来源页明确指出,没有公开的统一正面对照足以对部分闭源模型给出确定排名。看到“第一”或“前五”时,应先确认它对应哪个任务、哪个日期和哪个版本。

如何建立自己的编码基准

从真实待办中选择 20 个代表任务,覆盖小缺陷、跨文件功能、测试编写、前端交互和工具失败恢复。固定仓库提交、提示词、模型配置、时间上限和验收脚本,每个任务至少重复多次。

记录一次通过率、最终通过率、总时长、首字延迟、工具失败率、输入输出 Token、费用和人工修复时间。对于前端任务,再加入截图对比、响应式检查和可访问性测试。最终按团队任务分布设置权重,而不是照搬公开排行榜。

结论

Kimi K3 的公开编码数据覆盖终端 Agent、软件工程、长周期任务、程序合成与前端生成,其中 Frontend Code Arena 第一名和 Terminal-Bench 2.1 的 88.3 是较醒目的信号。与此同时,多数成绩仍是厂商报告,且各基准口径不同。它们足以说明 K3 值得进入候选名单,但不能替代在真实代码库上的固定任务复测。

相关文章

精彩推荐