Kimi K3 是否具备长程编码和 Agent 任务能力?

作者:袖梨 2026-09-12

Kimi K3 具备长程编码和 Agent 任务能力。其技术报告在 SWE-Marathon 上报告 42.0,在 FrontierSWE 上为 81.2;Agent 评测中 BrowseComp 为 91.2、MCPMark-Verified 为 94.5、AutomationBench 为 30.8。团队还展示了一次持续 48 小时的自主芯片设计案例。不过这些结果多数来自模型团队,且不同模型可能搭配不同 Agent Harness,适合证明能力存在,不能直接保证真实项目的稳定成功率。

什么是长程编码能力

长程编码不是一次生成函数,而是在较长时间内维持目标,持续读取代码、调用工具、运行测试、处理失败并推进多个阶段。任务越长,越容易出现上下文遗忘、局部修复破坏整体、工具状态丢失和错误循环。

Kimi K3 提供 100 万 Token 上下文,后训练覆盖编码与 Agent 强化学习。论文还描述了百万 Token Agent 强化学习、可恢复的 rollout 和持久化沙箱状态,用于支持跨多轮的环境交互。

长程编码基准表现

SWE-Marathon 面向较长周期的软件工作,K3 报告 42.0,高于论文表格中的 Claude Fable 5 的 35.0、GPT-5.6 Sol 的 39.0。需要注意,该评测使用 2026 年 7 月 9 日的 H20 校准分支,并非最终 v1.1;部分对照运行还发生了 fallback。

FrontierSWE 上,K3 为 81.2,低于 Claude Fable 5 的 86.6,高于表中其他模型。DeepSWE 为 67.5,落后于 70.0 和 73.0 的两个领先对照;ProgramBench 则以 77.8 位列该表最高。Terminal-Bench 2.1 为 88.3,与最高的 88.8 接近。

这些成绩表明 K3 在程序合成、终端工具和长任务中均有竞争力,但并非所有编码维度领先。不同基准考察对象不同,42.0 与 81.2 不能直接横向比较。

Agent 任务覆盖哪些类型

论文的 Agent 套件涵盖网页研究、深度搜索、MCP 工具、自动化、办公文档、电子表格、计算机操作、企业系统、和法律研究。K3 在 BrowseComp 获得 91.2,在 DeepSearchQA 获得 95.0 F1,在 MCPMark-Verified 为 94.5,在 SpreadsheetBench 2 为 34.8。

更困难的计算机操作仍有明显空间:OSWorld-Verified 为 84.8,但 OSWorld 2.0 降至 58.3;SaaS-Bench 为 60.1。Agents' Last Exam 为 28.3,略低于表中最高的 29.6。结果说明“会调用工具”不等于所有长链工作都稳定。

48 小时自主案例说明什么

论文展示 K3 配合 Kimi Code,在一次 48 小时自主运行中设计、优化并验证一个用于 nano 模型的推理芯片原型。它使用开源 EDA 工具和 Nangate45 标准单元库,设计在 4 平方毫米分析面积预算内以 100 MHz 完成时序收敛,包含 146 万个标准单元,并在 RTL 仿真中达到每秒超过 8700 Token 的解码吞吐。

这是长时间保持工程目标并协调多种工具的强案例,而且论文提供了 RTL 代码仓库。但它仍是团队选择并呈现的单个案例,不能由此推断任何 48 小时任务都能无人值守完成。真实复现还需核对提交记录、环境、人工介入和完整验证范围。

评测配置会怎样影响结果

K3 的主评测统一使用 max 思考强度和温度 1.0。编码任务可能使用 Kimi Code、Claude Code 或 Codex 三种 Harness,Terminal-Bench 还报告各模型在不同 Harness 中的最佳成绩。Agents' Last Exam 同样为不同模型绑定特定 Harness。

因此,表格比较的是“模型加执行框架”的组合表现,不是完全隔离的裸模型能力。max 档也意味着更高推理投入,不能直接代表日常低成本配置。选择模型时,应在同一个工具框架和预算下复测。

如何把长程能力用于真实项目

先将大型目标拆成可恢复阶段,每阶段都有产物、测试和停止条件。保存当前计划、已修改文件、失败日志和下一步,让会话压缩或进程中断后仍能恢复。长命令应放入可观察的后台任务,而不是让 Agent重复启动。

对工具权限采用最小授权。允许读取仓库和运行测试,不应默认开放生产凭据、线上部署和不可逆删除。高风险步骤设置人工审批,代码提交保持小而可回滚。

最后记录一次通过率、总轮次、Token、工具失败率、人工接管次数和最终验收结果。长时间自主运行的价值是减少人工等待,不是单纯追求运行时长。

结论

Kimi K3 的公开基准、训练设计和 48 小时案例共同证明它具备长程编码与 Agent 执行能力,在 SWE-Marathon、FrontierSWE、BrowseComp 和 MCP 工具任务中表现突出。但技术报告也显示,它在部分仓库级编码和困难计算机操作上仍落后于领先对照。实际部署应使用统一 Harness、真实任务和固定预算验证,并通过阶段验收、持久状态与最小权限控制长程运行风险。

相关文章

精彩推荐