Kimi K3 的任务规格会怎样影响 Agent 编码的 Token 成本?

作者:袖梨 2026-09-14

Kimi K3 的任务规格会显著影响 Agent 编码的 Token 成本。2026 年 8 月的一项研究在 5 个 SWE-bench Verified 任务上进行了 2700 次运行:把完整规格缩减为只有用户故事的最小描述,平均成本增加 29.7%,成功前的 Agent 轮次增加 16.4%。但影响高度依赖任务,同一种删减在不同任务上的成本变化从 13% 到 115% 不等。

实验怎样控制变量

研究固定使用 Kimi K3,通过 Modal 端点调用,以 mini-swe-agent 在标准 SWE-bench Docker 环境中执行。作者选择 5 个软件工程任务,为每个任务构造 10 种规格变体和 2 个锚点提示,再分别使用 low、high、max 三档思考强度,每个组合重复 15 次,总数为 5 乘以 12 乘以 3 乘以 15,即 2700 次。

完整规格包含标题、用户故事、Given/When/Then 验收场景、边界情况、功能需求、关键实体、成功标准和假设八部分。变体要么删掉单独一节,要么只保留用户故事,或者只保留需求与成功标准。原始失败测试输出作为低结构锚点,直接给出修复方案的提示作为理想化锚点。

规格越短为什么反而更贵

提示词本身更短,只能节省一小段输入 Token;若它省略了定位信息和具体验收场景,Agent 就需要通过搜索文件、读取代码、运行测试和分析错误重新发现这些信息。少付出的提示成本,可能换来更多轮推理与工具调用。

实验中,把完整规格压缩成用户故事,虽然平均少了 548 个提示 Token,却让成本增加 29.7%,轮次增加 16.4%,而且 5 个任务方向一致。其中 xarray-7393 的成本增幅达到 115%,说明某些任务对规格完整度尤其敏感。

哪些规格内容最值得保留

单独移除功能需求、假设、边界情况、关键实体或成功标准,对成本的汇总影响较小,变化约为负 5.4% 到负 2.4%。这不意味着这些内容没有工程价值,只说明在这 5 个任务中,删掉单独一节没有显著增加 Agent 的探索成本。

验收场景更关键。移除具体的 Given/When/Then 场景,会让成功前轮次平均增加 7.0%。论文对比发现,抽象成功标准与具体场景可能表达相近要求,但具体场景更能减少模型自己寻找“哪些情况必须通过”的工作。

原始失败测试输出在低思考强度下,反而是 5 个任务中 4 个最便宜的提示之一。原因不是结构越差越好,而是日志直接暴露了失败测试和相关文件,定位信息替代了 Agent 的发现轮次。有效规格的关键是提供可执行线索,而不是单纯增加篇幅。

思考强度怎样改变提示收益

规格差异在 low 思考强度下影响最大:同一任务最贵和最便宜规格的成本比平均为 2.13 倍;到 high 降为 1.67 倍,max 为 1.61 倍。移除验收场景增加的轮次也从 low 的 20.1% 降到 high 的 4.5% 和 max 的 2.1%。

一种合理解释是,低思考强度下,提示中缺少的信息需要额外轮次来找回;max 档本来就会投入较多推理,因此补充同样信息带来的相对节省更小。不过绝对费用仍会上升:实验中的几何平均单次费用从 low 的 0.117 美元增至 max 的 0.561 美元。

更详细的规格会提高成功率吗

在这项实验中,没有任何单独规格删减对解决率产生可信的显著影响,所有 90% 可信区间都包含零。4 个任务的汇总解决率达到 98% 以上,另一个 Django 任务为 86.3%。因此,主要观察到的是达到成功所需成本和轮次变化,而不是解决更简单版本造成的假象。

这项结论不能外推为“规格不影响质量”。实验任务少、总体解决率高,而且测试用例提供了明确判定。真实需求中的歧义、错误验收标准和隐藏业务规则仍可能显著影响正确性。

为什么减少输入未必是最佳优化

2700 次运行的缓存命中率达到 96.3%。输出 Token 只占处理 Token 的 2.7%,却占总金额的 51.1%;新鲜输入占费用的 13.4%。因此,在这一价格表与缓存条件下,单纯压缩输入只能触及较小一部分成本,减少 Agent 轮次更重要。

这组比例不能直接用于其他模型或平台,因为它依赖具体单价与缓存命中率。但优化思路具有普遍意义:先从中拆分缓存输入、普通输入和输出,再判断应该缩短提示、提高缓存复用,还是减少失败重试与冗长输出。

同一提示的费用仍会波动

在相同规格和思考强度下重复运行,成本的几何标准差中位数为 1.34 倍。不同规格的这一指标约在 1.29 到 1.40 倍之间,没有证据表明改写提示能缩小随机波动。

更贵的配置在金额上的绝对波动也更大,平均成本与绝对离散程度接近同比例增长。因此,预算不能只使用单次运行数据,应保留重试余量,并以多次运行的分布而非平均值制定上限。

如何用一次低成本探针预测预算

研究从 4 个任务学习不同规格与思考强度的相对成本形状,再对未见任务执行一次“完整规格加 low 思考强度”的探针。没有探针时,新任务成本预测的中位误差为 161%;一次成本约 0.11 美元的探针把误差降至 36%,约三分之二的配置落在正负 50% 范围内。

增加到 3 次探针,误差降为 29%;10 次为 25%。这说明在重复型工作流中,先花少量费用测一次真实任务,比让模型在执行前凭空估算 Token 更可靠。为覆盖 90% 的设置,一次探针后的预算仍需使用约 1.9 倍安全系数。

怎样写更省 Token 的编码任务

优先提供可复现的失败、相关文件或模块、可执行验收命令和具体场景。说明当前行为、预期行为与不得破坏的兼容性。不要为了“完整”堆入与任务无关的组织背景,也不要只给一句宽泛用户故事让 Agent 自行探索整个仓库。

对低思考强度任务,具体验收场景尤其有价值。高思考强度下,则应评估长规格是否真的节省轮次,因为模型可能无论如何都会进行广泛推理。稳定重复任务可以先跑一次低成本探针,再决定规格详略与思考档位。

研究结论有哪些限制

实验只包含 5 个 SWE-bench Verified 任务和一个模型,任务数量少于真实团队的工作分布。规格由另一个模型起草后人工校正,并非直接收集自工程师。实验使用固定 Agent、容器和价格表,结论未验证其他 Harness、服务端或模型。

作者用大量重复运行换取了每个配置更稳定的估计,但任务稀疏仍是外推的主要限制。预测方法也没有建模每个新任务独有的提示敏感度。团队应复用方法,而不是照搬百分比。

结论

Kimi K3 的 Agent 编码成本并不由提示长度单独决定。完整、具体且可验收的规格能够减少探索轮次;把它缩成简单用户故事,反而可能增加近三成成本。真正有效的优化是提供定位与验收信息、按任务选择思考强度、减少迭代轮次,并用一次低成本真实探针校准预算。

相关文章

精彩推荐