必须确认使用Agent API的/run端点而非/chat/completions,启用MiMo V2Flash缓存(X-Cache-Mode: v2flash)、固定tools schema、截断对话历史至最近两轮、显式设置enable_search: false,并可选启用OpenClaw共享缓存池。
想把MiniMax Agent API集成进客服系统或自动化报告工具,但发现Token账单一个月涨到三千多元,必须立刻控制成本。
很多开发者误以为调用的是Agent能力,实际请求发到了chat/completions端点——这会按完整上下文计费,且无法启用Agent专属缓存。打开你最近一次API调用的原始请求体,检查url是否为https://api.minimaxi.com/v1/agents/run(注意结尾是run而非chat/completions)。如果不是,所有后续优化都无效。
Agent API的run端点强制要求传入tools数组和tool_choice字段,缺失任一字段将自动降级为普通Chat调用并全额计费。
方法一:在请求头中添加缓存开关
在HTTP请求头中加入X-Cache-Mode: v2flash。这一步必须在首次调用前完成,否则缓存指纹无法注册。
方法二:确保输入结构完全一致
缓存命中依赖字节级一致——system prompt、user message、tools schema、temperature=0、top_p=1这五项必须逐字相同。哪怕tools里一个字段名多一个下划线,或temperature写成0.0,都会导致X-Cache-Status: MISS。建议用Python的json.dumps(obj, sort_keys=True)生成标准化JSON字符串后再发送。
【tools schema必须固定不变】一旦上线,禁止修改tools定义中的name、description、parameters结构。变更schema会导致全部历史缓存失效。
第一步:计算当前对话的语义哈希值
对system prompt + 最近两轮user/assistant消息拼接后取SHA256,作为cache_key字段值。不要用时间戳或随机数。
第二步:在请求体中注入cache_key
在JSON请求体顶层添加"cache_key": "a1b2c3d4..."字段。该字段不参与模型推理,仅用于缓存索引。
第三步:主动丢弃冗余历史
Agent API默认保留全部历史,但超过3轮后复用率急剧下降。在构造messages数组时,只保留最近1个system + 最近2个user/assistant交替对,其余全部剔除。实测可使单次调用token消耗降低42%。
登录MiniMax控制台→Billing→OpenClaw Settings→Enable Shared Cache Pool。开启后,同一企业下所有应用共享缓存指纹库,跨服务重复请求自动命中。
在请求头中添加X-OpenClaw-Pool: shared。此参数仅对企业认证账户生效,个人开发者账号无法使用。
注意:启用OpenClaw缓存池后,X-Cache-Mode: v2flash仍需保留,二者叠加使用效果最佳。
MiniMax Agent API默认开启enable_search: true,该功能会额外调用内部检索服务并按1000 tokens/次单独计费。若你的Agent不依赖外部知识库,必须显式设为false。
在请求体中找到tools数组,将每个tool对象内的"enable_search": false字段补全。漏掉任意一个tool的设置,整个请求仍会触发搜索扣费。
WRC 2026|超维动力郑存远:筑牢世界模型底座,让物理AI真正走进千家万户
生存33天末世联赛通关指南
WRC 2026|致同咨询冯维祺:具身智能商业化破局提速,还需跨越“三座大山”
擎朗智能李通:从“岗位化”破局,探寻具身智能商业化现实路径
第二届世界人形机器人运动会开幕:2056 台机器人齐聚“冰丝带”,666 支队伍竞技 51 赛项
Ravensburger确认新Disney Lorcana Coco与向前系列即将推出