DeepSeek V4 Flash凭LLM验证器实现推理效率革命,Terminal-Bench准确率达88%,成本仅竞品1/4,逼近Fable5性能。核心内容:1. LLM-as-a-Verifier验证器核心思路(多候选+自我验证)2. 实验数据:采样5次+验证准确率88%(对比采样1次79%)3. 成本-性能优势:成本1/4-1/11,逼近Fable5等闭源模型
DeepSeek V4 Flash 通过 LLM-as-a-Verifier(大模型作为验证器),在Terminal-Bench 2.1上把准确率从79%直接拉到88%,同时成本只有闭源竞品的1/4到1/11。
这不是简单的模型变强了,而是推理阶段的效率革命。
核心思路其实很朴素:
当开源模型已经足够强、推理成本又足够低时,多生成几次 + 自己验证就成了性价比极高的策略。

实验数据显示:
在成本-性能曲线上,DeepSeek V4 Flash + Verifier 的表现非常漂亮——成功率接近甚至超过部分GPT-5.6和Claude Fable 5系列模型,但单价低得多。
https://x.com/Azaliamirh/status/2089469598240510144https://github.com/llm-as-a-verifier/llm-as-a-verifier
登录查看剩余 70% 内容