让DeepSeek-V4-Flash逼近Fable5的开源神器

作者:袖梨 2026-08-20

DeepSeek V4 Flash凭LLM验证器实现推理效率革命,Terminal-Bench准确率达88%,成本仅竞品1/4,逼近Fable5性能。核心内容:1. LLM-as-a-Verifier验证器核心思路(多候选+自我验证)2. 实验数据:采样5次+验证准确率88%(对比采样1次79%)3. 成本-性能优势:成本1/4-1/11,逼近Fable5等闭源模型

DeepSeek V4 Flash 通过 LLM-as-a-Verifier(大模型作为验证器),在Terminal-Bench 2.1上把准确率从79%直接拉到88%,同时成本只有闭源竞品的1/4到1/11。

这不是简单的模型变强了,而是推理阶段的效率革命

核心思路其实很朴素:

  1. 让同一个模型生成多个候选答案(比如采样5次)
  2. 再用这个模型自己当裁判,对候选答案进行打分、排序、筛选
  3. 选出最优解

当开源模型已经足够强、推理成本又足够低时,多生成几次 + 自己验证就成了性价比极高的策略。

img_6a86f3f26cea430.webp

实验数据显示:

  1. 采样1次:约79%
  2. 采样3次 + 验证:明显提升
  3. 采样5次 + 验证:达到88%

在成本-性能曲线上,DeepSeek V4 Flash + Verifier 的表现非常漂亮——成功率接近甚至超过部分GPT-5.6和Claude Fable 5系列模型,但单价低得多。

https://x.com/Azaliamirh/status/2089469598240510144https://github.com/llm-as-a-verifier/llm-as-a-verifier

#DeepSeek #AI #Fable5 #Calude #GPT #GLM #Qwen #LLM #Harness

登录查看剩余 70% 内容

相关文章

精彩推荐