重磅!姚顺雨入职腾讯首秀:CL-BENCH 撕破大模型的学习伪装

作者:袖梨 2026-07-27

这是姚顺雨入职腾讯担任首席 AI 科学家后参与的首个重要研究成果 ——CL-BENCH,一个专门测试大模型 “从上下文中学习” 能力的全新基准,它首次系统性地揭露了当前前沿大模型在真实世界任务里最被忽略的核心短板。

Gus Van Sant 的《大象》用细碎的长镜头铺陈出零散的校园日常,没有直白的叙事线,却让观众从那些看似无关的脚步声、储物柜开关声里,自行拼凑出悲剧的完整脉络。这种从零散细节里构建认知的能力,正是人类应对真实世界问题的核心 —— 我们不必依赖已有的知识库,总能从全新的复杂信息里快速学习,搭建新的逻辑框架。但当前的大模型,恰恰在这一点上,与人类智能有着本质的差距。

腾讯与复旦大学联合团队的这篇论文,正是要直面这个问题:他们构建了一个全新的基准测试 CL-BENCH,专门评估大模型的 “上下文学习” 能力 —— 也就是从复杂的、全新的上下文里学习新知识,并应用这些知识解决问题的能力,而这正是当前大模型评估体系里被严重忽略的部分。

当前的大模型,无论是 GPT 系列还是国内的大模型,都擅长用预训练阶段习得的知识解决问题:它们能解数学题、写代码、回答常识问题,这些能力都依赖于它们在预训练阶段存储的海量知识库。

但真实世界的任务往往远比这些复杂:你需要根据一份全新的产品手册操作设备,需要根据一个虚构国家的法律体系裁决案件,需要从一组实验数据里总结出物理规律 —— 这些任务都需要你从全新的上下文里学习知识,而不是调用已有的记忆。

论文里的图清晰地展示了这种 mismatch:当前的模型优化路径,大多聚焦在 “提示工程”,也就是让模型更好地用预训练知识解决问题;而真实世界的需求,是让模型能从复杂的上下文里学习新知识,这就是 “上下文学习” 的能力。

这种能力的缺失,让大模型在真实世界的复杂任务里举步维艰 —— 比如当你给模型一份全新的 API 文档,让它根据文档写代码,它往往会依赖预训练里的旧知识,而不是遵循文档里的新规则;当你给它一组实验数据,让它总结规律,它往往会输出预训练里的已有结论,而不是从数据里推导新的规律。

为了系统性地评估这种能力,团队构建了 CL-BENCH,这是一个由 500 个复杂上下文、1899 个任务、31607 个评估标准组成的基准测试,所有内容都由领域专家打造,确保真实、无污染且具有挑战性。

CL-BENCH 的上下文分为四个核心类别,覆盖了人类在真实世界里的学习场景:

领域知识推理:一份全新的医学研究报告,分析一种新药的疗效;

规则系统应用:一个虚构国家的法律体系,裁决一个案件;

程序性任务执行:一份无人机物流系统的 API 文档,生成操作代码;

经验发现与模拟:一组实验数据里总结出物理规律,或者模拟一个复杂的沙盒环境。

每个类别下还有更细分的子类别,比如领域知识推理包括金融、医疗、人文等,规则系统应用包括游戏机制、数学形式化、编程语法等。这些上下文里的知识,要么是专家全新创建的,要么是经过修改的,要么是小众的长尾知识,确保模型无法依赖预训练知识解决,必须从上下文里学习。

CL-BENCH 的任务还有一个特点:51.1% 的任务是多轮的,需要依赖前一轮的任务结果,这更贴近真实世界的交互场景 —— 比如你需要先理解一个产品的基础规则,才能解决更复杂的操作问题。

团队测试了 10 个前沿的大模型,包括 GPT-5.1、Claude 3 Opus 等,结果令人惊讶:所有模型的平均解决率只有 17.2%,即使是表现最好的 GPT-5.1,也只解决了 23.7% 的任务。

尤其是经验发现与模拟类的任务,模型的平均解决率只有 11.8%,这说明大模型在从实验数据里总结规律、模拟复杂环境的能力上极其薄弱。而程序性任务执行的平均解决率也只有 16.3%,说明模型在遵循复杂的程序步骤上也存在很大问题。

论文里的图展示了一个典型的 CL-BENCH 任务流程:模型需要从上下文里学习带电粒子动力学的新规则,然后应用这些规则解决问题,评估标准会从多个维度检查模型的回答是否正确,包括是否使用了上下文里的规则,是否给出了正确的计算步骤,是否得出了正确的结果。

错误分析显示,模型失败的主要原因是忽略了上下文里的信息 —— 它们更倾向于使用预训练里的知识,而不是遵循上下文里的新规则。比如在一个法律任务里,模型会使用现实世界的法律知识,而不是上下文里虚构国家的法律规则;在一个 API 任务里,模型会使用预训练里的旧 API 语法,而不是上下文里的新语法。

另外,长上下文推理能力不足也是一个重要原因:很多上下文的长度达到了 65000 tokens,模型无法处理这么长的上下文,无法提取其中的关键信息。还有指令遵循的问题:模型无法理解上下文里的复杂约束,无法按照要求完成任务。

《大象》的叙事逻辑,恰好对应了 CL-BENCH 想要测试的核心能力:观众需要从电影的零散细节里搭建出完整的故事逻辑,大模型也需要从复杂的上下文里提取新的知识,构建出解决问题的框架。但当前的大模型,更像是只看过电影梗概的读者,无法捕捉那些藏在细节里的关键信息,只能依赖已有的预训练知识,而无法从新的上下文里真正学习。

这揭示了当前大模型发展的一个误区:我们一直在追求更大的预训练数据集,更多的参数,以为这样就能让模型更智能,但实际上,人类的智能不是记住多少知识,而是能从新的信息里快速学习。

一个小孩不需要记住所有的物理知识,就能从一次实验里总结出物理规律;一个员工不需要记住所有的操作手册,就能从一份新的文档里学会操作设备。这才是我们需要大模型具备的能力。

CL-BENCH 的出现,不仅仅是提供了一个新的基准测试,更是指出了大模型发展的一个新方向:我们需要让大模型具备真正的 “学习” 能力,而不是 “记忆” 能力。

当前的上下文工程(比如 RAG)只关注如何给模型提供上下文,却没关注模型能不能从上下文里学习 —— 就像我们给了一个学生一本教材,却没教他怎么读教材。

未来的研究应该聚焦在如何提升模型的上下文学习能力:

如何让模型更好地处理上下文里的冲突信息,当上下文里的知识和预训练知识冲突时,模型能优先遵循上下文里的知识;如何提升模型的长上下文推理能力,让模型能处理更长的上下文,提取其中的关键信息;如何提升模型的多轮学习能力,让模型能在多轮对话里保持对上下文信息的记忆,应用之前学到的知识解决后续的任务;如何让模型能从上下文里提取结构化的知识,比如从一份文档里提取出规则、流程、规律,而不是零散的信息。

另外,CL-BENCH 也给大模型的评估体系带来了新的思考:我们需要更多关注模型的 “学习” 能力,而不是 “记忆” 能力。一个能从新的上下文里快速学习的模型,比一个记住了更多知识的模型,更能适应真实世界的复杂任务。

本文参与腾讯云自媒体同步曝光计划,分享自微信公众号。原始发表:2026-02-08,如有侵权请联系[email protected] 删除

相关文章

精彩推荐