MetaWorld:基于单视角视频数据扩展多智能体视频世界模型
AirDreamer 利用世界模型实现通用无人机导航
Plan2Map:从规划记录重建地理空间边界的多模态基准
Qwen-Image-Flash:少步蒸馏训练配方超越设计目标
面向复杂图像编辑的鲁棒序列分解方法提出
多LoRA合并为单一低秩适配器方法研究
SEAOTTER:传感器嵌入式自动编码实现一次性转码高效重建
Greed is Good:无训练引导生成的后验与端到端统一视角
CP-Agent:上下文感知多模态推理实现化学扰动下细胞形态分析
EvoDrive:帕累托进化结合自改进LLM生成自动驾驶安全关键场景
PyraMathBench 发布 3.2 万题层次基准,评估 LLM 数学推理与数值处理
多智能体LLM系统Ringelmann效应缩放定律:三种渐近规模分类
StepFinder:多智能体系统故障归因时序语义框架
SLM智能体编排网关:AI虚拟世界从提示到服务的架构革新
诊断LLM新型API获取知识缺口:NovelAPIB基准
NTK-UQ用经验神经正切核实现极端天气预报不确定性量化
DeskCraft 提出专业工作流与人类协作的桌面智能体基准测试
核心层次结构提升GraphRAG全局语义理解效率
CORE冲突导向推理:通用多模态操纵检测新方法
对抗性补丁劫持VLA模型CoT推理导致机器人行为误判
前沿语言模型评估意识分解与测量研究
自主智能体基准测试忽略放弃能力:合规偏差需纳入评估
ClinicalMC 多病程临床决策基准:评估大语言模型动态病情决策能力
AI编码代理任务中断引发“交接债”:重新发现成本攀升
视觉指令微调通过抽象将视觉特征嵌入LLM中间语义层
图结构用作大语言模型内部推理组织支架
DMF:以CPU优先的确定性记忆框架替代LLM生成式压缩
模型合并导致MoE路由崩溃,免训练校准方案提出
基于蒸馏聚合的轻量LLM智能合约安全审计框架
CAPER:面向Text-to-SQL的子句对齐过程监督方法
基于结构化指令表示的大推理模型约束遵循框架
面向受众与意图的机器翻译:LLM多语言大规模系统评估
ARBOR用可复用评分缓冲实现搜索智能体在线过程奖励
CauTion方法:判断何时信任LLM进行集成因果发现
R²-dLLM:时空冗余削减加速扩散大语言模型推理
SEA-NLI:面向东南亚文化的自然语言推理基准发布
PsychoPass:对话几何建模检测多轮LLM越狱攻击
MemTrain自监督上下文记忆训练降低长程LLM代理数据成本
EntSQL基准:面向长上下文企业知识的Text-to-SQL评估
FederatedSkill:联邦学习驱动智能体技能隐私化演进
选择性Token级加密实现大语言模型临床部署隐私保护
SenseJudge提出以用户偏好驱动的可定制LLM评估框架
llama.cpp 项目新增 Mellum 架构模型支持
多智能体经济系统:市场拍卖驱动去中心化集体智能涌现
Reasoning Primitive Induction:从Agent轨迹归纳推理原语构建伪工具库
多模态大模型模因理解:Intent Projection分解字面与语用意图
SCOPE:面向边缘部署的实时自然语言相机代理
ChristBERT:面向德国医学NLP的领域特定BERT预训练策略
VistaHop 基准评估多跳视觉推理,推动深度搜索迭代认知
PIWM框架实现零售场景主动意图推断与干预决策