TwinRouterBench:面向代理型LLM路由的静态与动态实时评估基准
EVA-0:仅需两次前向传播实现测试时模型进化
The 99% Success Paradox: When Near-Perfect Retrieval Equals Random Selection
EMO-BOOST:情感增强音视频特征提升深度伪造检测泛化能力
GeoX提出自我对弈与可验证奖励方法攻克地理空间推理难关
AQuaUI:利用自适应四叉树压缩GUI代理视觉令牌
Cubit 提出用核岭回归实现 Transformer 中的 Token 混合
AQuaUI用自适应四叉树压缩GUI智能体视觉令牌
Cubit: Token Mixer with Kernel Ridge Regression
LLM生成代码中的库幻觉:基于开发者查询的供应链风险分析
LVLM胸部X光推理的视觉归因可信度缺乏验证
CADENet条件自适应异步双流增强网络突破恶劣天气自动驾驶感知实时瓶颈
PEEK:上下文地图作为长上下文LLM智能体的方向缓存
动态模型合并瘦身法优化精度与效率
ClinSeekAgent自动化多模态证据寻求用于临床推理
多智能体架构实现教科书级细粒度评估基准自动生成
GoLongRL:能力导向的长上下文强化学习多任务对齐框架
HalluWorld:基于参考世界模型的大模型幻觉受控基准
DECOR:基于信息操纵理论细粒度审计大语言模型欺骗
SCA框架:通过逐步置信度归因诊断黑盒LLM多步推理失败
OP4KSR 提出一步式无补丁4K超分辨率,抑制周期性伪影
Grad-ECLIP 被指非新路线,等价简化方法 Attention-ECLIP 已提出
Real2Sim:物理驱动可编辑高斯泼溅框架保障自动驾驶时空一致性
扩散模型泛化归因于数据依赖脊流形归纳偏差
三阶段学习法驱动简单模型在长期时间序列预测中达到高性能
大语言模型医学知识评估缺失时间动态感知
KVM:可扩展块循环压缩记忆的线性复杂度Transformer
融合视觉与触觉的多模态世界模型 实现机器人交互精准预测
BEAVER:面向企业复杂SQL场景的Text-to-SQL基准测试
SREGym 推出高保真故障场景实时基准测试
CANTANTE:通过对比信用分配优化智能体系统
风险分层用例配置下T2I生成模型性别偏见审计
CRePE提出弯曲射线期望位置编码实现统一相机控制视频生成
REVELIO 框架揭示视觉语言模型可解释故障模式
StereoTales:多语言框架开放式发现LLM刻板印象
持续学习视角下正交梯度投影减轻大语言模型对齐税
RLHF与DPO偏好学习性能差距的理论归因分析
阿里千问3.7编程能力超GPT/Gemini,全球第二仅次Claude
深圳十五五规划:2030年实时可用算力目标超150EFlops
面壁智能MiniCPM5-1B:1B端侧模型刷新开源SOTA
因特智能AI视觉攻克半导体光罩纳米级检测卡脖子难题
WPS Office原生登陆Windows on ARM平台
水母智能两部AI竖屏剧集入选戛纳,短剧工业化出海
国产Agent模型跻身全球第一梯队,限时免费适配多平台
多中心临床验证PulmoFoundation模型实现肺部病理综合解释
ReMind框架:让视频生成器学会动态记忆未观测状态演化
DexSIM:统一因果视频扩散实现实时灵巧手操作模拟
世界模型作为群动作:动作忠实性形式化框架
GPT-4o mini安全过滤器致多模态仇恨检测失效
GitHub Copilot研究揭示LLM对开源创新的影响异于组织环境