PlanarBench基准测试:LLM平面图ASCII绘制空间推理能力评估
BraveGuard:面向开放世界威胁的计算机使用代理自进化防御框架
CoCoVideo:基于商业模型的高质量AIGC视频检测基准
大语言模型缺乏自我能力评估,研究提出CSA策略学习认识局限
Reasmory:用3D重建作为显式记忆增强VLM空间推理
BitsMoE:频谱能量引导比特分配实现MoE大模型超低位量化
DyLLM:显著性令牌选择与部分注意力实现高效扩散LLM推理
强化学习驱使代理型Transformer学会树搜索的机制证明
大语言模型性别推断受最小上下文干扰打破语境不变性假设
多模态大模型注意力头中的函数向量负责视觉关系传输
MAPR:预测奖励验证元意识提升推理模型性能
智能体操作系统AOS:将智能体控制平面嵌入并超越传统OS
RL评估基准被指失效:训练集与测试集效果几乎无异
2-bit量化使推理模型陷入冗长无效推理链
大型多模态模型在归纳物理推理中表现不佳
贝叶斯非负奖励模型BNRM缓解RLHF中的奖励黑客问题
六大主流LLM应用AI视频通话性能基准测试
安全必须优先于自演化开放型AI的大规模部署
MedSynapse-V:潜在记忆演化弥合视觉感知与临床直觉认知偏差
从片段到场景:视觉语言模型赋能自动驾驶时间理解
检索对齐表格基础模型在真实EHR约束下实现稳健临床风险预测
跨境零售平台GenAI实验:客服匹配广告七流程提升销售
DenseMLLM提出标准化多模态大模型实现密集预测
利用近似微分等价性聚合功能相似神经元压缩神经网络
AgentProcessBench:工具使用智能体步骤级过程质量诊断基准
黄仁勋称迈威尔科技或成万亿美元公司,盘前涨超25%
ToolSelf: Unifying Task Execution and Self-Reconfiguration via Tool-Driven Emerg
RescueBench:评估具身代理在野外搜救中的多阶段交互与空间记忆能力
AnyMo利用掩码建模实现任意模态条件运动生成
DeepIPCv2:基于LiDAR的端到端自动驾驶感知与控制框架
Large Electron Model: A Universal Ground State Predictor
Genotype-Conditioned Molecular Generation via Evidence-Grounded Multi-Objective
SHERLOCK框架:动态知识适应提升大模型电商风控效能
EvoCut:多层演化感知视觉令牌压缩,高效LVLM推理
UniPinRec统一生成式检索与排序,降低Pinterest推荐系统算力成本
随机擦除对抗模型反转:有效防御还是空幻想?
DuetServe:自适应GPU多路复用协调LLM预填充与解码阶段
R3-CoVR:零样本推理感知组合视频检索框架
Chroma Clues 利用颜色统计特征检测 AI 合成图像
SliceScorer:驾驶VLM测试覆盖缺口可解释发现新方法
2047基准数据集实验:数据泄漏中估计类可忽略,选择类影响显著
Learning Action-Conditional and Object-Centric Gaussian Splatting World Models f
MOGKAN框架利用多组学与PPI网络实现多癌症分类及生物标志物识别
OptiWorld将最优控制引入视频生成以解决物理约束下的轨迹问题
机器学习工作流语法:调用时拒绝数据泄漏
4D雷达与LiDAR、摄像头协同:恶劣天气下感知新方案
TradeArena审计框架揭示LLM交易代理行为对齐与风险反馈机制
FlowNar:一种面向长视频的可扩展流式叙述新框架
WorldCache异构Token缓存加速扩散世界模型推理
FineVerify:细粒度自验证框架扩展测试时计算以提升智能搜索性能