CAREAgent:结构化推理与工具集成的临床医嘱生成智能体
Science Earth:面向AI原生科学发现的星球级操作系统
TriLens:逐层Logit透镜熵实现白盒幻觉检测
POIROT:通过智能体审问检测多智能体系统故障
HomeFlow可验证仿真数据飞轮驱动智能家居代理训练
SIRIUS-SQL:执行反馈锚定多候选消除SQL生成冗余
SkillSmith:技能与工具协同进化框架实现智能体自我改进
EAPO:让智能体学会何时不使用工具,缓解工具滥用
研究显示AI算法会诱导人类道德判断趋同
测试时提示优化提升VLM奖励模型零样本奖励准确性
MIND模型:显式建模数据流形几何的扩散图像生成
LLM Agent弥合时间序列预测的最后一公里业务上下文鸿沟
SMH-Bench:智能家居LLM智能体环境推理与动作基准
论文提出实用智能体系统的简单性、可控性与成本可预测设计
视觉噪声引导的上下文蒸馏实现多模态大语言模型遗忘
BenHalluEval:面向孟加拉语的大语言模型多任务幻觉评估框架
AutoMedBench 提出面向医学 AI 自动化研究的流程感知基准
超双曲与证据优先专家:新MoE架构解决LVLM模态不对称
视觉链式思维代理:工具多样性优于频率,用于3D与医学推理
RuleEdit:规则引导的AI模型编辑系统,可预检失败与影响
深度研究代理轨迹中的跨度级错误定位新方法
WorldCoder-Bench:评估LLM生成物理正确3D世界的基准
RAFT数据精炼与自适应蒸馏:缓解领域微调中的能力遗忘
MemGraphRAG:记忆型多智能体图检索增强生成
从人类视频到机器人操作:可扩展视觉-语言-动作学习综述
SIRI框架让LLM智能体自我内化技能无需外部生成器
eMoT:符号锚定与记忆腐蚀驱动LLM思维记忆进化
研究:具身视觉语言规划需从语言预测转向物理因果推理
DAPD:基于注意力的依赖感知并行解码加速扩散LLM
BudgetDraft提出接受感知多视图训练,实现稀疏KV投机解码
LLM智能体工具调用:有效性衡量与RL训练效率研究
What Makes a Strong Model? A Unified Spectral Analysis of Knowledge Transfer ove
CaB方法:有限校准下VLA代理的完成感知边界切换部署
Persona Attack利用记忆注入越狱攻击大型语言模型
CEAR认证集成防御为DNN提供可证明对抗鲁棒性
FoLoRA:基于广义瑞利商优化的基础模型能力保持微调方法
MURMUR高效长语音识别推理系统平衡精度与延迟
PaCo-VLA:用被动屏蔽合规先验填补语义到控制鸿沟
A Unified Evaluation-Instructed Framework for Query-Dependent Prompt Optimizatio
FeynmanBench:多模态大模型图表物理全局推理基准
LLM Agent解析Linux内核故障诊断的复杂性
Towards a Virtual Neuroscientist: Autonomous Neuroimaging Analysis via Multi-Age
Knowledge-Intensive Video Generation
GraphCast机器学习模型将大气可预报性扩展至30天以上
查询电路:直接追踪信息流解释语言模型如何回答用户提示
过程奖励代理引导知识密集型推理新方法
Benchmarking at the Edge of Comprehension
大模型跨实例注意力重分配:移动查询而非缓存
Distillation of Large Language Models via Concrete Score Matching
批次大小隐藏偏差:LoRA变体性能差异实为超参数假象