多模型LLM调度器研究:GPU内存约束下的卸载与抢占实证分析
阿里巴巴 Megatron-SWIFT v4.1:独立 mcore-bridge 并支持 GRPO 路由回放
Formal Skill: Programmable Runtime Skills for Efficient and Accurate LLM Agents
jina-embeddings-v5-omni 发布:锁对齐塔实现多模态几何保持嵌入
LLM代理的“历史锚定”效应:过往有害行为引导后续不安全决策
PEEK:为长上下文LLM智能体构建可复用方向知识的上下文地图
推理模型作为评估者:扩展测试时计算提升评估能力
CADENet提出异步双流增强网络,应对自动驾驶恶劣天气感知瓶颈
SAGE研究揭示RLVR仅提升LLM采样效率而非推理能力
跨语言解释的合理性-忠实性权衡揭示大模型审计局限
SCA方法可诊断黑盒大模型多步推理的逐步失败
水印应作为监控原语:生成模型的内部监控不可避免
CHI-Bench 基准测试:政策密集型医疗工作流自动化评估
多示例链式思维上下文学习研究推理任务缩放规律
MultiSearch提出并行搜索与显式合并,扩展检索增强推理规模
MTraining: Distributed Dynamic Sparse Attention for Efficient Ultra-Long Context
理论分析阐明掩码扩散模型缓解反转诅咒的原因
ECG-R1:协议引导多模态大模型实现可靠心电图解读
语言基础代理控制LBAC:编程语言安全技术约束AI代理行为
研究称Agentic AI系统是通往AGI的可预见路径
ZeroSearch以无搜索方式激励LLM搜索能力
Orthrus双架构框架融合自回归与扩散模型实现并行生成
真实自回归Transformer的图灵完备性高度依赖上下文管理
AI Harness Engineering:运行时基底提升基础模型软件代理可靠性
库漂移:自进化LLM技能库因无生命周期管理致性能停滞
语义模糊测试揭示LLM代理技能自身规范违规风险
语言基础智能体控制(LBAC)新型编程模型融合安全策略
LLM Agent技能自破坏规范:无攻击语义模糊测试暴露安全漏洞
因果感知端到端自动驾驶提出自我中心联合场景建模
教师引导策略优化解决LLM蒸馏中分布失配问题
教师引导策略优化解决LLM蒸馏中分布差异失效问题
多智能体LLM谄媚错误源于预训练基模型而非RLHF
大语言模型历史有害行为会引导后续决策走向不安全
自动化对齐研究或生成误导安全评估致误部署不对齐AI
AIGC规模超越偏好:千万用户数据揭示内容生态重塑
多示例思维链上下文学习让大模型真正学会推理
生成模型水印应作为监控原语,内部监控不可回避
因果感知端到端自动驾驶:自车中心联合场景建模
几何与谱分析揭示低秩预训练泛化能力的本质差异
多Agent LLM分布式信息集体推理存在系统性失败
MinT:面向百万级大模型训练与服务的托管基础设施
RIGVid:机器人仅凭模仿AI生成视频完成复杂操作,无需物理演示
AI co-mathematician 工作台:数学家与AI代理协作探索开放研究
高阶线性注意力HLA实现长上下文因果流式交互
低秩预训练几何与谱研究:泛化能力与全秩训练对比
AI Harness工程:运行时基座提升基础模型软件代理可靠性
大语言模型规模定律与架构设计:推理效率权衡研究
CodeClash基准:面向目标导向软件工程的AI编码能力评估
AI co-mathematician工作台:用智能体加速开放数学研究
MoE压缩新发现:生成任务中专家剪枝优于合并