MemSkill:让大模型代理的记忆技能可学习与自演化
用细粒度事实核查与领域适应减少医疗LLM幻觉
大语言模型评估作弊与高估:一次性密码本框架下的基准研究
ChunkLLM:轻量可插拔框架加速大模型推理
RouteScan通过专家路由遥测实现MoE大模型非侵入式安全审计
AgentFugue:多对等智能体通过集体推理扩展长期任务能力
LiveMCP-101 基准:压力测试与诊断 MCP 智能体的复杂查询
RLDF:去噪反馈强化学习用于扩散语言模型策略损失估计
语法引导稀疏注意力:提升Transformer效率与可解释性
大语言模型长时间编程会话中人格漂移被ContextEcho基准揭示
扩散语言模型填充提取训练数据风险被低估
llama.cpp CUDA实现快速沃尔什-哈达玛变换
Ollama v0.30.0 改用 llama.cpp 架构原生支持 GGUF 并引入 MLX 加速
Nvidia Vera CPU 基准测试:Olympus 核心性能表现强劲
Cloudflare Flagship正式上线:面向开发者的全栈边缘平台
千问AI眼镜线上零售额份额超30%,稳居行业第一
红杉华兴投了AI产品社区观猹,02年创始人仲泰打造大众点评式平台
World-R1 用强化学习为文本生成视频加上 3D 约束
MVISTA-4D:单视图RGBD生成任意视角4D场景,赋能机器人操作
TrackRef3D实现3D高斯泼溅的多视图一致开放世界指代分割
JLT:在FLUX.2 VAE潜空间上进行干净预测的130M扩散Transformer
RT-Lynx用半结构化稀疏性削减扩散模型近半FLOPs
华为推出AI DC全栈数据基础设施方案,加速行业智能化
PhyWorldBench基准:评估文生视频模型的物理真实性
Xreal携手谷歌,智能眼镜行业终于迎来转折点
快手Keye2.0引入DSA注意力,开启多模态强化推理新范式
去中心化LLM协作新方法:多智能体Actor-Critic优化
Kalai-Vempala概率框架揭示大模型幻觉率等于训练数据缺失质量
最新基准LiveK12Bench:多模态大模型真能通过高中考试
AI代理也会衰老:部署系统的寿命工程挑战
OmniInteract:实时全模态流式交互基准测试
语言模型自我验证蒸馏:无需外部数据即可自我优化推理能力
阿里千问3.7编程能力全球第二,仅次于Claude
Claude Code 日常驱动:技能、子代理、插件与 MCP 集成实践
恒生港美科技指数将新增SpaceX为成分股
图灵奖得主萨顿联手他山科技,打造“能犯错”的机器人幼儿园
DeepSeek自动研究Skill:人类仅需动脑2小时即可完成论文
雷达-摄像头BEV多任务学习提出跨任务注意力桥接
GeoSolver 以细粒度过程监督扩展遥感视觉推理的测试时推理
引导式Token稀疏扩散模型解决推理性能瓶颈
HiSpec层次化推测解码技术加速大模型推理验证
因果表示学习技术助力推荐系统实现泛化
DIET:合并任务重要性分数实现LLM维度级全局剪枝
LLM推荐基准数据泄漏陷阱:评估结果虚高不可信
Transformer通过上下文学习近似后验预测分布
LeJEPA在加性噪声下可线性恢复世界潜在变量
复旦系触觉具身创业公司获近亿元天使轮融资
TriProRep结构感知预训练提升蛋白质结构预测
Vital Trace提出协议约束患者状态推理,实现纵向临床轨迹分析
TABX:高通量多智能体强化学习沙盒战斗模拟器