秒哒3.0让8岁小学生想法秒变手机APP,AI应用门槛归零
Ardent 推出秒级 Postgres 沙箱,零迁移供 AI 编码 agent 测试
CrewAI 1.14.5 废弃CrewAgentExecutor,新增状态恢复与搜索增强
ReBel:基于信念一致性奖励的长程智能体信用分配方法
Gemini Omni Reddit讨论 vs 官方测评:哪个更真实?
DecisionBench:面向长期代理工作流的多模型委托基准发布
Ardent 零迁移 Postgres 沙箱,秒级创建供 AI 编码代理测试
Google Gboard 集成 Gemini 听写,首登三星与 Pixel 手机
Anthropic 向下拓展市场,小企业主成AI平台新战场
Nvidia发布Nemotron扩散视觉语言模型8B
OScaR提出用奥卡姆剃刀实现LLM极端KV缓存量化
腾讯AI投入拖累利润,资本开支仍将显著扩张
LLM代理记忆系统:超越原子事实的终身记忆新范式
CrewAI 1.14.5 弃用CrewAgentExecutor 改进沙箱与搜索工具
GRASP:确定性论点排序方法解决LLM评判不一致问题
Spherical KV 通过角度域注意力与率失真保留优化长上下文推理
OpenCompass 发布大语言模型通用评估平台
Transformer在数独求解中线性表示高度结构化世界模型
结构化推理信号优于纯代码,新研究揭示提升数学推理关键
ZeroUnlearn提出大语言模型少样本知识遗忘方法
Medicare首创AI医疗代理支付机制,科技界尚不知情
秒哒3.0让8岁小学生用手机做APP,AI应用门槛归零
腾讯AI投入拖累利润增速,Q1研发225亿资本开支319亿
重新思考终身学习LLM智能体记忆:超越原子事实
AI会议同行评审中ChatGPT修改文本的规模估计方法
OpenCompass通用大语言模型评估平台上线
VL-DPO:视觉语言引导的自动驾驶偏好对齐微调
大语言模型基准数据集必须抗污染以避免评估失真
OmniGUI 发布首个全模态智能手机 GUI 代理步骤级基准
ZeroUnlearn实现大语言模型少样本知识遗忘
神经模拟器能量守恒失效:扩散模型能量波动超真实值数万倍
微调大语言模型实现自动化算法设计专用化
ORCA框架:推理时结构化推理提升视觉语言模型抗幻觉与对抗鲁棒性
新研究揭示结构化推理信号比纯代码更有效提升数学推理能力
DecisionBench:面向长期代理工作流紧急委托的多模型基准测试
ReBel方法:基于信念奖励解决长程任务信用分配难题
Mistral AI v1.10.0 发布:Tokenizer v15、推理增强与 Python 3.14
场景分割策略实现黑盒越狱攻击文本到视频模型
PAVE认知架构:生成式智能体在紧急情况下的合理违规
HiDe提出层次解耦:重新审视高分辨率多模态大模型的缩放局限
OScaR:用奥卡姆剃刀原理实现大模型极低比特KV缓存量化
Spatial-MLLM:仅2D输入增强多模态大模型空间智能
VLAs混合训练:思维链增强机器人动作规划
噪声校正GRPO方法:消除奖励噪声实现无偏梯度
ChatGPT对AI会议同行评审影响:大规模监控AI修改文本
PiKV:面向混合专家模型的KV缓存并行管理系统
MaxShapley算法实现生成式搜索公平上下文归因与激励兼容
Transformer在数独求解中建立结构化世界模型
扩散模型预测物理轨迹能量偏差巨大,神经网络难以学习守恒量
Exact Linear Attention 通过核函数精确分解实现线性复杂度无近似注意力