大语言模型安全对齐需实现上下文不变性以抵御对抗性改写
大语言模型类人推理的持续涌现被追踪
Orchard开源代理建模框架,赋能LLM自主智能体开发
LLM/RAG应用就绪度评估框架:集成可观测性与CI质量门
RRB基准测试:Claude在文本扰动下推理能力落后于其他前沿模型
字节跳动发布BindWeave图像转视频模型
字节跳动Timer-S1时间序列预测基础模型发布
月之暗面开源轻量级多模态思考模型Kimi-VL-A3B
智源开源RoboBrain2.5-8B-MT多模态模型
字节跳动USO模型实现主题个性化与风格迁移图像生成
ChronoMedicalWorld 模型:从纵向护理数据学习患者轨迹预测
阶跃星辰发布Step-Audio-R1.1音频推理模型,支持链式思维
基于世界模型模拟推理的通用智能体规划
BAAI开源Emu3.5视觉分词器,支持自定义代码与安全张量
BAAI发布URSA-1.7B文本到图像模型
LANG框架以语言自适应提示指导强化多语言推理能力
昆仑万维开源Skywork-UniPic-1.5B多模态统一模型
月之暗面发布 Moonlight-16B-A3B-Instruct,16B参数激活仅3B
智源基于Qwen3-VL发布RoboBrain2.5-4B机器人视觉模型
五条PyTorch代码SVD分解lm_head权重揭示LLM秘密词典
字节跳动UMO模型实现文本到图像的主体个性化生成
分布能量基模型用于结构化LLM推理的不确定性感知验证
稀疏注意力蒸馏实现顺序替换,降低Transformer推理成本
GeoX:自我博弈与可验证奖励驱动的地理空间推理框架
查询感知流扩散方法为图RAG提供检索理论保证
SceneCode:用可执行世界程序生成可编辑铰接物体室内场景
多模型LLM调度器:CPU-GPU卸载与抢占的实证洞察
SSR自对弈强化学习训练超级智能软件代理
Argus提出证据组装方法,实现可扩展深度研究智能体并行搜索
左医科技:AI医疗落地从赢得科室主任信任开始
IBM发布Granite Switch 4.1-3B预览版语言模型
StarCoder2-15B-Instruct 指令微调版发布,专注代码生成与对话
Claude Opus 4.6 借助 Rocq-MCP 自主证明 10 道 Putnam 竞赛题
百度健康以场景为锚,AI破局大健康产业供需矛盾
The Path AI疗法模型心理健康安全评分95,远超消费级产品
智源研究院发布Emu3.5视觉分词器模型
艾迪普元典大模型:以AI治理激活企业沉睡数字资产
百川智能发布14B参数医疗大模型Baichuan-M1-14B-Base
Mistral发布Voxtral-4B多语言文本转语音模型
多智能体强化学习实现超人类安全敏捷赛车
MLCommons Chakra:标准化执行轨迹赋能AI基准测试与协同设计
SEGS 提出结构能量引导采样解决文本到3D生成的视角不一致问题
HAVEN分层对齐多模态基准统一视频理解评估
异构感知数据集调度实现音频大语言模型高效训练
小语言模型的可执行推理支架评估:CGR协议
昆仑万维发布Matrix-Game-3.0图像文本转视频模型
百川智能发布Baichuan-Omni-1d5全模态基础模型
特朗普推迟AI安全行政令,称原语言或成阻碍
智源发布RoboBrain2.5-8B-MT多模态模型
Dr.LLM动态层路由:按需分配计算深度提升效率