扩散模型预测物理轨迹能量偏差巨大,神经网络难以学习守恒量
Exact Linear Attention 通过核函数精确分解实现线性复杂度无近似注意力
QAM算法借助伴随匹配实现连续动作强化学习策略优化
自适应残差更新引导法低开销缓解大视觉语言模型幻觉
Motif-Video 2B技术报告:用不到10M视频和10万GPU小时实现强文生视频
OmniGUI:首款评估全模态智能手机环境GUI代理的步级基准
阶跃星辰推出音频推理模型 Step-Audio-R1.1
IBM发布Granite Vision 4.1-4B多模态视觉语言模型
Spotify联合ElevenLabs推出有声书创作工具,作者可自由发行
多智能体LLM辩论启用Wald SPRT动态计算调控器
PiKV:面向混合专家模型的并行分布式KV缓存管理系统
Spatial-MLLM:仅用二维输入提升多模态大模型空间智能
LLM基准数据集应具备抗污染能力以保障评估可靠性
HiDe层次解耦纠正高分辨率MLLM的zoom-in认知误区
微调大语言模型用于自动化算法设计
VL-DPO:视觉语言引导微调实现自动驾驶偏好对齐
推理后端对LLM可复现性的量化影响:静默超参数
WARC-Bench发布438项GUI子任务基准,评估多模态AI代理
损失自适应学习率微调防止大语言模型灾难性遗忘
生成式AI交互学习中模型塌缩的发生条件
噪声修正GRPO:从有噪奖励到无偏梯度
SceneSplit越狱攻击:用场景分割绕过文本生成视频模型安全机制
LionMuon交替谱与符号下降降低训练迭代成本
首个针对掩码扩散语言模型的后门攻击方法
MASFactory提出基于有向计算图的LLM多智能体编排框架
字节跳动开源HuMo图像生成视频模型,支持ONNX部署
深度求索发布Janus-Pro-1B:一款任意到任意多模态统一模型
混合光学-数字架构实现可扩展节能深度伪造视频检测
TideGS外存优化实现单GPU训练超十亿3D高斯溅射基元
Wald-SPRT动态调控多智能体LLM辩论轮数
QAM算法:伴随匹配Q学习高效优化连续动作扩散策略
Phantom:联合视觉与潜在物理动力学的物理注入视频生成
MVI-Bench:评估大型视觉语言模型对误导性视觉输入鲁棒性的新基准
Motif-Video 2B:以不足千万片段和十万GPU小时实现强视频生成
AnyAct:从非人类角色视频直接重演可编辑人类动作
首个针对掩码扩散语言模型的后门攻击方法提出
抖音推荐系统实现端到端万级用户行为序列建模
LongLive-2.0 基于 NVFP4 并行架构加速长视频生成全流程
沉默超参数:量化推理后端对大语言模型可重复性的影响
Artifact-Bench:评估多模态大模型对AI视频伪影的检测能力
MaxShapley:生成式搜索公平归因算法推动内容补偿机制
MSAlign:对齐分子与质谱基础模型提升代谢物鉴定精度
HCLBind提出分层对比学习预测多域蛋白质-配体结合
Artifact-Bench评估多模态大模型对AI视频伪影的检测与判别
合成数据污染下结构化交互学习的模型崩溃条件
LionMuon:交替谱与符号下降实现高效训练
xAI推出Grok Skills与OpenClaw集成,支持文档生成和工作流自动化
场景-动作提示融合框架实现连贯文本到视频故事生成
损失自适应学习率微调方法防止大模型灾难性遗忘
小米EV世界模型:融合重建与生成的自动驾驶统一框架