VistaHop 基准评估多跳视觉推理,推动深度搜索迭代认知
PIWM框架实现零售场景主动意图推断与干预决策
字节跳动发布Bernini-R-Diffusers图像文本转视频模型
GLINT:稀疏门控实现放射学细粒度视觉语言对齐
TBS:多智能体社交模拟中的“思考-再表达”内省机制
MedCUA-Bench:评估临床AI代理在医疗GUI可靠性的基准
世界模型与多模态大语言模型:具体与抽象推理互补
EvoDS:自我进化数据科学智能体实现技能学习与上下文管理
LAP:面向自主科学的智能体-仪器互操作协议
大推理模型并行推理路径剪枝首个系统化分类法
多轮越狱攻击下GPT-4.1-mini医疗对话不安全率升至80%
LEAP框架赋能通用大模型实现形式数学定理证明SOTA
SkillPyramid分层技能整合框架驱动智能体自我进化
SegTune:基于扩散Transformer的结构化细粒度歌曲生成控制
首个字节原生大语言模型实现原始字节直接理解与应答
TriEval:资源高效评估LLM偏见、毒性及真实性的新流水线
FSA-GRPO:强化学习教听觉LLM利用小样本演示
图神经网络解释机制或加剧决策逻辑泄露与模型窃取风险
KnapSpec将自推测解码层选择重构为背包问题提升吞吐量
DDOR:大模型过度拒绝的可解释测试与修复新方法
ReLoRA:知识重用适配方法加速LLM服务快速迭代部署
窄秘密忠诚植入Qwen模型,暗中诱导用户极端行为
Libra 高效管理 Agentic RL 后训练中的长尾非稳态资源
小模型是GRPO中策略级多样性的天然探索者
CodeHacker自动生成对抗性测试用例,暴露编程竞赛方案漏洞
等变编码器与预测器训练保持精确等变实现对称群零样本泛化
机制设计不足以让LLM智能体合作,亲社会智能体更优
后验采样实现共形语言建模,减少大模型幻觉
vLLM语义路由器:信号驱动决策路由实现混合模态模型
模型提取攻击绕过单客户端防御假设,威胁军事C2系统
SeeTraceAct:基于可见性感知的跨实施例演示视频潜在规划
KITScenes发布多模态自动驾驶数据集:400米激光雷达与4D成像雷达
Vision Inference Former 维持多模态大模型视觉一致性
AAM多模态基础模型:统一人类注意力建模新范式
Any2Poster 发布八种输入源海报生成评估基准
Multi^2分层多智能体框架解决LLM长期决策目标漂移问题
Kapa.ai 详解图像索引方法以提升 RAG 检索效果
概率电路:快速且富有表现力的多字节预测
动态短卷积引入输入依赖滤波器改进Transformer
文生图模型对文本编码器信息的依赖低于预期
大语言模型微调安全措施应基于能力目标
LLM评审者自偏好偏差的量化与缓解方法
Pluto.jl 1.0正式发布:Julia 响应式交互笔记本
AURA:动作门控记忆实现机器人策略恒定VRAM推理
利用幻觉拒绝采样,大模型实现长文本可靠生成
WildRoadBench 提出无人机道路损伤视觉定位基准测试
大语言模型推理新知识还是抄袭?科学界两派叙事对立
研究揭示LLM自动评分系统面临提示注入攻击风险
无训练多概念LoRA组合:提示感知权重提升图像生成一致性
DriftSched:面向多租户GPU推理的运行时Token漂移自适应QoS调度