基于无监督越狱激活模拟的 LLM 安全对抗训练新方法
MVR-cache:多向量检索与学习型提示分割优化语义缓存
Transformer模型借助范畴论函子实现类比推理形式化
Reflect-Guard用逻辑自反思增强LLM安全分类器抗对抗攻击
AAI框架提出精算接口为AI代理动作定价并执行边界控制
CUA-Gym规模化可验证训练环境与任务,赋能计算机使用代理
llama.cpp 新增对 Gemma4 因果语言模型架构的转换支持
SaaS-Bench实测:Claude等大模型全自动办公通过率不足4%
StreamChar:解耦编排实现长时流式角色音视频生成
Blink采用动态视觉token分辨率增强多模态理解
PixelWizard:分层解耦全局局部,实现超大规模高分辨率视频生成
StreamOV基于证据引导记忆与响应触发实现流式全模态视频理解
Pantheon360基于3D感知360度视频扩散生成数字孪生
利用标注者分歧校准概率目标检测器
校准交互方法解决组合图像检索查询语义歧义
SRUG:阴影引导的生成式城市场景重光照方法
FDDet提出FDD-48数据集与半监督框架实现数据高效食品缺陷检测
遥感组合图像检索方法在地球观测中的迁移性基准测试
物理世界建模统一3D场景理解,多视觉任务融合新方法
VideoMAE中概念激活向量实现物理因果方向控制
多轮LLM现新型后门攻击:回合结构信号可触发恶意行为
FairJudge:可弃权多模态评判器用于文本到图像模型公平性与对齐评估
高熵token是视觉语言模型多模态薄弱点
弱到强泛化改进随机特征岭回归的缩放定律
微调掩蔽扩散模型实现可证明的自校正能力
动态优化与安全指标注入高效越狱T2I多模态安全过滤器
联邦Sketching LoRA框架实现异构客户端LLM高效微调
LLMTabBench:从零到少样本的LLM表格分类评估
DPO离线RLHF遭受高效偏好投毒攻击
SaaS-Bench:用真实SaaS评估计算机使用智能体的专业工作流能力
后训练语言模型能识别并响应自身生成内容
LLM学习专家诊断推理:基于NEJM临床病理会议案例
Walsh谱旋转与Intel auto-round实现极端低位LLM量化
OmniSapiens:异构感知相对策略优化的社交行为处理基础模型
九国公众对军事AI态度调查:超越“杀人机器人”迷思
大语言模型微调生命周期安全:威胁、防御与未来方向
几何感知生成自编码器实现无标签语言模型流形干预
LLM编程代理驱动即时系统:从零合成专用核心存储
LLM智能体社会动态行为新研究:合作机制比结果更重要
AgentHijack:首个评估计算机代理在环境干扰下鲁棒性的基准测试
KT4EQG:基于知识追踪的个性化习题生成方法
FrontierOR基准测试评估LLM设计大规模优化算法能力
自适应进化CoT越狱攻击暴露LLM推理安全新漏洞
MEMOR-E:融合上下文与微调LLM的阿尔茨海默症辅助机器人
CLiViS用语言-视觉协同增强具身视觉推理认知地图
Agent-X:视觉中心代理任务深度多模态推理基准
CARTBENCH:视觉语言模型对中国艺术理解、解读和真实性的评估
VCF:推理时向文本扩散模型注入图像引导的双重条件方法
无奖励对齐法解决多目标冲突提升大语言模型对齐效果
Claw-Anything:衡量个人助理广泛访问用户数字世界的基准