字节跳动开源多模态模型Vidi1.5-9B,支持视频与音频理解
字节跳动推出ATI模型:基于Wan2.1的图像转视频方案
字节跳动OneReward:基于FLUX.1的图像生成奖励模型
字节跳动开源Valley3-32B-Think多模态推理模型
字节跳动发布OneReward图像到图像生成模型
字节跳动推出ATI图像转视频模型,基于Wan2.1微调
字节跳动开源Vidi1.5-9B:基于Gemma-2的视频音频多模态模型
字节跳动Wan2.1-14B图像提示视频生成模型上线
字节跳动ChatTS-8B时间序列对话模型发布
阿里巴巴发布Ovis2.6-80B-A3B视觉语言模型,80B参数仅3B激活
字节跳动FaceCLIP模型实现文本驱动的面部主题个性化生成
字节跳动Dolphin-1.5多模态模型上线,专注文档智能解析
字节跳动Dolphin-1.5视觉模型专注文档理解与OCR
字节跳动推出Video-As-Prompt-Wan2.1-14B图像转视频模型
月之暗面开源Kimi-Audio-7B,集语音识别理解与生成为一体
阿里巴巴发布8B深度研究智能体Marco-DeepResearch
月之暗面开源Kimi-Linear-48B-A3B-Base模型
月之暗面发布Kimi-Audio-7B音频语言模型
阿里巴巴开源Ovis-Image-7B文生图模型
字节跳动发布Sa2VA-Qwen3-VL-2B多模态对话模型
MiniMax发布SynLogic-Mix-3-32B混合逻辑推理模型
阿里巴巴开源80B参数多模态模型Ovis2.6-A3B
Stability AI发布sv4d2.0视频转4D模型
智源研究院发布基于Qwen3-0.6B微调的文生图模型URSA
BAAI 发布 URSA-0.6B-FSQ320 文本生成视频模型
MiniMax 推出 SynLogic-Mix-3-32B 混合逻辑推理模型
智源研究院推出 RoboBrain-X0-Preview 多模态机器人模型
BAAI推出URSA-0.6B-IBQ1024:基于Qwen3微调的文生图模型
腾讯混元开源多模态图片描述模型HunyuanCaptioner
BAAI开源URSA-1.7B-FSQ320文本生成视频模型
BAAI开源URSA-1.7B-IBQ1024文生图模型
智源RoboBrain2.0-3B多模态机器人模型发布
智源发布RoboBrain-X0-Preview机器人多模态模型
智源AI开源URSA-1.7B文本生成视频模型
HuggingFaceTB发布100M参数MoE文本生成模型nanowhale-100m
OpenGVLab发布ScaleCUA-32B多模态Agent模型
昆仑万维发布Unipic3统一多模态模型,支持任意到任意任务
BAAI发布基于Qwen3的URSA-1.7B文生图模型
智源开源机器人灵巧操作模型RoboBrain-Dex
BAAI发布RoboBrain2.0-3B机器人视觉语言模型
HuggingFace发布ORPO训练141B参数Mixtral文本生成模型
InternLM 开源 14B 参数代码生成模型 JanusCoder
HuggingFaceTB 发布 SmolVLM-500M-Instruct 小参数多模态模型
HuggingFaceTB推出100M参数MoE文本生成模型nanowhale-base
OpenGVLab推出ScaleCUA-32B视觉语言模型
上海AI实验室开源JanusCoder-14B代码生成模型
百川智能推出Baichuan-Audio-Instruct音频指令模型
SandboxAQ brings its drug discovery models to Claude — no PhD in computing requi
苹果发布多项新无障碍功能,同步升级Apple Intelligence
用Claude Code编写10万行Rust代码的经验总结