video-search-and-summarization:实践指南

作者:袖梨 2026-10-02

实际看video-search-and-summarization,先要确认它的用途:NVIDIA AI 视频搜索和摘要蓝图 (VSS) 是一个 GPU- 加速参考架构,用于构建具有实时验证警报、可视化问答和自动报告功能的视频分析代理。视频制作里,素材、节奏、编码和最终画面容易不一致。我会拿一组已有素材完成一段短样片,检查素材路径、渲染结果、音画同步和导出格式。它适合有真实素材并需要稳定视频产出的创作者;采用前仍要看维护状态和试跑结果。

NVIDIA-AI-Blueprints/video-search-and-summarization 项目截图 1

NVIDIA AI 蓝图:视频搜索和摘要 (VSS)

构建 GPU- 加速视频 AI 代理,使用自然语言对实时或录制视频进行搜索、分析、总结和推理。

NVIDIA AI 视频搜索和摘要蓝图 (VSS) 结合了视觉语言模型、RAG 和 NVIDIA NIM 微服务,可提供实时视频分析、可视化问答、警报验证、剪辑检索、长视频摘要。

  • 使用自然语言查询搜索视频流或档案
  • 总结视频时长
  • 提出视觉问题并自动生成报告
  • 使用 VLMs 检测和验证实时警报

尝试演示 · ⚡ 快速入门 · 文档 · 架构 · 最新版本

概述

NVIDIA 视频搜索和摘要蓝图 (VSS) 提供了一套参考架构,用于构建视觉代理和 AI- 支持的视频分析应用程序。这些架构汇集了加速视觉微服务、视觉语言模型 (VLMs) 和大型语言模型 (LLMs),因此您可以在现有应用程序中使用它们,作为独立的微服务,或作为更大的视觉代理的一部分。

VSS 分为三个处理和分析领域:实时视频智能(特征提取、嵌入和流理解,并将结果发布到消息代理)、下游分析(将元数据丰富到轨迹、事件和经过验证的警报)以及代理和离线处理(用于搜索、问答、摘要和剪辑检索的编排工具,包括通过模型上下文协议)。

该存储库实现了蓝图,并为自然语言视频代理的 NVIDIA 构建体验 提供支持 - 搜索、摘要、视觉问答和相关工作流程 - 由生成式 AI、VLMs 和 VLMs 提供支持LLMs 和 NVIDIA NIM 微服务在下面的堆栈中配置。

用例/问题描述

NVIDIA AI 视频搜索和摘要蓝图解决了部署能够与大量存储和流式视频数据交互的视觉代理的挑战。这可用于创建视觉 AI 代理,该代理可应用于多种用例,例如监控智能空间、仓库自动化和 SOP 验证。这一点非常重要,因为快速、准确的视频分析可以带来更好的决策并提高运营效率。

代理工作流程

我们提供了多个参考 代理工作流程,它们演示了代理如何利用各个组件:

工作流程 描述
问答和报告生成(快速入门) 视频检索、基于VLM-的问答、短视频片段的报告生成
警报验证 使用感知(对象检测、跟踪)和行为分析实时处理视频以生成警报,随后使用 VLM 进行验证以减少误报
实时警报 通过VLM连续处理视频流以进行异常检测
视频搜索 使用视频嵌入在视频档案中进行自然语言搜索 (alpha)
长视频总结 通过对密集字幕进行分块和聚合来分析和总结扩展视频记录

软件组件

  1. NIM 微服务:以下是此蓝图中使用的模型:

    • Cosmos3 Nano Reasoner
    • NVIDIA Nemotron 3.5闪电30B A3B
  2. 实时视频智能:实时视频智能层从视频数据中实时提取丰富的视觉特征、语义嵌入和上下文理解,将结果发布到消息代理以进行下游分析和代理工作流程。它提供了三个用于处理视频流的核心微服务。

  3. 下游分析:下游分析层处理并丰富实时视频智能微服务生成的元数据流,将原始检测转化为可操作的见解和经过验证的警报。

  4. 代理和离线处理:顶级代理利用模型上下文协议 (MCP) 通过统一的工具界面访问视频分析数据、事件记录和视觉处理功能。它集成了多种基于视觉的工具,包括使用视觉语言模型的视频理解 (VLMs)、使用嵌入的语义视频搜索、用于扩展镜头分析的长视频摘要以及视频 snapshot/clip 检索。

目标受众

该蓝图旨在简化设置,提供广泛的配置选项,需要技术专业知识。它的目的是:

  1. 视频分析师和 IT 工程师: 专注于分析视频数据并确保高效处理和汇总的专业人员。该蓝图提供一键式部署步骤、易于管理的配置和即插即用模型,使其可供早期开发人员使用。

  2. GenAI 开发人员/机器学习工程师: 需要针对特定用例定制蓝图的专家。这包括修改独特数据集的管道并根据需要微调 LLMs。对于高级用户,该蓝图提供了详细的配置选项和自定义部署可能性,从而实现了广泛的自定义和优化。

存储库结构概述

目录 描述
services/agent/ 视频搜索和摘要代理(Python)。包含 src/agent/(工具、代理、APIs、嵌入、评估器、视频分析)、tests/、stubs/、docker/ 和 3rdparty/。请参见 services/agent/README.md。
services/ui/ 前端 monorepo(Next.js、Turbo):apps/(nv-metropolis-bp-vss-ui、vss-chat)和共享 packages/。请参见 services/ui/README.md。
services/analytics/ 用于处理实时视频智能元数据的下游分析服务。包含行为分析流处理和用于查询分析结果的 REST APIs。
services/analytics/behavior-analytics/ 用于空间 AI 分析、事件检测、智能城市、仓库、回放和其他行为分析应用程序的 Python 流管道。包括应用程序入口点、配置、Docker 支持、测试和详细指南。参见 services/analytics/behavior-analytics/README.md。
services/analytics/video-analytics-api/ 用于 VSS 视频分析数据的 Node.js 和 Express REST API 服务。公开 Elasticsearch 支持的指标、跟踪器、框架、行为、集群、事件、传感器、配置、警报和事件端点。请参见 services/analytics/video-analytics-api/README.md。
deploy/ 部署配置、Docker Compose 和 Helm 图表:NIM 模型配置、开发人员配置文件(dev-profile-base、dev-profile-search、dev-profile-alerts、dev-profile-lvs)、基础服务、LVS、RTVI、 VLM-as验证者、VST和根compose.yml。还包含 deploy/docker/scripts/ — Brev 可启动笔记本和开发配置文件/补丁脚本。
tools/message-broker-consumers/ 多处理 Redis 和 Kafka 消费者,解码来自 streams/topics 的 VSS protobuf 消息并将其导出为 JSON Lines 文件以进行检查、调试或离线处理。请参见 tools/message-broker-consumers/README.md。
tools/sdg-postprocessing/ 用于合成数据生成工作流程的数据集后处理实用程序:语义标记助手、原始数据健全性检查、RGB/depth/video 转换以及 MTMC- 兼容数据集的真实值转换。请参见 tools/sdg-postprocessing/README.md。
tools/rtvi-cv-mv3dt-utils/ 用于生成 MV3DT RTVI-CV 配置工件的离线实用程序,包括用于仓库 MV3DT 部署的每个摄像机 camInfo 投影配置和 MQTT publish/subscribe 拓扑文件。请参见 tools/rtvi-cv-mv3dt-utils/README.md。
tools/logstash-plugins/ 用于 ELK 摄取管道的自定义 Logstash 插件。包括 input/redis-stream/ (logstash-input-redis_stream),这是一个 Java 输入插件,可通过消费者组 (XREADGROUP) 从 Redis Streams 读取数据,并具有可选的 Protocol Buffer 解码功能。请参见 tools/logstash-plugins/input/redis-stream/README.md。
skills/ agentskills.io- 与 VSS 兼容的代理技能:带有 SKILL.md frontmatter 的独立技能目录,按类别分组(deployment/、operations/、 tools/、benchmarking/)加上顶级 vss-build-vision-ai。涵盖搜索、摘要、警报、VIOS、RT-VLM、LVS 和其他相关工作流程的部署和使用 - 请参阅 skills/README.md 中的目录和安装说明。
libs/analytics/spatialai-data-utils/ 空间 AI 数据实用程序 (SDU):NVSchema / 地面实况 / 校准 / Sparse4D 加载器、相机校准 + 分组(BEV 组原点 / 每组扇出)、3D↔2D 几何、多摄像头 3D-bbox 可视化、检测(mAP)+跟踪(HOTA、CLEAR、身份、计数)评估器、NVSchema 结果转换器和视频↔帧实用程序。参见 libs/analytics/spatialai-data-utils/README.md。

文档

有关此蓝图的详细说明和附加信息,请参阅 官方文档。

先决条件

获取API密钥

  • NVIDIA AI 本地主机 NVIDIA NIM 需要企业开发人员许可证。
  • API 目录键:
    • NVIDIA API 目录 或 NGC (生成密钥的步骤)

容器镜像可用性

开发容器注意事项: 标记为 develop-* 或 nightly-* 的图像是预发布工件,仅用于开发和测试。它们可能会更改,恕不另行通知,并提供“AS IS”。官方发布镜像通过NVIDIA NGC发布。对于生产部署,仅使用 NGC 中已完成 NVIDIA 发布审核的版本化发布映像。

硬件要求

平台要求可能会有所不同,具体取决于用于 VSS 的配置和部署拓扑以及 VLM、LLM 等依赖项。有关经过验证的 GPU 拓扑的列表以及要使用的配置,请参阅 GPU 要求。

快速入门指南

可启动部署

非常适合: 快速开始制作您自己的视频,无需担心硬件和软件要求。

按照 文档 和 deploy/docker/scripts 目录中的笔记本中的步骤完成所有先决条件,并在 2xRTX PRO 6000 中使用 Brev Launchable 部署蓝图SE AWS 实例。

  • deploy/docker/scripts/deploy_vss_launchable.ipynb:此笔记本专为使用临时存储的 AWS CSP 量身定制。

Docker Compose 部署

非常适合: 在您自己的硬件或裸机云实例上部署 VSS 代理。

系统要求

  • OS:
    • x86 主机:Ubuntu 24.04
    • DGX站(GB300):DGX OS 7.6.0
    • DGX-SPARK: DGX OS 7.5.0
    • IGX-THOR(T5000和T7000):IGX-SW 2.0生产(LTS),包括IGX OS 2.0(Ubuntu 24.04)
    • Jetson AGX Orin、AGX-THOR 和 Jetson Orin NX:JetPack 7.2(Jetson Linux/L4T r39.2)
  • NVIDIA 驱动程序:
    • 595.58.03(使用 Ubuntu 24.04 的 x86 主机)
    • 595.58.03(DGX 站 GB300)
    • 580.173.02 (DGX-SPARK)
    • 580.00,与 IGX-SW 2.0 捆绑(IGX-THOR)
    • 595.78(Jetson AGX Orin、AGX-THOR 和 Jetson Orin NX)
  • NVIDIA容器工具包:1.17.8+
  • Docker 引擎:28.3.3 <= Docker 引擎 < 29.5.0
  • Docker 撰写:v2.39.1+
  • NGC CLI: 4.10.0+

Docker 上限: Docker Engine 29.5.0+ 可能无法拉取 NGC- 托管映像。使用 Docker Engine 28.3.3 或低于 29.5.0 的其他受支持版本。

请参阅此处的 先决条件部分,了解安装详细信息。

相关文章

精彩推荐