YAOTU INSIGHTS

VSS横向扩展指南:如何把视频AI处理规模从单机扩展到生产级

VSS横向扩展指南:如何把视频AI处理规模从单机扩展到生产级
VSS横向扩展指南如何把视频AI处理规模从单机扩展到生产级【免费下载链接】video-search-and-summarizationNVIDIA AI Blueprint for video search and summarization (VSS) is a GPU-accelerated reference architecture for building video analytics agents with real-time verified alerts, visual QA, and automated reporting. The VSS Blueprint uses vision language models (VLMs) such as NVIDIA Cosmos, LLMs such as NVIDIA Nemotron, RAG, and NVIDIA NIMs.项目地址: https://gitcode.com/GitHub_Trending/vi/video-search-and-summarizationVSSNVIDIA AI Blueprint for Video Search and Summarization是一个 GPU 加速的视频搜索与摘要参考架构支持实时告警核验、视觉问答和自动报告生成。当你接入的摄像头从几路变成几百路、视频时长从分钟级变成小时级时如何横向扩展视频AI处理规模本指南带你用 5 个关键步骤把 VSS 从单机 Demo 平滑扩展到多节点生产环境。一、为什么 VSS 天生适合横向扩展视频 AI 的瓶颈通常不在“算法”而在三件事GPU 推理算力、消息吞吐、存储与检索。VSS 的架构天然为这三件事留出了水平扩展空间VSS 整体分为三层每层都有独立的扩展维度处理层核心组件扩展方式实时视频智能RT-CV、RT-VLM、RT-Embedding按并发流数增加副本共享 GPU 池下游分析行为分析、告警核验无状态微服务直接加副本智能体与离线处理搜索、问答、长视频摘要LLM/VLM 通过 HPA 自动扩缩容这种分层解耦意味着扩流路加推理副本扩并发加分析副本扩延迟敏感的模型加 HPA互不干扰。二、扩展路径从 Docker Compose 到 KubernetesVSS 提供两条递进的部署路线官方文档见 docs/deployments.mdx。阶段 1单机验证Docker Compose快速体验走 Docker Compose 路线官方提供 4 个开发者配置developer profilebase问答与报告、alerts告警、search搜索、lvs长视频摘要。它适合功能验证和性能摸底但不适合承载生产流量。阶段 2多节点生产Helm K8s真正的横向扩展发生在 Kubernetes 上Helm 部署指南见 docs/helm-deployment.mdxChart 源码位于 deploy/helm/集群要求Kubernetes ≥ 1.34 GPU Operator NIM Operator 支持ReadWriteMany的 StorageClass每个开发者配置都有对应的 Helm Chartbase/alerts/search/lvs可通过 values 文件调整副本数、GPU 分配集群内启动时间较长镜像拉取 模型下载 预热全部 Pod Ready 通常需要20–25 分钟属于正常现象 扩展经验先在一个命名空间里把单个 profile 跑通再用命名空间隔离不同业务alerts / search / lvs最后按流数压测确认瓶颈位置。三、扩流的钥匙中间件解耦微服务之间的数据与控制消息全部经由中间件流转这是 VSS 能横向扩展的根本原因概览见 docs/middleware.mdx。消息代理二选一docs/message-broker.mdx 给出了选择原则方案特点适合场景Kafka默认高吞吐、持久化、可扩展生产环境、大规模流数据Redis Streams轻量、低延迟、低内存占用开发环境、控制消息为主选择 Kafka 后分析微服务可以放心地横向加副本——任何副本都能消费到属于自己的那份流数据不需要有状态协调。数据库与存储分析结果、事件incidents和核验结果统一落到持久化存储检索服务可独立扩容视频文件本身的读写由 VIOS视频 IO 与存储承担两者都支持独立扩缩。四、VLM 推理怎么扩基于延迟的自动扩缩容这是 VSS 扩展指南中最精华的部分完整文档见 docs/vss-scale.mdxVLM Autoscaling。它让 VLM 服务如 Cosmos 视觉语言模型按业务延迟自动扩缩容而不是傻乎乎地按 CPU 利用率扩。工作原理三步走共享模型缓存NIMCache模型权重只下载一次到共享卷ReadWriteManyPVC之后新副本秒级挂载扩容不再被“下载模型”拖慢暴露自定义指标通过 Prometheus Adapter 计算e2e_request_latency_seconds_over_1s_fraction——即超过 1 秒延迟的请求占比HPA 决策当该占比 ≥ 40% 时立即扩副本空闲 3 分钟后保守缩容扩缩容策略示例可直接参考策略配置意图扩容0 秒稳定窗口每次 3 Pod15 秒评估一次突发流量快速响应缩容180 秒观察期每次最多 -50%选更保守的策略防止抖动、省钱⚠️ 注意这些数值是示例需要按你的流量特征突发型还是平稳型、SLA 要求和 Pod 启动时间做调优。测试阶段可用官方推荐的压力工具生成合成流量观察 HPA 副本数的涨落是否符合预期。五、实时视频流能扛多少路先算账再扩容扩容前先看单卡极限官方基准见 docs/performance.mdx 与 docs/performance-rt-cv.mdx。以 1080p30FPS、启用检测追踪为例单张 GPU 的最大并发流数GPURT-DETR (Resnet50)Grounding DINOH10050 路6 路RTX Pro 6000 SE29 路5 路L40S15 路3 路横向扩展公式很简单目标流数 ÷ 单卡并发流数留 10–15% 余量 需要的 GPU 副本数。例如 200 路 1080p 实时检测H100 大约需要200 ÷ 43 ≈ 5张卡分布在多个推理副本上即可。六、扩展后如何验证扩了不等于好验证靠数据可观测性栈Blueprint 自带 Grafana Prometheus DCGM ExporterGPU 指标详见 docs/observability.mdx关键指标GPU 利用率、HPA 副本数变化、VLM 慢请求占比、Kafka 消费延迟压测场景平稳增长验证线性扩容、突发尖峰验证快速扩容、流量回落验证缩容与稳定期总结VSS 横向扩展速查清单你要扩什么怎么做参考文档部署形态Docker Compose → Helm K8s 多节点docs/helm-deployment.mdx消息吞吐Redis 换 Kafka默认即 Kafkadocs/message-broker.mdx实时流路数按基准表加 GPU 推理副本docs/performance-rt-cv.mdxVLM 延迟NIMCache 自定义延迟指标 HPAdocs/vss-scale.mdx验证效果Grafana/DCGM 指标 三类压测场景docs/observability.mdx掌握这套“分层扩、按延迟扩、先算账再扩”的方法你就能让 VSS 的视频 AI 处理规模从容跟上业务增长。【免费下载链接】video-search-and-summarizationNVIDIA AI Blueprint for video search and summarization (VSS) is a GPU-accelerated reference architecture for building video analytics agents with real-time verified alerts, visual QA, and automated reporting. The VSS Blueprint uses vision language models (VLMs) such as NVIDIA Cosmos, LLMs such as NVIDIA Nemotron, RAG, and NVIDIA NIMs.项目地址: https://gitcode.com/GitHub_Trending/vi/video-search-and-summarization创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考