English

用于 GPU 图像处理的 Fastvideo SDK

更新日期:

Fastvideo SDK 是一个 C++/CUDA 库,在 NVIDIA GPU 上运行完整的相机图像处理流水线 — 从原始图像采集到 JPEG 或 JPEG2000 压缩与存储 — 无需往返 CPU。在 NVIDIA GeForce RTX 4090 上,完整的 RAW 转 RGB 流水线之快,以至于端到端吞吐受限于 SSD 而非 GPU:完全在 GPU 内存中运行时,它以约 60 fps 处理一帧 65 MPix 图像;而读写磁盘的完整工作流对 12 位 4K 图像端到端最高达 60 fps。单个模块的速度远高于此 — JPEG 编码约 5500 fps(Full HD)或 3800 fps(4K),视觉无损的 JPEG2000 编码最高约 2100 fps(2K,批处理模式),去马赛克最高 69 GPix/s。帧只上传一次,端到端在 GPU 内存中处理,结果即可实时用于显示、流式传输或写入磁盘。

该 SDK 面向同时看重吞吐与画质的应用:机器视觉与工业相机、数字电影、广播、医学影像、航空、航天与街景成像,以及基于 NVIDIA Jetson 的嵌入式系统。除相机流水线外,相同组件还支撑离线 RAW 处理、FFmpeg 编解码器与滤镜,以及 AI 应用的预处理。

NVIDIA CUDA 上的 Fastvideo SDK 图像处理流水线:相机、采集卡、SDK、输出
NVIDIA CUDA 上的 Fastvideo SDK 图像处理流水线:帧从相机经采集卡流入 SDK — 在 GPU 上进行预处理、去马赛克、调色、缩放以及 JPEG/JPEG2000/H.264 编码 — 再输出到显示、存储或网络。

Fastvideo SDK 一览

Fastvideo SDK 性能基准

Fastvideo SDK 各模块在 GPU 上有多快?

NVIDIA GeForce RTX 4090 上主要 SDK 模块的代表性峰值吞吐(纯 GPU 处理时间,24 位彩色;模式在各行注明)。具体数值取决于您的 GPU、分辨率与质量 — 完整的逐模块结果见所链接的基准页面。

Fastvideo SDK 在 NVIDIA GeForce RTX 4090 上按操作与图像分辨率的代表性逐模块性能。
模块 操作 分辨率 RTX 4090 上的速度
RAW→RGB 流水线最小流水线,GPU 内存中65 MPix60 fps
完整 RAW→RGB 流水线端到端,含 SSD 读写4K,12 位60 fps
JPEG 编解码器编码Full HD / 4K / 6K5500 / 3800 / 1500 fps
JPEG 编解码器解码4K / 8K1350 / 650 fps
JPEG2000 编解码器编码(批处理,视觉无损)2K / 4K2108 / 732 fps
JPEG2000 编解码器解码(批处理,视觉无损)2K / 4K1317 / 362 fps
去马赛克HQLI … MG 算法峰值吞吐20–69 GPix/s

RAW→RGB 各行为完整 ISP 流水线:内存内情形受限于 GPU,而端到端情形受限于 SSD 而非 GPU。JPEG 数据为单线程单图;JPEG2000 数据为多线程批处理模式 — 单图结果与完整表格见 JPEG2000 编码器解码器基准页(英文)。JPEG 编解码器在 24 MPix(6K)帧上达到约 117 GB/s。每个模块的详细基准(英文)另见相应页面。

为什么选择 Fastvideo SDK

为什么在 GPU 上运行完整的图像处理流水线?

整条流水线都在 GPU 上,而非只有其中一部分。若数据在各阶段之间必须往返 CPU,单个 GPU 加速环节就失去了优势。Fastvideo SDK 让整条流水线保持在 GPU 内存中,因此 PCIe 总线只被跨越两次 — 原始数据进、最终结果出。这正是让实时 4K 与多相机处理在实践中可行的原因。

性能不以牺牲画质为代价。每个模块都以在画质上不逊于最好的 CPU 实现为目标 — 包括双边与 NLM 去噪、DFPD 与 MG 去马赛克,以及 Lanczos 缩放 — 同时运行得明显更快。每个主要模块公布的基准(英文)印证了这一点。

一套 SDK 覆盖整个 NVIDIA 产品线。相同的 API 可运行在从 Jetson 模块到笔记本、桌面与服务器 GPU 的一切设备上。在工作站上开发的应用无需改动代码即可部署到嵌入式 Jetson 系统 — 变化的只是性能上限。

降低最终应用的总成本。GPU 处理减轻了 CPU 负载,因此单台机器即可承担原本需要多台才能完成的工作 — 每套相机系统所需的计算机更少、机架空间更小、维护更简单。SDK 与第三方 CPU 及 GPU 库兼容,因此能集成到既有应用中,而非取代它们。

图像与视频处理 SDK 特性

图像采集

RAW 域处理

去马赛克

颜色与色调

去噪与增强

几何变换

分析与监看

输出与编解码器

流水线基础设施

SDK 可选项

以下模块也是 SDK 的一部分。它们面向较不常见的任务,按需授权。

扩展格式支持

视频编解码器

I/O 与集成

兼容性

带源码的 SDK 示例程序

Fastvideo 在 GitHub 上的开源项目

可下载的基于 GPU 的演示程序

许可与定制开发

我们向软件开发者、相机制造商、系统集成商与经销商授权面向 Windows、Linux 与 L4T 的 GPU 图像与视频处理 SDK 及其组件。该 SDK 已用于从机器视觉到数字电影与广播的广泛实时成像应用(英文)

Fastvideo 也根据客户需求开发定制的图像与视频处理方案,并提供集成服务以将 SDK 与您既有的软件对接。如果您的图像处理流水线包含本页未列出的阶段,请联系我们讨论 — 也可查看我们开发中的项目(英文)

SDK 的演示版本、文档、授权细节与报价可应要求提供 — 请使用下方联系表。

常见问题

什么是 Fastvideo SDK?

Fastvideo SDK 是一个 C++/CUDA 库,在 NVIDIA GPU 上运行完整的相机图像处理流水线 — 从原始采集、去马赛克、去噪、颜色与色调处理、缩放,到 JPEG 与 JPEG2000 压缩 — 全部在 GPU 内存中完成。

它有多快?

在 NVIDIA GeForce RTX 4090 上,完整 RAW 转 RGB 流水线在 GPU 内存中以约 60 fps 处理一帧 65 MPix 图像(12 位 4K 端到端最高 60 fps,此时吞吐受限于 SSD 而非 GPU)。单个模块更快:JPEG 编码约 5500 fps(Full HD)与 3800 fps(4K),视觉无损 JPEG2000 编码最高约 2100 fps(2K,批处理模式),去马赛克最高 69 GPix/s — 参见基准测试方法(英文)

支持哪些 GPU 与平台?

任何支持 CUDA 的 NVIDIA GPU,从 Jetson 嵌入式模块(Xavier、Orin)到笔记本、桌面与服务器显卡,运行于 Windows 10/11、Linux Ubuntu 与 Linux4Tegra。相同的 C++/CUDA API 无需改动代码即可覆盖整个产品线。

SDK 覆盖哪些流水线阶段?

RAW 域处理、去马赛克、去噪、颜色校正与色调映射、几何变换、分析与监看,以及输出编解码器 — JPEG、JPEG2000,以及通过 NVENC/NVDEC 的 H.264/H.265。它还集成 GPU 上的 FFmpeg 滤镜与编解码器。

我能自己测试性能吗?

可以。下载各模块的免费演示程序(英文),在您自己的 GPU 上测量速度 — 参见基准测试方法(英文)Fastvideo SDK 基准报告(PDF)

CUDA 图像处理 SDK 路线图

Fastvideo SDK 是自 2009 年起开发与打磨的成熟产品;其最新版本(2026)新增了对最新 NVIDIA GPU 与 CUDA 版本的支持。以下为最近新增内容与当前进行中的工作。

已发布:

进行中:

Fyodor Serzhenko, Fastvideo

关于作者

Fyodor Serzhenko 博士,Fastvideo 创始人兼 CEO。他于 1993 年在莫斯科物理技术学院(MIPT)获得博士学位。自 2009 年起,他一直领导 Fastvideo 基于 GPU 的图像编解码器与 ISP 模块(包括 Fastvideo SDK)的开发。LinkedIn

为什么这些结果可信

Fastvideo 自 2009 年起开发基于 GPU 的图像处理软件。我们的编解码器严格遵循相关标准 — JPEG(ITU-T T.81 / ISO IEC 10918)与 JPEG2000(ITU-T T.800 / ISO IEC 15444),开源工具详见 GitHub。我们公布的每一项性能数据均可复现:请参阅测试方法(英文),下载 Fastvideo SDK 基准报告(PDF),并在您自己的 GPU 上测量。

联系表单

本表单将收集您的姓名和电子邮件地址。我们如何处理您的个人数据,请见隐私政策(英文)。