Skip to content

Latest commit

 

History

History
244 lines (191 loc) · 16.9 KB

File metadata and controls

244 lines (191 loc) · 16.9 KB

Video2E 模型支持与维护计划

更新日期:2026-07-26
REAL-Video-Enhancer 源码基线:edb9b129a7aa5ecc284be730074b85b5f17d9dcc(2026-07-13)
当前规模:48 个内置模型、12 种 architecture、2 种 runtime、3 类 capability

本文档记录当前模型清单、选择建议、技术边界、候选方向和维护规则。运行时声明以 src/video2e/manifest.py 为唯一权威来源;本文档不保留已经完成的接入过程、临时工作量估算或镜像上传时间等历史信息。

RTX 3090 Ti 上使用完整 1080p 测试视频得到的逐模型耗时、显存、GPU 利用率、匹配参数和失败信息,见 全模型 CUDA 性能测试报告

1. 支持范围

Video2E 支持视频和自动识别的静态图片,提供以下能力:

Capability 输入 Runtime 设备
upscale 视频、静态图片 PyTorch、ONNX Runtime CPU、NVIDIA CUDA;ONNX 可使用 Apple CoreML
restore 视频、静态图片 PyTorch CPU、NVIDIA CUDA
interpolate 视频 PyTorch CPU、NVIDIA CUDA

当前不维护 NCNN、TensorRT 或 PyTorch MPS 后端。Apple Silicon 的加速路径仅适用于 ONNX Runtime CoreML Execution Provider;PyTorch 模型回落到 CPU。

设备默认值为 auto:CUDA 可用时优先使用 CUDA;Apple Silicon 上的 ONNX 模型其次使用 CoreML;否则使用 CPU。用户显式指定但不可用的设备会直接报错,不会静默切换。

2. 模型生命周期

状态 含义
内置·保留 正式注册并持续维护,名称和稳定 ID 可直接使用
内置·观察 当前仍正式支持,但需要与新候选持续比较
候选 尚未进入 manifest,必须完成来源、许可、加载和视频验收
暂缓 当前收益不足、依赖复杂、来源不明或超出产品边界
已移除 不再提供内置名称或稳定 ID;移除记录仅保留必要迁移信息

2.1 稳定性规则

  1. 已发布模型 ID 不得静默指向另一份权重。
  2. 新版本、不同质量档或不同素材域使用独立 ID。
  3. 模型名称可以映射多个稳定 ID,但多值选择器必须由用户明确选择。
  4. 正常移除应先完成废弃过渡;损坏或法律风险可直接停止分发。
  5. 只有工作区内没有其他模型使用某个 loader 时,才可单独删除对应架构代码。

3. 当前内置模型

3.1 超分与动画修复(37 个)

模型 ID 或 ID 组 数量 Runtime / Architecture 主要用途 生命周期
openproteus-2x 1 pytorch / Compact 轻量通用实拍 2× 内置·保留
animejanai-v3-sharp-2x 1 pytorch / Compact 现代动画、偏锐线条 2× 内置·观察
realesr-general-x4v3 1 pytorch / Compact 轻量通用实拍 4× 内置·保留
realesr-animevideov3-4x 1 pytorch / Compact 动画视频速度档 4× 内置·保留
realesrgan-x2plus 1 pytorch / ESRGAN 通用实拍质量档 2× 内置·保留
realesrgan-x4plus 1 pytorch / ESRGAN 通用实拍质量档 4× 内置·保留
realesrgan-x4plus-anime-6b 1 pytorch / ESRGAN 动画插画质量档 4× 内置·保留
public-realplksr-2x 1 pytorch / PLKSR 复杂真实退化 2× 内置·保留
bhi-realplksr-real-4x 1 pytorch / PLKSR 真实噪声、模糊和压缩 4× 内置·保留
anisd-realplksr-medium-2x 1 pytorch / PLKSR 中等退化 WEB/DVD 动画 2× 内置·保留(非商业)
anitoon-small-2x 1 pytorch / PLKSR 老动画速度与保守修复档 2× 内置·保留(非商业)
anitoon-large-2x 1 pytorch / PLKSR 老动画高容量强修复档 2× 内置·保留(非商业)
realcugan-se-{conservative,no-denoise,denoise1,denoise2,denoise3}-2x 5 pytorch / RealCUGAN 动画 2×,完整降噪档 内置·保留
realcugan-se-{conservative,no-denoise,denoise3}-3x 3 pytorch / RealCUGAN 动画 3× 内置·保留
realcugan-se-{conservative,no-denoise,denoise3}-4x 3 pytorch / RealCUGAN 动画 4× 内置·保留
realcugan-pro-{conservative,no-denoise,denoise3}-2x 3 pytorch / RealCUGAN 动画高质量 2× 内置·保留
realcugan-pro-{conservative,no-denoise,denoise3}-3x 3 pytorch / RealCUGAN 动画高质量 3× 内置·保留
animejanai-v3-1-balanced-2x 1 onnx / SPANF3 跨 CPU、CUDA、CoreML 的动画 2× 内置·保留(非商业)
nomos8k-{weak,medium,strong}-4x 3 pytorch / SPAN 实拍 4×,三档修复强度 内置·观察
anisd-{high,medium,low}-2x 3 pytorch / SPAN 动画 2×,按输入质量分档 内置·保留(非商业)
animesr-v2-4x 1 pytorch / AnimeSR 动画视频专用 4× 内置·保留

生命周期描述维护状态,不替代权重许可证结论;具体授权和风险以 manifest 元数据为准。

Real-CUGAN 的精确 ID、官方文件名、Google Drive 文件 ID、字节数和 SHA-256 记录在 realcugan-model-sources.json。官方 Pro 仅提供 2×/3×,当前没有 Pro 4×。

3.2 降噪与压缩修复(5 个)

模型 ID Runtime / Architecture 主要用途 生命周期
deh264-super-ultra-compact pytorch / Compact H.264 修复超轻速度档 内置·保留
deh264-span pytorch / SPAN 通用 H.264 修复均衡档 内置·保留
deh264-rtmosr pytorch / RTMoSR H.264 修复中高质量档 内置·保留
deh264-realplksr pytorch / PLKSR 重压缩输入质量档 内置·保留
drunet-color pytorch / DRUNet 通用彩色降噪 内置·保留

3.3 插帧(6 个)

模型 ID Runtime / Architecture 定位 生命周期
gmfss pytorch / GMFSS 通用稳定基线 内置·保留
gmfss-pro pytorch / GMFSS 质量优先档 内置·保留
ifrnet-vimeo90k pytorch / IFRNet 轻量速度档 内置·保留
rife-4.25 pytorch / RIFE 上一标准版,可复现旧输出 内置·保留
rife-4.26 pytorch / RIFE 当前通用 RIFE 档 内置·保留
rife-4.26-heavy pytorch / RIFE 复杂运动与动画质量档 内置·保留

4. 按场景选择模型

输入或目标 建议起点 进一步比较
干净实拍 2× openproteus-2x 复杂退化比较 public-realplksr-2xrealesrgan-x2plus
实拍 4× realesr-general-x4v3 Nomos8k 三档;RTX 3090 Ti 的 1080p 整帧测试禁用 realesrgan-x4plusbhi-realplksr-real-4x
现代动画 2× animejanai-v3-sharp-2x 非商业可比较 animejanai-v3-1-balanced-2x;压缩输入比较 Real-CUGAN
老动画或 DVD 2× AniSD SPAN 三档 非商业质量优先比较 AniSD RealPLKSR、AniToon Small/Large
动画视频 4× realesr-animevideov3-4x animesr-v2-4x 在本次 1080p 整帧测试中 OOM;realesrgan-x4plus-anime-6b 导致主机重启
H.264 快速修复 deh264-super-ultra-compact 质量提高依次比较 SPAN、RTMoSR、RealPLKSR
彩色降噪 drunet-color 真实盲噪声模型仍在候选阶段
通用插帧 rife-4.26 轻量使用 IFRNet;质量与复杂动画比较 GMFSS Pro、RIFE Heavy
时序视频恢复 暂无 需要独立 sequence runtime,不进入逐帧模型管线

模型名称可能包含多个倍率、profile 或降噪档。只有一个候选值时可以省略选择器;存在多个值时必须显式指定。--scaling-factor 选择原生权重倍率,--output-scale 控制推理后的最终输出倍率。

5. 技术边界

5.1 路由与 loader

Capability 当前 Architecture 执行边界
upscale AnimeSRCompactESRGANPLKSRRealCUGANSPANSPANF3 单帧超分;AnimeSR 使用专用视频模型路径
restore CompactDRUNetPLKSRRTMoSRSPAN 单帧降噪和压缩修复
interpolate GMFSSIFRNetRIFE 相邻帧或局部上下文插帧
Loader 当前能力 明确不覆盖
Compact/SRVGG 轻量超分、1× 修复 NAFNet、SCUNet、DAT2
SPAN 超分、1× 修复 SPANPlus
PLKSR/RealPLKSR 普通、DySample、LayerNorm,多倍率和网络尺寸 DAT2、ParagonSR
ESRGAN/RRDB 新旧状态字典转换、倍率和 block 推导 Compact/SRVGG 由 Compact loader 处理
Real-CUGAN SE/Pro、2×/3×/4×、fast marker NCNN models-nose
ONNX 图像 单输入、单输出、NCHW、FP16/FP32、动态高宽、全帧/tile 多输入插帧、时序恢复、非图像输出
插帧 factory GMFSS、IFRNet、RIFE 4.25/4.26/Heavy 不兼容的新网络需要独立实现

5.2 单帧与时序

类型 输入方式 主要风险
单帧图像模型 每次处理一帧 强修复产生纹理闪烁、过锐或颜色漂移
插帧模型 相邻帧对或局部上下文 遮挡鬼影、跨 scene cut 错误插帧
时序恢复模型 多帧窗口或递归状态 显存、分段、状态重置、时间轴和边界融合

Real-CUGAN 当前使用通用 tile 管线,并不等同于上游 cache-based seamless 算法。SE 统计量按 tile 独立计算;要求全帧等价时使用 --tile-size 0

5.3 已验证的 4× CUDA 稳定性边界

RTX 3090 Ti 24,564 MiB、batch 1、1920×1080 完整视频、--tile-size 0 的实测边界如下。完整指标和证据见 全模型 CUDA 性能测试报告

模型 结果 增量峰值显存 当前整帧建议
realesr-general-x4v3 完整通过 2869 MiB 可用
realesr-animevideov3-4x 完整通过 2863 MiB 可用
Nomos8k weak/medium/strong 完整通过 5799 MiB 可用
animesr-v2-4x CUDA OOM 7992 MiB 禁止按本次配置重试
realesrgan-x4plus 主机重启 23,507 MiB 禁止按本次配置重试
realesrgan-x4plus-anime-6b 主机重启 23,672 MiB 禁止按本次配置重试
bhi-realplksr-real-4x 主机重启 18,463 MiB 禁止按本次配置重试

这里的“禁止”只约束已经证实不稳定的 RTX 3090 Ti 1080p 整帧配置,不等同于移除模型,也不能外推到其他 GPU、输入尺寸或 tile 配置。未经独立验证,不应把降低 batch、启用 tile 或切换精度描述为这些失败模型的已验证解决方案。

6. 候选与优先级

候选进入 manifest 前必须同时满足来源、许可、产品缺口和视频验收要求。loader 能加载某种权重不代表该模型已经受支持。

6.1 近期候选

候选 目标能力 所需工作 当前决定
BHI DAT2 General/Noisy/Clean 4× 真实与程序模拟退化超分 已从 Spandrel e1f2ea1 选择性回移 DAT loader;继续与 BHI RealPLKSR 做视频盲测 已接入;General 为默认选择,Noisy 用于明显噪声与压缩损伤,Clean 用于低噪声素材
NAFNet GoPro/REDS 单帧运动去模糊 选择性 vendoring NAFNet,验证 tile 和视频闪烁 候选;优先补齐缺失能力
SCUNet Color Real 真实盲降噪 新增 SCUNet loader,验证低光和 tile 候选;与 DRUNet 对照后决定
GaterV3 restore 通用 1× 恢复 新架构和状态字典检测 候选;需证明联合恢复的独立收益
ModernSpanimation V3 现代动画 2× 可复用 SPAN;补原始来源和权重授权 暂缓;来源明确后再盲测
RTMoSR Unshuffle 超快速 H.264 修复 可复用 RTMoSR;补原始来源和权重授权 暂缓;必须证明相对现有速度档的价值

6.2 时序运行时候选

候选 定位 当前决定
RealBasicVSR Apache-2.0 时序 4× 原型 首个 sequence runtime 候选
BasicVSR++ 多任务时序恢复 在 RealBasicVSR 之后评估 DCN/MMCV 可维护性
SeedVR2 高资源生成式视频恢复 仅研究;资源和幻觉风险不适合默认发行
VRT / RVRT 非商业时序研究基准 不进入商业默认运行时

6.3 暂不接入

类别或模型 原因 重新评估条件
SPANPlus、BHI SPANPlus Dynamic 无现有 loader,优先级低 相对 SPAN/RealPLKSR 有明确收益
Nomos2 RealPLKSR 4× 权重为 CC BY 4.0,无许可证阻碍;但与现有实拍 4× 档重叠,仍需排除颜色偏移 盲测证明具有独立质量收益
Restormer 多任务架构接入成本高,与 NAFNet、SCUNet 候选方向重叠 明确任务和权重优于对应专用候选
HAT、ATD、DRCT、OmniSR 重型架构,缺少明确默认模型目标 具体权重具有不可替代的质量档
ParagonSR Nano 权重输入输出契约和许可仍需核验 可分发 ONNX 权重通过视频稳定性验收
CodeFormer、GFPGAN、RestoreFormer 需要人脸检测、对齐、融合和时序身份一致性 建立独立人脸修复阶段
SUPIR、普通图像扩散超分 资源重且可能重绘文字、面部和纹理 有明确远程产品定位和忠实度控制
仅 NCNN 权重 当前不维护 NCNN 后端 多个高价值模型共同证明新后端值得维护
来源或权重授权不明 无法稳定发布 原作者、原始资产、授权和哈希均可追溯

7. 新模型验收标准

类别 必须通过的检查
产品价值 填补明确能力、质量或速度缺口,不因发布时间较新而接入
来源与授权 原始发布页、作者、权重授权、商业和再分发条件可追溯
文件锁定 记录文件名、字节数、SHA-256、上游 URL 和最后核验时间
加载 CPU 严格加载;CUDA FP16/FP32 或 ONNX 对应 provider 使用声明精度
尺寸 偶数、奇数、非 16 对齐尺寸;全帧和 tile 无明显接缝
视频稳定性 实拍、动画、低光、压缩、快速运动、字幕、人脸和 scene cut
人工检查 闪烁、颜色漂移、halo、ringing、过锐、细节抹除和身份变化
性能 720p/1080p 的 FPS、首次加载时间、峰值 RAM/VRAM 和 OOM 降级
回归 registry、CLI、runner、loader smoke test;现有 ID 和路由不改变

8. 元数据与来源维护

每个内置模型在 manifest 中保存以下可审查信息:

  • 稳定 ID、runtime、architecture、capability 和权重文件名;
  • 相对质量、速度、适用视频类型、输入建议和模型风险;
  • weight_source_urlweight_licenseweight_license_urllicense_risk
  • 可核验时记录 weight_updated_at,表示观察到的发布资产时间,不代表训练日期。

unknown 表示没有确认权重授权,不表示权重可自由使用。镜像仅用于定位资产,不能替代原作者来源或授权证据。精确文件锁应保存在独立 JSON 来源文件中,避免在规划文档中重复维护容易过时的上传时间和哈希。

当前来源锁文件:

9. 主要上游来源

项目或模型 来源
REAL-Video-Enhancer 模型镜像 TNTwise/real-video-enhancer-models
AnimeJaNai the-database/mpv-AnimeJaNai
Practical-RIFE hzwer/Practical-RIFE
Public/BHI RealPLKSR、BHI DAT2 Phhofm/models
Real-ESRGAN xinntao/Real-ESRGAN
Real-CUGAN bilibili/ailab Real-CUGAN
AniSD、AniToon Sirosky/Upscale-Hub
NAFNet megvii-research/NAFNet
SCUNet cszn/SCUNet
Restormer swz30/Restormer
RealBasicVSR ckkelvinchan/RealBasicVSR
BasicVSR++ ckkelvinchan/BasicVSR_PlusPlus
SeedVR2 ByteDance-Seed/SeedVR
VRT JingyunLiang/VRT
RVRT JingyunLiang/RVRT