跳到内容
视角姬
记录

图像超分研究记录:从卷积到生成式放大

超分 超分 Real-ESRGAN 图像

备案备注里的「机器学习放大图片」对应这条记录。目标不是再发一篇教程,而是记下我们实际对照过的模型族、失败条件和显卡侧约束。

问题

给定低分辨率图 (I_{LR}),求高分辨率图 (I_{HR})。经典路径把放大拆成「插值 + 残差」;生成式路径直接采样高频。GIF 单帧可以走图像模型,但时序一致性要另记,见视频超分篇。

模型族

  1. SRCNN / ESPCN:小卷积,适合做基线。PSNR 好看,纹理假。
  2. EDSR / RCAN:残差与通道注意力。研究对照时仍用来卡「无 GAN 上限」。
  3. Real-ESRGAN / GFPGAN:退化建模 + GAN。二次元和实拍要换权重,不能混用。
  4. SwinIR / HAT:窗口注意力,4× 放大细节比 ESRGAN 稳,显存更高。
  5. 扩散超分(StableSR 一类):纹理丰富,容易改身份。证件、截图、UI 放大不要默认走扩散。

显卡侧

  • Tensor / XMX / RDNA AI 单元对 INT8/FP16 卷积友好;注意力超分更吃显存带宽。
  • 4K 整图 4× 时,优先 tile + overlap,不要整幅进 24 GB 卡。
  • NVIDIA 走 TensorRT 或 FP16 PyTorch;AMD 走 ROCm / DirectML;Intel 走 OpenVINO。同一权重三端输出要对齐再写进评测,不能只报一家。

记录要点

放大倍数、退化模型(模糊、压缩、噪声)、色彩空间、是否人脸修复,四项缺一不写入对照表。PSNR/SSIM 只作回归,观感用固定图集 + 固定缩放。