画像復元(DiffBIR,Python,PyTorch を使用)(Windows 上)

要約DiffBIRは,画像復元の手法で,低品質な画像を高品質に復元する.Windows上でのインストールでは,DiffBIRのセットアップを行う.学習済みモデルを使用して,画像復元を行う.詳細は公式GitHubページで説明されている.

元画像処理結果

目次

  1. 前準備
  2. DiffBIR のインストール(Windows 上)
  3. DiffBIR の動作確認(Windows 上)
  4. DiffBIR を使う Python プログラムの実行(Windows 上)

DiffBIR

DiffBIRは画像復元の手法の一つである。 画像復元は、低品質または劣化した画像を元の高品質な状態に修復するタスクである。 このタスクでは、ノイズや歪みなどの複雑な問題に対処する必要がある。 DiffBIRは、2つの主要なステージから成り立っている。 最初のステージでは、画像復元が行われ、低品質な画像が高品質に修復される。 そして、2番目のステージでは、事前に訓練されたStable Diffusionを使用して、高品質な画像が生成される。

文献

Xinqi Lin, Jingwen He, Ziyan Chen, Zhaoyang Lyu, Bo Dai, Fanghua Yu, Wanli Ouyang, Yu Qiao, Chao Dong, DiffBIR: Towards Blind Image Restoration with Generative Diffusion Prior, arXiv:2308.15070, 2024.

https://arxiv.org/abs/2308.15070

関連する外部ページ

前準備

Build Tools for Visual Studio 2026(ビルドツール)のインストール

Build Tools for Visual Studio 2026(ビルドツール)のインストールを行い、C/C++ コードのビルド環境を整える。

[Build Tools for Visual Studio 2026(ビルドツール)のインストール手順を見るには、ここをクリック]

Windows での Build Tools for Visual Studio 2026 のインストール

Build Tools for Visual Studio は,Visual Studio の IDE を含まない C/C++ コンパイラ,ライブラリ,ビルドツール等のコマンドライン向け開発ツールセットである。インストール済みの場合,この手順は不要である。

以下のコマンドは、Build Tools が未インストールの場合は winget で新規インストールし、インストール済みの場合は setup.exe modify でコンポーネントを追加する(バージョンは変更しない)。

インストールコマンドの実行方法

管理者権限コマンドプロンプトを起動する(手順:Windows キーまたはスタートメニュー → cmd と入力 → 右クリック → 「管理者として実行」)。そして、コマンド全体をコマンドプロンプトにコピー&ペーストする。

REM ============================================================
REM Visual C++ 再頒布可能パッケージ (VCRedist 2015-)
REM ============================================================
winget install --scope machine --id Microsoft.VCRedist.2015+.x64 -e --silent --disable-interactivity --force --accept-source-agreements --accept-package-agreements --override "/quiet /norestart"
if not "%ERRORLEVEL%"=="0" ( color 0c & echo VCRedist のインストールに失敗しました & ping 127.0.0.1 -n 6 >nul & color )

REM ============================================================
REM Visual Studio Build Tools + Desktop development with C++
REM (VCTools、MSBuildTools、CMake連携、Clang、Windows 11 SDK)
REM ============================================================
REM 進行中のインストーラーを停止(ロック競合回避。対象プロセスが存在しない場合は
REM taskkillがエラーを返すが、これは想定内であるため出力のみ抑制する)
taskkill /F /IM vs_setup.exe /T >nul 2>&1
taskkill /F /IM vs_installer.exe /T >nul 2>&1
taskkill /F /IM vs_installerservice.exe /T >nul 2>&1
taskkill /F /IM msiexec.exe /T >nul 2>&1

REM Build Tools + Desktop development with C++(VCTools)+ 追加コンポーネント(一括)
REM 未インストール時: winget で新規インストール
REM インストール済み時: setup.exe modify でコンポーネント追加(バージョンは変更しない)
winget list --id Microsoft.VisualStudio.BuildTools 2>nul | findstr /i "BuildTools" >nul 2>&1
if %ERRORLEVEL% EQU 0 (
    for /f "usebackq delims=" %P in (`"C:\Program Files (x86)\Microsoft Visual Studio\Installer\vswhere.exe" -products Microsoft.VisualStudio.Product.BuildTools -property installationPath`) do start /wait "" "C:\Program Files (x86)\Microsoft Visual Studio\Installer\setup.exe" modify --installPath "%P" --add Microsoft.VisualStudio.Workload.VCTools --add Microsoft.VisualStudio.Workload.MSBuildTools --add Microsoft.VisualStudio.Component.VC.CMake.Project --add Microsoft.VisualStudio.Component.VC.Llvm.Clang --add Microsoft.VisualStudio.Component.VC.Llvm.ClangToolset --add Microsoft.VisualStudio.Component.Windows11SDK.26100 --add Microsoft.VisualStudio.Component.VC.v143.x86.x64 --includeRecommended --quiet --norestart --nocache
    if not "%ERRORLEVEL%"=="0" ( color 0c & echo Build Tools のコンポーネント追加に失敗しました & ping 127.0.0.1 -n 6 >nul & color )
) else (
    winget install --scope machine --id Microsoft.VisualStudio.BuildTools -e --silent --disable-interactivity --force --accept-source-agreements --accept-package-agreements --override "--quiet --wait --norestart --nocache --add Microsoft.VisualStudio.Workload.VCTools --includeRecommended --add Microsoft.VisualStudio.Workload.MSBuildTools --add Microsoft.VisualStudio.Component.VC.CMake.Project --add Microsoft.VisualStudio.Component.VC.Llvm.Clang --add Microsoft.VisualStudio.Component.VC.Llvm.ClangToolset --add Microsoft.VisualStudio.Component.Windows11SDK.26100 --add Microsoft.VisualStudio.Component.VC.v143.x86.x64"
    if not "%ERRORLEVEL%"=="0" ( color 0c & echo Build Tools のインストールに失敗しました & ping 127.0.0.1 -n 6 >nul & color )
)

REM
REM BuildTools のインストールパスを vswhere.exe で取得(メジャーバージョンに依存しない)
set "VSWHERE=C:\Program Files (x86)\Microsoft Visual Studio\Installer\vswhere.exe"
set "BT_PATH="
for /f "usebackq delims=" %P in (`"%VSWHERE%" -products Microsoft.VisualStudio.Product.BuildTools -property installationPath`) do set "BT_PATH=%P"
if not defined BT_PATH ( color 0c & echo Build Tools のインストールパスを取得できませんでした & ping 127.0.0.1 -n 6 >nul & color )

REM 破損時の修復(任意、動作がおかしくなった場合)
REM if defined BT_PATH "C:\Program Files (x86)\Microsoft Visual Studio\Installer\setup.exe" repair --installPath "%BT_PATH%" --quiet --norestart
REM 導入確認(インストールパスが表示されれば正常)
"%VSWHERE%" -products * -requires Microsoft.VisualStudio.Workload.VCTools -property installationPath

上記のコマンドでは、Build Tools 本体と Visual C++ 再頒布可能パッケージをインストールし、続いて以下のコンポーネントを追加している。

追加のコンポーネントが必要になった場合は Visual Studio Installer で個別にインストールできる。

インストール完了の確認

winget list Microsoft.VisualStudio.BuildTools

Visual Studio を必要とするとき

Visual Studio の機能を必要とする場合は,追加インストールできる。

Python 3.10 のインストール

Pythonのインストールを行い、Pythonのプログラムを実行する環境を整える。扱う環境は、Windows搭載パソコンである。金子研究室では、Python 3.12.10を推奨する。

[Windows での Python 3.12 のインストール手順を見るには、ここをクリック]

Windows での Python 3.12 のインストール

以下のいずれかの方法でPython 3.12をインストールする。Pythonがインストール済みの場合、この手順は不要である。

方法 1:winget によるインストール

インストールコマンドの実行方法

管理者権限コマンドプロンプトを起動する(手順:Windowsキーまたはスタートメニュー → cmd と入力 → 右クリック → 「管理者として実行」)。そして、コマンド全体をコマンドプロンプトにコピー&ペーストする。

--scope machine を指定することで、システム全体(全ユーザー向け)にインストールされる。このオプションの実行には管理者権限が必要である。インストール完了後、コマンドプロンプトを再起動するとPATHが反映される。

REM Python 3.12 をシステム領域にインストール
winget install --id Python.Python.3.12 -e --scope machine --silent --accept-source-agreements --accept-package-agreements --override "/quiet InstallAllUsers=1 PrependPath=1 Include_test=0 Include_pip=1 Include_launcher=1 InstallLauncherAllUsers=1 TargetDir=\"C:\Program Files\Python312\""
if not "%ERRORLEVEL%"=="0" ( color 0c & echo Python 3.12 のインストールに失敗しました & ping 127.0.0.1 -n 6 >nul & color )

REM Python と Scripts を PATH 先頭に追加
powershell -NoProfile -Command "$p='C:\Program Files\Python312'; $s=\"$p\Scripts\"; if(Test-Path $p){$k=[Microsoft.Win32.Registry]::LocalMachine.OpenSubKey('SYSTEM\CurrentControlSet\Control\Session Manager\Environment',$true); $c=$k.GetValue('Path','',[Microsoft.Win32.RegistryValueOptions]::DoNotExpandEnvironmentNames); $t=$k.GetValueKind('Path'); $new=$c; if((';'+$new+';') -notlike \"*;$p;*\"){$new=$p+';'+$new}; if((';'+$new+';') -notlike \"*;$s;*\"){$new=$s+';'+$new}; if($new -ne $c){$k.SetValue('Path',$new,$t)}; $k.Close()}"

REM 現在のセッションにも反映(システムPATHを再取得して連結)
for /f "usebackq tokens=2,*" %A in (`reg query "HKLM\SYSTEM\CurrentControlSet\Control\Session Manager\Environment" /v Path`) do set "PATH=%B"

REM pip / wheel の更新
python -m pip install --no-user -U pip wheel
if not "%ERRORLEVEL%"=="0" ( color 0c & echo pip / wheel の更新に失敗しました & ping 127.0.0.1 -n 6 >nul & color )

方法 2:インストーラーによるインストール

  1. Python公式サイト(https://www.python.org/downloads/)にアクセスし、「Download Python 3.x.x」ボタンからWindows用インストーラーをダウンロードする。
  2. ダウンロードしたインストーラーを実行する。
  3. 初期画面の下部に表示される「Add python.exe to PATH」にチェックを入れてから「Customize installation」を選択する。このチェックを入れ忘れると、コマンドプロンプトから python コマンドを実行できない。
  4. 「Install Python 3.xx for all users」にチェックを入れ、「Install」をクリックする。

インストールの確認

コマンドプロンプトで以下を実行する。

python --version

バージョン番号(例:Python 3.12.x)が表示されればインストール成功である。「'python' は、内部コマンドまたは外部コマンドとして認識されていません。」と表示される場合は、インストールが正常に完了していない。

Git のインストール

管理者権限コマンドプロンプトで以下を実行する。管理者権限のコマンドプロンプトを起動するには、Windows キーまたはスタートメニューから「cmd」と入力し、表示された「コマンドプロンプト」を右クリックして「管理者として実行」を選択する。

REM Git をシステム領域にインストール
winget install --scope machine --id Git.Git -e --silent --disable-interactivity --force --accept-source-agreements --accept-package-agreements --override "/VERYSILENT /NORESTART /NOCANCEL /SP- /CLOSEAPPLICATIONS /RESTARTAPPLICATIONS /COMPONENTS=""icons,ext\reg\shellhere,assoc,assoc_sh"" /o:PathOption=Cmd /o:CRLFOption=CRLFCommitAsIs /o:BashTerminalOption=MinTTY /o:DefaultBranchOption=main /o:EditorOption=VIM /o:SSHOption=OpenSSH /o:UseCredentialManager=Enabled /o:PerformanceTweaksFSCache=Enabled /o:EnableSymlinks=Disabled /o:EnableFSMonitor=Disabled"

関連する外部ページ

Build Tools for Visual Studio 2022,NVIDIA ドライバ,NVIDIA CUDA ツールキット 11.8,NVIDIA cuDNN 8.9.7 のインストール(Windows 上)

サイト内の関連ページNVIDIA グラフィックスボードを搭載しているパソコンの場合には, NVIDIA ドライバNVIDIA CUDA ツールキットNVIDIA cuDNN のインストールを行う.

関連する外部ページ

FFmpeg のインストール(Windows 上)

Windows での FFmpeg のインストール(Windows 上): 別ページ »で説明

DiffBIR のインストール(Windows 上)

  1. 以下の手順を管理者権限コマンドプロンプトで実行する (手順:Windowsキーまたはスタートメニュー → cmd と入力 → 右クリック → 「管理者として実行」)。
  2. インストール
    cd /d c:%HOMEPATH%
    rmdir /s /q DiffBIR
    git clone https://github.com/XPixelGroup/DiffBIR.git
    cd DiffBIR
    python -m pip install -U --ignore-installed pip
    python -m pip install -r requirements.txt
    

    requirements.txt の中で,PyTorch 2.2.2(NVIDIA CUDA 11.8 用)と xformers のバージョンが指定されている.事前に NVIDIA CUDA ツールキット 11.8 がインストール済みであること.

  3. 終了の確認

    エラーメッセージが出ないこと

DiffBIR の動作確認(Windows 上)

DiffBIR の公式の GitHub のページ: https://github.com/XPixelGroup/DiffBIR に従う

  1. Windows で,コマンドプロンプトを実行
  2. 画像復元の実行

    公開されている学習済みモデルを用いて実行する.学習済みモデルは,実行時に自動的にダウンロードされる. 画像復元したい画像ファイルは,inputs/demo/bsr に置く. 画像復元の結果は,results/v2.1_demo_bsr に置かれる.

    cd /d c:%HOMEPATH%
    cd DiffBIR
    python inference.py ^
    --task sr ^
    --upscale 4 ^
    --version v2.1 ^
    --captioner llava ^
    --cfg_scale 8 ^
    --noise_aug 0 ^
    --input inputs/demo/bsr ^
    --output results/v2.1_demo_bsr
    

    --task には,超解像(画質を高精細にする)を行う sr,顔の復元を行う face,ノイズ除去を行う denoise などを指定できる.--version には,モデルのバージョン(v2 または v2.1)を指定する.--captioner には,画像の内容説明(キャプション)の生成に使うモデルを指定する.GPU の VRAM が少ない場合は,llava の代わりに ram または none を指定する.

    元画像

    処理結果

  3. 別の画像で試してみた結果

    元画像

    処理結果

GPU の VRAM が少ない場合(タイル処理)

GPU の VRAM が少ない場合は,画像を分割して処理するタイル処理(tiled sampling)を使う.次の引数を追加する.

python inference.py ^
--task sr ^
--upscale 4 ^
--version v2.1 ^
--captioner llava ^
--cfg_scale 8 ^
--noise_aug 0 ^
--input inputs/demo/bsr ^
--output results/v2.1_demo_bsr ^
--cleaner_tiled --cleaner_tile_size 256 --cleaner_tile_stride 128 ^
--vae_encoder_tiled --vae_encoder_tile_size 256 ^
--vae_decoder_tiled --vae_decoder_tile_size 256 ^
--cldm_tiled --cldm_tile_size 512 --cldm_tile_stride 256

DiffBIR を使う Python プログラムの実行(Windows 上)

.mp4 ファイルを処理するプログラム

  1. Windows で,コマンドプロンプトを実行
  2. エディタを起動
    cd /d c:%HOMEPATH%\DiffBIR
    mkdir invideo
    notepad diffbirvideo.py
    
  3. エディタで,次のプログラムを保存

    このプログラムは, DiffBIR の inference.py の処理を .mp4 動画ファイルの各フレームに適用するプログラムである. 公式リポジトリの diffbir パッケージ(diffbir.inferencediffbir.modeldiffbir.utils)を利用している.

    from typing import List
    import os
    import argparse
    
    import cv2
    import numpy as np
    import torch
    from PIL import Image
    from accelerate.utils import set_seed
    
    from diffbir.inference import (
        BSRInferenceLoop,
        BFRInferenceLoop,
        BIDInferenceLoop,
        UnAlignedBFRInferenceLoop,
    )
    from diffbir.utils.common import instantiate_from_config
    
    
    def parse_args() -> argparse.Namespace:
        parser = argparse.ArgumentParser()
    
        parser.add_argument(
            "--task", type=str, default="sr", choices=["sr", "denoise", "face", "face_background"]
        )
        parser.add_argument("--upscale", type=float, default=4)
        parser.add_argument("--version", type=str, default="v2.1", choices=["v1", "v2", "v2.1", "custom"])
        parser.add_argument("--train_cfg", type=str, default="")
        parser.add_argument("--ckpt", type=str, default="")
    
        parser.add_argument("--captioner", type=str, default="none", choices=["none", "ram", "llava"])
        parser.add_argument("--pos_prompt", type=str, default="")
        parser.add_argument(
            "--neg_prompt",
            type=str,
            default="low quality, blurry, low-resolution, noisy, unsharp, weird textures",
        )
        parser.add_argument("--cfg_scale", type=float, default=8.0)
        parser.add_argument("--noise_aug", type=int, default=0)
    
        parser.add_argument("--input", type=str, required=True)
        parser.add_argument("--output", type=str, required=True)
        parser.add_argument("--device", type=str, default="cuda", choices=["cpu", "cuda"])
        parser.add_argument("--seed", type=int, default=231)
    
        return parser.parse_args()
    
    
    def list_mp4_files(datadir: str) -> List[str]:
        return [os.path.join(datadir, f) for f in os.listdir(datadir) if f.endswith(".mp4")]
    
    
    LOOP_CLASS = {
        "sr": BSRInferenceLoop,
        "denoise": BIDInferenceLoop,
        "face": BFRInferenceLoop,
        "face_background": UnAlignedBFRInferenceLoop,
    }
    
    
    def main() -> None:
        args = parse_args()
        set_seed(args.seed)
    
        assert os.path.isdir(args.input)
        frame_dir = "frames_in"
        os.makedirs(frame_dir, exist_ok=True)
        os.makedirs(args.output, exist_ok=True)
    
        loop_cls = LOOP_CLASS[args.task]
    
        for file_path in list_mp4_files(args.input):
            print(file_path)
            cap = cv2.VideoCapture(file_path)
            frame_num = 0
            while cap.isOpened():
                ret, frame = cap.read()
                if not ret:
                    break
    
                frame_path = os.path.join(frame_dir, "a.png")
                cv2.imwrite(frame_path, frame)
                print(f"Saved frame {frame_num} as '{frame_path}'")
    
                # 1フレームずつ inputs ディレクトリに入れ替えて推論ループを実行する
                single_frame_dir = "frames_single"
                os.makedirs(single_frame_dir, exist_ok=True)
                for f in os.listdir(single_frame_dir):
                    os.remove(os.path.join(single_frame_dir, f))
                Image.open(frame_path).convert("RGB").save(
                    os.path.join(single_frame_dir, "a.png")
                )
    
                args.input = single_frame_dir
                loop = loop_cls(args)
                loop.run()
    
                save_path = os.path.join(args.output, f"a{str(frame_num).zfill(7)}.png")
                produced = os.path.join(args.output, "a.png")
                if os.path.exists(produced):
                    os.replace(produced, save_path)
                print(f"save to {save_path}")
                frame_num += 1
    
            cap.release()
    
    
    if __name__ == "__main__":
        main()
    
  4. .mp4 動画ファイルを準備する

    ここでは,次のコマンドを実行する, 動画像ファイルをダウンロードし, 「-b:v 100k -vf "boxblur=luma_radius=5:luma_power=1,eq=contrast=1.5」を指定することにより,わざと動画像を劣化させている. また、-vf scale=1024:-1 は、動画の幅を1024画素に変換し,高さをアスペクト比に基づいて算出している.

    もちろん,自前の動画ファイルを準備してもよい.

    cd /d c:%HOMEPATH%\DiffBIR
    mkdir invideo
    curl -O https://www.kkaneko.jp/sample/pose/kaneko_sample_video.mp4
    del kaneko_sample_video_lowquality.mp4
    ffmpeg -i kaneko_sample_video.mp4 -vf "scale=1024:-1,boxblur=luma_radius=5:luma_power=1,eq=contrast=1.5" -b:v 100k -r 30 kaneko_sample_video_lowquality.mp4
    
    copy kaneko_sample_video_lowquality.mp4 invideo
    

    ここで準備した動画ファイル kaneko_sample_video_lowquality.mp4 は次のような 動画である.

    準備した動画ファイルは,invideo のようなディレクトリを作り,そこに置くことにする.

  5. プログラムの実行
    Python プログラムの実行

    Python 開発環境(Jupyter Qt Console, Jupyter ノートブック (Jupyter Notebook), Jupyter Lab, Nteract, Spyder, PyCharm, PyScripterなど)も便利である.

    Python のまとめ: 別ページ »にまとめ

    cd /d c:%HOMEPATH%
    cd DiffBIR
    python diffbirvideo.py ^
    --input invideo ^
    --task sr ^
    --upscale 1 ^
    --version v2.1 ^
    --captioner llava ^
    --cfg_scale 8 ^
    --noise_aug 0 ^
    --output out ^
    --device cuda
    
  6. 連番画像ができるので確認
  7. 連番画像から .mp4 動画ファイルを作成
    ffmpeg -framerate 30 -i a%07d.png -c:v libx264 -pix_fmt yuv420p output.mp4
    

    結果は次の通り

    使用した動画ファイル: kaneko_sample_video_lowquality.mp4

    DiffBIR での処理結果: output.mp4