動画超解像コンテストの優勝アルゴリズムがCVPR 2022に選出された。センスタイムと南洋理工大学が開発したアルゴリズムで、16の類似モデルを一気に打ち負かした。

この記事はAI新メディアQuantum Bit（公開アカウントID：QbitAI）より許可を得て転載しています。転載の際は出典元にご連絡ください。

ぼやけた古い映画を高解像度にするにはどうすればいいですか?

AI の答えは超解像度アルゴリズムです。

現在、ビデオ超解像の分野では、強力なアルゴリズムが超解像コンテストNTIRE 2021で3回の優勝と1回の準優勝を獲得し、CVPR 2022にリストされました。

その名前はBasicVSR++で、ビデオ超解像 SOTA モデル BasicVSR をさらに改良したものです。

BasicVSRはNTIREチャンピオンシップでも優勝し、CVPR 2021に選出されました。

現在、この BasicVSR+++ は、基本的に同じ数のパラメータで前世代の製品を大幅に上回り、PSNR (ピーク信号対雑音比、画質評価指標) が 0.82dB 向上しているだけでなく、より多くのビデオ復元タスク (圧縮ビデオの強化など) にも適用できます。

BasicVSRの強化版

BasicVSR は双方向伝播 + 特徴アライメントを使用して、入力ビデオ全体から超解像のための有効な情報を抽出します。

しかし、その基本設計では、特に複雑に遮蔽された領域を扱う場合に細かい詳細を復元するのが難しいなど、情報集約の有効性も制限されます。

そのため、BasicVSR++ の拡張バージョンでは、 2 次グリッド伝播を使用して、伝播と配置の点で再設計されました。光学フロー誘導変形アライメントフローガイドによる変形可能なアライメントの設計は、ネットワーク内の情報集約能力を向上させ、閉塞領域の堅牢性と有効性を高めるために使用されます。

その中で、2 次グリッドは、異なる時間および空間位置から情報を前方および後方に伝播することを可能にし、特徴の伝播をより効率的にします。

オプティカルフローガイドによる変形可能なアライメントにより、フレームのより堅牢な特徴アライメントが可能になります。

このアライメント方法は、変形可能な畳み込みでは単純な変形アライメントのトレーニング効果が不安定であるため主に使用されます。（DCN）ネットワーク内の多様なオフセットにより、変形アライメントのパフォーマンスはオプティカルフローアライメントよりも向上します。

BasicVSR++ の具体的なアーキテクチャは次のとおりです。

入力ビデオが与えられると、まず残差モジュールを使用して各フレームから特徴を抽出します。次に、これらの特徴は 2 次ネットワークに伝播され、アライメント部分ではオプティカルフローガイドによる変形アライメントが使用されます。情報伝播が完了した後、特徴が集約されて出力画像が生成されます。

16の類似アルゴリズムの中でパフォーマンスが最高

著者らは、16 種類の異なるビデオ超解像度アルゴリズムのパフォーマンス、パラメータ数、および時間消費を比較しました。その結果、BasicVSR++ は、すべてのデータセットで両方の劣化方法で最高のパフォーマンスを達成しました (赤は最高スコア、青は 2 番目に良いスコアを表します)。

特に、BasicVSR++ は、大容量スライディングウィンドウアルゴリズム EDSR と比較して、65% 少ないパラメータで 1.3dB のパフォーマンス向上を実現します。

従来の最先端の IconVSR と比較すると、BasicVSR++ はパラメータが少なく、パフォーマンスが 1dB 向上します。

BasicVSR++ (S) の軽量バージョンでは、前バージョンの BasicVSR と比べて 0.82dB の改善が見られ、これは大きなメリットです。

具体的な結果に関しては、REDS4、Vimeo-90K-T、Vid4 データセットのいずれであっても、BasicVSR++ は極めて詳細な画像を最良の効果で復元できます。

現在、BasicVSR++ のコードはオープンソース化されており、興味のある学生は試すことができます。

著者について

第一著者: 陳卓傑（ケルビン・CK・チャン）私は南洋理工大学コンピュータサイエンス工学部の博士課程3年生です。香港中文大学で学士号と修士号を取得しました。

彼の現在の研究分野は画像/ビデオの復元であり、合計 5 つのトップカンファレンス論文を発表しています。

責任著者は、指導教員のChen Change Loy氏であり、南洋理工大学コンピューターサイエンス学部の准教授であり、SenseTimeと南洋理工大学の共同研究室であるS-Labの副所長である。

彼らは BasicVSR のオリジナルの作成者でもあります。

BasicVSR++ の残りの 2 人の著者は、同校の博士課程 2 年生である Zhou Shangchen 氏と、同校の研究員である Xu Xiangyu 氏です。

論文アドレス: https://arxiv.org/abs/2104.13371

コード：

https://github.com/ckkelvinchan/RealBasicVSR

<<: 量産型マスターコントロールチップのネットワークセキュリティ設計

>>: 2つのセッションが始まります！自動運転とスマートカーに関する最新の提案13選

マイクロソフト、学習者の読解力向上を支援する独立AIツール「リーディングコーチ」を発表

動画超解像コンテストの優勝アルゴリズムがCVPR 2022に選出された。センスタイムと南洋理工大学が開発したアルゴリズムで、16の類似モデルを一気に打ち負かした。

BasicVSRの強化版

16の類似アルゴリズムの中でパフォーマンスが最高

著者について

マイクロソフト、学習者の読解力向上を支援する独立AIツール「リーディングコーチ」を発表

DeLu Deep Visionが蘇州スマート博覧会に登場、3Dフルスタックでマシンビジョンの新時代を切り開く

再トレーニングなしでモデルを6倍圧縮：数学者チームが新しい量子化法を提案

OpenAI の共同創設者 Karpathy が記事「自動運転による AGI の解釈」を公開しました。元の投稿は削除されました。保存済み

ツイッターがマスク氏の買収を阻止：15％以上の株式を保有する者は割引価格で発行される

レストランロボットの準備はできていますか?それが答えかもしれない

コンピューティングパワーがボトルネックにならないように、Xiaohongshu の機械学習の異種ハードウェア推論を最適化する方法

AIの次の大きな課題：言語のニュアンスを理解すること

2019 年の Web 開発のトレンドトップ 10

推薦する

2021 年の自動化には何が期待できるでしょうか?

Google が「同時通訳」システム Translatotron を発表: テキスト変換なしの音声翻訳

データサイエンスの現在と未来

自動運転時代のヒューマンマシンインタラクションの発展動向

メタは商業用人工知能に注力するためタンパク質折り畳みチームを解散すると報道

虐殺後に行方不明になった親族をAIで探す！ Googleのエンジニアが第二次世界大戦の70万枚以上の古い写真を識別できる顔認識プログラムを開発

ディープラーニングの専門家になるにはどうすればいいですか?このアリ天池大会の優勝者はあなたのためにプロとしての成長の道を計画しました

AIは古い文化的シンボルを解体し革新することはできない

人工知能がスマート交通の発展に与える影響

人工知能は多くの仕事を置き換えるでしょう。将来の子供たちの競争力は成績とは全く関係ないかもしれません。

農業生産性を最適化するスマート農業監視ソリューション