AIによる画像の高画質化の仕組みと、使いどころ

かつて「拡大」といえば、ピクセルを引き伸ばしてうまくいくよう祈ることでした。現代のAIによる高画質化は、まったく別の処理です。何百万枚もの画像を見てきたニューラルネットワークが、写真が縮小、圧縮、あるいは雑に保存される前に持っていたであろうディテールを再構築します。その内部で実際に何が起きているのか、そして最良の結果を得るにはどうすればよいのかを、わかりやすく解説します。

リサイズは高画質化ではない

一般的なソフトで画像を拡大すると、「補間」が行われます。手持ちのピクセルを大きなキャンバスに広げ、隙間を周囲のピクセルの平均で埋める処理です。ニアレストネイバー法はピクセルをそのままコピーするので、カクカクした見た目になります。バイリニア法とバイキュービック法はピクセルを混ぜ合わせるので、ぼやけた見た目になります。古典的なフィルターで最も優れたLanczos法は輪郭を少しよく保ちますが、どんな補間方法でも情報を増やすことはできません。800×600の写真に含まれる本物のピクセルは480,000個です。これを3200×2400に拡大すると、720万個のピクセルを同じ480,000個の値で表すことになります。欠けている93%こそが、拡大した画像がぼやける理由です。データがそもそも存在しないのです。

超解像:失われたディテールを推測する

AIによる超解像は正反対のアプローチをとります。既存のピクセルを平均するのではなく、何百万組もの画像ペアから学んだ知識を使って、欠けているピクセルを予測するのです。学習では、鮮明な写真と、わざと劣化させたコピー(縮小、ぼかし、ノイズ付加、JPEGでの強い圧縮)をネットワークに見せ、元の画像をどれだけうまく再構築できたかで採点します。これを何百万回も繰り返すことで、ネットワークはレンガ、布、毛並み、葉、肌が高解像度でどう見えるか、そして画像が縮小されたときにそれぞれがどう劣化するかを身につけます。

このサイトで動かしているオープンソースモデルReal-ESRGANは、この考え方を洗練させたもので、実用上重要な工夫が2つあります。1つ目は、敵対的生成ネットワークであることです。本物の写真と再構築された画像を見分けるよう訓練された「批評家」役のネットワークがもうひとつあり、生成側は無難になめらかな画像ではなく、写真らしい質感を出すよう鍛えられます。2つ目は、現実に近い劣化パイプライン(ぼかし、センサーノイズ、リサイズ、圧縮のランダムな組み合わせ)で学習していることです。そのため、実験室的な縮小画像だけでなく、実際に手元にある雑多な画像にも対応できます。ここで使っているバリアントrealesr-general-x4v3は、コンパクトな汎用版です。重みは約5 MBで、入力のちょうど4×の解像度を出力します。

これがブラウザのタブで動くようになった理由

少し前まで、この種のモデルを動かすにはNVIDIA製GPUを積んだデスクトップアプリかサーバー群が必要でした。オンラインの高画質化ツールの多くが画像をクラウドにアップロードするのはそのためです。状況を変えた出来事が2つあります。ONNX Runtime Webによって本格的なニューラルネットワークをJavaScript環境で実行できるようになり、WebGPUによってブラウザのコードからグラフィックボードを直接使えるようになりました。現在のChrome、Edge、Safariは、5 MBの超解像ネットワークを対話的な速度で動かせるだけのGPU演算能力を提供しています。WebGPUが使えない環境では、同じモデルがCPU上のWebAssemblyに切り替わります。速度は落ちますが、出力はまったく同じです。

進行状況バーで気づくかもしれない技術的な工夫がひとつあります。画像は一度に処理されるのではなく、8ピクセルずつ重ねた192ピクセルのタイルに分けて処理されます。タイルに分けることで、画像がどれだけ大きくてもGPUメモリの使用量は一定に保たれます。また重なり部分があることで各タイルが隣のタイルの情報を参照でき、合成したときに継ぎ目が見えなくなります。デスクトップツールが非常に大きなファイルを扱うときと同じ手法です。

実際の速度:正直な数字

速度は、ブラウザがどのエンジンを使えるかでほぼ決まります。以下は、Appleシリコン搭載のノートパソコンのChromeで、このサイトの4×モデルを実測した結果です(2026年8月)。

入力サイズタイル数WebGPUWASM(代替処理)
512×51292.9秒6.0秒
1024×10243610.7秒約1分
2000×150088約26秒(推定)約2.5分(推定)

お使いのハードウェアによって結果は変わります。ゲーミングPCならこの数字を上回り、古いスマートフォンでは届きません。また、初回アクセス時にはエンジンとモデルを一度だけダウンロードし(約10 MB)、初回実行時にGPUシェーダーをコンパイルします。その後はすべてローカルにキャッシュされ、次回以降はすぐに開始できます。

4×高画質化が役立つ場面

  • 印刷。画面では約100 DPIで足りますが、印刷には約300 DPIが必要です。1200×900のWeb用写真をきれいに印刷できるのは4×3インチまでですが、4800×3600に高画質化すれば、16×12インチのプリントをフル300 DPIでカバーできます。
  • 古い写真や低解像度の写真。初期のデジタルカメラの写真、原本が失われてダウンロードしたコピーしか残っていない写真、小さなスキャン画像。これこそ典型的な修復の用途で、モデルが最も力を発揮する場面です。
  • ロゴ、イラスト、ゲームのテクスチャ。Real-ESRGANはイラストの輪郭をうまく処理します。4×の出力なら、トリミングや拡大表示、再合成の余裕もたっぷりあります。
  • フルサイズで必要なサムネイル。商品写真、アルバムのジャケット、アバターなど、残っているのが小さなコピーだけの場合に。

…そして役立たない場面

  • 小さな文字。超解像が再構築するのは質感であって、言語ではありません。読めない文字は、たいてい、くっきりしているのに間違った形になります。
  • ひどく崩れた顔。この汎用モデルには顔の復元に特化した処理がありません。30ピクセルのにじみでしかない顔は、(少しシャープな)にじみのままです。
  • すでに鮮明な画像。元のサイズでくっきりしている写真なら、4×にしても増えるのはほぼファイルサイズだけです。ピクセルが具体的に必要なときに高画質化しましょう。

何もアップロードせずに高画質化する

オンラインの高画質化ツールの多くはクラウドサービスです。写真は相手のサーバーに送信され、そこで処理され、結果が送り返されます。良心的なサービスは「24時間以内」の削除を約束していますが、その約束は確かめようがなく、アップロードが行われたこと自体は認めています。ここではモデルがブラウザの中で動くため、そうしたリスクはまるごとなくなります。家族写真も、身分証のスキャンも、未発表の商品写真も、クライアントの仕事も、ネットワークを一切通りません。作業中にネットワークインスペクターを見ていても、ページ読み込み後にオフラインにしてもかまいません。必要なものがすべて手元にあるので、高画質化はそのまま動き続けます。

無料なのに裏がないのも、この仕組みのおかげです。私たちが回収すべきGPU費用がないので、クレジットも利用上限もアカウントも透かしもありません。処理するのはあなたのマシンで、結果もあなたのものです。

最良の結果を得るために

  • 手元にある最も圧縮の少ないコピーを使いましょう。同じ画像なら、保存し直したJPEGより元のPNGのほうが良い結果になります。
  • 先にトリミングしてから高画質化しましょう。モデルが4×の処理能力を本当に必要なピクセルに使えるうえ、サイズの上限にも収まりやすくなります。
  • スライダーは100%の表示倍率で見比べましょう。プレビューに縮小された状態では、質感の違いは見えません。
  • 編集や印刷にはPNGの出力をそのまま使い、JPEGやWebPへの再圧縮は、必要な場合だけ最後の工程で行いましょう。

自分の画像で試してみませんか? 高画質化ツールはトップページにあります。無料、無制限で、写真があなたのマシンから出ることはありません。ご質問があれば、よくある質問で対応形式、サイズの上限、ブラウザの対応状況を説明しています。