画像生成 AI
ガゾウセイセイエーアイ

画像生成 AI とは、テキストの指示や参考画像から新しい画像を生成する生成 AI の総称で、広告・資料・EC の素材制作に使われる。商用利用では権利と利用規約の確認が欠かせない。
画像生成 AI は、テキストの指示(プロンプト)や参考画像から新しい画像を作る生成 AI の総称である。広告バナー、Web サイトの挿絵、EC の商品イメージ、社内資料の図版などの制作で、ゼロから描く時間を大きく縮められる。
代表的なサービス
| サービス | 特徴 |
|---|---|
| ChatGPT の画像生成(API は GPT Image) | 会話しながら修正でき、文字入りの画像も扱いやすい |
| Gemini の画像生成 | Google のモデル。参照画像の人物や商品を保ったままの編集が得意 |
| Midjourney | 写真調・芸術表現の品質に定評がある |
| Stable Diffusion 系 | オープンなモデル。自社サーバーで動かせ、LoRA で画風を固定できる |
| Adobe Firefly | 商用利用を前提に学習データを管理し、Photoshop などと統合 |
| Canva などデザインツール内蔵 | テンプレートと組み合わせて、デザイナーでなくても使える |
どれが最適かは用途で変わる。文字の入った告知画像なら ChatGPT、既存の商品写真の背景差し替えなら Gemini、ブランドの画風を固定した大量生成なら Stable Diffusion 系、という選び方がひとつの目安になる。
業務で使うときの手順
- 媒体・サイズ・ブランドの色・避けたい表現を先に決める
- 被写体・構図・スタイル・光・背景を具体的に書く。英語のほうが安定するサービスもある
- 1 回で決めず、4〜8 案から選んで部分修正する
- 文字入れ・トリミング・色調整は既存のデザインツールで仕上げる
- どのサービスで、どのプロンプトで作ったかを記録し、後から権利と再現性を確認できるようにする
料金
無料枠(枚数や解像度に制限)、月額のサブスクリプション、API の従量課金の 3 形態が一般的だ。自社サーバーで動かす場合は GPU 費用が中心になる。商用利用の可否と生成物の権利の扱いはプランによって違うため、契約前に確認したい。
商用利用と権利の注意
日本では、人の創作的な関与がないまま AI が生成した画像には著作権が認められにくいと考えられている。自社の生成物を他社に真似されても主張しにくい一方、既存の作品に似た画像を生成して使えば侵害になりうる。有名人の顔、他社のロゴ、キャラクターを含む生成は避けたい。
実在の製品や実績に見える画像を作らないことも大切だ。ディープフェイクへの悪用を防ぐ観点から、生成した旨の記録(来歴情報)を残しておくとよい。誰がどの用途で使ってよいかをガイドラインにまとめ、チェック担当を置くのが現実的な運用である。動画については Sora の項目で、提供終了後の代替サービスとあわせて整理している。生成 AI の業務導入とガイドライン整備は AI・DX サービスで支援している。
関連用語

Jev(TypeSafe AI)
Jev とは、TypeSafe AI が開発した判断専用の AI モデルで、文章を生成せず、あらかじめ決めた選択・段階評価・真偽の判断を確率付きで返す「System One モデル」である。

PEFT
PEFT(Parameter-Efficient Fine-Tuning)とは、大規模言語モデルの全パラメータではなく一部のみを更新することで、少ない計算資源とデータでモデルを特定タスクに適応させるフ

QLoRA
QLoRA(Quantized LoRA)とは、LoRA に 4bit 量子化を組み合わせることで、コンシューマ向け GPU でも大規模言語モデルのファインチューニングを可能にした手法である。

RLHF
RLHFとは人間のフィードバックを報酬として使う強化学習手法、RLVRとは検証可能な正解を報酬として使う強化学習手法であり、いずれもLLMの出力を人間の期待に沿うよう調整するために用いられる。