記事のサマリー(TL;DR)
- OpenAIは新しい画像生成モデル「ChatGPT Images 2.5」を発表し、より精細なディテール、正確な編集、高速な生成を実現したとしています。画像生成のレイテンシはImages 2.0と比較して最大50%削減されたと説明されています。
- ChatGPTには、手描きの下絵を参照画像として使える新機能「Sketch」、人気の画像フォーマット向けの「テンプレート」、画像への直接コメント機能、使用したプロンプトの共有機能が追加されます。
- APIでは新たに「GPT‑Image‑2.5 Flare」と「GPT‑Image‑2.5 Sunburst」の2つのモデルが提供されます。Images 2.5はChatGPT、ChatGPT Work、Codexの全ユーザーにデスクトップ・モバイル・Web上で提供されます。
詳細
概要
OpenAIによると、ChatGPT Images と API上のGPT-Image系モデルを合わせて、毎週30億枚以上の画像が生成されているとのことです。今回発表された「ChatGPT Images 2.5」は、その最新の画像モデルとして、より精細なディテール、より正確な編集、より高速な生成をクリエイティブなワークフローにもたらすとされています。
Images 2.5は、より自然な光の表現と豊かな質感を生成し、参照写真に写る被写体をより忠実に保持し、複数ターンにわたる編集指示にもより確実に従うとされています。また、画像生成のレイテンシはImages 2.0と比較して最大50%削減されたと説明されており、これによりアイデアの生成や修正をより素早く行えるとしています。
ChatGPTでは、創作プロセスをより細かくコントロールできる新機能が導入されます。「Sketch」は、ChatGPT内で直接手描きを行い、それを最終的な画像の参照として使える新機能です。「テンプレート」機能により、チラシや商品写真といった代表的な画像フォーマットでの作成を始めやすくなります。さらに、画像に直接コメントを付けることでより的を絞った編集が可能になったほか、使用したプロンプトを共有し、他のユーザーが自分の写真やディテールを使って同じアイデアを試せるようになりました。
Images 2.5は、ChatGPT、ChatGPT Work、Codexの各ユーザーにデスクトップ、モバイル、Webを通じて提供されます。
開発者向けには、APIに2つの新モデルが導入されます。「GPT‑Image‑2.5 Flare」は品質・編集・速度の面で同様の改善をもたらすモデルで、「GPT‑Image‑2.5 Sunburst」は生成時間は長くなるものの、より精密な創作作業向けの高い精度を提供するモデルとされています。
参照画像に基づく再現性(Image fidelity)
OpenAIは、意味のある画像は実在の人物・場所・記憶に基づいていることが多いとした上で、Images 2.5は参照写真をもとに、見慣れた被写体を新しい設定・ビジュアルスタイル・構図へと変換する精度が向上していると説明しています。被写体はより認識しやすくなり、光や質感もより自然に感じられ、被写体特有の特徴もより保持されやすくなったとしています。
APIを使って開発するチームにとっても、この再現性の向上により、参照画像を起点とするワークフローの信頼性が高まり、バリエーションを生成しても元の素材に近い状態を保ちやすくなるとされています。
精密な編集(Precision editing)
OpenAIは、ユーザーが意図した内容により近い最終画像を得られるよう、的を絞った編集をしやすくしたと説明しています。Images 2.5は、複雑な被写体や背景であっても、指示された箇所のみを編集し、それ以外の部分は変更しないという点で改善されているとしています。
Images APIを利用する開発者にとっては、商品、背景、コピーといった単一の要素のみを更新しつつ、被写体・構図・ブランド表現をそのまま維持できるようになるとされています。
原文には、この精密な編集指示への追従性の向上を示す複数の画像で構成された動画が掲載されています。
複数ターンにわたる編集の一貫性(Multi-turn editing consistency)
ChatGPTでの長い会話の中でも、Images 2.5は複数回の編集にわたって具体的な編集指示をより確実に守るとされています。それ以前の変更内容が保持されやすくなり、新たな編集を重ねても画像の品質が時間とともに劣化しにくくなっているとしています。
この一貫性は、既存のアセット全体を作り直すことなく的を絞った変更を行う必要がある実運用のワークフローにおいても重要だとされています。
原文には、複数ターンにわたって画質を維持する能力の向上を示す、複数の画像で構成された動画が掲載されています。
知性とスタイルの改善(Intelligence and style improvements)
OpenAIは、Images 2.5は複雑な視覚的指示を理解し、一貫性のある結果に落とし込む能力が向上していると説明しています。現実世界の情報を含む画像はより正確な内容になり、透明な背景を含むより複雑なレイアウトも扱えるようになったとしています。また、ビジュアルスタイルの反映にも優れており、意図した芸術的な方向性により近い画像を生成できるとしています。
開発者や企業にとっては、複雑な創作ブリーフへの対応がより安定するとされています。指示がより具体的になっていく過程で内容がずれていくのではなく、要求された方向性・構図・個々のディテールを保持しやすくなるとしており、これはブランドに沿った一連のクリエイティブ素材の生成、階層構造を保つUIコンセプト、決まった構成に沿うプレゼンテーション用ビジュアルの作成などで重要だとしています。
Sketchでアイデアを描いて形にする
OpenAIは、アイデアを説明する最も分かりやすい方法が「描くこと」である場合があるとしています。
新機能「Sketch」により、ChatGPT内で直接手描きを行い、それをビジュアルガイドとして利用できます。部屋のレイアウトや検討中の服のシルエット、あるいはただの落書きを素早く描くだけで、ChatGPTがその粗いスケッチを完成した画像に変換します。スタイルやその他反映したい詳細の説明を加えることもできます。
プロのアーティストである必要はなく、これは最終的な画像を意図したイメージに近づけるためのもう一つの方法だとされています。試すには、ChatGPT内で「@Sketch」と入力するとのことです。
テンプレートでプロンプトを構造化する
何を作りたいかは明確でも、始め方に助けが必要な場合があるとしています。
そのために、代表的な創作フォーマット向けのテンプレートが導入されます。白紙の状態から始める代わりに、「Poster」や「Merch」といったテンプレートを選び、伝えたい情報やデザイン要素、好みのスタイルといった詳細を追加して、結果をカスタマイズできます。
良いアイデアを他の人にも共有する
出来上がった画像が良すぎて、共有したくなることもあるとしています。
画像を共有する際には、そこに至るまでに使ったプロンプトも合わせて共有できるようになりました。これにより、他のユーザーが同じアイデアをもとに、自分自身の画像やディテールを使って自分なりのバージョンを作ることができます。
例として、現在話題になっているという、80年代の自分の姿を再現するプロンプトが紹介されています。
APIにおけるImages 2.5
開発者は、Images APIを使って、クリエイティブ・マーケティング・小売・メディアの各チームが日常的に利用する製品に画像生成のワークフローを組み込んでいます。
APIでは以下の2つの新しい画像モデルが提供されます。
- GPT‑Image‑2.5 Flare:品質・編集・速度の面で同様の改善をAPIにもたらすモデルで、多くのアプリケーションにおけるデフォルトの選択肢とされています。GPT‑Image‑2よりも高品質な画像を、レイテンシ50%減で生成できるとされています。クリエイターやソーシャル向けコンテンツから、商品体験、ビジュアル検索、迅速な画像プロトタイピング、大量生成まで幅広く適しているとしています。
- GPT‑Image‑2.5 Sunburst:編集にわたってより厳密なコントロールが求められる、プレミアムなビジュアルワークフロー向けに構築されたモデルです。制作用のキャンペーンクリエイティブや、仕上がりの整った商品画像といった創作・編集ワークフローでの利用が想定されています。
原文では、新モデルについての早期利用顧客のコメントが紹介されています。
安全性への取り組み
OpenAIは、画像生成を「有用で、創造的で、安全なもの」にすることを目指しているとしています。ChatGPT Images 2.5は既存の安全対策を土台としており、有害な出力を防ぐためにプロンプトと画像の両方についてチェックを行っているとしています。引き続き、C2PAメタデータと不可視の電子透かしを用いて、自社のツールで作成された画像を識別できるようにしているとのことです。評価内容やアプローチについての詳細は、システムカードで確認できるとしています。
価格と提供状況
Images 2.5は本日より、ChatGPT、ChatGPT Work、Codexの全ての利用プランのユーザーに対し、デスクトップ、モバイル、Web上で順次提供が開始されます。
GPT‑Image‑2.5 SunburstおよびGPT‑Image‑2.5 FlareはAPI上で利用可能です。価格の詳細は、OpenAIの案内ページで確認できるとされています。