記事のサマリー(TL;DR)
- OpenAIは、最上位モデル「GPT‑6 Astra」に続き、コスト効率を高めた「GPT‑6 Sol」と「GPT‑6 Luna」を発表しました。両モデルはAstraと同様の手法で訓練されており、専門的業務、事実性、コーディング、コンピュータ操作、アライメントにおけるAstraの性能向上を、より高速で安価なモデルにもたらしています。
- キャッシュや推論の改善により提供コストを下げ、その削減分をAPI価格に反映。GPT‑6 SolおよびLunaのAPI価格は、GPT‑5.6の販促価格と比較して入力・出力とも50%引き下げられました。
- GPT‑6 SolとLunaは本日より、ChatGPT WorkおよびCodexでPlus、Pro、Business、Enterprise、Eduの各ユーザーに提供開始。FreeおよびGoユーザーはデスクトップアプリでGPT‑6 Lunaを利用できます。両モデルはChatではまだ利用できません。
利用条件・提供範囲
GPT‑6 SolおよびGPT‑6 Lunaは、本日よりChatGPT WorkおよびCodexにおいて、Plus、Pro、Business、Enterprise、Eduの各ユーザー向けに提供が始まりました。Free版およびGo版のユーザーは、デスクトップアプリでGPT‑6 Lunaを利用できます。これらのモデルは、Chatにはまだ導入されていません。OpenAI APIでは、gpt-6-solおよびgpt-6-lunaとして利用可能です。
なお、サービスの安定性を保つため、ChatGPTでの展開は当日中に段階的に行われる予定であり、ChatGPT WorkまたはCodexで新モデルが表示されない場合は、時間を置いて再度確認するよう案内されています。
詳細
GPT‑6 SolとLunaの位置づけ
OpenAIは今月初め、「世界で最も知的でアラインメントの取れたモデル」として GPT‑6 Astra を発表しました。もっとも要求水準の高い重要なプロジェクトには引き続きAstraの性能が必要とされる一方、作業には異なる規模、ペース、予算があるとして、GPT‑6ファミリーをGPT‑6 SolおよびGPT‑6 Lunaへと拡張しました。
GPT‑6 Astraが新世代の知能を導入したのに対し、SolとLunaはコスト効率のフロンティアを前進させることで、その知能がもたらす恩恵を広く行き渡らせる役割を担うとされています。両モデルはAstraと同様の手法で訓練されており、専門的業務、事実性、コーディング、コンピュータ操作、アライメントにおけるAstraの最先端性能の進歩を、より高速で手頃な価格のモデルにもたらしています。
GPT‑6モデル群は、コストと知能のカーブ全体で優位に立つとされ、各価格帯で高い性能を発揮しつつ、それを大規模に効率よく提供するインフラを備えているといいます。キャッシュおよび推論の改善により、これらのモデルをより低コストで提供できるようになり、その削減分を利用者・顧客に直接還元する形で、SolおよびLunaのAPI価格をGPT‑5.6の販促価格と比較して50%引き下げました。
GPT‑6 API価格
| モデル | 入力 | 出力 | 価格引き下げ |
|---|---|---|---|
| GPT‑5.6 Sol → GPT‑6 Sol | $4 → $2 | $20 → $10 | 50%引き下げ |
| GPT‑5.6 Luna → GPT‑6 Luna | $0.20 → $0.10 | $1.20 → $0.50 | 50%引き下げ |
価格は100万トークンあたりの金額です。GPT‑6 Astraは引き続き全体で最良のモデルとされ、最高の結果と妥協のない体験を求める場合に選択するモデルと位置づけられています。
モデルファミリー全体での性能向上
GPT‑6 SolとLunaは、既に利用されているモデル群に知能面の向上とコスト効率をもたらし、複雑な作業をこなす上で有用な能力を強化しています。
専門的業務
GPT‑6 Solは、より高い利用上限とより低いコストにより試行錯誤の余地を広げつつ、難易度の高い業務タスクに対応できるとされ、同水準の価格帯の競合モデルと比べてより高い知能とより良い結果を提供するとしています。
業務アプリ横断のワークフローをテストする「AutomationBench」において、GPT‑6 Sol(xhigh効力)はClaude Opus 5(max効力)を上回る成績を、Opus 5のタスクあたりコストのわずか9%で達成しました。また、high効力のGPT‑6 Lunaは、前モデルに対して5.4ポイント性能が向上し、タスクあたりコストは58%低減しています。
AutomationBench 1.0.6では、営業・マーケティング・オペレーション・サポート・財務・人事にまたがる47のツールを用いたエンドツーエンドのワークフローでAIエージェントを評価しています。Claude Fable 5.1のデータポイントは、タスクの約40%で発生したOpus 5へのフォールバックのコストを含んでいないため、実際のコストを過小評価しているとされています。
GPT‑6 Solは、Claude Fable 5.1よりもはるかに低いコストで上回り、低効力設定のGPT‑6 Astraをも上回っています。
| モデル(効力) | スコア | タスクあたりコスト |
|---|---|---|
| GPT‑6 Sol (xhigh) | 33.2% | $0.27 |
| GPT‑6 Astra (low) | 30.3% | GPT‑6 Solの3.9倍 |
| Claude Opus 5 (max) | 26.9% | GPT‑6 Solの11.1倍 |
| Claude Fable 5.1 w/ Opus 5 Fallback (max) | 31.4% | GPT‑6 Solの8.9倍超(フォールバックコストは未報告) |
複雑な専門的ワークフローでエージェントを評価する「Agents’ Last Exam」では、GPT‑6 Sol(max効力)が56.4%のスコアを記録し、Claude Opus 5の同評価における最高スコアを、タスクあたりコスト60%減で上回りました。
事実性
回答の有用性は事実の正確性に左右されるとし、OpenAIは事実の信頼性向上に継続的に取り組んでいるとしています。ユーザーが誤りを指摘した実際の会話(匿名化済み)に基づく社内の事実性評価において、GPT‑6 Solは前モデルの約半分の誤り件数となり、大幅に低いコストでAstraに近い信頼性に近づいているとしています。GPT‑6 Lunaも大きく改善しており、より高い効力設定では、GPT‑5.6 Solとほぼ同等の性能を、その約100分の1のコストで達成しているとしています。
この評価は、ユーザーが以前のモデルによる事実誤りを指摘した、匿名化されたChatGPTの会話に基づいています。こうした誤りを含む会話は、事実誤りがより稀な通常利用を代表するものではないとされています。スコアは回答の長さについて調整されていませんが、冗長性を変化させた検証では、回答の長さへの依存はほとんど見られなかったとしています。
コーディング
コーディングエージェントは今年、これまで以上に複雑さ・範囲・期間を伴うタスクに取り組み始めているとされ、OpenAI社内での利用も指数関数的に増加しているといいます。API価格換算で、1日あたりのトークン使用量は、中央値の研究者で600ドルを、上位90パーセンタイルの研究者では7,000ドルを超えているとしています(出典:Research acceleration: The view inside OpenAI)。コーディングエージェントがより長時間・高難度のタスクを担うようになるにつれ、継続利用のコストがより重要になるとし、GPT‑6 SolおよびLunaは高いコーディング性能と低いAPI価格を両立させ、開発者が試行錯誤する余地を広げ、チームがCodexに任せる作業をより意欲的に検討できるようにするとしています。
実際のコードベースへのマージ可能な変更を生成できるかを評価する「FrontierCode」において、GPT‑6 SolはGPT‑5.6 Solから大きく改善し、Claude Fable 5.1のxhigh設定に、はるかに低いコストで匹敵する性能を示しています。
実際のコードベースでの複雑なソフトウェアエンジニアリングタスクを検証する「DeepSWE v1.1」では、GPT‑6 Sol(max効力)が68.8%のスコアを記録し、Claude Fable 5の同評価における最高スコア(xhigh効力で69.9%)に1.1ポイント差まで迫りつつ、タスクあたりコストは約80%低くなっています。
GPT‑6 Luna(max効力)は66.6%のスコアを記録し、medium効力のClaude Opus 5およびFable 5と同等の水準です。これらの比較において、Lunaのタスクあたりコストは、Opus 5比で93%減、Fable 5比で96%減となっています。
コンピュータ操作
GPT‑6 Astraはコンピュータ操作において引き続き世界最高水準のモデルとされる一方、GPT‑6 SolとLunaは前モデルよりもコスト効率の高い性能を提供するとしています。長時間にわたるコンピュータ操作ワークフローを検証する「OSWorld 2.0 offline」では、GPT‑6 Sol(xhigh効力)がClaude Opus 5(medium効力)とほぼ同等のスコア(60.5%対60.3%)を、タスクあたりコスト約80%減で達成しています。GPT‑6 Luna(max効力)は、GPT‑5.6 Sol(medium効力)を、そのコストの10分の1で上回っています。
OSWorld 2.0では、日常業務・専門業務にまたがる長時間のコンピュータ操作ワークフローをAIエージェントに実行させて評価しており、今回はv2026.08.08版のオフラインセットにおける部分報酬を報告しているとしています。
対話スタイル
GPT‑6 Astraで改善されたコミュニケーションスタイルは、SolおよびLunaにも導入されており、特に技術的な会話やコーディングに関する対話で顕著になるとみられています。専門用語の減少、不自然な言い回しの減少、価値の低い詳細情報の削減、そして全体としてやや簡潔でありながら内容を損なわない回答が期待できるとしています。
記事では、あるプロンプト例(Webサイトデザインの変更依頼)に対するGPT‑5.6 SolとGPT‑6 Solの回答を比較し、スタイルは主観的であるとしつつも、GPT‑6 Solの回答の方が好ましいとしています。GPT‑6 Solは早合点せず、質問者にとって自明な詳細(サイトが4ページ構成であることなど)の繰り返しが少なく、曖昧な表現(「bento feel」「reshaping… around that system」など)が少なく、何を確認し何を確認していないかをより明確に伝え、画像ツールのプロンプトのような実装の詳細を不必要に共有しないとしています。
エージェントおよび長い会話向けのキャッシュ改善
トークン単価の引き下げに加え、開発者がGPT‑6上で構築するアプリケーションが再利用するコンテキストについても、より多くのコスト削減ができるよう支援するとしています。GPT‑6向けにプロンプトキャッシュを改善し、デフォルトでのキャッシュヒット率を高めることで、エージェントがより多くのコンテキストを再利用し、より速く応答し、キャッシュされた入力トークンの読み取りに対して90%の割引を受けられるようにしたとしています。
開発者は、キャッシュ性能を測定・最適化するための手段も追加で利用できます。
- 監視と診断:Prompt Caching Dashboardでは、どれだけの入力がキャッシュされているか、それが時間とともにどう変化するかを確認できます。診断ツールは、キャッシュの機会損失の原因と対処法を説明します。
- 推論の効力とツール利用可否をキャッシュを崩さずに調整:難しいタスクには推論効力を上げ、単純な追加質問には下げることができ、エージェントのニーズの変化に応じてツールを有効・無効にできます。いずれの操作も、キャッシュ再利用のためにそれ以前のコンテキストを保持するようになったとしています。
- キャッシュ対象のプレフィックスを最適化:明示的なブレークポイントにより、開発者はキャッシュされるプロンプトのプレフィックスがどこで終わるかを選択できます。これにより、キャッシュ再利用に対するコントロールが高まり、性能改善につながるとしています。
GitHubの報告によると、これらの改善により、過去数か月間でOpenAIモデルへの数十億件のリクエストにおいて、新規処理が必要なプロンプトトークンの割合が50%以上削減され、Copilotの応答速度向上に寄与しているとしています。
アライメントの継続的な改善
GPT‑6 SolおよびLunaは、これまでで最もアライメントが取れたモデルとされるAstraで導入されたアライメント関連の取り組みを引き継いでいます。アライメント評価において、SolとLunaはいずれもGPT‑5.6の対応モデルからの改善を示しており、コーディング作業に関する誤解を招く主張の発生率の低下も含まれるとしています。
なお、これらの評価は意図的に困難な状況を検証するものであり、通常利用における失敗率を測定するものではないとしています。詳細な結果はシステムカードに記載されています。
評価に関する注記
GPT‑6の評価は、研究環境またはAPI経由で実施されており、システムプロンプトや利用可能なツールなどの違いにより、実際のChatGPT本番環境の出力とはわずかに異なる場合があるとしています。競合モデルの評価は、公開されている報告書から引用されています。Claude Fable 5.1のスコアが得られない項目については、Claude Fable 5のスコアが報告されています。
[“GPT-6”, “OpenAI”, “GPT-6 Sol”, “GPT-6 Luna”, “ChatGPT”, “Codex”, “API価格”]