記事のサマリー(TL;DR)
- OpenAIは、GPT‑6 Solの上位版となる「GPT‑6.1 Sol」を発表しました。エージェント型コーディング、コンピュータ操作、専門業務においてGPT‑6 Astraに近い性能を、Astraの標準入出力トークン価格の5分の1で提供するとしています。
- キャッシュ入力価格は100万トークンあたり0.10ドルで、標準入力価格より95%安く、GPT‑6 Solのキャッシュ入力価格よりも50%安いとしています。
- 本日よりChatGPT WorkおよびCodexでPlus、Pro、Business、Enterprise、Eduの各ユーザーに提供開始され、OpenAI APIでも
gpt-6.1-solとして利用可能です。Chatでの提供はまだ行われていません。
詳細
価格と性能のバランス
OpenAIは、GPT‑6 Solの上位モデルとして「GPT‑6.1 Sol」を発表しました。GPT‑6.1 Solは、エージェント型のコーディング、コンピュータ操作、専門業務においてGPT‑6 Astraの性能にほぼ匹敵するとしており、価格はAstraの標準入出力トークン価格の5分の1としています。キャッシュ入力コストは100万トークンあたり0.10ドルで、標準入力価格より95%低く、GPT‑6 Solのキャッシュ入力価格よりも50%低いとしています。OpenAIは、これによりコンテキストをリクエスト間で再利用する高性能なエージェントを開発・運用する余地が開発者に広がるとしています。
あらゆるタスクで強化されたSol
GPT‑6.1 Solは、日常的に重要な業務において能力とコストの新たなバランスを提供するとされています。コードの記述・デバッグから、文書の理解、複数ステップにわたるビジネスワークフローの実行まで、複雑な専門業務全般でGPT‑6 Solに対して大幅な改善が見られるとしています。これらの評価の一部では、GPT‑6 Astraの性能に大幅に低いコストで近づいているとのことです。
コーディング
実際のコードベースにおける複雑なソフトウェアエンジニアリングタスクを評価する「DeepSWE v1.1」では、GPT‑6.1 Solはおよそ5分の1のコストでGPT‑6 Astraに匹敵するスコアを記録し、より低い推論努力・コストでGPT‑6 Solの最高スコアを6.4ポイント上回ったとしています。
専門業務
表、図表、グラフ、細かい注釈を含む複雑なPDF文書を用いて、モデルが専門的な質問にどれだけ正確に答えられるかを測定する「GDP.pdf」では、GPT‑6.1 Solは、テストされた推論設定全体でOpus 5.5(フォールバック利用時)をタスクあたり半分未満のコストで上回るスコアを記録したとしています。また、タスクあたりおよそ5分の1のコストで、GPT‑6 Astraの最高水準の性能に近づいているとしています。GDP.pdfでは、金融、医療、法律をはじめとする10の専門領域から集めた複雑なPDFに関する実際の業務上の質問にモデルが回答することが求められます。
複数ステップのビジネスワークフローを正しく完了できるかを測定する「AutomationBench」では、GPT‑6.1 Solは中程度の推論努力設定において、Opus 5.5をおよそ3分の1のコストで2.2ポイント上回るスコアを記録しました。これは同じ設定におけるGPT‑6 Solのスコアからも4.8ポイントの向上だとしています。AutomationBench 1.0.6では、営業、マーケティング、業務運営、サポート、財務、人事にまたがる47種類のツールを用いたエンドツーエンドのワークフローでAIエージェントがテストされます。なお、Claude Fable 5.1のデータポイントは、タスクの約40%で発生したフォールバックのコストを含んでいないため、実際のコストを過小評価しているとしています。
コンピュータ操作
GPT‑6.1 Solは、コンピュータアプリケーションの操作を伴うタスクでも大幅な進展を見せているとしています。高度なコンピュータ操作ワークフローを評価する「OSWorld 2.0」のオフラインセットでは、GPT‑6.1 Solは最大推論努力設定において、半分未満のコストでGPT‑6 Solを7ポイント上回りました。最大推論努力設定では、タスクあたりおよそ7分の1のコストで、Astraのスコアとの差を2.1ポイントまで縮めたとしています。OSWorld 2.0では、日常的および専門的なタスクにまたがる長期的なコンピュータ操作ワークフローにAIエージェントが挑戦します。記載されているのは、v2026.08.08リリースのオフラインセットにおける部分的な報酬スコアです。
科学研究
データ分析、シミュレーション、定理証明などの科学的ワークフローを評価する「Terminal-Bench Science 0.1」では、GPT‑6.1 Solは最大推論努力設定において、タスクあたり半分未満のコストでGPT‑6 Solのスコアを2倍以上に伸ばしたとしています。最大努力設定では、GPT‑6.1 Solのタスクあたりの平均コストは5.47ドルで、Opus 5.5の23.21ドル、Astraの23.80ドルと比較して、いずれのモデルよりも75%以上低いコストで大幅な科学的能力を発揮しているとしています。なお、テストされたモデルの中では、GPT‑6 Astraが68.1%で最高スコアを維持しており、OpenAIは最も難易度の高い科学研究タスクにはAstraを使用すべきだとしています。
事実性
GPT‑6.1 Solは、難易度の高いプロンプトにおける事実の正確性も向上しているとしています。GPT‑6 Solからの事実性における最大の改善は低い推論努力設定で見られ、事実誤りを含む回答の割合を11.4%から7.7%へと、約32%削減したとしています。テストされた推論設定全体で、その誤り率はGPT‑6 Astraとの差が1.9ポイント以内に収まっており、コストはタスクあたり5分の1未満だとしています。
この評価は、ユーザーが以前のモデルの誤りを指摘した非識別化された会話データを対象に、少なくとも1つの事実誤りを含む回答の割合を測定するものです。OpenAIは、これらの意図的に難易度の高いプロンプトは通常の利用実態を代表するものではないとしています。事実性の評価は、ユーザーが以前のモデルの事実誤りを指摘した非識別化されたChatGPTの会話をもとに行われており、こうした誤りを誘発しやすい会話は、事実誤りがより稀である通常利用を代表するものではないとOpenAIは述べています。
GPT‑6.1 Solの安全な展開
OpenAIによると、GPT‑6.1 Solは同社のアライメント評価においてGPT‑6 Solから大幅な改善を示し、GPT‑6 Astraに近づいているとしています。GPT‑6.1 Solは、自身の限界についてより透明性が高く、ユーザーの意図や安全上の制約を尊重する点でより信頼性が高いとしています。難易度の高い評価において、検索ツールの不具合に関する透明性、明示的な制限の遵守、エージェント型タスク中の未許可の結果の回避について、GPT‑6 Solよりも低い失敗率を示したとしています。自動化された安全レビュアーを回避しようとする試みは観測されず、この点はGPT‑6 AstraおよびGPT‑6 Solと同様だとしています。詳細はGPT‑6.1 Solのシステムカード補遺に記載されているとのことです。なお、これらの評価は意図的に難易度の高い状況をテストしたものであり、通常利用時の失敗率を測定するものではないとOpenAIは注記しています。
価格と提供状況
GPT‑6.1 Solは本日より、ChatGPT WorkおよびCodexにおいて、Plus、Pro、Business、Enterprise、Eduの各ユーザーに提供されます。Chatでの提供はまだ行われていません。開発者は、OpenAI APIを通じてgpt-6.1-solとしても利用できます。標準のAPI価格は、入力トークン100万あたり2ドル、キャッシュ入力トークン100万あたり0.10ドル、出力トークン100万あたり10ドルです。また、数日中には、Codexにおける標準速度と比較して最大8倍高速にトークンを生成する「GPT‑6.1 Sol Ultrafast」も提供予定だとしています。
[“GPT-6.1 Sol”, “OpenAI”, “GPT-6 Astra”, “ChatGPT”, “OpenAI API”, “Codex”]