解決できる課題 事業紹介トップ 経営データ分析基盤 AI導入・業務改善 AI 業務アプリ 基幹システムのWeb化・段階移行 複雑な SaaS を専用 UI に Shopify Plus 移行・拡張 生成AI 活用(Multi AI) SEO / AIO / 広告運用 顧問・アドバイザリ インフラ構築 自社メディア投資・開発
AI導入 AI導入・業務改善 ChatGPTの社内導入 OpenAI Codex導入 AI運用・定着 Claude / MCP 総合 Claude Cowork Claude Code 導入支援 Claude Code 使いこなし支援 Claude Design MCP 開発・サーバー構築
EC構築・移行 Shopify Plus トップ EC-CUBE からの移行 大手カートからの移行 Shopify 通常プラン EC サイト構築
実績
業界ニュース 業界ニュース トップ AI ニュース └ Claude └ ChatGPT・Codex └ Gemini └ その他 Shopify ニュース SaaS ニュース お知らせ(自社発信)
会社情報 相談する
2026.09.30

H Company、汎用コンピュータ操作エージェント向けモデル「Holo4」を発表

記事のサマリー(TL;DR)

  • H Companyは新しいエージェント型モデル群「Holo4」を発表しました。27Bの高密度(dense)モデルと35B-A3BのMixture of Expertsモデルの2サイズがあり、いずれもH Models APIで利用可能です。あわせてHolotron 3の更新版「Holotron4 Nano」もリリースされました。
  • Holo4は、GUI、コード、MCP(Model Context Protocol)、APIといった利用可能なあらゆるインターフェースを通じてソフトウェアを操作できるモデルとして構築されており、デスクトップ、Web、Android、コードサンドボックス、業務用APIに対して同一のモデル・同一の呼び出し方法で動作します。
  • OSWorld 2.0ベンチマークでは、Holo4 27Bが61.7%(Opus 5.5は81.8%)、Holo4 35B-A3Bが30.9%のスコアを記録しました。提供元は、これらのモデルがはるかに少ないパラメータ数と低いコストで達成された結果であると説明しています。

詳細

Holo4の概要とリリース内容

Holo4は、H Companyの新しいエージェント型モデルシリーズです。27Bの高密度モデルと35B-A3BのMixture of Expertsモデルの2サイズで提供され、いずれもH Models APIで利用できます。あわせて、Holotron 3の更新版である「Holotron4 Nano」もリリースされています。

Holo4は同社の従来モデルをベースに構築されており、GUI、コード、MCP、APIなど、利用可能なあらゆるインターフェースを通じてソフトウェアと対話します。学術ベンチマークで良好なスコアを収めていますが、提供元は実際の業務ワークフロー向けに構築したモデルであると説明しています。トレーニングには、教師あり学習と強化学習が用いられ、同社の「Agentic Task Factory」が生成したものを含む大規模な環境・タスク群が使用されました。

公開されているリソースは以下の通りです。

  • モデル: Holo4-27B、Holo4-35B-A3B、Holotron4 Nano
  • コレクション(FP16、FP8、GGUF形式): Holo4
  • トラジェクトリ(実行軌跡): ビューア、データセット
  • H Models API: クイックスタート
  • 詳細なブログ記事: hcompany.ai/newsroom/holo4

あらゆるインターフェース向けに構築されたモデル

Holo4は、画面上でクリック・入力操作を行い、自らコードを記述して実行し、MCPやAPIツールも呼び出します。タスクに応じて、適切な手段をそのつど使い分けます。

提供元によれば、多くのエージェント型モデルは単一のインターフェース向けにしか訓練されておらず、GUI中心のモデルは画面がなければ機能せず、ツール呼び出しを優先するモデルはAPIを持たないアプリケーションの前で行き詰まるといいます。実際の業務はそのように分断されておらず、単一の業務タスクの中でも複数の手法を組み合わせる必要がある場合があるとしています。

Holo4は、デスクトップ、Web、Android、コードサンドボックス、業務用APIに対して動作し、いずれの場合も同一のモデルが同一の呼び出し方法で使用されます。プラットフォームごとに別のモデルを選ぶ必要はありません。

Holo4のモデルは、ベースとしているQwenに対して大きく性能が向上しています。長時間にわたるワークフローにおいては、最も性能の高いクローズドモデルにのみ劣る結果となっており、OSWorld 2.0ベンチマークでは、Holo4 27Bが61.7%(Opus 5.5は81.8%)、Holo4 35B-A3Bは30.9%のスコアを記録しました。ただし提供元は、これらの結果を桁違いに少ないパラメータ数と大幅に低いコストで達成していると説明しています。公開ベンチマークのスコアの背後にあるすべてのトラジェクトリはオープンソースで公開されており、trajectories.hcompany.aiで各ステップを再生するか、Hugging Faceからダウンロードできます。

フロンティアモデルに匹敵する性能を低コストで

デスクトップ操作に関する最も難易度の高い学術ベンチマークであるOSWorld 2.0と、API利用に関するAutomationBenchにおいて、Holo4はタスクあたりのコストを大幅に抑えながら、フロンティアモデルと競合する性能を示しています。

コスト・性能グラフに関する注記は以下の通りです。

OSWorld 2.0: コストは各エージェント実行の入力・出力トークン数から推定されています。Holo4はH Models APIの料金(単一実行)で計算されています。Qwen3.8 27Bはモデルカードのスコアを用い、コストはAlibaba Cloudの定価に基づく自社実行時のトークン数から算出しています。Qwen3.6 35B-A3Bは、Alibaba Cloudの定価(入力価格の20%でキャッシュヒットを想定)による自社ハーネスでの単一実行結果です。GPTおよびOpusのエフォート幅(effort sweep)についてはOpenAIの発表データを用い、その他のクローズド・オープンウェイトモデルの数値は公式のOSWorld 2.0リーダーボードによっています。リリース内容、ハーネス、タスクのサブセットはモデルごとに異なります。グラフの線は、クローズドモデルの中でスコアとコストの両方で他に劣後しない(non-dominated)組み合わせを結んだものであり、Holo4はこの線には含まれていません。

AutomationBench: Holo4、Qwen3.8 27B、Qwen3.6 35B-A3Bについては、AutomationBench v1.0.6を用い、社内ハーネスでスコアとコストを測定しています。その他のモデルについては、AutomationBenchのREADMEに記載された公開セットのスコアと、非公開セットで稼働する公式リーダーボードによるタスクあたりのコストを用いています。Holo4の非公開セットでの評価結果は、評価が完了次第報告するとしています。

実務作業における性能検証

Agentic Task Factoryが生成した環境・タスクで訓練されたHolo4モデルは、業務用ソフトウェア上で高い性能を示すとされています。以下の例では、Holo4 27BとそのベースモデルであるQwen3.8 27Bを、同一のプロンプト・同一のハーネス条件で比較しています。

3Dモデリング:エッフェル塔
FreeCAD上で、縮尺1mm対1mとし、原点を中心にX軸・Y軸に沿ってエッフェル塔の3Dモデルを構築するという課題です。塔は各高さで常に正方形の平面形状を持ち、円形にはなりません。中心軸から角までの半幅は、地上レベルで62.5mm、高さ57で32.5mm、高さ115で17.5mm、高さ276で9.35mmと指定され、その間はなめらかな曲線(地面付近で急に、上部で緩やかに変化し、直線にはならない)を描きます。4本の同一の脚は各象限に1本ずつ配置され、それぞれ正方形断面の柱で、外側の角がこの輪郭に沿います。各脚は地上で14mm角、高さ276で4mm角までテーパーします。脚は最初のプラットフォームまで地面から離れて立ち、上に行くにつれて収束します。脚の間には何も配置されず、塔はどの面からも中が透けて見える構造です。3つのプラットフォームはいずれも中心軸に配置された正方形の平板で、高さ57では72mm角・厚さ4mm、高さ115では40mm角・厚さ3mm、高さ276では22mm角・厚さ3mmです。高さ276から324まで伸びるマストは正方形断面で、根元8mm角から先端2mm角までテーパーします。すべてのパーツは非ゼロの体積を持つ閉じたソリッドでなければならず、脚の間の空間を埋めるパーツがあってはなりません。

この課題で、Holo4 27Bは84回の呼び出し・130万トークンを使用し、Qwen3.8 27Bは60回の呼び出し・100万トークンを使用しました。

3Dモデリング:Hロゴ
FreeCAD上で、H社のロゴ(塗りつぶされた円盤と、ブロック状のサンセリフ体大文字Hを、同じ厚さで押し出し、両者は近い高さで重ならないように離して配置し、円盤の中心をHの中央の高さに揃える)を3Dモデル化する課題です。両方の形状は黒色に着色します。

この課題で、Holo4 27Bは94回の呼び出し・150万トークンを使用し、Qwen3.8 27Bは118回の呼び出し・190万トークンを使用しました。

ゲームデザイン:パックマン
Godot上でパックマン風のゲームを構築し、実行させたままにするという課題です。グリッド上に壁を配置した長方形の迷路があり、開いている通路すべてにペレットが配置されます。プレイヤーマーカーは通路を継続的に移動し、通過したペレットを食べて得点します。3体のゴーストが同じ通路を移動し、プレイヤーを追いかけます。ゴーストがプレイヤーを捕まえると、プレイヤーはライフを1つ失い、すべてが開始位置にリセットされます。得点とライフは画面上に表示されます。誰も実際にプレイすることは想定されておらず、プレイヤーは単純なヒューリスティックによって自動操作されます。各分岐点で最も近いペレットに向かい、ただしゴーストが近い場合はゴーストから離れる方向に動きます。ゲームはキーボード入力なしに、無人かつ無期限に稼働し続ける必要があります。動作確認後、ゲームを開始し、プレイし続けたままにします。

この課題で、Holo4 27Bは68回の呼び出し・240万トークン・268行のコードを使用し、Qwen3.8 27Bは197回の呼び出し・1140万トークン・327行のコードを使用しました。

Holo4の開発方法

Agentic Task Factory
社内のエージェント型パイプライン群は、実在のWebサイトのスクリーンショットやオープンソースソフトウェアといったドキュメントのみから、対話的な環境と検証可能なタスクを構築します。これまでに、Webアプリ、MCPサーバー、デスクトップ環境を対象に約1万件のタスクが生成されており、その中には同一の状態をGUIとMCPの両方で公開するハイブリッド環境も含まれます。

トレーニング用ハーネス
トレーニングと並行して、モデルのアクションを実行し数百ステップにわたってコンテキストを管理するループである「ハーネス」を、OSWorld 2.0におけるエージェント性能のフィードバックを用いて再構築しました。エージェントが各タスクの失敗理由にタグ付けを行い、エンジニアがその修正内容をレビューしました。最も大きな変更点は、数百ステップを追跡できる信頼性の高いメモリ機能と、デスクトップマシン自体で動作するシェルをエージェントに与えたことです。

Opus 5(70.2%)およびGPT-5.6 Sol(66.2%)のスコアは、OpenAIの発表チャートにあるv2026.08.08オフラインセットにおける、コスト・性能グラフと同様のmax-effort partial rewards(最大努力時の部分報酬)に基づくものです。それ以外の参照スコアはモデルカードおよび公式リーダーボードによっています。タスクのリリース内容、サブセット、ハーネスはモデルごとに異なります。

Holotron4 Nano
提供元のポストトレーニングのスタックは、新しい基盤モデルに適応し、複数のインターフェースや環境をまたいで汎化するエージェントを生成できるよう設計されているとしています。NVIDIA Nemotron Coalitionの一員として、同社は最新のスタックをNemotron 3 Nano Omniモデルに適用し、Holotron 3の後継として開発しました。同じレシピにより、Nemotron 3 Nano Omniは「Holotron4 Nano」となり、GUIワークフローや、MCP・API・コーディングサンドボックスを公開する環境において、ベースモデルから大きく性能が向上した汎用エージェント型モデルとなっています。

性能向上幅は、Nemotron 3 Nano Omniに対する絶対的なパーセンテージポイントの改善として示されています。提供元は、これらの向上幅により、自社のレシピが良好に転移し、汎用モデルをエージェントの専門家に変えられることが示されていると説明しています。また、このレシピにはモデルサイズに固有の要素は含まれていないとしています。

利用方法

両サイズのモデルは、本日時点でH Models APIから利用可能です。重みはHugging Face上でBF16、FP8、NVFP4、4ビットGGUF形式で公開されており、小型モデルであるHolotron4 Nanoも同様に公開されています。提供元は、推論をさらに高速化するための最適化されたDSparkドラフターのチェックポイントを、近日中にリリースする予定であるとしています。