記事のサマリー(TL;DR)
- NVIDIAが外科ロボット向け世界モデル「Cosmos-H-Surgical-Simulator」をリアルタイム動作に蒸留した「Cosmos-H-Dreams」を公開
- 単一の NVIDIA RTX PRO 6000 GPU 上で約160fps のインタラクティブ手術シミュレーションを実現(従来比約16倍)
- CMR Surgical・Cambridge Consultants と共同で Versius 外科コントローラとのリアルタイム連携も実証済み
医療AI・手術ロボット開発者が注目すべきアーキテクチャの転換点
Cosmos-H-Dreams は研究・開発プラットフォームであり、診断システムや物理的な手術ロボットのコントローラの代替ではありません。ただし、日本の外科手術ロボット研究・医療SaaS開発の文脈では注目すべき点が複数あります。
第一に、物理ロボットを動かさずに政策評価(policy evaluation)や合成データ生成が可能になる点です。高価な手術ロボットプラットフォームへのアクセスが限られる研究機関や医療機器スタートアップにとって、シミュレーションでのポリシー学習コストが大幅に下がります。第二に、失敗事例(針の落下、縫合失敗など)を含む訓練データを積極的に組み込んでいる設計思想は、実際の医療AIで起きうるエッジケースへの対応として参考になります。第三に、自社データへの適応レシピが公開されており、da Vinci Research Kit(dVRK)以外の手術システムへの展開も技術的に開かれています。
詳細
1. 外科世界モデルからインタラクティブシミュレーターへ
外科ロボティクスは遠隔操作から、より高度なビジョン・言語・行動ポリシーへと急速に移行しています。しかしこうしたシステムの評価・訓練には大きな課題が残っています。物理ロボットプラットフォームは運用コストが高く、実験の再現に時間がかかり、失敗時には機器や生体組織を損傷するリスクがあります。
従来型シミュレーターは安全な代替手段ですが、外科シーンの再現は極めて難しいです。変形する組織、精細な器具の動き、鏡面反射、縫合糸、針、煙、遮蔽など、モデル化すべき要素が多岐にわたります。
世界基盤モデル(World Foundation Model)はこの問題に別のアプローチを取ります。オブジェクトや物理インタラクションを手動でオーサリングする代わりに、同期された映像とロボット運動学から視覚的ダイナミクスを直接学習します。NVIDIAの Cosmos-H-Surgical-Simulator は、初期シーンとロボット行動シーケンスから将来の手術映像を生成することでこのアプローチを実証し、Open-H-Embodiment エコシステムにおける物理実験より高速な評価と合成データ生成を可能にしました。
Cosmos-H-Dreams はその次のステップです。Cosmos-H-Surgical-Simulator の能力を因果的・少ステップの学生モデル(student model)に蒸留し、NVIDIAの加速型ストリーミング推論ライブラリ「FlashDreams」を通じて提供します。単一の NVIDIA RTX PRO 6000 GPU 上で動作し、人間または学習済みポリシーがクローズドループで制御できるインタラクティブ環境を実現しています。
2. Cosmos-H-Surgical-Simulator のリアルタイム蒸留
2.1. 外科の教師モデル(Surgical Teacher)
双方向教師モデルは Cosmos-H-Surgical-Simulator の Open-H チェックポイントから始まり、統一44次元の行動表現を使用します。公開されている dVRK テーブルトップモデルでは、デュアルアーム dVRK の行動内容(相対エンドエフェクターの並進・回転・グリッパー状態)をこの共通表現にマッピングします。
教師モデルは JHU dVRK テーブルトップ混合データセットでファインチューニングされており、成功デモンストレーションだけでなく、失敗事例や分布外のエピソード(針の落下、投げ損ない、結び目失敗など)も含まれています。失敗事例の組み込みは重要です。ポリシー評価を目的とするシミュレーターは、理想的なデモンストレーションだけでなく、不適切な行動の結果も再現できなければならないからです。
長いロールアウトの安定性向上のため、訓練プロセスでは教師の時間的ホライズンを段階的に拡大します。12フレームのホライズンから開始し、最大72フレームまで段階的に増やし、各ホライズン拡大時に事前学習済みの重みで初期化します。
2.2. 因果的ウォームアップ(Causal Warmup)
教師のデノイジング軌跡を事前計算してキャッシュします。因果的学生モデルは教師から初期化され、これらのキャッシュされた軌跡を模倣するよう訓練されます。このウォームアップ段階により、学生モデルは自身が生成した履歴から学習を開始する前に、因果的アテンションとストリーミングキー・バリューキャッシュを使った動作を習得します。
2.3. セルフフォーシング蒸留(Self-Forcing Distillation)
自己回帰モデルには既知の問題があります。訓練中はクリーンなグラウンドトゥルースのコンテキストを参照できますが、デプロイ時には自身の不完全な出力を条件として動作しなければならず、小さなエラーが時間とともに累積します。
Cosmos-H-Dreams はこのミスマッチをセルフフォーシング蒸留で対処します。訓練中、学生モデルは自身が生成したコンテキストを使って前進ロールアウトを行います。フリーズされた教師からの分布マッチング教師指導により、それらの自己生成ロールアウトがリアルな手術映像に向かって誘導されます。
結果として得られるモデルは、完全な教師が必要とする多ステップのプロセスではなく、各潜在フレームあたり最小2ステップのデノイジングという少ステップ拡散をサポートします。
3. FlashDreams:リアルタイム推論エンジン
モデル蒸留はリアルタイム化の一側面にすぎません。Cosmos-H-Dreams は自己回帰型世界モデル・動画モデル向けの加速推論ライブラリ FlashDreams を通じて提供されます。
FlashDreams は、ストリーミング KV キャッシュ、CUDA Graph キャプチャ、モデルコンパイルなど複数の最適化を組み合わせることで、蒸留された学生モデルを低レイテンシのストリーミングシステムに変換します。これらの最適化により、標準的な Cosmos-H-Surgical-Simulator 推論の約10fps から、単一の NVIDIA RTX PRO 6000 上で約160fpsのインタラクティブ動作へと引き上げています。
ヒューマンマシンインターフェースとしては以下の2つが提供されています。
- ブラウザクライアント:キーボードコマンドの送信と WebRTC による生成フレームの受信が可能
- Meta Quest クライアント:追跡されたコントローラの動きをロボット行動にマッピングし、WebXR を通じて合成シーンを表示
同一モデルを学習済み外科ポリシーに接続し、生成された観測と予測された行動をクローズドループ内で交換することも可能です。
4. 自社データへの適応
Cosmos-H-Dreams にはテーブルトップ縫合向けの事前学習済みチェックポイントが含まれていますが、システムは特定の実施形態への拡張が可能な設計になっています。自社データセットに向けたリアルタイム学生モデルの訓練のために、教師ファインチューニングとセルフフォーシング蒸留のステップバイステップガイドが提供されています。
5. 次のステップ:クローズドループ外科 Physical AI に向けて
Cosmos-H-Dreams は外科シミュレーションに新たな領域を開きます。実際のロボットデータから学習し、インタラクティブに操作できる環境の実現です。
次の重要課題は視覚的品質の評価にとどまらない点です。有用な外科シミュレーターは行動に正しく反応し、長いロールアウトを通じて器具とシーンの構造を保ち、物理ロボットへ転用できる知見を支援しなければなりません。このことを背景に、新たなクローズドループベンチマーク群が動機付けられています。ツールチップの到達精度・姿勢精度、グリッパーサイクルの忠実度、アイドル安定性、反事実的行動の多様性、長期的ドリフト、シミュレーションと実機のポリシー結果間の一致度などです。
さらに先の応用としては以下が挙げられています。
- レイテンシ対応遠隔手術:世界モデルがより安定した表示を維持
- インタラクティブな手術リハーサル:手順計画と術中意思決定支援
- 稀な失敗事例のオンデマンド生成:強化学習・模倣学習向けのスケーラブルな環境提供
- 新ポリシーの迅速評価:希少な物理ロボットハードウェアに縛られない実験
Cosmos-H-Dreams はモデルの忠実度・時間的安定性・ハードウェア効率が向上し続けることで、外科医教育・合成データ生成・ポリシー訓練・ポリシー評価を一つの共有 Physical AI 環境内で結びつける基盤として機能します。
6. 関連リソース
- Cosmos-H-Dreams コードと例:GitHub リポジトリ
- Cosmos-H-Dreams モデル:Hugging Face チェックポイント
- Cosmos-H-Surgical-Simulator:Hugging Face モデルおよび GitHub リポジトリ
- 自社データ適応:教師ファインチューニングとセルフフォーシング蒸留のステップバイステップレシピ
- Open-H-Embodiment:Hugging Face データセット
- FlashDreams:GitHub リポジトリ
- NVIDIA Cosmos-Predict2.5:GitHub リポジトリ
- Cosmos-Surg-dVRK:世界基盤モデルベースの外科ロボットポリシー学習自動オンライン評価(arXiv 論文)