記事のサマリー(TL;DR)
- 動画生成スタートアップ Synthesia が評価額 40億ドル、ARR 1億ドル超(2023年時点)に達し、記者向けに業界初のインタラクティブ・アバターを制作
- アバターは voice-to-text・LLM エージェント・text-to-voice・Synthesia 独自の動画モデルを組み合わせた決定論的(deterministic)設計で、学習対象記事以外の質問には回答しない
- AI によるデジタルツイン(digital twin)が PR・社内トレーニング・ジャーナリズムへ与えるインパクトは大きく、「信頼の代替可能性」という根本的な問いを提起
国内 PR・社内研修 SaaS 導入企業が押さえておくべき技術と商慣習の変化
Synthesia の事例が示す「インタラクティブ・アバター」は、すでに国内でも無縁ではありません。D-ID・HeyGen・Colossyan といった競合も存在し、日本市場でも HeyGen を活用した動画コンテンツ制作やトレーニング動画の内製化が一部の先進企業で始まっています。とりわけ Synthesia が展開する Roleplay Sessions(従業員が AI アバターを相手に営業ロールプレイを行い、採点まで受けられる機能)は、大企業の研修コストを大幅に圧縮できる構成です。国内では kintone や Salesforce 上で管理している研修進捗データと、こうしたアバター型学習ツールを API 連携させる構成が現実的な選択肢になりつつあります。また、Synthesia がクラウドホスティング先を顧客が自由に選べる設計(AWS・GCPを含む)を採用していることは、国内のデータ主権・セキュリティ要件を重視する企業にとって導入検討のハードルを下げる要因になります。
詳細
Synthesia の PR 担当者がアバターを使い始めた日
今年の夏、動画生成スタートアップ Synthesia のコーポレートアフェアーズ責任者 Alexandru Voica 氏から、あるリンクが送られてきました。クリックすると、Voica 氏自身のインタラクティブ・バーチャルアバターが登場しました。Synthesia が何をする会社でどのように機能するのか、といった報道向けの定番質問に答えられるよう学習させたものです。
その前日、筆者は AI 生成テキストを使ったピッチを嫌うかどうかという PR 業界のパネルディスカッションに参加していました。それと比べると、Voica 氏のアバターはもはや「AI を PR に使う行為の最終形態(final boss)」とも言えるものでした。
Synthesia とはどんな会社か
英国発の Synthesia は、D-ID・HeyGen・Colossyan と並ぶ注目のデジタルアバター・スタートアップです。2024年初頭に 評価額 40億ドル に達し、2023年には ARR 1億ドル超 を達成したと発表しています。
同社の主力製品は、企業が AI アバターを使ったインタラクティブな研修動画を作れるプラットフォームです。最近では Roleplay Sessions という製品もリリースしており、従業員が AI アバターを相手に営業トークを練習し、応答内容を採点されるという体験を提供しています。
記者本人のアバターが生まれるまで
筆者は今年9月、ニューヨークの新オフィス開設イベントに招待され、自分のアバターを作らないかと提案されました。即答で「yes」と答えました。
制作はオフィス内のミニスタジオで行われ、多数の写真撮影と 2分間の音声録音 が必要でした。筆者が同意署名をした後、デジタルの「Dom」が誕生。制作されたアバターは計4種類です。
- パーソナルアバター(スクリプトを読み上げるだけのもの)× 眼鏡あり・なし
- インタラクティブ・アバター(会話ができるもの)× 眼鏡あり・なし
インタラクティブ・アバターは特定の記事を学習させており、今回は「ベンチャー支援スタートアップが非 VC 支援企業より多く不正を犯す理由」という記事が対象として選ばれました。
アバターを支える技術スタック
インタラクティブ・アバターは以下のモデル群を組み合わせて動作します。
- voice-to-text モデル — 話しかけた内容をテキストに変換
- エージェント型言語モデル(agentic LLM) — テキストを理解し、アクションを決定
- text-to-voice モデル — 応答テキストを音声に変換
- 動画モデル(Synthesia 独自開発) — 話しながらアバターをアニメーション化
音声・動画は Synthesia の自社モデルが基本ですが、顧客は Cartesia・ElevenLabs・Google・OpenAI など他社モデルへの切り替えも可能です。ホスティングも任意のクラウドを選択できるほか、Synthesia に委託するオプションもあります。
Synthesia の製品ラインは大きく3つです。
| 種別 | 概要 |
|---|---|
| 動画作成・配信プラットフォーム | スクリプトを入力するとアバターが読み上げる「クラシック型」 |
| Sessions(エージェント型プラットフォーム) | アンケートやロールプレイで双方向に対話できる |
| API プラットフォーム | Synthesia の動画・音声モデルを他サービスと組み合わせて独自製品を構築できる |
実際に触ってみた体験
アバターの制作には数日かかりました。パーソナルアバターにはニューヨークの秋の到来について話す汎用スクリプトを入力してテスト。声の再現度は高く、録音時の声のかすれが反映されていなかった点を筆者は安堵しています。非テック系の友人に見せると「面白い、でも少し不気味」という反応でした。
インタラクティブ・アバターは 決定論的(deterministic) な設計で、学習対象の記事以外の質問には一切答えず、必ず記事の話題に誘導します。筆者が TechCrunch 入社前の経歴やニューヨークでの居住地を聞いても、すべて「ベンチャー不正記事」へと話が戻りました。
友人からは「声の再現度がパーソナルアバターより低い」「でも十分不気味」という評価。一方、筆者の母親は「すごい(amazing)」と絶賛。父と二人で「本人しか知らないような質問」を試みましたが、アバターはそのたびに記事の話題に誘導しました。「あなたを2人産んだ記憶はないけれど」と母は冗談を言っていたそうです。
ジャーナリズムの未来と信頼という問題
この体験から、筆者はジャーナリズムの将来についていくつかの問いを持ちました。
- ニュースがアバターによって配信されることに視聴者は納得するか?
- CEO は人間のジャーナリストではなく AI アバターと話したいと思うか?
- アバターはジャーナリストを「補完」するのか、それとも「代替」するのか?
ある投資家は「アバターキャスターには絶対に馴染めない」と即答しました。一方で、AI 生成コンテンツ(いわゆる「AI スロップ」)への反発が強まっているとはいえ、確信を持って否定できない人も多くいました。
筆者が自身のキャリアで大切にしているのは、人とのつながり・記事の執筆・新しいトピックの調査です。しかしジャーナリズムで最も重要な要素は 信頼(trust) であり、それは AI に外注できるものではない、と筆者は述べています。
デジタルツインは「ログオフできる」から人型ロボットよりマシ
ビジネスの文脈では、自分のデジタルツインは魅力的な存在になり得ます。休暇明けの業務の山に戻らずとも、アバターが常に質問に答え続けてくれるイメージです。
筆者は自分のアバターを眺めながら、「瞬きするかもしれない」「何か新しいことを言うかもしれない」と感じる瞬間があったと告白しています。決定論的なアバターにはそれはありえませんが、自由に発話できる非決定論的なチャットボット型アバターなら、「AI サイコーシス(AI psychosis)」に陥る人が出ても不思議ではないと警告します。
ジェネレーション Z に属する筆者の見立てでは、自身の世代はデジタルツインに慣れることはないだろうとのこと。「映画の中のものが全部現実になった感じがする」と表現しています。それでも、人型ロボット(humanoid)と比べればアバターの方が違和感は少ない——「変なことが起きたら、いつでもログオフできるから」。