本文へ移動
LIFEMAKERS.COM — 自立型ライフの実践知カタログベータ版
Signal観測テクノロジーと道具FUTURE LIFE BRIEF

Meta の Muse に顔、870ms で返る透かし入り映像

Meta の AI エージェント Muse が顔と体を得た。発話の終わりから約 870 ミリ秒で表情つきの映像が返り、生成された映像には目に見えない透かしが入る。提供時期はまだ日付で示されていない。

Meta の Muse に顔、870ms で返る透かし入り映像のイメージ

この記事でわかること

  • Meta が Connect 2026 で、AI エージェント Muse に表情と身ぶりを与える Muse Realtime Avatar を発表した
  • 発話の終わりから最初の応答まで約 870 ミリ秒、448×768 の映像を毎秒 25 フレームで生成する
  • 生成映像には目に見えない透かしが全編に入るが、画面の前の人間が自分の目で見分けられるわけではない

Meta は 9 月 23 日 (米国時間) の Connect 2026 で、AI エージェント Muse に顔と体を与える Muse Realtime Avatar を発表した。これまで音声で返していた相手が、表情と身ぶりを伴ってビデオ通話のように応答する。

変わるのは会話の中身より、会話の手ざわりのほうだ。相手に顔があるかどうかで、人が話しかける頻度も、言葉の選び方も変わる。その変化がどこから来るのかは、発表された数字にはっきり出ている。

870 ミリ秒という間合い

語を正確にしておきたい。Meta が示した約 870 ミリ秒は、利用者の発話が終わってから応答の最初の 1 バイトが届くまでの時間だ。アバターが一文を言い終えるまでの長さではない。

その間合いで、448×768 の縦長映像が毎秒 25 フレームで流れる。1 フレームあたりのモデル計算は 2.5 ミリ秒。声と口の動きと表情は同じ生成の流れを共有していて、そこがずれない作りになっている。

従来の音声アシスタントは、問いかけと返答のあいだに無言の処理時間が入った。870 ミリ秒は、人が相づちを打つ間合いの側にある。沈黙が減ると、会話は指示から雑談の側へ寄る。

120 回の計算を 2 回に削った

この速さは、モデルを軽くして得たものだ。手本になる教師モデルは、映像をひとかたまり作るのに 120 回のモデル評価を必要としていた。その出力をまねるよう軽いモデルを訓練する蒸留を経ると、生徒モデルは 2 回で済む。計算回数で 60 分の 1 になった。

それでも軽いとは言いにくい。Meta の計測では、データセンター向け GPU の GB200 1 基で同時 12 セッション。映像つきの会話は、文字や音声のやりとりよりはるかに重い計算を占有する。

Zuckerberg は Muse について、大量のトークンを無料にし、いずれ取引の手数料で収益を得ると述べている。裏を返せば、映像で話し続けたときにどこまでが無料の範囲なのかは、まだ示されていない。使う側の費用は、料金表ではなく使い方の側に隠れている。

長い会話で絵が崩れないための工夫も入っている。生徒モデルは自分が生成した文脈の上で学習し、小さな誤差が積み上がるのに耐えるよう訓練されている。直前に作った映像の内部表現が次のかたまりへ引き継がれ、見た目と癖が持ち越される仕組みだ。

透かしは入るが、目には見えない

参照にできる素材の幅は広い。写真の肖像、全身のイラスト、動物、身のまわりの物。それぞれが会話の相手として動き、表情を持つ。

生成された映像には Meta Video Seal による透かしが全編に埋め込まれる。耐久性があり、実時間の応答速度を落とさずに入る。ただしこの透かしは目に見えない。画面の前にいる人間が、映っているものが生成映像かどうかを自分の目で判別できるわけではない。来歴の確認は、検出する側の道具に委ねられる。

未成熟な部分も書かれている。Meta 自身が研究ブログに、記事中の例はモデルの能力を示すもので、そのすべてが Muse アプリで使えるアバターを反映しているわけではない、と注記している。提供時期は近くとされ、スマートグラスへの統合は数か月のうちとされるだけで、日付は出ていない。利用は 18 歳以上に限られる。

何を見ておくか

価格と日付が決まっているものと、決まっていないものが混ざっている。Meta VR Glasses は 1,299.99 ドル・2027 年春と公式のまとめに明記された。一方で Muse Charm は価格も発売日も出ておらず、「今年のうちに追加で共有する」とだけ書かれている。続きは meta.com の Connect 2026 発表まとめページに載る。年内にもう一度そこを見れば、手元に置く側の費用がいくらになるかが分かる。

使うときの条件も見ておきたい。448×768 は手元の縦長画面に向けた解像度で、居間のテレビや会議用の横長画面を想定した作りではない。顔のある相手と話す体験は、いまのところ手のひらのなかにある。

ことば

  • Muse Realtime Avatar — Meta の AI エージェント Muse の音声に、表情と身ぶりのある映像をつける技術。写真やイラスト、動物や物を参照素材として受け取り、会話しながら映像を作り続ける。
  • Meta Video Seal — 生成した映像に目に見えない透かしを埋め込み、あとから来歴をたどれるようにする仕組み。今回は実時間の応答速度を落とさずに入れられる点が示された。
  • 蒸留 — 学習済みの重いモデルを手本に、軽いモデルへ振る舞いを移す手法。120 回を 2 回に削るような圧縮は、映像生成を会話の間合いに載せるために要る。

相手に顔があるだけで、人は機械にもっと話しかけるようになるかもしれない。その顔は手元の画像から立ち上がり、見ている側に印は見えない。あなたなら、その参照素材に自分の顔を渡すだろうか?

参照

あなたの暮らしで、最初に試せることは何でしょうか。