Tavusは10月1日、顔と声で対話するAIモデルGriffinを発表し、自社の1分間の通話試験で54人中26人が相手を人間と判断したと報告した。短い会話の印象が人間らしくなった結果と、日常で誰もが使える製品になったことは分けて読む必要がある。
試験に使われたGriffin-Liteは、一部の信頼できる試験者に限る研究プレビューだ。一般提供やAPI公開はまだ行われておらず、Tavusは相手にAIだと知らせる機能などの安全対策を進めてから提供するとしている。顔の自然さに加え、誰と話しているかを知らされる仕組みが、利用する側の判断材料になる。
■ 54人が話した相手は、別の参加者と説明されていた
Tavusの試験では、独立した研究プラットフォームを通じて参加者を募集した。ただし、試験を実施して結果を報告しているのはTavus自身であり、募集経路が外部であることを第三者による独立検証とは数えられない。
参加者は別の参加者と1分間のビデオ通話をすると説明され、相手がAIだとは事前に知らされていなかった。Griffin-Liteと通話した54人のうち、人間だと判断したのは26人、約48%だった。AIかもしれないと考えたかを尋ねる調査の後、参加者には相手がAIだったと伝えられた。
比較対象は、顔を生成するPhoenix-4.5、会話のタイミングを扱うSparrow-2、相手を認識するRaven-1を組み合わせたTavusのシステムだ。こちらは41人中1人、約2.4%が相手を人間と判断した。同じ人数で比較した結果ではない。
| Tavusが報告した通話試験 | 相手を人間と判断した人数 | 割合 |
|---|---|---|
| Griffin-Lite | 26/54人 | 約48% |
| Phoenix-4.5+Sparrow-2+Raven-1 | 1/41人 | 約2.4% |
この結果には、1分間という長さと、別の参加者が相手だと説明された条件が伴う。長い会話でも同じ割合になるか、AIと告知してから話した場合にどう評価されるか、日本語の会話で再現するかは、この数字から決まらない。人間と判断した割合は、会話の内容が正確だった割合や、相手を信頼してよい割合でもない。
■ 会話の評価スコアは、人間と誤認した割合とは別
Griffinは、話しながら聞き、言葉に加えて表情や間を扱う仕組みを目指している。Tavusは、それらを別々の処理に順番に渡す方式から、映像と音声の対話を一つのモデルで扱う方向へ進めたと説明する。
会話能力を測る別の材料が、NVIDIAの研究チームなどによるVideoFDBだ。相手の振る舞いを読み取る知覚と、自分の声や映像を適切に返す生成を分け、0〜5の尺度で評価する。公開されている総合スコアは次の通りだ。
| VideoFDBの評価 | Griffin-Lite | 比較対象 | 人間の参照値 |
|---|---|---|---|
| 生成 | 3.83 | Gemini 2.5+Anam:2.80 | 3.92 |
| 知覚 | 3.73 | 音声のみのMiniCPM-o 4.5:3.44 | 4.20 |
知覚欄の3.44は、映像を与えない音声のみの比較対象の値だ。生成欄とは比較するシステムも評価する能力も異なる。生成の3.83と2.80の相対差は約37%になるが、応答が37%速いという意味にはならない。速度は別の指標で測る。
VideoFDBは、評価基準に沿ってモデルが出力を採点する仕組みを使う。人が相手を人間だと思うかを尋ねた1分間の試験とは、測定方法が違う。生成スコアが人間の参照値に近くても、すべての会話能力が人間と同等になったと読むことはできない。
■ AIと知らせる規約と、知らせる機能を分ける
Tavusの利用方針は、利用者に対し、会話相手がAI生成コンテンツやAIエージェントであることを、相手へ明確で目立つ形で知らせるよう求めている。人の顔や声を使って複製を作る場合の明示的な同意も要求する。
これらは利用する側が守る条件であり、どの通話でもAIだという表示が自動で届き、消せない仕組みが完成したという証拠にはならない。Griffinの発表ページは、開示の安全機能を開発中だと説明している。同意を得る手続きと、会話相手へ知らせる手続きにも、それぞれの対象がある。
顔のあるAIは、学習相手や仕事の練習相手として、文字だけでは伝えにくい間や反応を返せる可能性がある。一方で、実際の提供時期、価格、日本語での性能、独立した再現結果はまだ確認できていない。人間らしいと感じる映像が公開された段階で、利用できる範囲や費用まで揃ったとは扱えない。
■ 一般提供の発表で、表示の位置まで確認する
いまTavusのページにあるAPIや製品への案内は、既存モデルを使うサービスも含む。Griffin-Liteが一般にAPIから使えるという案内と読み替えることはできない。研究プレビューの提供範囲を確かめる入口は、Griffin公式ページの安全性と提供に関する説明だ。
一般提供が発表された時には、同じページと製品の利用説明で、AIであることが通話の前や途中のどこに表示されるか、顔や声の同意をどう扱うかを確かめたい。あなたが対話相手を選ぶとき、自然な受け答えに加えて、どんな表示や確認手順があれば安心して話せるだろうか?
■ ことば
- Griffin-Lite:TavusのGriffinを試すための研究プレビュー。今回の通話試験と評価の対象であり、既存のTavus製品が使えることと、このモデルの一般提供は別に確認する必要がある。
- VideoFDB:映像と音声による双方向の対話を評価する研究用ベンチマーク。相手を読み取る知覚と、声や表情を返す生成を分けるため、一つの数字だけで会話全体を評価しない。
■ 一次ソース
- Tavus:Griffin公式発表 — Griffin-Liteの研究プレビュー、1分間の企業試験、26/54人と比較対象、安全性・提供条件。
- NVIDIA研究チームほか:VideoFDB — 生成・知覚の公開評価表、0〜5の採点尺度と評価方法。
- Tavus:Acceptable Use Policy — AIであることを目立つ形で知らせる要求、顔・声等の同意、複製の使用条件。