Google DeepMind が 9 月 23 日、音声合成のモデルを 2 つ公開した。創作向けの Gemini 3.8 Flash TTS と、量をさばくための Gemini 3.8 Flash-Lite TTS だ。録音を一つも用意しなくても、声の人物像を言葉で書けば新しい声が立ち上がる。
声を作る工程が、機材と収録の側から文章を書く側へ動く。役柄、なまり、話す速さ。これまで声優と録音室に頼んでいた指定が、そのまま入力欄に収まる。ただし作り方には二本の道があり、手続きの重さは同じではない。
ゼロから設計する声と、誰かから写す声
語を分けておきたい。一つは声の設計で、既存の音声を使わず、役割・アクセント・声の特徴を自然文で指定して新しい声を作る。もう一つは声の複製で、30 秒ほどの音声見本から、その人の声の特徴を再構成する。
前者に録音は要らない。後者には要る。Google は公式に、複製を使う前に、参照する話者と一致する本人の口頭での同意録音を提出させると書いている。家族の声を作ってみたくなったとき、最初に必要なのは機材でも技術でもなく、本人の声で録った同意だ。
既製の声も増えている。公式の発表では 2,000 を超える実用向けの声とされ、開発者向けの文書では、まず 30 種の既定音声があり、拡張ライブラリからさらに多くを呼び出せる、という書き方になっている。言語は発表文で 100 以上、モデル文書では Flash TTS が 130 言語、Flash-Lite が 101 言語と分かれて書かれている。
作った声には、耳に聞こえない印が入る
Gemini の音声モデルが出すクリップには、すべて SynthID の透かしが入る。耳では分からないが、検出する側の道具には残る。複製にはこれに加えて、来歴をたどるための C2PA の情報が付く。
地域の制限もある。AI Studio からの声の複製は、イリノイ州、テキサス州、欧州経済領域、英国、スイス、インドでは利用できない。声を写す行為が本人の権利に触れるという判断が、機能の地図にそのまま出ている。
作った声の置き場所にも期限がある。保存する声は 1 つのプロジェクトにつき 200 個まで、保持は 1 年。保存しない使い捨ての鍵なら 7 日で消える。一度に渡せる文章は、文字を細かく割った単位であるトークンで 8,192 まで。出力は 16,384 まで。長編の朗読は、一息では通らない。
年内の値段は、1 月 1 日に倍になる
料金は期間で区切られている。どちらのモデルにも無料枠がある。有料の場合、文字の入力は 100 万トークンあたり 0.50 ドル。音声の出力は Flash TTS が 9.00 ドル、Flash-Lite が 6.00 ドル。これが 2026 年 12 月 31 日までの値段で、2027 年 1 月 1 日からは入力が 1.00 ドル、出力がそれぞれ 18.00 ドルと 12.00 ドルになる。
いま安いのは導入期の値段だ。試すだけなら無料枠で足りる。ただし毎週配信する音声や、店の案内をまるごと差し替えるような使い方を年明けから始めるなら、見積もりは倍で立てておくほうがいい。
試す順番を、先に決めておく
順番は決めておける。まず既定の声で足りるかを確かめる。足りなければ言葉で設計する。それでも届かないときにだけ、複製と同意録音の手続きへ進む。後ろへ行くほど必要なものが増え、使えない地域も出てくる。
金額の確認先は Gemini API の料金ページだ。年をまたぐ計画があるなら、単価が切り替わる年明けに一度そこを開いてから本数を決めたい。無料枠で試した感触のまま本番の見積もりを立てると、年明けの請求で倍の差が出る。
ことば
- Gemini 3.8 Flash TTS — Google が 9 月に公開した音声合成モデル。文章を読み上げるだけでなく、役柄やなまりを自然文で指定して声そのものを作れる。量をさばく用途には Flash-Lite TTS が並ぶ。
- 声の設計 — 既存の録音を使わず、声の人物像を言葉で書いて新しい声を立ち上げる機能。作った声には識別子が振られ、次の依頼でも同じ声を呼び出せる。
- SynthID — 生成した音声に、耳では分からない透かしを埋め込む仕組み。Gemini の音声モデルが出す音声すべてに入り、あとから機械の側で見分けられるようにする。
言葉で声を注文できるようになると、次に来るのは誰の声を注文するかという問題だ。自分の声、家族の声、店の看板になる声。同意録音を求められたとき、あなたは誰に頼み、何のために作るのだろうか?
参照
- Google 公式「Gemini 3.8 Flash TTS and Gemini 3.8 Flash-Lite TTS」— 声の設計と複製、同意録音の要件、SynthID と C2PA、利用できない地域
- Gemini API モデル文書 gemini-3.8-flash-tts — 130 言語、入力 8,192 / 出力 16,384 トークン
- Gemini API モデル文書 gemini-3.8-flash-lite-tts — 101 言語、量をさばく用途向けという位置づけ
- Gemini API 料金ページ — 無料枠と、2026 年 12 月 31 日まで / 2027 年 1 月 1 日からの単価
- Gemini API 音声生成ガイド — 既定音声 30 種と拡張ライブラリ、保存する声の上限と保持期間
- Google DeepMind 公式投稿 — 2 モデルの発表告知