🔥 HNで話題

Gemini 3.8 TTS、「声を選ぶ」から「声を演出する」へ

約3分で読めます Tiny Why編集部 · 文: 特派員 キュリオ

ことば
Gemini 3.8 Flash TTS(ジェミニ・スリー・ポイント・エイト・フラッシュ・ティーティーエス)

Googleが発表した、声の作成や演技の指示に対応する音声生成モデル。

音声複製(おんせいふくせい)

音声サンプルから、似た声の特徴を作ること。

SynthID(シンスアイディー)

Googleが生成音声に入れる、見えない識別用の印。

何が起きたか

Google(グーグル)は2026年9月23日、Gemini 3.8 Flash TTSとGemini 3.8 Flash-Lite TTSという二つの音声生成モデルを発表しました。公式発表によると、前者は声をゼロから作り、台詞ごとに演技を指示する創作向けです。後者は大量の吹き替えや音声サービスを効率よく処理する用途を狙います。

Flash TTSでは、自然な文章の指示だけで、役柄、アクセント、声の特徴を組み合わせられます。100以上の言語と方言に対応し、2,000以上の用意された声も使えると説明されています。30秒の音声サンプルから声の特徴を再現する音声複製にも対応しますが、利用者が自分の声か、使う権利を持つ声であることが条件です。声の持ち主の同意録音を照合する仕組みも入ります。

背景

TTS(text-to-speech)は、文字を音声に変える技術です。今回の発表でGoogleが強調するのは、決められた声を選ぶだけでなく、声と演技を細かく設計できる点です。台詞ごとに速さ、感情、方言の変化、間の取り方を指示できます。二人の会話を一つの台本から作り、長い音声でも話者の声が変わりにくいようにする機能も示されています。

なぜ重要か

音声生成の価値が、単に聞き取りやすい声を出すことから、作品の場面に合わせて演じることへ広がります。ゲームの登場人物、オーディオブック、ポッドキャスト、リアルタイムの音声エージェントなどで、同じ声を保ちながら場面ごとの演技を作りやすくなります。特に二人の掛け合いを一つの台本から作れる点は、音声コンテンツの制作手順を変える可能性があります。

一方で、声は本人らしさと結びつくため、便利さだけでは評価できません。Googleは、生成音声すべてにSynthIDという見えない透かしを入れ、音声複製には同意確認とC2PAの認証情報を使うと説明しています。これは安全策の設計を示すものですが、実際の運用結果まで証明するものではありません。

確認できたこと

新モデルはGoogle AI StudioとGemini APIで開発者向けに順次提供され、Gemini NotebookやGoogle Vidsにも展開されます。Gemini EnterpriseのAPI提供は今後です。音声複製はイリノイ州、テキサス州、欧州経済領域、英国、スイス、インドでは利用できないと明記されています。

性能については、GoogleがHume AIのVoice Design BenchmarkでFlash TTSが首位になったことや、Voice Arenaの人間による比較評価で複数言語の上位に入ったことを紹介しています。これはGoogleが示した評価結果です。Hacker Newsでは記事が275ポイント、125コメントを集めました。ただし、これらはコミュニティの注目度であり、元発表の正しさを証明する数字ではありません。Hacker Newsの投稿

まだ分からないこと

この発表だけでは、料金、APIの利用上限、長時間音声での品質、各言語の実際の聞こえ方は分かりません。SynthIDがどのような条件で検出できるのか、同意確認がサービス上でどこまで機能するのかも、独立した検証が必要です。

次に見る点

今後は、Googleのベンチマーク以外の比較試験、特に日本語を含む各言語での評価に注目したいところです。開発者向けの価格と制限、地域ごとの提供状況、声の権利を守る仕組みが実際にどう運用されるかも重要になります。

💬 HNの反応:Gemini 3.8 TTSは安価で有望だが、品質・安全・提供状況は割れる

コメントでは、低コストと表現力を評価する声の一方、指示への追従、音声クローンの悪用、地域やUIの未整備を懸念する声もあった。数値・性能・不具合は、HN利用者の自己申告または試算であり、独立検証ではない。

  • ローカル実例の自己申告では、KeenLoreというアプリがクラウドや従量課金なしで多人数の朗読を行い、引用の話者割り当てで485件中499件、97.2%の正解率を得たという。Gemma 4で文章を分析し、Qwen3 TTS Voice Designで声を作り、8GBのNVIDIA T1000、96GB RAM、Ryzen 5 7600で動かしている。
  • 別の利用者の自己申告では、約12分、約150本の録音からQwen3-TTS 1.7BをRTX 3090で微調整し、家族が驚くほど本人らしい声になったという。
  • 長時間の最終朗読については、別の利用者がFish AudioやHiggsのほうが韻律がよく、聞きやすいと評価した。ただし、これは比較した利用者の感想である。
  • 料金については、コメント上の試算で、Gemini 3.8 Flash TTSは標準で1時間0.81ドル、バッチで0.41ドル、Flash-Liteは標準0.54ドル、バッチ0.27ドルとされた。
  • 別の利用者は、25万語・約150万文字の本なら約15ドルで、ElevenLabsなら約75ドルになると計算した。いずれも利用者の試算で、料金は変わり得る。
  • 反対意見では、技術自体は驚異的でも、実演音声がプロンプトの重要部分を無視し、自然さや製品利用にはまだ足りないという。品質を高く評価する声と、用途によっては不十分という声が分かれている。
  • 提供状況では、AI StudioでVoice Designがエラーになり、音声複製が地域制限で使えず、価格表示や中性的な声、用途別の選択肢も不足しているという利用者報告があった。
  • 音声複製については、所有者の同意録音をどれだけ保存するのか、悪用をどう防ぐのかを心配するコメントもあった。

コメント150件時点の成熟版(改訂2)。100件を取得し、全体から100件を抽出して要約しました。内容はHN利用者の自己申告で、編集部が確認した事実ではありません。

🔥 HNで話題

Gemini 3.8は、声を「選ぶ」だけでなく「作って演じさせる」

📰 しっかり版: Gemini 3.8 TTS、「声を選ぶ」から「声を演出する」へ

Gemini 3.8の新しい音声AIは、文章を声にします。声の雰囲気や話し方まで指示できます。

約2分で読めます Tiny Why編集部 · 文: 特派員 キュリオ

ことば
TTS(ティーティーエス)

書いた文を声にする仕組み。

SynthID(シンスアイディー)

AIが作った音声に入れる、見えない印。

💡 ようするに

  • Googleが、新しい音声AIを発表しました。
  • 文章ごとに、声の速さや気持ちを指示できます。
  • Hacker Newsで275ポイント、125コメントを集めました。

Google(Geminiを作る会社)は、Gemini 3.8 Flash TTS(文章を声にするモデル)を発表しました。TTSは、書いた文を声にする仕組みです。今回のモデルは、声の高さ、速さ、アクセント、気持ちを文章で指示できます。新しいキャラクターの声を作ることもできます。

もう一つのGemini 3.8 Flash-Lite TTSは、大量の吹き替えや音声サービス向けです。Googleは、100以上の言語と方言、2,000以上の用意された声に対応すると説明しています。二人の声を一つの台本で会話させることもできます。長い本や番組の音声にも使える設計です。

自分の声、または使う権利がある声は、30秒の音声から再現できます。ただし、声の持ち主の同意を確かめる仕組みがあります。AIが作った音声には、SynthIDという見えない印も入ります。これは、AIが作った音声だと分かりやすくするためです。

新モデルは、Google AI StudioとGemini APIなどに順次提供されます。音声の再現は、地域によって使えません。価格や利用量の上限も、今回の発表だけでは分かりません。

このニュースは、Hacker Newsで275ポイント、125コメントを集めました。これは技術の話題として注目された大きさです。Googleの説明が正しいと証明する数字ではありません。Googleの発表とHacker Newsの投稿で確認できます。

💬 HNの反応:安くて便利そうだが、まだ気になる点がある

利用者のコメントには、家で動く音声技術への期待と、音の品質・値段・安全性への心配の両方がある。数字や不具合は利用者の報告や計算である。

  • 自分のPCで本を登場人物ごとに読むアプリを作った人がいる。本人の報告では、引用の話者割り当ては485件中499件、97.2%だった。別の人は約12分の録音で声を学習させ、かなり本人らしくなったと話している。
  • 長い朗読では、Fish AudioやHiggsのほうが聞きやすいという比較報告もある。
  • 料金の利用者試算では、1時間あたり約0.27〜0.81ドル。約150万文字の本は約15ドルで、別サービスなら約75ドルという計算もあった。
  • 一部の人は声が自然でない、指示どおりに話さないと批判した。別の人は品質を高く評価しており、感想は分かれている。
  • AI Studioのエラーや地域制限、足りない声の種類への不満があり、同意録音の保存や悪用を心配する声もあった。

コメント150件時点の成熟版(改訂2)。100件を取得し、全体から100件を抽出して要約しました。内容はHN利用者の自己申告で、編集部が確認した事実ではありません。

🔥 HNで話題

Gemini 3.8は、ことばを声にする新しい道具

📰 しっかり版: Gemini 3.8 TTS、「声を選ぶ」から「声を演出する」へ

書いた文を、いろんな声のおしゃべりにできます。

約1分で読めます Tiny Why編集部 · 文: 特派員 キュリオ

ことば
Gemini 3.8 Flash TTS(ジェミニ・スリー・ポイント・エイト・フラッシュ・ティーティーエス)

書いた文を声にするGoogleの道具。

SynthID(シンスアイディー)

AIが作った音に付く見えないしるし。

Google(コンピューターの道具を作る会社)が、新しい声の道具を発表しました。

Gemini 3.8 Flash TTS(文字を声にする道具)です。 書いた文を、声に変えます。 声を高くしたり、ゆっくり話したりできます。 二つの声で、お話もできます。 長い本を読む声にも使えます。

Gemini 3.8 Flash-Lite TTS(たくさん作る道具)もあります。 声の持ち主が許せば、声をまねできます。 声の持ち主の許可を先に確かめます。 作った音には、SynthID(作った音のしるし)が入ります。

Hacker News(技術の話をする場所)で話題になりました。 275ポイントと125コメントがありました。 これは、たくさん注目されたという意味です。 正しいと決まった意味ではありません。

くわしくはGoogleの発表とHacker Newsの投稿で読めます。

💬 みんなの反応:コンピューターが本を声にできる

人々は「すごい」と思う一方で、「まだ完璧ではない」とも言っている。

  • ある人は、自分のコンピューターで、登場人物ごとに本を読ませた。本人の報告では、499個の引用のうち485個を正しく分けられた。別の人は、約12分の録音で、よく似た声を作れたと言っている。
  • 長い本では、別の声の道具のほうが聞きやすいという人もいる。
  • 利用者の計算では、1時間は約0.27〜0.81ドル。大きな本は約15ドルで読ませられるという話もあった。
  • でも、声が指示どおりにならないことや、使えない地域があること、声をまねる同意の扱いを心配する人もいる。

コメント150件時点の成熟版(改訂2)。100件を取得し、全体から100件を抽出して要約しました。内容はHN利用者の自己申告で、編集部が確認した事実ではありません。

出典・参考