🔥 HN 热议

Gemini 3.8 TTS:从挑选声音到指挥声音

约3分钟读完 Tiny Why编辑部 · 文:特派员 好奇

词语
文本转语音(TTS)(wén běn zhuǎn yǔ yīn)

把写下来的文字转换成声音。

音色复制(yīn sè fù zhì)

根据声音样本制作相似的声音特点。

SynthID(SynthID)

Google放进生成音频里的隐形识别标记。

发生了什么

Google(开发Gemini的科技公司)在2026年9月23日宣布了两种新的语音生成模型:Gemini 3.8 Flash TTS和Gemini 3.8 Flash-Lite TTS。官方说明称,前者面向创作,后者面向大量语音生产。

Gemini 3.8 Flash TTS可以根据自然语言提示,从零设计一种新声音。用户可以描述角色、口音和声音特点。Google称,它支持100多种语言和方言,并提供2000多种可以直接使用的声音。Flash-Lite则重点服务大量配音、音频制作和语音代理。

这两种模型都能逐句控制说话方式。用户可以安排语速、情绪、方言变化和停顿,也可以让两个声音按照同一份脚本对话。Google还称,长篇音频中,声音特点会更稳定。

背景

文本转语音(TTS)就是把文字变成声音。过去,用户通常先从现成声音中选择。Google把这次更新描述为更像一个声音创作工作室:用户不仅选择谁来读,还能安排每一句应该怎样读。

模型还支持有条件的音色复制。用户可以用30秒的音频样本复制自己的声音,或复制自己拥有使用权的声音。系统会核对声音主人的同意录音。Google称,生成的音频会加入SynthID隐形标记,音色复制还会带有C2PA认证信息。

为什么重要

这次更新把语音生成从单纯的朗读,推进到声音和表演的设计。游戏角色、有声书、播客、配音和实时语音代理,都可以更细地控制声音。两个角色用一份脚本自然轮流说话,也可能减少部分制作工作。

但声音和真实身份关系密切。复制声音时,谁同意、谁拥有使用权、听众能否识别人工生成内容,都会变得重要。Google给出了同意核对和隐形标记等方案,不过这些方案的实际效果,还需要产品使用和外部测试来确认。

已确认的信息

Google表示,两个模型已经开始通过Google AI Studio和Gemini API向开发者推出。Gemini 3.8 Flash TTS还会进入Gemini Notebook,Flash-Lite会进入Google Vids。Gemini Enterprise的API支持将在之后提供。音色复制目前不适用于美国伊利诺伊州、得克萨斯州、欧洲经济区、英国、瑞士和印度。

性能方面,Google介绍了Hume AI的Voice Design Benchmark、质量指数,以及Voice Arena的盲测结果。Google称,Flash TTS在其中一些项目中排名靠前。但这些是Google引用的评测结果,不等于本篇资料已经完成独立验证。

这条消息在Hacker News获得275个积分和125条评论。讨论页面的数字表示社区关注度,不证明Google的产品说法一定正确。

仍不清楚

官方说明没有完整列出价格、调用上限和每种语言的实际效果。长时间生成时,声音能否一直稳定,也需要更多样本。SynthID能在什么条件下被发现,同意核对在真实业务中是否可靠,同样需要外部观察。

接下来关注

接下来应关注独立听测,尤其是日语和其他地区语言。开发者也需要看到清楚的价格、配额和地区规则。更重要的是,声音的授权和来源信息,能否在普通媒体制作中一直保持清楚。

💬 HN 反应:Gemini 3.8 TTS 价格有吸引力,但质量、安全和可用性仍有分歧

评论者一方面肯定它的低成本和表现力潜力,另一方面也质疑它是否能准确遵循提示、声音克隆是否会被滥用,以及产品发布是否完善。以下数字、性能和故障都来自用户自报或估算,并非独立验证。

  • 一位用户自报了本地应用 KeenLore:它无需云服务或按量付费,就能用不同角色朗读整本书。该用户称,引用语句的说话人归属正确了499条中的485条,即97.2%;应用用 Gemma 4 分析文本,用 Qwen3 TTS Voice Design 制作声音样本,并运行在8GB NVIDIA T1000、96GB内存和 Ryzen 5 7600 上。
  • 另一位用户自报用约12分钟、约150段录音,在 RTX 3090 上微调 Qwen3-TTS 1.7B,并称家人觉得生成的声音非常像本人。
  • 关于长时间的最终朗读,一位用户认为 Fish Audio 或 Higgs 的韵律更好,也更容易长时间聆听。这只是用户比较,不是基准测试。
  • 一条评论估算 Gemini 3.8 Flash TTS 的标准模式约为每小时0.81美元,批处理约0.41美元;Flash-Lite分别约为0.54美元和0.27美元。
  • 另一位用户计算,一本25万词、约150万字符的有声书在这里约需15美元,而 ElevenLabs 约需75美元。这些是用户估算,价格可能变化。
  • 批评者认为技术本身很惊人,但演示有时忽略提示中的重要要求,还不适合正式生产;也有人认为声音很可信,因此评价取决于用途。
  • 一位用户报告 AI Studio 的 Voice Design 会报错,语音复制在其地区不可用,中性性别声音不足,用途选项不完整,价格也不清楚。
  • 语音复制还引发了安全疑问:同意录音会保存多久,以及复制出的声音可能怎样被滥用。

这是评论数为150时的成熟版(修订2)。获取100条,并从整体抽取100条总结。内容属于HN用户自述,并非编辑部核实的事实。

🔥 HN 热议

Gemini 3.8能自己设计声音,还能逐句指挥

📰 完整报道: Gemini 3.8 TTS:从挑选声音到指挥声音

Google公布了新的语音工具。它们不只会朗读,还能控制每句话的说法。

约1分钟读完 Tiny Why编辑部 · 文:特派员 好奇

词语
文本转语音(TTS)(wén běn zhuǎn yǔ yīn)

让电脑把文字读成声音。

SynthID(SynthID)

放在人工生成声音里的隐形标记。

💡 一句话总结

  • Google公布了两种新的语音模型。
  • 它们可以设计声音,也可以控制说话方式。
  • 这条消息在Hacker News获得275分和125条评论。

Google(开发Gemini的公司)公布了Gemini 3.8 Flash TTS(把文字变成声音的模型)。文本转语音(TTS)就是把写下来的话读出来。这个模型可以从头设计一种新声音,也能控制语速、语气、口音和停顿。

Gemini 3.8 Flash-Lite TTS适合大量配音。Google称,两种模型支持100多种语言和方言。它们还提供2000多种可以直接使用的声音。两个声音可以按照同一份脚本轮流对话。

如果用户有权使用某种声音,就可以用30秒的音频样本复制它。系统会先核对声音主人的同意录音。生成的声音还会加入SynthID标记。这个标记像一个看不见的提示,帮助人们知道声音由人工系统生成。

新模型会进入Google AI Studio、Gemini API、Gemini Notebook和Google Vids。音色复制在一些地区暂时不能使用。官方说明也没有说清全部价格和使用上限。

Hacker News是讨论科技消息的网站。这条消息有275分和125条评论,表示它受到关注。但关注度不是正确证明。可以查看Google的说明和Hacker News讨论。

💬 HN 反应:看起来便宜又有用,但还不够完善

用户既期待能在本地制作声音,也担心质量、价格、使用限制和安全问题。数字都是用户报告或估算。

  • 有人在自己的电脑上做出了能让不同角色朗读的有声书工具。一位用户报告称,499条引用中有485条分对了,即97.2%;另一位用户说,用约12分钟录音就做出了很像自己的声音。
  • 关于长篇朗读,有人比较后认为 Fish Audio 或 Higgs 更容易听。
  • 用户估算每小时约需0.27到0.81美元;一本约150万字符的书,有人算出这里约15美元,另一项服务约75美元。
  • 一些人认为声音不够自然、没有完全遵循指令,也还不能用于正式制作;另一些人则觉得效果很真实。
  • 还有用户遇到 AI Studio 报错和地区限制,并担心同意录音的保存方式以及克隆声音被滥用。

这是评论数为150时的成熟版(修订2)。获取100条,并从整体抽取100条总结。内容属于HN用户自述,并非编辑部核实的事实。

🔥 HN 热议

Gemini 3.8会把文字变成声音

📰 完整报道: Gemini 3.8 TTS:从挑选声音到指挥声音

你写下故事,电脑就能用声音读出来。

约1分钟读完 Tiny Why编辑部 · 文:特派员 好奇

词语
Gemini 3.8 Flash TTS(Gemini 3.8 Flash TTS)

把文字变成声音的Google工具。

SynthID(SynthID)

电脑声音里藏着的小记号。

Google(做Gemini的公司)公布了新的声音工具。

Gemini 3.8 Flash TTS(把字变成声音的工具)可以读故事。 你可以叫它慢一点。 你也可以叫它开心一点。 两个声音可以一起说话。 另一个工具可以做很多声音。

如果要学别人的声音,主人要先同意。 声音里还会有SynthID(看不见的小记号)。 这个记号帮助人们发现电脑做的声音。

Hacker News(讨论技术的地方)也在谈这条消息。 它有275分和125条评论。 这些数字只表示很多人看到了它。 它们不能证明消息一定是真的。

你可以读Google的说明。

💬 大家怎么说:电脑可以用很多声音读书

大家觉得这项技术很神奇,但也发现它还会出问题。

  • 有人说,自己的电脑能让书里不同人物用不同声音说话,并正确分开499句话中的485句。另一个人说,约12分钟的录音就能做出很像自己的声音。
  • 有人觉得,读很长的书时,其他声音工具更好听。
  • 用户估算一小时大约要0.27到0.81美元,大书可能要15美元左右,而别的服务可能要75美元。
  • 声音不一定总能听懂指令,有些地方还不能使用;人们也担心别人会怎样保存和滥用被复制的声音。

这是评论数为150时的成熟版(修订2)。获取100条,并从整体抽取100条总结。内容属于HN用户自述,并非编辑部核实的事实。

来源