🔥 HN 热议

Gemini 3.8 Live发布:人工智能一边聊天,一边做事

约3分钟读完 Tiny Why编辑部 · 文:特派员 好奇

词语
视觉输入(shì jué shū rù)

模型收到的画面信息。

语音代理(yǔ yīn dài lǐ)

能用声音完成任务的人工智能程序。

SynthID水印(SynthID shuǐ yìn)

Google放进AI生成音频里的隐藏标记。

Google(开发 Gemini 的公司)在2026年9月15日宣布推出 Gemini 3.8 Live(实时语音对话模型)和 Gemini 3.8 Live Extended Thinking(面向复杂任务的版本)。Google在官方博客中说,这两种模型可以在接近实时的状态下推理、理解视觉输入,并在对话继续时调用工具。消息发布后,也在Hacker News(科技新闻网站)上受到关注,获得350 points和224 comments。这些数字只表示社区关注度,不证明发布内容或性能一定正确。

发布了什么

Live面向大规模使用和成本效率。Google称,它能让对话更流畅,也能在接近实时的状态下处理画面。它可以在一次对话中自动识别并切换97种受支持语言。它还可以在后台调用工具和API,同时继续和用户说话。

Extended Thinking面向高复杂度任务。它会一边说话,一边处理多步推理。它可以先用简短的话告诉用户自己正在检查,再说明任务进度。官方示例包括多步预订和异步处理。示例说明的是产品目标,不等于所有任务都能稳定完成。

背景:让对话和工作同时进行

这次发布的重点,不只是更聪明的答案。模型还要在处理事情时保持对话连贯。Live强调速度和效率;Extended Thinking强调复杂步骤和推理。Google把两者定位为开发者构建语音代理的基础。用户可以用声音提出任务,模型在后台工作,并报告进展。

为什么重要

语音交互把听、看、说和调用服务放进一条流程。如果模型能边回应边完成后台任务,用户就不必每一步都停下来重新下指令。关键是任务没完成时,模型能否说清进度。

Google引用的外部评测显示,Extended Thinking在三个项目中得到82.6、68.6%和97.7%;Live在另一项语音代理评测中排第二。数字来自Google公告,公告没有完整说明测试条件,也没有独立复测。

已确认的提供方式

开发者可从 Gemini API(调用服务的方式)和 Google AI Studio(开发者工具)开始。企业用户可在 Gemini Enterprise(企业服务)中看到私有预览。Live也进入 Search Live(搜索里的语音功能)。Extended Thinking进入 Gemini Live。Google列出 Workspace(办公服务)中的 Docs、Gmail、Keep,供符合条件的用户使用。

Google还称,AI产品生成的音频都带有不可察觉的SynthID水印,用来帮助识别AI音频,并协助减少错误信息传播。

还不知道什么

官方文章没有给出完整价格,也没有逐一说明国家、设备和套餐的开放时间。97种语言在嘈杂环境中的表现、工具调用失败后如何处理、用户能否在关键操作前确认,都无法从这篇公告确认。外部评测的具体条件和比较对象也没有完整展开。

接下来观察

下一步应看实际产品,而不只是演示:对话是否在工具运行时保持自然,任务要等多久,API成本是多少,视觉理解是否稳定。若第三方能在相同条件下复现评测,性能数字才更容易判断。普通用户则可以关注 Search Live、Gemini Live和Google Workspace的实际开放范围。

💬 Gemini 3.8 Live:对话自然,但评价要分开看

HN评论认为,Gemini 3.8 Live在对话自然度、速度和多语言语音方面有吸引力;但也有人质疑它的国际象棋演示、据称的幻觉、上下文遗忘、语音疲劳,以及搜索工具链对比较结果的影响。以下是评论者的个人体验和观点,不是独立验证。

  • 有人认为,演示中模型似乎漏掉了很常见的将杀模式,因此作为先进模型的展示显得失分。
  • 也有人反驳说,对实时语言模型而言,能在不走非法棋、不凭空增加棋子的情况下完成整盘棋,本身就是值得肯定的进步;还有评论提到没有使用引导式解码。
  • 一些用户自称觉得Gemini的文字较易读、反应较快,适合开放式讨论和头脑风暴。对编程能力的评价更分裂,但有人认可它的多语言语音和翻译。
  • 一位用户称Gemini Live能在多语言对话中分辨说话者并进行实时翻译。另一位用户则认为语音的自然语调过于夸张,长时间使用会疲劳。
  • 一位自称使用Pro/Thinking的用户报告说,在需要先研究资料的问题上仍出现幻觉。这说明聊得自然和查得可靠是两回事。
  • 另一位用户称,Gemini有时会突然忘记较早的上下文,导致对话跑题;相较于逐渐压缩旧上下文的模型,这种失效更突然。
  • 有评论反驳说,通过Google应用进行比较时,结果可能部分反映搜索工具链和分配的计算量,而不只是底层模型能力。
  • 因此,这个讨论提醒人们把对话易用性,与复杂推理、资料检索、编程和长任务中的可靠性分开评价。

这是评论数为327时的成熟版(修订4)。获取300条,并从整体抽取120条总结。内容属于HN用户自述,并非编辑部核实的事实。

🔥 HN 热议

Gemini 3.8 Live:会聊天,也会在后台做事

📰 完整报道: Gemini 3.8 Live发布:人工智能一边聊天,一边做事

Google发布了两种新的语音人工智能模型,它们能在说话时继续处理任务。

约2分钟读完 Tiny Why编辑部 · 文:特派员 好奇

词语
基准测试(jī zhǔn cè shì)

用相同方法比较模型表现的测试。

API(API)

一种让软件使用模型功能的方式。

Hacker News(Hacker News)

分享科技消息并显示关注度的网站。

💡 一句话总结

  • Live重视快速、自然的语音对话。
  • Extended Thinking处理更难的多步任务。
  • 两者都能理解画面,并在后台调用工具。

Google(开发 Gemini 的公司)在9月15日发布了这两种模型。请看官方说明。Gemini 3.8 Live(会用声音对话的模型)可以接收接近实时的视觉信息。Google说,它能在一次对话中识别并切换97种语言。它还可以调用工具和API。任务进行时,对话不必停止。

Gemini 3.8 Live Extended Thinking专门处理复杂工作。它会把任务分成几步来想,同时继续说话。它还会用短句告诉用户正在检查,并说明进度。Google展示了多步预订的例子。这解释了它为什么不只是一个会回答问题的聊天工具:它还试图把请求向后推进。

Google列出了几项外部基准测试结果。Extended Thinking在语音质量、任务完成和音频推理项目中分别是82.6、68.6%和97.7%。不过,这些数字来自Google的公告。测试条件和比较方法没有全部写出。

这条消息在Hacker News(科技新闻网站)上也受到关注。它有350 points和224 comments。这表示很多人看到了消息,不表示模型一定正确或好用。

两种模型会分批开放。开发者可使用Gemini API(调用模型的方式)和Google AI Studio(开发工具)。Live会进入Search Live(搜索里的语音功能),Extended Thinking会进入Gemini Live(语音对话功能)。部分用户还可在Docs、Gmail和Keep中使用。价格、设备范围和全部开放时间,仍需等待更多说明。

💬 Gemini 3.8 Live:好聊,但也会出问题

有些评论者觉得Gemini 3.8 Live很快、好读,也会处理多种语言。另一些人报告它在下棋、查资料和长对话中会犯错。这些是个人体验,不是官方测试结果。

  • 有人觉得它在棋局演示中漏掉了一个很容易的将杀。
  • 也有人认为,实时模型能合法地下完整盘棋,已经很厉害。
  • 用户自称它适合头脑风暴,有人也觉得它的多语言语音和翻译不错。
  • 但也有人报告它会编造查资料的答案,或忘记前面的对话。
  • 还有人觉得它的声音太夸张,听久了会累。
  • 比较结果还可能受到Google搜索系统和计算量的影响,不一定只代表模型本身。

这是评论数为327时的成熟版(修订4)。获取300条,并从整体抽取120条总结。内容属于HN用户自述,并非编辑部核实的事实。

🔥 HN 热议

Gemini 3.8 Live:会说话,也会做小任务

📰 完整报道: Gemini 3.8 Live发布:人工智能一边聊天,一边做事

Google发布了会和人说话、还会继续做事的人工智能。

约1分钟读完 Tiny Why编辑部 · 文:特派员 好奇

词语
Gemini 3.8 Live(Gemini 3.8 Live)

Google给会用声音聊天的人工智能起的名字。

Gemini 3.8 Live Extended Thinking(Gemini 3.8 Live Extended Thinking)

处理难任务的版本。

Hacker News(Hacker News)

分享科技消息的网站。

Google(开发 Gemini 的公司)在发布说明中介绍了新的人工智能。它叫 Gemini 3.8 Live(用声音聊天的人工智能)。你可以和它说话。它也能看见你给它的画面。Google说,它能在97种语言之间切换。

它还可以让别的工具帮忙。工具工作时,它不会马上停下聊天。

Google还发布了 Gemini 3.8 Live Extended Thinking(处理难任务的版本)。它会把难事分成几步。它一边想,一边告诉你进度。Google举了预订的例子。

这条消息也出现在Hacker News(科技新闻网站)上。那里有350 points和224 comments。这个数字表示很多人注意到了它。这个数字不能证明AI一定正确。

两种AI不会同时到每个人手里。Google会慢慢开放它们。价格和每台设备的情况,还没有说清楚。

💬 大家怎么说Gemini 3.8 Live

大家发现了它的优点,也发现了它的麻烦。

  • 有人说它说话快,还会说不同的语言。
  • 可是,它下棋时好像犯了一个很容易的错误。
  • 有人说它会忘记很久以前说过的话。
  • 还有人觉得它的声音太用力,听久了会累。

这是评论数为327时的成熟版(修订4)。获取300条,并从整体抽取120条总结。内容属于HN用户自述,并非编辑部核实的事实。

来源