Qwen3.8-Omni-Flash发布:一个模型同时理解文字、图片、声音和视频
全模态(quán mó tài)
同时处理文字、图片、声音和视频等信息。
上下文窗口(shàng xià wén chuāng kǒu)
一次请求中,模型可以参考的信息范围。
Qwen3.8-Omni-Flash(Qwen 3.8 Omni Flash)
阿里巴巴 Qwen 团队发布的多种输入AI模型。
发生了什么
阿里巴巴的 Qwen 团队发布了 Qwen3.8-Omni-Flash。它可以接收文字、图片、音频和视频。Qwen 官方资料把它用于音视频理解、会议摘要和字幕生成。资料还列出 1M 上下文窗口、工具调用和网页搜索等能力。模型的主要任务,是理解这些输入后生成文字。Qwen 官方文档
这条消息也登上了 Hacker News。相关帖子有327个积分和126条评论。这个数字说明技术社区关注它。它不等于模型已经被证明可靠。Hacker News 帖子
背景:什么是全模态
视频不只有画面。它还有说话声、背景声音、画面文字和时间顺序。全模态模型,就是尝试把这些不同信息放进同一套理解流程里。这样做的价值,不只是能看图,而是能把图像发生的事和声音说的话联系起来。
在很多长视频工作流中,内容需要分段处理。Qwen3.8-Omni-Flash强调较大的上下文窗口。1M不是永久记忆,也不是模型一定能正确理解一百万个单位。它表示一次请求可以放入很长的信息。能放进去,不代表每一处都能看得准确。
为什么重要
如果一场会议里,决定出现在前半段,细节出现在后半段,完整上下文有机会帮助模型写出更连贯的摘要。字幕也可能受益于前后语句的联系。接入工具调用后,模型还可以让外部程序执行指定动作。网页搜索则能提供外部资料。这些功能组合起来,指向一种先看懂音视频,再查询或处理的工作方式。但这只是应用可能,不是每次都能完成的保证。
已确认的信息
Qwen云文档列出 Chat Completions 和 Responses 两种调用路径,并明确列出工具调用和网页搜索。Qwen发布资料还称,在30项评测中,平均成绩比Qwen3.5-Omni-Plus高出超过26%。这是提供方公布的测试结果,不是独立机构复测。Qwen发布资料
Hacker News的327分和126条评论只说明帖子受到关注。不能用它来证明上述性能数据,也不能把它当成模型可靠性的测试。
还不知道什么
目前还不能只靠这些资料判断,模型在长视频、杂音、口音或多语言场景中会错在哪里。真实价格、响应速度和错误率,也要看具体接口和用法。尤其要确认它能否稳定地找到关键片段,而不是只给出听起来顺口的总结。
接下来关注
接下来应看第三方评测、实际用户案例和公开的错误分析。还要看长音视频任务的费用,以及工具调用是否容易被人检查。更稳妥的结论是:Qwen3.8-Omni-Flash让多种输入放进一次AI工作流成为新的选择,但它还不是“什么都能准确理解”的证明。
Qwen3.8-Omni-Flash:能看图、听声音的新AI
📰 完整报道: Qwen3.8-Omni-Flash发布:一个模型同时理解文字、图片、声音和视频
一种能同时处理文字、图片、声音和视频的新AI出现了。
上下文窗口(shàng xià wén chuāng kǒu)
一次能放进AI视野的信息量。
工具调用(gōng jù diào yòng)
让AI请求其他程序完成工作的功能。
Hacker News(Hacker News)
讨论技术新闻的网站。
💡 一句话总结
- 它能接收文字、图片、音频和视频。
- 它能帮忙总结会议和制作字幕。
- Hacker News的热度代表关注,不代表正确。
它带来了什么?
Qwen3.8-Omni-Flash(阿里巴巴 Qwen 团队的AI)发布了。它能接收文字、图片、音频和视频。官方资料说,它可用于分析音视频、总结会议和生成字幕。Qwen官方文档
它还有1M上下文窗口。上下文窗口可以理解为,一次能放进AI视野的信息量。信息放得更多,AI就有机会联系视频前后的内容。但容量大,不代表答案一定正确。
它支持工具调用和网页搜索。工具调用可以让AI请求其他程序帮忙。网页搜索可以让它查找网上资料。接入这些功能后,它不只是在回答问题,也能参与更长的工作流程。
Qwen方面称,它在30项评测中的平均成绩,比上一代Qwen3.5-Omni-Plus高出超过26%。这是发布方自己的数据。还需要独立测试来验证。Qwen发布资料
Hacker News的相关帖子有327个积分和126条评论。这说明它受到关注。它不能证明模型一定可靠。接下来要看长视频、杂音和不同语言下的表现,也要看真实价格和速度。
💬 Qwen 3.8 Omni Flash:很有希望,但运行起来不轻松
评论者看好它的能力和价格。不过,关于速度和故障的实际体验,主要来自相关的 Flash Next/Max,并不一定适用于 Omni Flash。
- 有人说,文章显示 Omni Flash 的音频和视频能力接近 Gemini 3.8 Flash,音频可能更强。但评论中没有独立验证。
- 评论者给出的价格是:每百万 token,Qwen 输入0.15美元、输出0.47美元;Gemini为1.50美元、9.00美元。可是,一个任务如果使用更多 token,最终花费可能不同。
- 相关的125B版本据用户自述需要约128GB内存。超过40 token/s的配置估计约需3,000美元,RTX 4090配置约30 token/s;27B版本更容易运行。
- 一些用户遇到奇怪的推理、虚构的上下文或很长的推理。运行方式和量化可能有影响;有人说NVFP4有所改善,但不能确定所有人都会遇到这个问题。
- 有人认为开放权重发布变慢,也有人指出Max和Flash Next已经发布,因此评论没有一致结论。
这是评论数为137时的成熟版(修订2)。获取100条,并从整体抽取100条总结。内容属于HN用户自述,并非编辑部核实的事实。
Qwen3.8-Omni-Flash能看很多东西
📰 完整报道: Qwen3.8-Omni-Flash发布:一个模型同时理解文字、图片、声音和视频
这个AI能一起看文字、图片、声音和视频。
Qwen3.8-Omni-Flash(Qwen 3.8 Omni Flash)
阿里巴巴 Qwen 团队做的AI。
Hacker News(Hacker News)
人们讨论技术新闻的网站。
它是什么?
Qwen3.8-Omni-Flash(阿里巴巴 Qwen 团队做的AI)来了。 它能看文字、图片、声音和视频。 它会用文字回答问题。
它能做什么?
它能帮忙整理会议。 它能帮忙做字幕。 它也能叫电脑工具帮忙。
大家为什么谈?
这条消息在Hacker News(技术新闻网站)上很受关注。 帖子有327分和126条评论。 这表示很多人注意到它。 这不表示它每次都正确。
还要记得
AI也会答错。 大人要检查答案。
💬 Qwen 3.8 Omni Flash:可能很聪明,但很大,也有点调皮
大家觉得它有潜力,但这些体验并不是在完全相同的条件下得到的。
- 一位评论者说,文章里的结果让 Omni Flash 的声音和画面能力看起来接近 Gemini 3.8 Flash,声音可能更强。不过还没有独立确认。
- 评论者提供的价格是:每百万 token,Qwen 输入0.15美元、输出0.47美元;Gemini是1.50美元、9.00美元。但一个任务如果读很多 token,便宜不一定代表总价便宜。
- 相关的大型125B版本像一个需要大桌子的模型:据用户说约需128GB内存。超过40 token/s的机器估计约3,000美元,RTX 4090约30 token/s,小型27B更容易运行。
- 一些人看到奇怪的思考文字、自己编出的上下文或很长的等待,可能和运行方法有关;另一些人仍觉得它好用。大家也没有决定开放权重是否变慢,有人指出Max和Flash Next已经公开。
这是评论数为137时的成熟版(修订2)。获取100条,并从整体抽取100条总结。内容属于HN用户自述,并非编辑部核实的事实。
💬 Qwen 3.8 Omni Flash:能力令人期待,但本地运行代价高
HN评论对它的音频、视频能力和低价格很感兴趣,但实际速度与稳定性的体验大多来自相关的 Qwen 3.8 Flash Next/Max,不一定能直接代表 Omni Flash。
这是评论数为137时的成熟版(修订2)。获取100条,并从整体抽取100条总结。内容属于HN用户自述,并非编辑部核实的事实。