🔥 HN 热议

GPT-5.6 Sol看图找东西,进步有多大?

约1分钟读完 Tiny Why编辑部 · 文:特派员 好奇

词语
物体检测

在图片中找出物体,并标明它的位置。

OCR

把图片里的文字读成可以使用的文字。

Hacker News

人们分享和讨论技术新闻的网站。

发生了什么

图像人工智能公司Roboflow用自家测试,评估了OpenAI的GPT-5.6 Sol。文章认为,Sol是OpenAI目前发布过的视觉能力最强的模型。报道说,它在图片中找物体和数物体两项任务上进步明显。

这篇文章也在Hacker News受到关注,获得311分和156条评论。这些数字表示技术社区的关注程度,不是测试结论正确的证明。

测了什么

测试包括物体检测、计数、OCR和信息提取。物体检测是找出图片里的物体,并标出它的位置。Roboflow报告,Sol的检测分数为46.2,GPT-5.5为13.8。

计数任务中,Sol为73.0%,GPT-5.5为64.9%。不过,不是每项能力都同样提高。OCR测试中,Sol为90.7%,GPT-5.5为91.2%。新模型在某些看图工作更强,不等于每种看图工作都最好。

为什么重要

会看屏幕并操作软件的人工智能,需要理解画面。处理文件的工具,也可能先要找到表格、签名或日期。更会找物体和计数,能让这类工具多一些可用场景。

可以确认的内容

文章展示了Sol区分文件标题、段落、表格、图片和签名的例子。它还描述了密集物体的测试。在该测试中,Sol平均每张图接近10秒,平均每张约2.5美分。Terra和Luna的结果较低,但更快也更便宜。

还不知道什么

这是Roboflow自己的测试,不能代表所有图片任务。文章所说的测试也尚未正式发布。报道还列出失败案例:约2000×2000像素或更大的图像中,Sol有时会把物体位置标得不稳定。文章称,OpenAI确认了这个现象,尤其在较低推理强度时。

接下来该看什么

实际选择模型时,准确度之外还要看等待时间、费用和检查错误的方法。文章自己的比较认为,在大量检测和计数任务中,Gemini 3.5 Flash仍是更实用的选择。独立测试和真实工作中的表现,才会说明这种进步能否稳定出现。

💬 GPT-5.6 Sol 的视觉能力:亮点与实际限制

讨论中既有用户称赞 Sol 图像理解能力,也有对基准测试、可靠性和工具选择的明确保留。

  • 有用户自行报告,Sol 能审视应用截图、重组不一致的界面区域,并兼顾整页的可读性与一致性。也有人认为,让 LLM 判断主观设计质量本身就有局限。
  • 另一位用户自行报告,在为游戏背景做扩图时,Sol 多次无法同时保持原有比例和既有内容。能理解图片,不等于能精确地按要求编辑图片。
  • 评论者指出,基准中可能有错误的真值标注,以及可能旋转了90度的检测框。文章作者承认一处真值错误会修正;对另一处问题,他解释为大图处理较弱,但这一判断也受到质疑。
  • 一位评论者依据文章所报的最佳药片计数81.1%,认为这不适合药房等高可靠性场景,应优先使用 OpenCV 一类确定性工具。反方认为,VLM 的优势在于通用性,也可用于创建数据集和把不确定案例交给人工复核。
  • 作者大体同意:在其比较中,Gemini 3.5 Flash 在许多任务上胜过 Sol,价格也更低;他还称较新的 Gemini 3.7 Flash 把价格算入后很有竞争力。这些均是作者和用户的评估,仍应按具体工作负载验证。

这是评论数为156时的初期(修订1)。获取100条,并从整体抽取100条总结。内容属于HN用户自述,并非编辑部核实的事实。

🔥 HN 热议

GPT-5.6 Sol看图找物体更强了

📰 完整报道: GPT-5.6 Sol看图找东西,进步有多大?

Roboflow的测试显示,Sol找物体和计数有进步。

约1分钟读完 Tiny Why编辑部 · 文:特派员 好奇

词语
Roboflow

制作和测试看图人工智能工具的公司。

GPT-5.6 Sol

OpenAI发布的、能处理图片和文字的人工智能。

💡 一句话总结

  • Sol在找物体的测试中进步很大。
  • 它数物体的结果也比旧模型好。
  • 速度、费用和错误,仍然需要一起看。

Roboflow测试了GPT-5.6 Sol。 OpenAI是制作Sol的人工智能公司。 Roboflow研究让人工智能看图片的工具。

测试让AI找图片里的物体。 也让AI数出物体的数量。 还测试了读出图片里的文字。

Sol找物体的分数是46.2。 旧版GPT-5.5是13.8。 Sol计数的结果是73.0%。 GPT-5.5是64.9%。

这些是Roboflow测试得到的结果。 它们是参考,不是最后的答案。 换一批图片,结果可能不同。

Sol不是每件事都更好。 在读全图文字的测试中,Sol略低于GPT-5.5。 所以新模型不一定适合每项工作。

文章说,Sol平均每张图接近10秒。 每张图平均约2.5美分。 图片很多时,费用会慢慢变大。

大图片也会带来问题。 Sol有时会把物体的位置标错。 重要的结果,应当让人来检查。

这篇文章在Hacker News得到311分和156条评论。 这说明它受到了关注。 这不说明测试结果一定正确。

💬 Sol 很有用,但要看任务

Sol 能帮助看图片,不过真实工作里,错误和成本同样重要。

  • 有用户说,Sol 能发现应用界面中不协调的地方,并提出更一致的布局。也有人提醒,设计好不好有一部分取决于人的判断。
  • 有用户报告,Sol 在把游戏图片向外扩展、同时保持原图比例和细节时表现不稳定。看懂图片和精确改图是两种能力。
  • 有人发现文章测试的标签或方框方向可能有错。作者承认会修正一处标签错误,所以不能不加检查地相信排名。
  • 像数药片这样不能轻易出错的任务,有评论者认为文章中的81.1%不够。固定任务可考虑 OpenCV 这类专用图像处理工具。
  • 按作者和用户的说法,Gemini Flash 在不少图像测试中比 Sol 更强,价格也可能更低。选择前最好用自己的图片测试。

这是评论数为156时的初期(修订1)。获取100条,并从整体抽取100条总结。内容属于HN用户自述,并非编辑部核实的事实。

🔥 HN 热议

Sol会看图片

📰 完整报道: GPT-5.6 Sol看图找东西,进步有多大?

GPT-5.6 Sol是会看图片的人工智能。

约1分钟读完 Tiny Why编辑部 · 文:特派员 好奇

词语
OpenAI

制作Sol的公司。

Hacker News

人们聊电脑新闻的网站。

OpenAI做了GPT-5.6 Sol。 OpenAI是一家做人工智能的公司。

Roboflow给Sol看图片。 它问物体在哪里。 它也问有几个。

Sol比旧AI做得更好。 可是,Sol也会做错。

大图片会让Sol迷糊。 读文字时,Sol也不总是最好。

看一张图片要约10秒。 用Sol也要花一点钱。

Hacker News的人谈了这件事。 文章有311分和156条评论。 这表示很多人注意到它。 这不表示每个结果都对。

💬 会看图片的 AI

Sol 可以帮忙看图片和画面。

  • 有人说,它能找到画面里不整齐的地方。也有人说,它还是会出错。
  • 有用户说,它把图片变宽时,没有总能保留原来的样子。
  • 数药片这种很重要的工作,大家说可以用专门的工具。
  • 文章作者说,另一个叫 Gemini 的 AI 看图片也很厉害。

这是评论数为156时的初期(修订1)。获取100条,并从整体抽取100条总结。内容属于HN用户自述,并非编辑部核实的事实。

来源