GPT-5.6 Sol看图找东西,进步有多大?
物体检测
在图片中找出物体,并标明它的位置。
OCR
把图片里的文字读成可以使用的文字。
Hacker News
人们分享和讨论技术新闻的网站。
发生了什么
图像人工智能公司Roboflow用自家测试,评估了OpenAI的GPT-5.6 Sol。文章认为,Sol是OpenAI目前发布过的视觉能力最强的模型。报道说,它在图片中找物体和数物体两项任务上进步明显。
这篇文章也在Hacker News受到关注,获得311分和156条评论。这些数字表示技术社区的关注程度,不是测试结论正确的证明。
测了什么
测试包括物体检测、计数、OCR和信息提取。物体检测是找出图片里的物体,并标出它的位置。Roboflow报告,Sol的检测分数为46.2,GPT-5.5为13.8。
计数任务中,Sol为73.0%,GPT-5.5为64.9%。不过,不是每项能力都同样提高。OCR测试中,Sol为90.7%,GPT-5.5为91.2%。新模型在某些看图工作更强,不等于每种看图工作都最好。
为什么重要
会看屏幕并操作软件的人工智能,需要理解画面。处理文件的工具,也可能先要找到表格、签名或日期。更会找物体和计数,能让这类工具多一些可用场景。
可以确认的内容
文章展示了Sol区分文件标题、段落、表格、图片和签名的例子。它还描述了密集物体的测试。在该测试中,Sol平均每张图接近10秒,平均每张约2.5美分。Terra和Luna的结果较低,但更快也更便宜。
还不知道什么
这是Roboflow自己的测试,不能代表所有图片任务。文章所说的测试也尚未正式发布。报道还列出失败案例:约2000×2000像素或更大的图像中,Sol有时会把物体位置标得不稳定。文章称,OpenAI确认了这个现象,尤其在较低推理强度时。
接下来该看什么
实际选择模型时,准确度之外还要看等待时间、费用和检查错误的方法。文章自己的比较认为,在大量检测和计数任务中,Gemini 3.5 Flash仍是更实用的选择。独立测试和真实工作中的表现,才会说明这种进步能否稳定出现。
GPT-5.6 Sol看图找物体更强了
📰 完整报道: GPT-5.6 Sol看图找东西,进步有多大?
Roboflow的测试显示,Sol找物体和计数有进步。
Roboflow
制作和测试看图人工智能工具的公司。
GPT-5.6 Sol
OpenAI发布的、能处理图片和文字的人工智能。
💡 一句话总结
- Sol在找物体的测试中进步很大。
- 它数物体的结果也比旧模型好。
- 速度、费用和错误,仍然需要一起看。
Roboflow测试了GPT-5.6 Sol。 OpenAI是制作Sol的人工智能公司。 Roboflow研究让人工智能看图片的工具。
测试让AI找图片里的物体。 也让AI数出物体的数量。 还测试了读出图片里的文字。
Sol找物体的分数是46.2。 旧版GPT-5.5是13.8。 Sol计数的结果是73.0%。 GPT-5.5是64.9%。
这些是Roboflow测试得到的结果。 它们是参考,不是最后的答案。 换一批图片,结果可能不同。
Sol不是每件事都更好。 在读全图文字的测试中,Sol略低于GPT-5.5。 所以新模型不一定适合每项工作。
文章说,Sol平均每张图接近10秒。 每张图平均约2.5美分。 图片很多时,费用会慢慢变大。
大图片也会带来问题。 Sol有时会把物体的位置标错。 重要的结果,应当让人来检查。
这篇文章在Hacker News得到311分和156条评论。 这说明它受到了关注。 这不说明测试结果一定正确。
💬 Sol 很有用,但要看任务
Sol 能帮助看图片,不过真实工作里,错误和成本同样重要。
- 有用户说,Sol 能发现应用界面中不协调的地方,并提出更一致的布局。也有人提醒,设计好不好有一部分取决于人的判断。
- 有用户报告,Sol 在把游戏图片向外扩展、同时保持原图比例和细节时表现不稳定。看懂图片和精确改图是两种能力。
- 有人发现文章测试的标签或方框方向可能有错。作者承认会修正一处标签错误,所以不能不加检查地相信排名。
- 像数药片这样不能轻易出错的任务,有评论者认为文章中的81.1%不够。固定任务可考虑 OpenCV 这类专用图像处理工具。
- 按作者和用户的说法,Gemini Flash 在不少图像测试中比 Sol 更强,价格也可能更低。选择前最好用自己的图片测试。
这是评论数为156时的初期(修订1)。获取100条,并从整体抽取100条总结。内容属于HN用户自述,并非编辑部核实的事实。
Sol会看图片
📰 完整报道: GPT-5.6 Sol看图找东西,进步有多大?
GPT-5.6 Sol是会看图片的人工智能。
OpenAI
制作Sol的公司。
Hacker News
人们聊电脑新闻的网站。
OpenAI做了GPT-5.6 Sol。 OpenAI是一家做人工智能的公司。
Roboflow给Sol看图片。 它问物体在哪里。 它也问有几个。
Sol比旧AI做得更好。 可是,Sol也会做错。
大图片会让Sol迷糊。 读文字时,Sol也不总是最好。
看一张图片要约10秒。 用Sol也要花一点钱。
Hacker News的人谈了这件事。 文章有311分和156条评论。 这表示很多人注意到它。 这不表示每个结果都对。
💬 会看图片的 AI
Sol 可以帮忙看图片和画面。
- 有人说,它能找到画面里不整齐的地方。也有人说,它还是会出错。
- 有用户说,它把图片变宽时,没有总能保留原来的样子。
- 数药片这种很重要的工作,大家说可以用专门的工具。
- 文章作者说,另一个叫 Gemini 的 AI 看图片也很厉害。
这是评论数为156时的初期(修订1)。获取100条,并从整体抽取100条总结。内容属于HN用户自述,并非编辑部核实的事实。
💬 GPT-5.6 Sol 的视觉能力:亮点与实际限制
讨论中既有用户称赞 Sol 图像理解能力,也有对基准测试、可靠性和工具选择的明确保留。
这是评论数为156时的初期(修订1)。获取100条,并从整体抽取100条总结。内容属于HN用户自述,并非编辑部核实的事实。