面包屑图标 当前位置: 首页
AI资讯
热点详情

GPT-5.6 Sol性能暴涨3倍成OpenAI最强视觉AI

AI热点日报
AI热点日报时间:2026-08-20
热点解读

什么情况?!GPT-5 6 Sol,竟然是一直被低估的「视觉大师」。最近,第三方视觉评测机构Roboflow,把GPT-5 6「全家桶」放进自家的VLM基准测试里完整跑了一遍。测试项目都很接地气,基本就是视觉模型最常见也最实用的任务:目标检测、物体计数、OCR识别、信息抽取。仅看目标检测这一项,上一

什么情况?!

GPT-5.6 Sol,竟然是一直被低估的「视觉大师」。

最近,第三方视觉评测机构Roboflow,把GPT-5.6「全家桶」放进自家的VLM基准测试里完整跑了一遍。

测试项目都很接地气,基本就是视觉模型最常见也最实用的任务:目标检测、物体计数、OCR识别、信息抽取。

仅看目标检测这一项,上一代GPT-5.5只拿到13.8分。这个成绩在视觉模型领域里,几乎等于没交出像样答卷。

而这次Sol直接冲到了46.2,涨幅超过三倍。

Roboflow项目负责人SkalskiP甚至直言,「GPT-5.6 Sol是OpenAI有史以来最强的视觉模型」!

GPT-5.6「超大杯」

OpenAI最强视觉AI

长期以来,目标检测一直是GPT系列在视觉能力上的短板。任务本身并不复杂:让模型在图片中把每个目标准确框出来。

上一代GPT-5.5的表现,大致就是「知道画面里有东西,但具体框在哪里基本靠猜」。

这一次,GPT-5.6 Sol的检测分数直接飙升到46.2,提升超过三倍。

更值得注意的是,Terra和Luna也紧随其后,分别达到44.7和43.3。

尤其是Luna,作为这一代里价格最低的版本,目标检测成绩依然明显压过上一代旗舰模型。

在物体计数方面,整体分数也同步上涨。

Sol的准确率从GPT-5.5的64.9%提升到73%,Terra和Luna分别达到67.6%和66.2%。

那么,GPT-5.6的视觉能力到底强在哪?

最亮眼的一项,是文档版面识别。标题、正文、表格、插图、签名等区域,Sol都能相对干净、准确地标注出来。

这对合同处理、票据识别、报表分析等场景意义很大,因为几乎所有文档自动化流程的第一步,都是先定位「该看哪一块」,然后再进行文字识别与信息提取。

即使面对密集场景,GPT-5.6也顶住了压力。

像药片、鸡蛋这类几十个同类物体挤在一起的图片,向来是VLM最容易翻车的典型场景。

原因在于,大模型输出检测框时,本质上是一个坐标一个坐标地生成数字。目标越多,输出越长,漏检、重复、坐标偏移的概率也就越高。

甚至还有更高难度的测试:给一张靶纸,只要求它统计落在指定环数区域内的弹孔数量。

Sol直接答对了,它不仅知道该数什么,还能理解规则的边界到底在哪里。

不得不说,这部分能力的提升是非常扎实的。

全能?不存在的

最出人意料的一点也在这里:Sol的OCR识字能力,反而出现了退步。

在OCR整段转写任务中,Sol拿到90.7%,比GPT-5.5的91.2%低了0.5个百分点,差距并不算大。

不过,在“定向提取”这类任务上,问题就更明显了。它不是要求转写全文,而是只抽取某一条关键信息,比如从票据中提取日期。这个项目里,Sol只有82.5%,而GPT-5.5是87.6%,下降了5个百分点。

这并不意味着它不会认字。手写笔记它可以整段转写,也能准确找出日期;脏轮胎弧面上印着的尺寸编号,它同样能读出来。

此外,像冰球比赛直播画面中的实时比分,它也能按照指定格式准确输出。

真正翻车的,是药板上那一行有效期:字体小、竖排、低对比度,而且还有明显反光。

一个能读懂体育转播画面的模型,却未必能准确读出你手里那盒药的过期时间。

OpenAI承认了

图一大框就飘

在部分图片中,Sol返回的检测框会漂移到画面里毫不相关的位置。

这些框与真实物体几乎没有重叠,而且往往排列得异常整齐:要么是一条直线,要么是一组均匀分布的框。

Roboflow把这些案例反馈给了OpenAI,对方也给出明确回复:当图片尺寸达到约2000×2000像素或更大时,Sol会变得不稳定,而且推理档位越低,这种不稳定现象越明显。

目前解决方法有两个。第一种是提高推理档位,稳定性确实会更好,但Token消耗、响应延迟和整体成本也会同步上升。

第二种则是最朴素但也最有效的办法:在把图片发送给API之前,先进行缩小或裁剪处理。

再看整体成本,Roboflow实测给出的价格和速度如下:

Sol:约2.5美分/张,约10秒;Terra:约1美分/张,约6秒;Luna:不到0.5美分/张,约5秒

而Gemini 3.5 Flash每张约0.8美分,比Sol便宜约三分之二,在这套基准测试里的目标检测和物体计数表现也依然领先。

对于高频、大批量的检测和计数任务来说,Gemini Flash仍然是当前更突出的「性价比之王」。

所以,GPT-5.6 Sol这次真正让人惊讶的地方在于,它的视觉能力正在从「看懂一张图」,迈向「真正完成视觉任务」。

无论是目标检测、画框、物体计数、空间关系理解,还是文档版面分析,

这些过去更像是专用计算机视觉模型主场的能力,如今正在被通用大模型一步步蚕食。

视觉大模型的下半场竞争,已经从「能不能看懂」,转向了「干活准不准、成本划不划算」。

GPT-5.6已经秀出了肌肉,但围绕性能、价格与效率的战争,才刚刚开始。

参考资料:

https://blog.roboflow.com/openai-gpt-5-6/

https://x.com/josephofiowa/status/2089430540864909719?s=20

热点追踪提示词
你是一名 AI 行业编辑,请围绕下面这条热点输出一份资讯解读:
热点:GPT-5.6 Sol性能暴涨3倍成OpenAI最强视觉AI要求:
1. 先用一句话解释这条热点在讲什么
2. 再总结它为什么重要
3. 说明会影响哪些 AI 产品或内容方向
4. 最后给出 3 个适合资讯站使用的标题
来源:https://www.aitntnews.com/newDetail.html?newId=28362
OpenAI

游乐网为非赢利性网站,所展示的游戏/软件/文章内容均来自于互联网或第三方用户上传分享,版权归原作者所有,本站不承担相应法律责任。如您发现有涉嫌抄袭侵权的内容,请联系youleyoucom@outlook.com。

相关热点
AI热点2026-08-20 23:01
阿里巴巴推出AI音乐模型快乐虾米并在国内外同步上线

8月17日,阿里巴巴正式发布AI音乐生成模型Happy Shrimp 1 0,中文名称为“快乐虾米”。目前,这款AI音乐模型已同步登陆国内及海外PC网页端,新用户还能领取大额免费积分,体验AI作曲与歌曲生成能力。阿里巴巴据阿里巴巴介绍,Happy Shrimp能够精准理解自然语言输入,可将用户的一种

AI热点2026-08-20 23:00
英伟达为OpenAI俄亥俄州数据中心提供1050亿美元融资支持详情

8月18日消息,据CNBC报道,俄亥俄州一份证券备案文件于周一披露,英伟达将为OpenAI正在新建的人工智能数据中心提供最高达1050亿美元的融资支持。这笔信贷资金将支持首期4 25吉瓦的算力部署,并保留额外增加3 75吉瓦的选择权。相关计算能力将由英伟达提供,预计从2028年开始分阶段上线投入使用

AI热点2026-08-20 23:00
Anthropic年化营收突破650亿美元冲刺史上最大IPO前景受关注

如果只看一年前,很难想象 Anthropic 的收入曲线会陡成这样。就在今天早上,据彭博社报道,Anthropic 向投资者披露,截至今年 7 月底,公司年化营收运行率(ARR)已经达到了 650 亿美元。以 2025 年底超过 90 亿美元的年化水平计算,短短数月时间,这一数字已经增长至原来的 7

AI热点2026-08-20 23:00
国内期货主力合约多数下跌 低硫燃料油跌近3%

今日国内期货市场主力合约多数收跌,整体呈现跌多涨少格局。领跌品种为低硫燃料油(LU)和20号胶,跌幅均接近3%;橡胶、豆二跌幅超2%。合成橡胶、豆粕、菜粕等多个品种跌幅也超过1%。上涨方面,对二甲苯(PX)和苯乙烯(EB)逆势飘红,涨幅超1%。市场情绪偏向谨慎,板块间表现分化明显。

延伸阅读