第三方视觉评测机构 Roboflow 最近把 OpenAI 的 GPT-5.6 全家桶(Sol、Terra、Luna)拉进自己的视觉基准跑了一轮,结果里有个数字很扎眼:目标检测这一项,上一代 GPT-5.5 只拿到 13.8 分,GPT-5.6 Sol 直接冲到 46.2,涨了三倍多。Roboflow 项目负责人评价说,这是 OpenAI 有史以来最强的视觉模型。
这事的本质:大模型从"看懂图"往"干视觉活"跨了一步
目标检测过去是大模型的传统重灾区。原因不复杂:大模型画检测框,是一个坐标一个坐标把数字"打"出来的,图里东西越多,输出越长,漏框、重复框、坐标写飞的概率就越高。Roboflow 的测试里,Sol 不仅在检测上翻了近三倍,计数准确率也从 GPT-5.5 的 64.9% 提到 73%(据报道)。最实用的进步在文档版面识别:标题、正文、表格、插图、签名能被比较干净地圈出来。对做合同、发票、报表处理的人来说,版面切分正是这类流水线的第一步。
但"变强"不等于"全能"。同一个测试里,Sol 的 OCR 整段转写是 90.7%,比 GPT-5.5 的 91.2% 还略低;定向提取(比如只揪出发票上的日期)是 82.5%,反而掉了 5 个点。还有一个 OpenAI 自己都确认的坑:图片尺寸到 2000×2000 像素左右或更大时,检测框会飘到不相干的位置,推理档位调得越低越不稳。
对普通开发者意味着什么
如果平时做文档处理、票据识别、商品图分类这类活,过去的选择基本是两条:接专门的检测模型,或者自己训一个 YOLO。现在多了一条路:直接问大模型"框出来"。门槛确实降了,但账要算清楚。
先看 Roboflow 实测的成本和速度(据报道):Sol 大约 2.5 美分/张、10 秒左右;Terra 大约 1 美分/张、6 秒左右;Luna 不到 0.5 美分/张、5 秒左右。而 Gemini 3.5 Flash 每张 0.8 美分,检测和计数在这套基准上还继续领先。换句话说,GPT-5.6 的视觉进步是真的,但"性价比之王"另有其人。
实际使用有几个坑:
- 大图先处理:喂 API 之前把图缩小或者裁一刀,这是最简单也最有效的办法,能明显减少框飘。
-
- 推理档位和账单挂钩:调高档位更稳,但 token、延迟、费用一起涨,批量场景要权衡。
-
- 别拿"整段转写还行"推断"定向提取也行":这两个能力在这代模型上是分开的,先拿自己的样本测。
-
- 评测只是参考 :分数是 Roboflow 一家之言,选型时用自己的业务数据跑一遍,别只看榜单。
接 API 本身不复杂,官方 Responses 接口的 model 填gpt-5.6即可(传图需按官方文档在 input 里加图片输入):
- 评测只是参考 :分数是 Roboflow 一家之言,选型时用自己的业务数据跑一遍,别只看榜单。
bash
curl https://api.openai.com/v1/responses \
-H "Authorization: Bearer $OPENAI_API_KEY" \
-H "Content-Type: application/json" \
-d '{"model": "gpt-5.6", "input": "这是一段纯文本请求示例,传图请按官方文档的图片输入格式"}'
```
## 我的看法
视觉大模型的下半场,已经从"能不能看懂"卷到了"干活准不准"。对做业务系统的打工人来说,这是好事:手里又多了一个能调用的能力。但别被"史上最强视觉模型"这种说法带节奏------按任务选模型、按成本算账,比追着最新旗舰跑更实际。毕竟老板只看结果和账单,不看谁的模型牌子响。
你怎么看这波"大模型抢专用视觉模型的活"?评论区聊聊。