AI 大模型看手相!图片视频加持深度思考,阿里 QVQ-Max“神了神了”

阿里又发了个有意思的大模型------

QVQ-Max,第一版视觉推理模型,对任意图像或视频都可以进行深度思考。

举个有趣的例子,上传一张你的手掌,再点击 Thinking ,QVQ-Max 就可以给你看手相

若是刨去视频里的背景音,单是看内容,还是比较抽象的。

对此,QVQ-Max 给出的理解是:

从观察到推理

除了效果之外,虽然 Qwen 团队没有公布相关论文,但对于背后的技术亮点,团队还是简单的介绍了一番。

首先,团队在 MathVision 这个 benchmark(汇集各类困难多模态数学)上进行了一番测试:

结果表明,通过调整模型 thinking 的最大长度,模型在 MathVision 上的准确率也会持续提升。

除此之外,团队还总结了 QVQ-Max 的三大能力特点。

包括对图片的解析能力非常强,无论是复杂的图表还是日常生活中随手拍的照片,它都能快速识别出关键元素。比如,它可以告诉你一张照片里有哪些物品、有什么文字标识,甚至还能指出一些你可能忽略的小细节。

仅仅识别出图片里的内容还不够,QVQ-Max 还能进一步分析这些信息,并结合背景知识得出结论。

例如,在一道几何题中,它可以根据题目附带的图形推导出答案;在一段视频里,它能根据画面内容推测出接下来可能发生的情节。

除了分析和推理,QVQ-Max 还能做一些有趣的事情,比如帮你设计插画、生成短视频脚本,甚至根据你的需求创作角色扮演的内容。

如果你上传一幅草稿,它可能会帮你完善成一幅完整的作品;上传一个日常照片,它可以化身犀利的评论家,占卜师。

值得注意的是,QVQ-Max 是免费可用的哦,感兴趣的朋友快去试试吧~

体验地址:
chat.qwen.ai

参考链接:

1qwenlm.github.io/zh/blog/qvq...

2x.com/Alibaba_Qwe...

欢迎在评论区留下你的想法!

--- ---

相关推荐
wujian83111 小时前
豆包导出word手机,就用AI导出鸭:一站式批量导出方案深度解析
人工智能·ai·chatgpt·智能手机·word·ai导出鸭
拿本唠嗑AI研究1 小时前
从电脑到手机:DeepSeek Harness Windows安装与手机互动教程(避坑完全版)
人工智能·windows·智能手机·deepseek·harness
ZJU_统一阿萨姆8 小时前
【算子开发】矩阵乘法(GEMM)入门与共享内存优化
人工智能·线性代数·矩阵·系统架构
AI码农小姐姐8 小时前
AI漫剧用什么软件制作?知漫剧对比即梦/豆包/可灵怎么选?
人工智能
YH55269849 小时前
GPT‑5.6 Sol 原本支持 1M 上下文,Codex 现已放开此前限制,如何看待这次调整?
java·jvm·人工智能·gpt·算法·chatgpt
ZYJCSZKJ9 小时前
AI数字人实时交互系统的工程架构与多方言适配实践
人工智能·架构·交互·ai数字人直播系统
2601_965958469 小时前
口腔黏膜脱皮超2周未愈建议及时就医
人工智能·python
智购科技智能售货柜9 小时前
2026自动售货机整机可靠性测试:从高低温交变到EMC电磁兼容的认证工程实践~YH
运维·服务器·数据库·人工智能·物联网
“初生”9 小时前
用 Codex 做一致性 AI 动画:5 步工作流,角色不再漂移
人工智能·ai·chatgpt
AI_小站9 小时前
刚面完百度的 Agent 开发岗,我才发现:世界就是个巨大的草台班子
java·开发语言·人工智能·spring·百度·langchain