AI 大模型看手相!图片视频加持深度思考,阿里 QVQ-Max“神了神了”

阿里又发了个有意思的大模型------

QVQ-Max,第一版视觉推理模型,对任意图像或视频都可以进行深度思考。

举个有趣的例子,上传一张你的手掌,再点击 Thinking ,QVQ-Max 就可以给你看手相

若是刨去视频里的背景音,单是看内容,还是比较抽象的。

对此,QVQ-Max 给出的理解是:

从观察到推理

除了效果之外,虽然 Qwen 团队没有公布相关论文,但对于背后的技术亮点,团队还是简单的介绍了一番。

首先,团队在 MathVision 这个 benchmark(汇集各类困难多模态数学)上进行了一番测试:

结果表明,通过调整模型 thinking 的最大长度,模型在 MathVision 上的准确率也会持续提升。

除此之外,团队还总结了 QVQ-Max 的三大能力特点。

包括对图片的解析能力非常强,无论是复杂的图表还是日常生活中随手拍的照片,它都能快速识别出关键元素。比如,它可以告诉你一张照片里有哪些物品、有什么文字标识,甚至还能指出一些你可能忽略的小细节。

仅仅识别出图片里的内容还不够,QVQ-Max 还能进一步分析这些信息,并结合背景知识得出结论。

例如,在一道几何题中,它可以根据题目附带的图形推导出答案;在一段视频里,它能根据画面内容推测出接下来可能发生的情节。

除了分析和推理,QVQ-Max 还能做一些有趣的事情,比如帮你设计插画、生成短视频脚本,甚至根据你的需求创作角色扮演的内容。

如果你上传一幅草稿,它可能会帮你完善成一幅完整的作品;上传一个日常照片,它可以化身犀利的评论家,占卜师。

值得注意的是,QVQ-Max 是免费可用的哦,感兴趣的朋友快去试试吧~

体验地址:
chat.qwen.ai

参考链接:

1\][qwenlm.github.io/zh/blog/qvq...](https://link.juejin.cn?target=https%3A%2F%2Fqwenlm.github.io%2Fzh%2Fblog%2Fqvq-max-preview%2F "https://qwenlm.github.io/zh/blog/qvq-max-preview/") \[2\][x.com/Alibaba_Qwe...](https://link.juejin.cn?target=https%3A%2F%2Fx.com%2FAlibaba_Qwen%2Fstatus%2F1905342260100956210 "https://x.com/Alibaba_Qwen/status/1905342260100956210") **欢迎在评论区留下你的想法!** --- **完** ---

相关推荐
董厂长3 小时前
langchain :记忆组件混淆概念澄清 & 创建Conversational ReAct后显示指定 记忆组件
人工智能·深度学习·langchain·llm
墨风如雪6 小时前
告别“面目全非”!腾讯混元3D变身“建模艺术家”,建模效率直接起飞!
aigc
G皮T6 小时前
【人工智能】ChatGPT、DeepSeek-R1、DeepSeek-V3 辨析
人工智能·chatgpt·llm·大语言模型·deepseek·deepseek-v3·deepseek-r1
九年义务漏网鲨鱼7 小时前
【大模型学习 | MINIGPT-4原理】
人工智能·深度学习·学习·语言模型·多模态
元宇宙时间7 小时前
Playfun即将开启大型Web3线上活动,打造沉浸式GameFi体验生态
人工智能·去中心化·区块链
开发者工具分享7 小时前
文本音频违规识别工具排行榜(12选)
人工智能·音视频
产品经理独孤虾7 小时前
人工智能大模型如何助力电商产品经理打造高效的商品工业属性画像
人工智能·机器学习·ai·大模型·产品经理·商品画像·商品工业属性
老任与码7 小时前
Spring AI Alibaba(1)——基本使用
java·人工智能·后端·springaialibaba
蹦蹦跳跳真可爱5898 小时前
Python----OpenCV(图像増强——高通滤波(索贝尔算子、沙尔算子、拉普拉斯算子),图像浮雕与特效处理)
人工智能·python·opencv·计算机视觉
雷羿 LexChien8 小时前
从 Prompt 管理到人格稳定:探索 Cursor AI 编辑器如何赋能 Prompt 工程与人格风格设计(上)
人工智能·python·llm·编辑器·prompt