Qwen 3.8‑Flash完整实测!从推理编程到多模态!真的能打吗?

完整测评报告视频:

一、推理&编程能力测评报告

Q1|强约束指令遵循句子生成测试 ------ 9/10

任务:输出10个以汉字数字结尾的句子,且按照顺序一到十,语句要通顺有意义,且倒数第二个字不能重复且不能是"第","是","为"

实测结果:从1到10结尾通顺,无明显问题。

Q2|24点问题 ------ 10/10

任务:请用 3、4、9、10 这四个数字,每个数字只能且必须使用一次。你可以使用任何初等数学运算符(包括乘方/根号),拼出 24 点。

实测结果:答案正确,10+9+3+√4=24

Q3|密码锁推理题 ------ 10/10

任务:五位数密码锁推理:78635 含 3 个正确数字且位置全错;16384、56483 各 1 个数字位置正确、1 个数字位置错误;92741 有 2 个数字位置正确、1 个数字位置错误;67153 有 2 个数字位置正确、2 个数字位置错误,据此推理密码。

实测结果:答案正确,密码:12753,推理过程无误。

Q4|浏览器内操作系统(AISniper OS)------ 6/10

任务:参考macOS,制作浏览器操作系统桌面UI,包含状态栏弹窗、时钟、底部快捷栏、主题切换,内置可交互3D太空射击游戏。

存在问题:

  • 弹窗内容超出右边界
  • 终端输入框在右侧,缺少输入位置标识
  • 飞机子弹从机身腹部发射,而非机头前方

多处UI细节bug,扣分较多。

Q5|3D 赛车游戏 ------ 8/10

任务:Three.js赛博朋克无限赛道游戏,摄像机跟随赛道平滑晃动、汽车避障物理反馈、实时计分板。

优点:UI观感不错,整体功能完整度高。

不足:碰撞障碍物一次直接结束游戏,缺少血量机制,对比其他模型容错偏低。

Q6|Trello 看板 ------ 7/10

任务:原生单文件实现拖拽看板,卡片跨列拖动、列表换位、拖拽平滑让位动画、边缘自动滚动、卡片弹窗与子任务标签编辑。

优点:绝大多数拖拽、增删改功能正常。

不足:弹窗内两个功能按钮文字未居中靠左,属于细节UI瑕疵。

推理编程测评总结

推理能力稳定在线,数学类题目(24点、密码锁)全部拿满分数;编程生成项目可以跑通,但UI小问题偏多。

浏览器OS弹窗超界、终端输入位置不对;赛车UI不错但撞车一次就挂设计不合理;Trello按钮文字未居中。

综合表现不及 Qwen 3.8 Max Preview(54分),但整体仍然属于可用水平。

二、多模态能力测评报告

背景:125B参数规模可以拿到这样的表现实属难能可贵,下面使用另一套祖传测试用例测试图片、视频理解能力。

Q1|电影剧照识别(老无所依)

任务:上传《老无所依》截屏,识别影片名称,开启推理+联网搜索

实测结果:模型将《老无所依》列入候选,但判定概率较低;最终识别错误,判定为《星际穿越》。

Q2|经典画面二次识别(老无所依)

任务:上传《老无所依》经典镜头,识别影片名称

实测结果:成功识别出影片为《老无所依》,回答正确。

Q3|空间方位判断

任务:判断图片当中电话亭是否在黄色车辆的右边

实测结果:模型正确判断电话亭在黄色车辆的右边,方位识别无误。

Q4|细微图形差异查找

任务:找出一组形状当中角度倾斜不一样的图形,肉眼分辨难度较高

实测结果:精准定位第一行第四列菱形,识别出图形倾斜,答案正确。

Q5|物种计数区分(鸳鸯+野鸭)

任务:统计图片内雄性鸳鸯、雌性鸳鸯数量,最左侧个体为野鸭,不计入雌鸳鸯

实测结果:雄性鸳鸯数量识别正确;雌性统计出错,误将野鸭计入,得出雌鸳鸯5只的结论。

Q6|视频时序理解(行车片段)

任务:上传清晰度一般的行车视频,识别车辆开始并线、右转的时间节点

  • 模型回答:5‑6秒开始并线,13‑14秒开始右转
  • 真实时间:5‑6秒并线正确;右转实际8‑9秒启动,模型时间偏差较大

多模态测评总结

综合整套多模态测试下来,千问3.8‑Flash整体表现不错。以它这个参数体量,能达到当前识图水准已经算得上可用;短板集中在复杂计数区分、长视频时间轴识别,视频时序判断误差较为明显。

对于Qwen 3.8‑Flash这套实测结果,你有什么看法?欢迎评论区讨论。

相关推荐
龍德明宇3 小时前
四个时代之问的存在论根基-龍德明宇
大语言模型·ai哲学·负主体性
今天吃饺子2 天前
超高创新模型!TF-SAX-Llama 轴承故障诊断
大语言模型·llama·故障诊断
prog_61032 天前
【笔记】用cursor手搓cursor(九)
人工智能·笔记·大语言模型·agent
Geek-Chow3 天前
02 多模态 LLM 是什么:定义、边界与生态位置
人工智能·大语言模型·多模态
Geek-Chow5 天前
12 开源 vs 闭源:同一份权重,两种交付
人工智能·llm·大语言模型
小白跃升坊6 天前
DeepSeek 多模态 API 调用完全指南:从调用到效果,一篇讲透
ai·大语言模型
白拾8 天前
【NeurIPS 2025】PKD:偏好驱动的知识蒸馏,少样本节点分类|从少样本图学习视角
大语言模型·图神经网络·知识蒸馏·少样本学习·neurips 2025·pkd 论文分享
猫先生Mr.Mao8 天前
具身智能语言规划之SayCan详解:让大模型“会说”,也让机器人“能做”
机器人·大语言模型·论文解读·具身智能·saycan
DogDaoDao9 天前
GR00T N1 论文深度拆解:英伟达给机器人装上了“快与慢“双系统大脑
机器人·大语言模型·nvidia·机器人模型·智能机器人·图像生成模型·gr00t