完整测评报告视频:
一、推理&编程能力测评报告
Q1|强约束指令遵循句子生成测试 ------ 9/10
任务:输出10个以汉字数字结尾的句子,且按照顺序一到十,语句要通顺有意义,且倒数第二个字不能重复且不能是"第","是","为"
实测结果:从1到10结尾通顺,无明显问题。

Q2|24点问题 ------ 10/10
任务:请用 3、4、9、10 这四个数字,每个数字只能且必须使用一次。你可以使用任何初等数学运算符(包括乘方/根号),拼出 24 点。
实测结果:答案正确,10+9+3+√4=24。

Q3|密码锁推理题 ------ 10/10
任务:五位数密码锁推理:78635 含 3 个正确数字且位置全错;16384、56483 各 1 个数字位置正确、1 个数字位置错误;92741 有 2 个数字位置正确、1 个数字位置错误;67153 有 2 个数字位置正确、2 个数字位置错误,据此推理密码。
实测结果:答案正确,密码:12753,推理过程无误。

Q4|浏览器内操作系统(AISniper OS)------ 6/10
任务:参考macOS,制作浏览器操作系统桌面UI,包含状态栏弹窗、时钟、底部快捷栏、主题切换,内置可交互3D太空射击游戏。
存在问题:
- 弹窗内容超出右边界
- 终端输入框在右侧,缺少输入位置标识
- 飞机子弹从机身腹部发射,而非机头前方
多处UI细节bug,扣分较多。

Q5|3D 赛车游戏 ------ 8/10
任务:Three.js赛博朋克无限赛道游戏,摄像机跟随赛道平滑晃动、汽车避障物理反馈、实时计分板。
优点:UI观感不错,整体功能完整度高。
不足:碰撞障碍物一次直接结束游戏,缺少血量机制,对比其他模型容错偏低。

Q6|Trello 看板 ------ 7/10
任务:原生单文件实现拖拽看板,卡片跨列拖动、列表换位、拖拽平滑让位动画、边缘自动滚动、卡片弹窗与子任务标签编辑。
优点:绝大多数拖拽、增删改功能正常。
不足:弹窗内两个功能按钮文字未居中靠左,属于细节UI瑕疵。

推理编程测评总结
推理能力稳定在线,数学类题目(24点、密码锁)全部拿满分数;编程生成项目可以跑通,但UI小问题偏多。
浏览器OS弹窗超界、终端输入位置不对;赛车UI不错但撞车一次就挂设计不合理;Trello按钮文字未居中。
综合表现不及 Qwen 3.8 Max Preview(54分),但整体仍然属于可用水平。
二、多模态能力测评报告
背景:125B参数规模可以拿到这样的表现实属难能可贵,下面使用另一套祖传测试用例测试图片、视频理解能力。
Q1|电影剧照识别(老无所依)
任务:上传《老无所依》截屏,识别影片名称,开启推理+联网搜索
实测结果:模型将《老无所依》列入候选,但判定概率较低;最终识别错误,判定为《星际穿越》。

Q2|经典画面二次识别(老无所依)
任务:上传《老无所依》经典镜头,识别影片名称
实测结果:成功识别出影片为《老无所依》,回答正确。

Q3|空间方位判断
任务:判断图片当中电话亭是否在黄色车辆的右边
实测结果:模型正确判断电话亭在黄色车辆的右边,方位识别无误。

Q4|细微图形差异查找
任务:找出一组形状当中角度倾斜不一样的图形,肉眼分辨难度较高
实测结果:精准定位第一行第四列菱形,识别出图形倾斜,答案正确。

Q5|物种计数区分(鸳鸯+野鸭)
任务:统计图片内雄性鸳鸯、雌性鸳鸯数量,最左侧个体为野鸭,不计入雌鸳鸯
实测结果:雄性鸳鸯数量识别正确;雌性统计出错,误将野鸭计入,得出雌鸳鸯5只的结论。

Q6|视频时序理解(行车片段)
任务:上传清晰度一般的行车视频,识别车辆开始并线、右转的时间节点
- 模型回答:5‑6秒开始并线,13‑14秒开始右转
- 真实时间:5‑6秒并线正确;右转实际8‑9秒启动,模型时间偏差较大

多模态测评总结
综合整套多模态测试下来,千问3.8‑Flash整体表现不错。以它这个参数体量,能达到当前识图水准已经算得上可用;短板集中在复杂计数区分、长视频时间轴识别,视频时序判断误差较为明显。
对于Qwen 3.8‑Flash这套实测结果,你有什么看法?欢迎评论区讨论。
