Flash模型又添一员大将:实测MiniMax M3.1

话说如今这大模型江湖,各路豪杰你方唱罢我登场,今日这家放出 Pro,明日那家端出 Flash,一波未平一波又起。

却说 MiniMax 这一回不等 Pro 出山,先遣一员 Flash 大将下山,唤作 M3.1-Flash-Preview。

正是:不等 Pro 来坐大寨,先遣 Flash 下山来。

这员大将刚在 MiniMax Code 上线,主打日常开发,1M 上下文,原生多模态。

推特上已经有人上手了,提得最多的是一个字:快。

还有人提到最近 OpenRouter 上很火的匿名模型 Space Bunny,猜就是 MiniMax 的。

另一条评论更有意思。有位用户拿 DeepSeek V4.1 Flash 调一个 bug,它找不到问题出在哪,换成 M3.1 Flash,第一次就修好了。

Flash 模型里,DeepSeek V4.1 Flash 这回碰上真正的对手了。

口碑归口碑,这员 Flash 大将到底有几分本事,且看下文实测分解。

MiniMax Code 下载

我这次全程用的是 MiniMax Code 桌面端,官网右上角就能下载。 官网地址:agent.minimax.cn/

装好登录,模型列表第一个就是 M3.1-Flash-Preview。

鼠标移上去还有一层二级菜单,上下文窗口可以在 512K 和 1M 之间切,推理等级除了 default,还有 low 到 max 五档。

下面几个任务我全程开的都是 max。

额度的消耗也提一句,M3.1 Flash 走的是 Token Plan 订阅里的额度。

看一张照片,搭一座能拆开看的应县木塔

先来看 3D 建模,我挑的是应县木塔。

应县木塔是世界上现存最高最古老的木塔。它是八角形的,外面看五层六檐,里面还夹着四个暗层,每层檐下都是密密麻麻的斗拱。

它难在是一层一层套起来的,檐、平座、栏杆、斗拱全叠在一起。我还要它能一层层剖开,看里面的结构。

那我肯定不可能把每个结构细节给它看啊,那得累死我,考验M3.1-Flash的时候到了,给了它一张照片去复刻,材质纹理也全部要用代码生成。

估计有同学会问,光看一张照片,真能把这么复杂的结构搭出来吗?

我们先来看看它的执行过程。

M3.1-Flash-Preview上来没急着敲代码,先看照片、拆木塔的结构。你别看就一张图,屋檐、斗拱、楼身一层咬一层,尺寸稍微没算对,后面就得推倒重来。

最后交卷的时候,M3.1-Flash-Preview自己列了一张改过的问题清单,一共 7 条,这一点很不错。

那做出来到底像不像?我们来看看成品,在 MiniMax Code 的内置浏览器里就能直接打开。

跟照片放在一起比,五层六檐、塔刹拉索、方形台基都对得上。就是整体色调比照片暗了不少。

交互也都能用。拖动就能转。点第 3 层,上面几层自动藏起来,镜头推进去,能看到里面的柱网和中间的佛像。

赶紧去拜一下:「阿弥陀佛,佛祖保佑用小林简历和看小林面试题的都能上岸大厂」。

当然,细看也不是没毛病:斗拱有点挤,面板写的通高 50.2 米也不对,真实木塔有 65 米多。这些细节还得再校。不过只给一张照片,它把五层六檐和逐层剖开的交互都做出来了,我觉得已经挺能打。

给一家中餐馆做一个国庆宴席网站

我看有人做的案例是一个餐厅网站,是一家上海本帮菜馆。

我就照着它做了一个国庆宴席站:餐馆「山河宴」。

要求是新中式加节日感,首页要有立体书法和烟花。另外再配一个菜单页和一个订座页。

它的执行过程是这个样子的。

它是按首页、菜单、订座的顺序往下做的,每做完一块都会自己打开页面检查。

有意思的是这一段,它自己截图看烟花效果。金色的环很好看,牡丹形的太稀太暗,它又回去把粒子加亮加密,觉得好看了才往下走,感觉它对这个设计和细节的认真度是有点东西的呀。

搞定后我们先来看看首页,在 MiniMax Code 的内置浏览器里打开就是这个样子。

立体书法是金属质感的,还带着厚度,会慢慢左右摆动。说实话,这个配色我很喜欢。深蓝底配鎏金,节日感有了,又没有做成大红大金的海报,而且还有烟花点缀,氛围感拉满了。

宴席菜单这一页,四档套餐,每档都有冷菜、热菜、汤、点心和甜品,菜单设计的还是很有高端的味道,完全没有 AI 味道。

心动了,也可以直接预约订座。

最后出来的结果你们觉得怎么样?我觉得网页设计还是有隆重大气的感的,像是一家百年饭店的感觉。

给具身机器人的视频做标注

这个月 GPT-6 Astra 发布之后,有人拿它直接去操控机械臂。具身圈子里争论了好几天,通用大模型会不会对具身来一次降维打击。

这个问题业内自己都还没有结论,但有一件事是具身公司每天都在做的:给机器人的操作视频做标注。一段视频切成哪几个动作,每一步做成了没有,下一步该干什么,现在很多还是靠人一帧帧去看。

我从开源数据集里找了一段 30 秒的 ALOHA 双臂机器人视频。任务是打开上面的柜子,把锅放进去,再关上柜门,我直接丢给了 M3.1 Flash。

我们来看看它是怎么一步步做的。

它第一步就发现了一个问题:附件只带上了视频开头的 2.3 秒,然后自己去找抽帧工具。

第一个办法编译不过,它就换了一门语言重写,最后还是把 30 秒全片按帧抽了出来。

有意思的是,它在回复里提到柜门大概 6 秒才打开。可我自己一秒一帧看的时候,压根没在画面里找到柜门。

回头把原图顶部放大一看,上柜就藏在画面最上沿那一条里,开门、放锅、关门全在,牛逼,它看得比我还仔细。

我一秒一帧盯了半天,最后发现该去配眼镜的是我。

最后交出来的是一个标注页,每段动作都有起止时间和关键帧。

那它会不会顺着任务说明,直接判成全部完成了事,当年南郭先生靠着人多悄悄混进去摸鱼,主人家听不过来看不出,你M3.1-Flash不会也趁着我看不清每个帧数,给我下套吧?

当然我们M3.1-flash行得正走得正,看不见的地方它会老实写看不见。开门时夹爪到底有没有碰到门、松爪那一下,都单独标成了不可见。

下一步建议也给得很清楚。它特意提醒,机器人别为了确认锅在不在里面又去开一次门,那样会把已经完成的步骤退回去。

标注页也能点,我在浏览器里试了一遍,点哪段视频就跳到哪段,没问题,人证物证俱在哈,看谁敢说我M3.1-Flash吹牛逼

顺着具身往下挖,拆一条人形机器人产业链

聊完具身,我就好奇现在做机器人的这条产业链现在到底长什么样?

所以, 我就让 M3.1-flash 做一个人形机器人的研报分析,正好考察一下办公能力靠不靠谱。

它先把上游零部件、中游整机、下游应用拆成几条线,每次好几个搜索一起发,一条一条往下挖。

中途它还专门去找了宇树的招股书、优必选的中报这类一手信源。

交卷的时候,它先列出来几条结论,我觉得比图本身还有价值。

同一台机器人,传感器的成本占比在不同来源里从 12% 到 30% 都有,它干脆把三套说法并排列出来,这就非常客观以及「数据驱动」。

交出来的是一张 18 个环节的产业链全景图,每个关键数都挂着信源等级。

点开任意一个环节,右边会弹出明细,每条数据都标着 P1、P2、P3,底下就是出处链接。

可能你们会吐槽,这么多数,会不会有它编的?

它要是随手编一个数出来,你还真不一定看得出来。所以我挑了 7 个最关键的数回去查,优必选上半年营收 12.69 亿、宇树 219 倍的发行市盈率、GGII 预测的 6.25 万台。7 个都找得到出处,没发现编的。

另外,它在页脚自己写了,这些数来自检索结果里的引用,没有逐条打开原文二次核验,还提醒这个领域很多数字是同一批研报互相引用出来的,表面上十几个来源,实际可能只有两三个独立测算。

当然了,这些肯定还是要仅供参考,如果你说真要拿去做研究,关键数字还是得自己追到原始文件的啦,真正涉及到公司的决策方面,别来压力我们小M3.1-Flash哈。 图片

写在最后

体验过后,你会发现这个M3.1-Flash真的模型如其名,非常弗拉许(快),一秒能到83-128token,而且任务时间越长,疑似会有更快的倾向

我的实测感受是,M3.1 Flash 是真的变聪明了,Flash 模型里这回是又添了一员大将。

模型厂商们这么神仙打架,说到底,受益的还是我们这些天天用的人。

我这边也会接着拿真实任务去测,有新发现再跟大家聊,一起加油吧!

相关推荐
颜进强2 小时前
25 · NestJs DurableProviders 持久化 Provider:把 ContextId 当缓存键
前端·后端·ai编程
tltwuyulw2 小时前
Java的函数式编程(四)
后端
我的xiaodoujiao2 小时前
Django 基础知识详细图文教程 14-Django 表单定义与使用
开发语言·后端·python·django
颜进强2 小时前
24 · NestJs LazyLoadingModules 懒加载模块:你在前端天天 `import()` 懒路由,但 Nest 偏偏不能懒加载路由
前端·后端·ai编程
Mav2 小时前
[个人学习记录]从零构建高性能 LLM 推理网关:为什么普通轮询会击穿显存?Nginx 平滑加权轮询(SWRR)在 Go 中的 57ns 零分配实战
后端
大哥43092 小时前
改了 ≠ 生效了:为什么"改完了"不是完成判据
后端
imDwAaY2 小时前
Spring中过滤器和拦截器的区别是什么?
spring boot·后端·spring
M1A12 小时前
VS Code 拉取 Gitee 代码全攻略:从零到一,新手也能轻松搞定!
后端