小米版 Codex,干活有点猛啊

这是苍何的第 594 篇原创!

大家好,我是苍何。

看到小米 MiMo 桌面版发布了,并正式开启了邀测。

我托了一些关系,要到了邀测名额,然后在上海出差期间嘎嘎猛测。

毕竟这个邀测期间,还能免费体验两款 Xiaomi MiMo 新⼀代模型(代号 MiMo-X-Flash/Pro-Preview),算是一手内测了。

我还给粉丝要来了 10 个邀测名额,感兴趣的可以留言。

小米 MiMo Desktop 是 Xiaomi MiMo ⾸个⾯向个⼈⽤⼾真实⼯作场景的桌⾯ AI 应⽤,可以理解为是小米版 Codex。

但 MiMo Desktop 主要解决的是长程复杂任务,去交付高质量可用的结果

最近 GPT-6 Astra 出来后,我看到不少人用它连接 Blender,做出来很多有意思的产品。

我也跟着试了试,刚跑一会儿,额度就快见底了,难受。

于是我换到了 Xiaomi MiMo Desktop,顺带也测测。

它是一款面向真实工作场景的桌面 AI 应用。你把图片、视频或者 PDF 丢给它,再说清楚要做什么,它会自己拆任务、调用工具,最后交付可以继续修改的成品。

先给大家看下效果叭。

我敲真实键盘,网页里的按键也会跟着按下、发声,还能拆开再复原。

我以前也玩 Blender,说实话Blender对于一个小白来说想搓出一个像样的作品,难度挺大的。

但是这次我只给了参考图和要求,全程没碰 Blender。

最后做出来的键盘有 90 多个零件,效果还真不错。

那到这里就有小伙伴问了,完全不会建模怎么做。

别急,往下看👇

这套键盘,我用的是 MiMo Desktop 里的 3D 创作 Skill。

我把机械键盘的三视图丢进去,让它调用 Blender,做一套未来感的 3D 键盘。

同时设计两个动画,拆解 W 键,再把整套键盘分层炸开。

等了一会儿,它给我发了一些效果图,这效果图已经很不错了。

但是我感觉看图片看不太仔细,就让它在 Blender 里面帮我打开。

模型确认没问题后,我又想把它放进网页里玩。

于是我让它先导出 glb,再做成一个可交互的 3D 网页。

导出模型、写网页、加交互,这几步串起来挺长,我直接开了 Goal 模式。

我只说最后要做成什么样,它会自己拆步骤往下做,中间卡住了,也会继续调整。

跑的过程中,右侧能看到任务进度和生成的文件,网页也可以随时点开预览。

这样我不用干等着,方向跑偏了也能及时发现。

任务结束后,它给了我访问链接,还列出了做好的功能和修过的问题。

说实话,感觉挺爽的。我以前连 Blender 的基本操作都没整明白,这次只给一张参考图,居然把建模、动画和网页全跑通了。

这类任务考验的是 AI 的长链路执行能力。 从理解参考图,到调用 Blender 建模、制作动画,再到导出模型、编写网页,每一步的结果都要能被下一步接着使用。

整个过程中,还要持续跟进任务进度,结合已有产物处理后续要求。

我看小米的介绍说,MiMo Desktop 基于 MiMo Code 框架,让新一代 MiMo 模型与 Harness(任务执行框架)协同优化,重点强化工具调用、上下文管理和任务编排。

这次从参考图一路做到可交互网页,就比较直观地体现了这种协同带来的任务完成度。

流程跑通后,顺手让它做成了一个 Skill。

下次换个物品,只要给它参考图,就能照着这套流程继续建模、做爆炸动画。

比如我让它做一个望远镜的建模爆炸效果。

这次直接复用刚才的 Skill,从建模到渲染视频,只用了 5 分钟。

第一次做键盘花了 40 分钟,第二次快了好几倍,不仅省时间还省token哈哈哈。

效果还挺像那么回事,零件拆分和爆炸动画都做出来了。

3D建模跑通后,我又换了种玩法。

这次我只丢了几张黄鹤楼和武汉夜景的照片,让它照着照片里的城市氛围,做一个旅行规划页面。

最后做出来还挺有感觉,点开每个地标,都能看到对应的介绍。

旅行页面里的交互比较简单,我决定再上点难度。

我一直蛮喜欢 GSAP 官网的设计和动效,想让它照着做一个。

但这种效果光靠文字很难说清楚,我干脆截了张图,又录了一段操作视频。

图片看样式,录屏看动效,我直接把两份素材一起丢给它。

最后做出来的页面,第一眼还真有 GSAP 官网那个味道。

配色和主要动效都还原了出来,它还顺手加了一些自己的想法。

只靠一张截图和一段录屏,能做到这个程度,已经超出预期了。

这里可以体现出 MiMo Desktop 多模态素材的互补作用。 截图提供布局、配色和视觉层级,录屏补充滚动、点击时的动态变化。

模型需要结合两种素材理解设计要求,再把这些要求转化为页面结构和交互逻辑。这也让一些很难用文字描述的效果,有了更明确的参考。

刚好最近 AI 硬件挺火,我让 MiMo Desktop 整理一份《2026 年 AI 硬件产业全景》研究报告。

它先拆分研究范围,再逐个查资料、整理数据。最后把所有内容做成了一份网页报告。

我看完以后,这几年 AI 硬件有哪些变化,基本就能快速摸清楚了。

网页报告看着有点长了。我就想把内容压一压,再配些图片,做成一份 PPT。

这次我开了一个会话,只说了一句:把刚才的报告做成 PPT。

结果它自己找到了上个会话里的研究报告,直接接着搜图、排版。

跨会话的成果复用还是非常有用的:前一个会话完成的研究报告,可以成为新会话制作 PPT 的基础,减少重新交代背景和搬运资料的步骤,让调研与内容制作衔接起来。

对我来说,就是换个窗口还能接着干。

等了一会儿,PPT 就出来了。

整体挺不错,但我感觉字有点太多,于是又让它改。

我懒得自己选模型,直接打开 Smart 模式,只丢了一句:

「文字太多了,多用图表和图片展示。」

按产品介绍,Smart 会综合评估任务类型、复杂程度、交付要求和执行成本,再匹配合适的模型、Agent 和 Skill,把质量、速度和成本一起纳入调度。

像这次调整 PPT,我只需要说明想怎么改,具体的执行路径交给它来安排。

模型和 Skill 都不用研究,直接说哪里不满意就行。

整体改完后,我又继续抠了下细节。

比如这页有组数字看着太干,直接框选它,让 AI 换成图表。

等了一会儿,它就把图表改好了。

前后一对比,重点信息更集中,也更适合演示。

不过,AI 改 PPT 也有翻车的时候。

有一版改完还不如之前,好在每次修改都会留下版本记录。

我直接点了版本回滚,马上退回修改前。

这样就不用担心 AI 瞎改,最后连原版都找不到了。

对于需要反复修改的工作,编辑粒度和版本管理会直接影响成品的可用性。 框选让修改要求能落到具体元素上,版本记录则让修改过程可以回溯。

两者结合,我就能逐步调整内容、检查效果,再决定保留哪一版,形成一个可控的修订过程。

我平时写东西会放点专注音乐,就顺手用 Smart 模式生成了一段自习室音乐。

第一版听着有点闷,我让它调得更清脆一些,很快就改好了。

大家可以听一下效果。

写到这里,我最大的感受就是终于不用自己收拾 AI 留下的残局了。

从建模到 PPT,成品都能直接打开,哪里不满意,可以接着改,改坏了还能回滚。

成本控制上,MiMo Desktop 主要做了三件事:Smart 根据任务需求匹配模型和执行路径;局部编辑缩小需要重新生成的范围;上下文缓存减少重复内容的计算。

三种机制分别作用于模型选择、修改范围和上下文复用。对于需要多轮沟通、反复修改的任务,有助于减少重复消耗。

按 MiMo Desktop 官方的测试数据来说,同会话缓存命中率最高可达 99%,跨会话最高可达 95%。

这个在使用体感上还是挺显著的。

AI 工具值不值钱,不看它能聊什么,看它能交什么活。

目前 MiMo Desktop 还是邀测预览版,所以我也更期待正式版了。

如果你也想上手,评论区有 10 个绿色通道名额,想玩玩的小伙伴可以留言。

通过后,可以限时免费体验 MiMo-X-Pro-Preview 和 MiMo-X-Flash-Preview。

相关推荐
苍何2 小时前
直播!用 AI 实时生成游戏,速来看
后端
苍何2 小时前
免费版 Typeless来了,不限额度,夯!
后端
Charlie_Byte3 小时前
Integer 缓存机制(JDK 17 源码)
后端
梨涡泥窝3 小时前
JavaWeb——基于 Spring Boot + Vue 的图书管理系统的设计与实现
vue.js·spring boot·后端
jsl_jsl_jsl4 小时前
LLM工具调用速记
后端
YIAN4 小时前
手撸社区后端:一套可落地的用户 - 文章 - 互动体系 MySQL 表设计与优化思路
后端·mysql
ThinkerQAQ_4 小时前
并发编程(一):先谈硬件——从 count++ 到原子性、可见性与有序性
后端
岁月如歌77864 小时前
分布式锁完全指南:从数据库到 Redisson 的演进
java·后端·架构
技术猫4 小时前
记一次因线程池不合理使用导致生产拨测告警
后端