用自然语言控制手机,一条命令让 AI 帮你操作 Android 和 iOS 设备!

你有没有想过------对着手机说一句话,它就自己操作了?

"打开设置,把深色模式关掉。"

"打开微信,给张三发一条消息说周五会议改到下午三点。"

"打开美团,帮我找附近评分最高的火锅店。"

然后手机真的自己动了。自己点、自己滑、自己输入。

这不是科幻。这是 mobilerun 正在做的事情。

它是什么?

一句话介绍:它是一款用自然语言控制 Android 和 iOS 设备的开源 Agent 框架。

MIT 开源,Python 写的,目前在 GitHub 上接近 9000 star,900+ fork。

你只需要几步:

bash 复制代码
uv tool install mobilerun  # 安装Mobilerun
# 或
uv pip install mobilerun  

mobilerun setup      # 安装 Portal 到手机
mobilerun configure  # 配置你的 LLM
mobilerun run "打开设置,关闭深色模式"  # 执行

然后你的手机就开始自己操作了。

不需要写一行脚本,不需要 XPath,不需要定位元素。

你只需要说人话。

为什么它能冲到 9000 star?

我分析下来,三个原因。

第一,它是 Agent,不是工具。

这是我跟同类项目最大的区别判断。

之前我介绍过 Callstack 的 agent-device------它的定位是"给 Codex / Claude Code 当手脚",你得有一个 AI Agent 来驱动它。

mobilerun 不一样。它自己就是 Agent。

你不用装 Codex,不用开 Claude Code。给它一个 prompt,它自己看屏幕、理解界面、规划步骤、执行操作。

换句话说------agent-device 需要你来当大脑,mobilerun 自带大脑。

门槛直接砍掉一半。

第二,LLM agnostic------什么模型都能接。

OpenAI、Anthropic、Gemini、DeepSeek、Ollama、OpenRouter------主流模型全支持。

这意味着什么?

你可以用 DeepSeek 白嫖,也可以用 Ollama 跑本地模型保护隐私。

不想折腾 API 的,DeepSeek 充几块钱就能跑。国内用户非常友好。

第三,Portal 机制------这才是真正的巧妙设计。

传统手机自动化依赖 USB 调试 + ADB 命令,你得插着线,开着调试模式。

mobilerun 不一样。它在你手机上装一个 Portal App,通过无障碍服务来控制。

这意味着什么?

手机不需要插线,不需要在你手边------只要 Portal 在跑,就能远程控制。

这就直接打开了 Cloud 模式的想象力。

两个最值得关注的功能

第一个,reasoning 模式。

简单的任务,mobilerun 直接执行。

但复杂任务呢?比如"帮我订下周去上海的机票"------搜索、比价、填信息、支付,十几步操作。

mobilerun 有个 --reasoning 模式,启动后用"管理者-执行者"架构:管理者负责规划,执行者逐步完成,管理者实时纠偏。

bash 复制代码
mobilerun run "帮我找联系人张三,给他发邮件" --reasoning

这才是解决复杂多步任务的设计。

第二个,vision 模式。

有些 App 没做无障碍适配,界面元素全是"button"、"view",Agent 根本分不清谁是谁。

mobilerun 的 --vision 模式会把截图直接发给 LLM,让它像人一样"看"屏幕。

还有 --vision-only 模式------完全不依赖无障碍树,纯靠视觉理解。

对那些没做 accessibility 的 App 来说,这是救命稻草。

但别急着吹,三个现实问题

第一,效果取决于模型。

LLM agnostic 的另一面是------模型选不好,体验就是灾难。

同样一句"帮我订机票",顶尖模型和免费模型的执行效果可能天差地别。

第二,稳定性还得打磨。

自然语言操控手机,本质上是概率性的。同一个任务,跑十次可能八次成功两次失败。

对于个人效率、探索性场景------没问题。对于生产环境的关键路径------你还不敢完全信任它。

第三,安全风险。

让 AI 直接操作你的手机------读你的消息、翻你的相册、操作你的支付------这件事本身就有风险。

Portal 的权限怎么管控?Agent 的操作边界在哪?这些目前还没有标准答案。

我的观点

mobilerun 它代表了一个方向------手机的交互方式正在被重新定义。

过去 15 年,我们操作手机的方式没变过:用手指点屏幕。

mobilerun 让我看到另一种可能:你说话,手机自己动。

但现在还处在早期。稳定性、安全性、准确性都有提升空间。但趋势已经出来了。

从"人适应机器"到"机器适应人"------这个方向不会变。

如果你对 AI + 移动端感兴趣,强烈建议去 GitHub 跑一遍 Demo。

不用写代码,三行命令,你的手机就开始自己动了。

那种感觉,真的很赛博朋克。

GitHub 项目地址:github.com/droidrun/mobilerun


以上,既然看到这里了,如果觉得不错,随手点个赞、在看、转发 三连吧,如果想第一时间收到推送,也可以给我个星标⭐~ 谢谢你看我的文章,我们,下次再见。

相关推荐
Csvn3 小时前
# 🎨 CSS Container Queries 实战踩坑——从「响应式」到「容器式」
前端
zhangjw343 小时前
第36篇:Spring Boot进阶:Web开发+参数校验+全局异常处理
前端·spring boot·后端
老王以为3 小时前
解剖 Claude Code:逆向工程视角下的入口架构分析
前端·ai编程·claude
ClouGence3 小时前
数据库为什么需要 SSL?一文了解 SSL 连接原理与配置
数据库·开源
Csvn3 小时前
💰 JavaScript 浮点数精度问题深度剖析——前端金额计算的「定时炸弹」
前端
GitCode官方3 小时前
开源鸿蒙跨平台直播| 快手KRN鸿蒙适配与性能优化
华为·开源·harmonyos·atomgit
Csvn3 小时前
structuredClone:原生深拷贝 API 的正确打开方式
前端
大猫会长3 小时前
获取favicon.ico的方法
前端·javascript·html
无人生还3 小时前
从 Vue3 到 React · 快速上手系列第 5 篇:事件处理与表单(受控组件 vs v-model)
前端·vue.js·react.js