用自然语言控制手机,一条命令让 AI 帮你操作 Android 和 iOS 设备!

你有没有想过------对着手机说一句话,它就自己操作了?

"打开设置,把深色模式关掉。"

"打开微信,给张三发一条消息说周五会议改到下午三点。"

"打开美团,帮我找附近评分最高的火锅店。"

然后手机真的自己动了。自己点、自己滑、自己输入。

这不是科幻。这是 mobilerun 正在做的事情。

它是什么?

一句话介绍:它是一款用自然语言控制 Android 和 iOS 设备的开源 Agent 框架。

MIT 开源,Python 写的,目前在 GitHub 上接近 9000 star,900+ fork。

你只需要几步:

bash 复制代码
uv tool install mobilerun  # 安装Mobilerun
# 或
uv pip install mobilerun  

mobilerun setup      # 安装 Portal 到手机
mobilerun configure  # 配置你的 LLM
mobilerun run "打开设置,关闭深色模式"  # 执行

然后你的手机就开始自己操作了。

不需要写一行脚本,不需要 XPath,不需要定位元素。

你只需要说人话。

为什么它能冲到 9000 star?

我分析下来,三个原因。

第一,它是 Agent,不是工具。

这是我跟同类项目最大的区别判断。

之前我介绍过 Callstack 的 agent-device------它的定位是"给 Codex / Claude Code 当手脚",你得有一个 AI Agent 来驱动它。

mobilerun 不一样。它自己就是 Agent。

你不用装 Codex,不用开 Claude Code。给它一个 prompt,它自己看屏幕、理解界面、规划步骤、执行操作。

换句话说------agent-device 需要你来当大脑,mobilerun 自带大脑。

门槛直接砍掉一半。

第二,LLM agnostic------什么模型都能接。

OpenAI、Anthropic、Gemini、DeepSeek、Ollama、OpenRouter------主流模型全支持。

这意味着什么?

你可以用 DeepSeek 白嫖,也可以用 Ollama 跑本地模型保护隐私。

不想折腾 API 的,DeepSeek 充几块钱就能跑。国内用户非常友好。

第三,Portal 机制------这才是真正的巧妙设计。

传统手机自动化依赖 USB 调试 + ADB 命令,你得插着线,开着调试模式。

mobilerun 不一样。它在你手机上装一个 Portal App,通过无障碍服务来控制。

这意味着什么?

手机不需要插线,不需要在你手边------只要 Portal 在跑,就能远程控制。

这就直接打开了 Cloud 模式的想象力。

两个最值得关注的功能

第一个,reasoning 模式。

简单的任务,mobilerun 直接执行。

但复杂任务呢?比如"帮我订下周去上海的机票"------搜索、比价、填信息、支付,十几步操作。

mobilerun 有个 --reasoning 模式,启动后用"管理者-执行者"架构:管理者负责规划,执行者逐步完成,管理者实时纠偏。

bash 复制代码
mobilerun run "帮我找联系人张三,给他发邮件" --reasoning

这才是解决复杂多步任务的设计。

第二个,vision 模式。

有些 App 没做无障碍适配,界面元素全是"button"、"view",Agent 根本分不清谁是谁。

mobilerun 的 --vision 模式会把截图直接发给 LLM,让它像人一样"看"屏幕。

还有 --vision-only 模式------完全不依赖无障碍树,纯靠视觉理解。

对那些没做 accessibility 的 App 来说,这是救命稻草。

但别急着吹,三个现实问题

第一,效果取决于模型。

LLM agnostic 的另一面是------模型选不好,体验就是灾难。

同样一句"帮我订机票",顶尖模型和免费模型的执行效果可能天差地别。

第二,稳定性还得打磨。

自然语言操控手机,本质上是概率性的。同一个任务,跑十次可能八次成功两次失败。

对于个人效率、探索性场景------没问题。对于生产环境的关键路径------你还不敢完全信任它。

第三,安全风险。

让 AI 直接操作你的手机------读你的消息、翻你的相册、操作你的支付------这件事本身就有风险。

Portal 的权限怎么管控?Agent 的操作边界在哪?这些目前还没有标准答案。

我的观点

mobilerun 它代表了一个方向------手机的交互方式正在被重新定义。

过去 15 年,我们操作手机的方式没变过:用手指点屏幕。

mobilerun 让我看到另一种可能:你说话,手机自己动。

但现在还处在早期。稳定性、安全性、准确性都有提升空间。但趋势已经出来了。

从"人适应机器"到"机器适应人"------这个方向不会变。

如果你对 AI + 移动端感兴趣,强烈建议去 GitHub 跑一遍 Demo。

不用写代码,三行命令,你的手机就开始自己动了。

那种感觉,真的很赛博朋克。

GitHub 项目地址:github.com/droidrun/mobilerun


以上,既然看到这里了,如果觉得不错,随手点个赞、在看、转发 三连吧,如果想第一时间收到推送,也可以给我个星标⭐~ 谢谢你看我的文章,我们,下次再见。

相关推荐
L·S·P3 小时前
25MB 管理 100+ 种数据库:开源轻量客户端 DBX 介绍与上手
数据库·mysql·开源·database·dbx
m4Rk_5 小时前
【论文阅读】Agent 记忆机制(83):Inside Out——用可演化 PersonaTree 构建 Agent 的核心长期记忆
论文阅读·人工智能·学习·开源·github
FungLeo5 小时前
成为全栈·React 管理后台篇·总复盘:从“接口能调通”到“后台值得使用”
前端·react.js·前端框架·项目复盘·成为全栈
Experience-摆渡6 小时前
一个开源免费的本地AI抠图工具 unbagrnd:断网也能用的背景移除
人工智能·开源
resh_people6 小时前
开源鸿蒙平台 KMP_CMP 三方库「WhatIf」适配全流程
华为·开源·harmonyos
Csvn6 小时前
并发模式:让渲染学会排队、插队和让路
前端
可乐鸡翅yeah_6 小时前
新手梳理:M3U8 线上问题,哪些是前端锅,哪些是后端锅
前端·ios·音视频·实时音视频·m3u8·音视频在线播放
Flynt7 小时前
Linear 用 1000 个 PR 换掉 styled-components,我写了 200 个按钮,把这笔账复现了一遍
前端·css·preact
分布式存储与RustFS7 小时前
模型 checkpoint 放对象存储:分片上传、断点续传与残留清理
运维·云原生·开源·对象存储·分布式存储·s3·性能基准
m4Rk_7 小时前
【论文阅读】Agent 记忆机制(81):EMR——用情景记忆避免 Agent 在多步推理中反复绕圈
论文阅读·人工智能·学习·开源·github