Operit 深度拆解:手机里的开源 AI 操作系统
古董级程序员,专注 AI 工程化与移动端 Agent 实践。微信公众号「字与码」(zicode),每周一篇硬核技术拆解。本文是「移动端 Agent 系列」第三篇:前两篇分别是《成为 Agent 工程师,需要哪些技能?》和《手机上的开源 Agent:对标 Pi 的 6 个原生 App》——这篇把 Operit 这一个项目彻底拆开。
一、一句话定位
Operit 是当前移动端原生 AI Agent 赛道里功能最稠密、工程完成度最高、迭代最稳的开源项目。它把桌面级 Agent 几乎所有的能力(工具调用、本地大模型、UI 自动化、工作流、MCP/Skill 生态、Web Chat)压缩进一个 Android APK,是少有的「手机装完即跑、动手干活、不要 Termux」三件事同时满足的项目。
上一篇《手机上的开源 Agent:对标 Pi 的 6 个原生 App》把它评为 4.8/5 的综合分。本篇是对它的全维度深拆:从架构、技术栈、历史、热度、活跃度、质量、先进性、功能、使用、桌面版、性能,到 9 个我未想到的角度。
关键数据:GitHub 7,140★ / 576 Fork / LGPL-3.0 / 30 贡献者 / 73 Issue / 已合并 1,008+ PR / 最近合并 PR 就在今天 / 20 个发布版本(v1.0→v1.12.1)/ 包体 ~380MB。数据口径:GitHub REST API(2026-08-21 22:00 GMT+8)。
二、先说「对标 Pi」到底在比什么
Pi(Inflection)是一款移动原生 AI 伴侣 App:装完即跑、跨 iOS/Android/Web/WhatsApp、语音极自然——但它只聊天,不干活。所以「对标 Pi」在 Agent 语境里有两层叠加:
- 皮:移动原生 + 装完即跑 + 体验流畅(Pi 的强项)
- 核:Agent 真的能「动手」(Pi 的弱点)
Operit 拿到的是「皮 + 强核」:它是原生 Android APK,不依赖 Termux 装环境;能力密度又远超 Pi——这是它被关注的原因。但受众和 Pi 完全不同,这一点下面会展开讲。
三、数据快照:热度、活跃度、质量
3.1 热度(GitHub 口径,截至 2026-08-21)
| 指标 | 数值 | 说明 |
|---|---|---|
| Stars | 7,140 | 在 A 类六项目中绝对第一,是第二名 OpenMinis(3,880)的 1.84 倍 |
| Forks | 576 | 复制/二次开发的体量 |
| Watchers | 43 | 订阅更新 |
| Open Issues | 73 | 活跃讨论量适中 |
| Contributors | 30 | 详见下文化名 |
| License | LGPL-3.0 | 修改后分发需开源改动部分 |
| 首发 | 2025-03-15 | ~17 个月项目 |
| 最近提交 | 2026-08-21(今天) | 合并 PR #1008,fix token 数据迁移 |
关于社区传言:部分中文媒体转载的「15,000+ stars、80+ 贡献者、200+ 插件、500+ 工作流」与 GitHub API 返回的真实数据不一致(stars 7,140、贡献者 30、issues 73),本文以 GitHub 官方 API 为准。
3.2 活跃度
- 发布节奏:v1.4→v1.12.1 共 11 个月 20 个版本,平均约 3 周一版。最密是 2025-12(v1.6.0→v1.6.4→v1.7.0→v1.7.1)和 2026-02(v1.8.0→v1.8.1→v1.9.0→v1.9.1)连发 4 个版本。
- 代码语言:Kotlin 19.3MB(约 88%),JavaScript 2.5MB,C++ 524KB(llama.cpp/MNN 绑定),TypeScript 470KB,Python 444KB(脚本/工具)。
- 贡献分布:前 5:AAswordman 1,269、luojiaping 80、CATMIAOZHI 27、yizhen47 23、ic-timon 21。第二名与第一名差 15.8 倍——单点维护风险显著。
3.3 质量
- 安全:v1.12.0 主动移除硬编码默认 DeepSeek API Key(社区早期版本曾内置作者的免费 key 引发隐私讨论,这次清理是负责任的)
- 稳定性:v1.9.1、v1.12.0 等多个「.1/.0」版本都是「集中修复」型,节奏诚实
- 国际化:v1.12.0 新增韩语/西班牙语/葡萄牙语本地化,多模型显示名/按钮溢出已修
- 文档:官方文档站
operit.app+ README(中文/英文双 README)+ 贡献指南 + Discord + QQ 群
四、架构:塞进 Android 的「AI 操作系统」
我从 README / 更新日志 / 多篇社区拆解中还原了 Operit 的运行时分层(非官方发布图):
图 1 · Operit 5 层架构(UI / Agent 运行时 / 能力执行 / 对外服务 / 底座)
4.1 技术栈关键决策
- chroot Ubuntu 24:不是 Termux,是把完整 Linux 用户空间 chroot 进 Android,与宿主共享内核。代价:无真实隔离;收益:apt 装包、Python/Node.js/SSH/vim 真能用。
- AutoGLM + UI Tree 双通道:AutoGLM(智谱)做视觉+规划决策;UI Tree + uiautomator dump 做结构化元素识别。两条路互补,比单截图更稳。
- MNN + llama.cpp 双推理:MNN(阿里)偏移动端速度优化;llama.cpp(GGUF)偏生态丰富度。Qwen 2.5 1.5B/7B 是社区主流搭配。
- ToolPkg IPC + Hook Runner + Plan-mode IPC:v1.11/v1.12 才浮出水面的「内核」:工具包以独立进程通信,Hook 可在调用前后拦截,Plan-mode 让 Agent 显式「先想后做」。这套设计对标桌面 harness 的内核抽象。
架构上的一个反直觉点:Operit 是一个单体 Android 应用,不是可自托管的 Web 服务。社区里把它类比成「手机版 Open WebUI / Open Claw」其实并不严谨——Open WebUI 是 Web 服务(多用户、跨设备、API),Operit 是 App(单用户、可选 Web 端点 + HTTP API)。这俩的目标形态不同。
五、历史演进:从聊天壳到 Agent OS
图 2 · v1.0 → v1.12.1,2025-05 → 2026-08
阶段一 · 聊天 + 工具(2025 上)
v1.0 (2025-05) 首发只有 AI 聊天 + 基础工具调用 + Shizuku/Root 集成;v1.1 接入 MCP 协议、OCR、悬浮窗;v1.2 上线语音和知识库;v1.3 加 Web 开发与主题;v1.4 把并行工具执行和角色卡做扎实——这是它从「App」变成「框架」的拐点。
阶段二 · Agent 化 + 生态(2025 下–2026)
v1.5 (2025-09) 是真正的分水岭:Ubuntu 24 完整终端 + MCP 市场 + 桌宠上线,「手机里的 Linux 工作站」叙事定型。后续节奏:
- v1.6 (2025-10):MNN 本地推理 + 记忆库(Memory Vault)重写 + Tasker 联动
- v1.7 (2025-12):AutoGLM + Root 虚拟屏(多显示器并行),并引入 Skill 协议 + Skill 市场
- v1.8 (2026-01/02):llama.cpp (GGUF) 本地推理,工作流系统+语音唤醒
- v1.9 (2026-02):移动端 Web 自动化 + Windows 终端控制(关键,详见 §八)
- v1.10 (2026-03/04):角色卡群聊 + AI 自配置 + 主题/液态玻璃 UI
- v1.11 (2026-05):Web Chat(桌面浏览器访问手机端对话)+ Artifact 市场 + ToolPkg AI Provider
- v1.12 (2026-07/08):统一市场 + Hook Runner + Plan-mode IPC + 多语言扩展
这条曲线与桌面 Agent 生态(OpenClaw/dify/n8n)的成熟轨迹高度同构——印证了上一篇文章的论点:MCP / Skill 协议 / 工具并行 / 工作流 / Artifact 是新 Agent 平台的事实标准组件。手机端不是另起炉灶,是同构压缩。
六、技术先进性:被低估的 5 个细节
不是「做出来」,是「做对」。下面这 5 点在桌面 harness 圈里讨论得也不多:
- ToolPkg IPC(v1.12):工具包不再是「直接调函数」,而是走 IPC。这意味着工具崩溃不会拖垮主进程,也可以做权限沙箱——是把桌面「sidecar / microservice」思维带进 App 的设计。
- Hook Runner + 计划模式:在 Agent 调工具前后插入拦截,可做权限提示、参数改写、审计;计划模式让 Agent 显式「先想后做」,减少直接执行的风险。这两件事桌面 harness 还在补。
- 并行只读工具(v1.10+):只读工具(文件搜索、HTTP 探活)自动并行,长上下文 token 减少的同时响应更快——是「工程化打磨」层面的进步。
- Compose DSL(v1.11):自研 DSL 支持 WebView、slot、调试 dump、重渲染——把移动端的 UI 表达力提升到接近桌面 SPA。
- 上下文限制器 + WorldBook 搜索(v1.11):长对话「lost in the middle」的硬解法,桌面 harness 普遍还没做。
七、功能全景:40+ 工具的拓扑
| 类别 | 代表能力 | 对标桌面能力 |
|---|---|---|
| Linux 环境 | apt、Python、Node.js、Git、SSH、vim | WSL / 多发行版容器 |
| 文件系统 | 读写、搜索、解压、格式转换、Git 集成 | shell + git + 文件管理器 |
| 网络 | HTTP 请求、网页访问、文件上传/下载、Web 开发导出 | curl + 浏览器 + webhook |
| 系统操作 | 装/卸 App、权限管理、UI 自动化(无障碍/ADB/Root)、AutoGLM、虚拟屏 | UIAutomator + ADB + AutoHotkey |
| 媒体 | 视频转换、帧提取、OCR/视觉理解、相机、音频读取 | ffmpeg + Tesseract + GPT-4V |
| 开发 / 终端 | Web 工作区/一键打包、代码编辑/语法高亮、SSH/Chroot/vim、Ctrl 组合键 | VSCode + tmux |
| AI 创作 | 绘图(OpenAI/Qwen/NanoBanana/Zhipu)、图片搜索/下载 | ComfyUI + Midjourney |
| 搜索 | 深度搜索、DuckDuckGo、Tavily、谷歌学术、Bing、百度地图 | Perplexity + 学术检索 |
| 工具包 / 工作流 | ToolPkg 管理、工作流自动化、定时/语音唤醒触发 | n8n / Zapier / Make |
| 集成 | Tasker、MCP/Skill 市场、OpenAI Responses、Claude、Gemini、xAI、Ollama、NVIDIA、OpenRouter、LMStudio | LangChain / LiteLLM / MCP 客户端 |
八、使用方法:5 步上手 + 3 个场景
8.1 上手 5 步
- 从 GitHub Releases(
AAswordman/Operit/releases)或官网下载 APK(第三方分发站存在被植入风险,README 明确警告) - 安装并启动,依次同意协议、个性化定制(职业/性格/身份)
- 授予「无障碍」权限;想做更强的自动化再开 Shizuku 或 Root
- 配置模型:云端填 API Key(OpenAI/Claude/Gemini/DeepSeek 等),或本地导入 GGUF 文件到
models/目录 - 进入 AI 对话,先试「Linux 环境」跑一条
python3 -c "print(1+1)",再试「UI 自动化」说一句「把微信第 3 条文件保存到网盘」
8.2 三个典型场景
- 移动开发者应急:高铁上 SSH 服务器、Git clone、修代码、跑测试、Commit。Ubuntu 终端 + 自动化一条龙。
- 自媒体内容工厂:深度搜索 → 总结大纲 → 绘图插件 → 本地 TTS 配音 → 整理到文件夹,全部由工作流串起来。
- 极客自动化中枢:Tasker 监听通知 → 触发工作流 → AI 读邮件 → 自动回复 → 摘要写 Notion,自然语言描述就能搭。
九、桌面版?明确回答 + 关系图
没有原生桌面版(没有 Windows / macOS / Linux 客户端)。官方只发 Android APK。
但桌面与 Operit 的关系不止「没有」这么简单。三条通路:
- ① 桌面 → 手机:v1.11 起开放 Web Chat:同 WiFi 下桌面浏览器访问手机 IP,可直接对话、操作工具。这是「手机当服务器,桌面当客户端」。
- ② 手机 → 桌面:v1.9 起支持 Windows 终端控制:Operit 远程执行 Windows 命令,可直接驱动 Codex 等桌面 CLI。手机成了桌面的「远程大脑」。
- ③ 任意 → 任意:v1.12 起 外部 HTTP 服务 默认关闭;开启后暴露本地 Web Chat + HTTP API,可自托管为家庭 Agent 节点。QQ Bot 示例也已就位。
所以「桌面版」这件事的答案不是「有/没有」,而是**「手机正在变成 Agent 节点,桌面只是它的一种端」**——这是 Agent 时代典型的形态转移。
十、性能 / 硬件门槛:物理上限是天花板
10.1 设备门槛(README)
- Android 8.0+(API 26+)
- 推荐 6GB+ RAM,最小 4GB
- 剩余存储 5GB+
- APK ~380MB(含 chroot 镜像)
10.2 本地推理速度(社区实测口径)
| 方案 | 模型 | 内存 | 速度(骁龙 8 系) | 适用 |
|---|---|---|---|---|
| MNN | Qwen2.5-1.5B / TinyLlama-1.1B | 2–4 GB | 10–20 tok/s | 中端机日常对话 |
| llama.cpp | Qwen2.5-7B-Q4 / Llama-3-8B-Q4 | 5–8 GB | 5–12 tok/s | 旗舰机离线复杂任务 |
| 混合 | 本地 + 云端按需切换 | — | — | 日常本地省电、复杂任务上云 |
10.3 物理天花板(软件改不了的部分)
三条硬约束:
- 散热:持续推理 10 分钟开始降频,7B 速度会从 12 tok/s 掉到 5 tok/s;
- 屏幕与输入:长代码编辑、表格操作,触屏仍不如键鼠;
- 电池:本地 7B 一小时对话约 20–30% 电量——应急可以,长时间不行。
所以「手机取代笔记本」是叙事,不是结论。它的真实价值是「应急/碎片时间/通勤的生产力补充」,不是替代。把期望放对,体验会顺很多。
十一、9 个我未想到的角度(文章真正的核心)
网上关于 Operit 的文章大多是「功能介绍 + 哇塞」型。我更想分享一些看穿表象的判断。
① 受众错位:装完即跑 ≠ 对标 Pi
满足「移动原生 + 装完即跑」是真的,但 Operit 的人群不是 Pi 的人群。Pi 是消费级伴侣——打开就聊、什么都不用配置。Operit 是工程级极客工具——你要懂 Shizuku、API Key、模型选择、权限分级。把它推荐给「想换个 AI 聊天」的朋友,大概率会被劝退。这是它和 Pi 最大的、但最不被人说起的差距。
图 3 · 移动原生 × 动手能力的二维定位:Operit 落在右上(满足你的约束),但与 Pi 的「右下大众」象限不同
② 单维护者风险(Bus Factor = 1)
AAswordman(aa 剑侠,B 站 UP 主)一人贡献 1,269 次 commit,第二名 luojiaping 80 次——差 15.8 倍。LGPL 保护代码,保护不了项目延续。如果他停更一年,主线几乎立刻停滞;社区可以 fork,但主线的事实标准仍会随维护者一起消失。这是「把 Operit 用于生产」时必须诚实写下的风险。给它一个 star 不够,贡献 issue/PR/文档是更实质的支持。
③ chroot 是特性,也是攻击面
「上帝视角」的代价是「无真实隔离」。chroot 共享 Android 内核,不是真容器:一旦授权 Root 或无障碍,被恶意工具利用就等于全设备裸奔。再加上它支持外部 HTTP API、QQ Bot、远程 MCP——任何一个开启的网络面都是新的攻击面。安全模型 = Android 权限本身 + 你给它的授权。不要在主力手机上裸跑陌生 MCP。
④ 集成者,不是创新者
把 Operit 的所有「先进技术」列出来:MCP(Anthropic 提出)、AutoGLM(智谱)、llama.cpp(社区)、MNN(阿里)、Skills(自创但概念上追随 Anthropic Agent Skills)、Compose DSL(学自桌面 SPA)、Hook Runner(学自桌面 harness)……它几乎没有自己的底层研究创新。它的强项是把别人的好东西压缩进 Android 并稳定可用。这本身就是巨大的工程价值,但要分清「集成」与「创新」——前者更常见,后者更稀有。
⑤ 与 Open WebUI 的类比不严谨
社区常说「手机版 Open WebUI」——不对。Open WebUI 是多用户 Web 服务,跑在服务器上,所有人共享一个大脑。Operit 是单用户 App,一个手机一个大脑,多端通过 Web Chat 接入是「可选项」。两者的部署、运维、扩展心智完全不同。这是判断它能不能上生产的根本分歧。
⑥ MCP 移动端标准化:上篇文章论点的强证据
我上篇文章说「MCP 是新基础设施」。A 类六项目里 Operit、Aether、OpenMinis 都 MCP 原生,OpenDroid 部分支持。从「桌面协议 → 移动端默认」只用了 1 年——这是非常快的协议扩散速度。Operit 还在 MCP 之上加了 uvx/npx 支持,等于把 npm 生态一并带进手机。这件事对未来 1–2 年的移动 Agent 格局影响极深。
⑦ 从「代理」到「产品」的拐点:Agent-as-a-Service
v1.11 Web Chat + v1.12 Artifact 市场 + 外部 HTTP API + QQ Bot 示例——这条线是**「你的手机正在变成一个 Agent 节点」**。它不再只「听你说话」,而是可以被外部系统调用、发布作品、对接 IM。下一阶段(v1.13 以后)的合理想象:把 Operit 装在旧手机上作为家庭 AI 节点,桌面/家庭设备全部接入。这和 Pi 的「云端大脑 + 任意端」形态是同构的,只是大脑在本地。
⑧ 物理天花板是真天花板
7B 5–12 tok/s、4GB 内存起步、380MB APK、Root 授权解锁虚拟屏——这些是「手机能跑到这里」的硬线。不是软件能改的。所以「手机变唯一计算设备」是远景,不是当下。当下真实:在通勤/高铁/临时场景下,能干活。期望放对,Operit 会很香;期望当 PC 替代品,会失望。
⑨ 给 Agent 工程师的作品集启示
Operit 是百万行级别的 Kotlin 单体应用,直接 fork 做作品集性价比低。但它的设计模式值得拆:
- ToolPkg IPC 抽象(怎么把工具做成 sidecar 进程)
- Hook Runner(怎么在 Agent 调工具时插入权限/审计/参数改写)
- Plan-mode + 上下文限制器(怎么压住长对话的失焦)
- Skill 协议(怎么把桌面 Skills 模式迁移到移动)
- Compose DSL(怎么在 App 内做嵌入式 UI 表达)
把这五点抽出来,用 200 行 Python 在你熟悉的桌面 harness 里复现一遍,比 fork Operit 改一行更值。
十二、结论:给谁用、怎么用(诚实给建议)
- ✓ 推荐:极客 / 移动开发者 / 自动化玩家 / 隐私敏感用户 / 想研究 MCP 移动化的 Agent 工程师 / 旧手机再利用玩家
- ✗ 不推荐:只想找个「开箱即聊的 AI 伴侣」的人 / 不会用 Shizuku/API Key/权限分级的人 / 把手机当唯一计算设备的人
我的真实使用建议:
- 研究者:把它当模式库,拆 ToolPkg IPC / Hook / Skill 协议 / 上下文限制器,写一篇《Operit 的可借鉴设计》——这比 star 数更能体现你深度
- 使用者:主力机不要裸跑未知 MCP,旧手机/备用机开 Root 玩,玩一周判断真不真用
- 普通用户:现阶段 Pi 仍然是更平滑的体验;Operit 的红利要等你愿意「自己配置」之后才能吃到
十三、关键数据卡
| 维度 | 结论 |
|---|---|
| 形态 | Android 原生 App(无桌面客户端) |
| License | LGPL-3.0 |
| 主语言 | Kotlin(88%),C++ 524KB(llama.cpp/MNN) |
| 系统要求 | Android 8+,6GB+ RAM,5GB 存储 |
| APK 大小 | ~380MB(含 chroot Ubuntu 24) |
| 最新版本 | v1.12.1(2026-08-08) |
| 项目年龄 | ~17 个月(2025-03-15 首发) |
| GitHub Stars | 7,140(A 类第一) |
| Forks / Contributors | 576 / 30(TOP1 占 95%+) |
| 版本节奏 | ~3 周一版,最新合并 PR 在今天 |
| 是否用 Termux | 否(chroot Ubuntu 24,自有容器) |
| 本地模型 | MNN + llama.cpp(GGUF),Qwen/Llama 主流 |
| 推理速度 | MNN 1.5B: 10–20 tok/s;llama.cpp 7B: 5–12 tok/s |
| 桌面接入 | Web Chat(桌面→手机)+ 外部 HTTP API + Windows 终端控制(手机→桌面) |
| 核心风险 | 单维护者(bus factor 1)/ chroot 无真实隔离 / 380MB 重 |
系列文章:上一篇《成为 Agent 工程师,需要哪些技能?》、上上一篇《手机上的开源 Agent:对标 Pi 的 6 个原生 App》。下篇预告:拆《Aether(扶摇)的 MCP 架构》——基于 Pi framework 的另一个有意思的项目。
微信公众号
欢迎关注「字与码」
如果这篇文章对你有用,也欢迎在微信里继续关注后续更新。
X / Twitter
关注 @ax2_zicode
更即时的技术观察、新文章提醒和一些短想法会发在 X 上。