推荐一款开源工具:让 AI Agent 替你做 iOS、Android 自动化测试,能平替 Appium?

简介: Appium统治移动端自动化测试12年,但脚本复杂、维护成本高。新开源工具agent-device(Callstack出品)开启范式革命:专为AI Agent设计,通过语义化元素引用(@e1)、全链路证据采集、探索→回放机制,让AI“看懂”界面自主操作,非Appium替代品,而是下一代智能测试基础设施。

Appium 你用了多少年?

它从 2013 年到现在,12 年了。

12 年里,移动端自动化测试的格局基本没变——Appium 统治一切。

但说实话,Appium 不好用

写个测试脚本,要找元素 ID、写 XPath、处理弹窗、适配各种屏幕。脚本写完比业务代码还长,UI 一改全崩。

12 年了,一直如此。

直到最近,我发现了一个开源项目——让我觉得移动端自动化测试的范式,可能真的要变了。

它叫 agent-device

Callstack 出品,MIT 开源,JPMorgan Chase、Expensify、Shopify 的团队都在用。

一句话介绍:它是一款开源给 AI Agent 用的设备自动化 CLI,iOS、Android、TV、桌面全覆盖,目前在Github上,该项目star数接近4k。

安装方式(Node.js 版本需大于22.12):

npm install -g agent-device@latest
agent-device doctor
agent-device --version
agent-device help workflow

注意——它不是另一个 Appium。

Appium 的逻辑:你写脚本,一步步告诉它怎么点、怎么填。

agent-device 的逻辑完全不同:你把它交给 AI Agent(Codex、Claude Code),Agent 自己看屏幕、找按钮、做操作。

agent-device 只干一件事——当 Agent 的"眼睛"和"手"。

为什么我觉得它可能改变格局?

先说我的判断:不是技术比 Appium 更强,是思路根本不一样。

Appium 时代,测试的核心能力是"写脚本"——你得会 XPath、懂定位策略、处理等待逻辑。

agent-device 时代,测试的核心能力变成"描述意图"——你说"验证登录功能正常",Agent 自己看屏幕、找元素、点按钮、判断结果。

这不是优化,是范式转移

就像从"手写汇编"到"用高级语言"——不是汇编不好,是抽象层变了。

三个我觉得很聪明的设计

第一,语义化引用。

agent-device 截取屏幕快照后,给每个可交互元素分配一个引用——@e1@e2@e3

Agent 不需要写 XPath,只需要说"点击 @e3"。

agent-device snapshot -i
# @e1 [heading] "Settings"
# @e2 [button] "Sign In"
# @e3 [text-field] "Email"

agent-device fill @e3 "test@example.com"

XPath 会因为 UI 改版而失效。但基于无障碍树的引用,稳定性高一个量级

第二,证据收集不只是截图。

日志、网络流量、性能采样、崩溃上下文、React 渲染 profile——全自动收集。

这意味着 Agent 不只是"操作完了",还能自证清白。出了 bug 要复盘?证据链一条不少。

第三,探索变回放。

Agent 探索完一遍操作流程,自动录制成 .ad 脚本,之后 CI 反复跑。

探索时靠 AI,回归时靠脚本——两个阶段各取所长。

但别急着吹,它也有短板

第一,需要 AI Agent 驱动。

你得有 Codex 或 Claude Code。没有 Agent,它就是一个 CLI,价值砍半。

第二,吃 App 的无障碍标签。

它依赖 accessibility tree。如果 App 没做无障碍适配,元素全标"button",Agent 也抓瞎。

第三,生态还处在早期。

虽然已经有大厂在用,但文档、教程、社区最佳实践还在积累。碰到坑,你得自己趟。

我的判断

它不会立刻替代 Appium——但代表了 Appium 之后的方向。

Appium 解决的问题是"怎么让机器按步骤操作手机"。

agent-device 解决的问题是"怎么让 AI 像人一样看屏幕、理解界面、自主操作"。

这两件事,根本不在一个层面上。

未来两三年,移动端测试的核心能力,会从"写自动化脚本"转向"编排 AI Agent 做验证"。agent-device 不是终局,但它可能是推倒多米诺骨牌的那只手

如果你在做移动端测试,建议现在就去 GitHub 看看,跑一遍 Demo。

别等到所有人都在用的时候,你才反应过来。

GitHub 项目地址:github.com/callstack/agent-device

相关文章
|
2天前
|
人工智能 运维 数据挖掘
最新版通义千问(Qwen3.8-Max-Preview)功能介绍
2026年7月,阿里云通义千问正式对外开放**Qwen3.8-Max-Preview旗舰预览模型**,作为目前千问系列规格最高、综合性能最强的新一代万亿级AI模型,该模型搭载2.4T超大参数架构,是阿里云首款突破万亿参数的原生多模态旗舰模型,全面覆盖文本、图像、视频、文档多维度处理能力。相较于前代热门Qwen3.7-Max版本,本次预览版实现全方位跨越式升级,在真实工程开发、多智能体长周期任务、全链路办公自动化、海量数据分析等高阶场景中,综合能力已达到全球顶尖模型水准。现阶段该模型已正式开放抢先体验通道,依托阿里云百炼Token Plan、Qoder编码平台、QoderWork办公终端三大专属
1810 0
|
6天前
|
人工智能 安全 测试技术
|
8天前
|
云安全 人工智能 安全
阿里云 Agentic SOC 位居 IDC MarketScape安全运营智能体2026领导者类别
以 Agentic AI 重构安全运营闭环,阿里云云安全在产品能力与市场份额
1200 3
|
3天前
|
人工智能
Qwen3.8抢先体验!正式版即将发布并开源!
千问Qwen3.8即将开源,参数达2.4T,进化速度以“天”计,实力媲美Fable 5。预览版Qwen3.8-Max已上线阿里Token Plan等平台,限时优惠:日间Credits低至1折,夜间更优,个人/团队版月付仅35元起!
493 18
|
2天前
|
人工智能 自然语言处理 数据挖掘
Qwen3.8-Max 预览版全解析:2.4 万亿参数旗舰模型,Token Plan 限时优惠指南
Qwen3.8-Max-Preview是通义千问Qwen3系列旗舰MoE大模型,参数达2.4万亿,综合推理能力居行业第一梯队。支持思考/快速双模式,擅长大模型五大高难场景。现于阿里云百炼Token Plan、Qoder及QoderWork上线体验,个人版低至39元/月。在阿里云百炼官网:https://t.aliyun.com/U/fPVHqY 免费领取千万Tokens
410 1
Qwen3.8-Max 预览版全解析:2.4 万亿参数旗舰模型,Token Plan 限时优惠指南
|
9天前
|
缓存 UED 开发者
Codex109天重置23次,明天还要再送一次
Codex近109天完成23次额度重置,7月14日将迎来第24次。Tibo高频响应用户反馈:优化GPT-5.6高消耗问题、补发失效福利、调整重置时间——形成“反馈→回应→修复→补偿”正向闭环,彰显以用户为中心的产品哲学。(239字)
790 12
|
2天前
|
人工智能 测试技术 语音技术
Qwen-Audio-3.0-TTS 正式发布!AI 语音从 “能说话” 升级到 “会带情绪表达”
阿里云发布Qwen-Audio-3.0-TTS语音合成大模型,支持细粒度标签控制(如[gasp][angry])、freestyle自由风格、16种语言及20种方言,声学鲁棒性强。含Flash(首包延时300ms)和Plus(全球榜单冠军)双版本,已在百炼平台开放调用。在阿里云百炼官网:https://t.aliyun.com/U/fPVHqY 免费领取千万Tokens
405 0
|
12天前
|
存储 人工智能 JSON
Qwen 本地部署搭配 ComfyUI 生成 AI 漫剧完整实操指南(小白零基础可落地,零成本无限生成+角色一致性天花板)
2026全网最优本地漫剧流水线:零成本、离线运行、角色统一、低配(8G显卡)可跑。融合Qwen本地大模型+ComfyUI双引擎,实现剧本生成→分镜绘图→动态成片全自动,隐私安全、无审核限流,新手30分钟上手,日更无忧。(239字)
|
8天前
|
数据采集 机器学习/深度学习 人工智能
田间杂草定位与检测4200张YOLO智慧农业数据集分享
本数据集含4200张真实农田图像,YOLO格式,单类别(杂草)高质量标注,覆盖多作物、多光照、多生长阶段等复杂场景,专为智慧农业杂草检测与智能除草设备研发设计,支持YOLOv5/v8/v10等主流模型训练。
384 94