DSHA插件与技能 · Android

Agent Skill

屏幕识别与操作

screen-ocr-operator · 2026-09-06

它能做什么

组织“截图 → 视觉模型分析 → ADB 操作 → 结果验证”的技能工作流。需要用户自己的视觉模型服务,模型费用由相应服务计收。

“查看当前页面有哪些按钮。只描述,不点击,也不提交任何内容。”

Agent Skill视觉模型截图

使用前准备

  • 已授权的 ADB 通道
  • 支持图像输入的 OpenAI 兼容视觉模型 API 与用户自己的 Key
  • 上传截图前确认其中不含不希望发送给模型服务的内容

安装与验证

  1. 下载技能包并放入 Agent 的技能目录,配置自己的视觉模型服务。
  2. 先以无敏感内容的页面测试截图与识别,并确认坐标对应原图或缩放图。
  3. 让 Agent 执行小步操作,每个关键步骤重新截图验证。

权限与数据

  • 读取手机屏幕截图并通过 ADB 操作设备
  • 截图会发送到用户配置的视觉模型服务
  • 本技能不要求 Android 无障碍服务授权

这些说明用于帮助判断使用条件,不是独立的插件沙箱。了解 DSHA 的权限边界

适配记录与限制

工作流文档已适配 rc1.1;不同视觉服务和设备组合尚未逐一实测。

  • 界面变化、缩放和识别误差都可能影响点击位置。
  • 密码、验证码、付款和对外提交等步骤应由用户接手确认。
  • 技能文件不包含任何 API Key,也不会由此网站接收或保存 Key。

核对日期:2026-09-06 · dsh 0.1.2-rc.1

来源与反馈

查看源项目 · 反馈 DSHA 问题

维护来源:DSHA 项目 · MIT 许可证。技能适配版保留项目许可,修改内容以本页下载文件为准。