Agent Skill
屏幕识别与操作
screen-ocr-operator · 2026-09-06
它能做什么
组织“截图 → 视觉模型分析 → ADB 操作 → 结果验证”的技能工作流。需要用户自己的视觉模型服务,模型费用由相应服务计收。
“查看当前页面有哪些按钮。只描述,不点击,也不提交任何内容。”
使用前准备
- 已授权的 ADB 通道
- 支持图像输入的 OpenAI 兼容视觉模型 API 与用户自己的 Key
- 上传截图前确认其中不含不希望发送给模型服务的内容
安装与验证
- 下载技能包并放入 Agent 的技能目录,配置自己的视觉模型服务。
- 先以无敏感内容的页面测试截图与识别,并确认坐标对应原图或缩放图。
- 让 Agent 执行小步操作,每个关键步骤重新截图验证。
权限与数据
- 读取手机屏幕截图并通过 ADB 操作设备
- 截图会发送到用户配置的视觉模型服务
- 本技能不要求 Android 无障碍服务授权
这些说明用于帮助判断使用条件,不是独立的插件沙箱。了解 DSHA 的权限边界
适配记录与限制
工作流文档已适配 rc1.1;不同视觉服务和设备组合尚未逐一实测。
- 界面变化、缩放和识别误差都可能影响点击位置。
- 密码、验证码、付款和对外提交等步骤应由用户接手确认。
- 技能文件不包含任何 API Key,也不会由此网站接收或保存 Key。
核对日期:2026-09-06 · dsh 0.1.2-rc.1
来源与反馈
维护来源:DSHA 项目 · MIT 许可证。技能适配版保留项目许可,修改内容以本页下载文件为准。