Gomaton
指南
API
GitHub
指南
API
GitHub
  • 前言

    • 快速开始
    • 能力速查
    • 工作原理
    • 硬件输入后端(ESP32 HID)
  • API 参考

    • motion - 触控 / 输入
    • images - 找图找色 / 截图
    • uiacc - 控件(UI 树)
    • device - 设备
    • app - 应用
    • ime - 输入法
    • ocr - 文字识别
    • yolo - 目标检测
    • files - 文件
    • storages - 键值存储
    • https - 网络
    • media - 媒体
    • system - 系统
    • utils - 工具

ocr — 文字识别(OCR)

import "gomaton.dev/sdk/ocr"

Package ocr 端上文字识别(PP-OCRv5,ncnn 推理,不联网)。cgo 薄封装,真身在 libppocr.so(二进制)。 用前先 Load 模型目录(det.param/det.bin/rec.param/rec.bin);缺省用项目 resources/models/ocr。

Close

func Close()

Close 释放模型。

FindText

func FindText(text string) (Result, bool)

FindText 整屏找包含 text 的第一条结果。

Load

func Load(modelDir string) error

Load 加载模型目录;modelDir 为空用 resources/models/ocr;重复调用无副作用。

Loaded

func Loaded() bool

Loaded 模型是否已加载。

Region

func Region(x1, y1, x2, y2 int) []Result

Region 识别像素区域内的文字(坐标换算回全屏);x2/y2<=0 到边。

Screen

func Screen() []Result

Screen 识别整屏文字。

WaitText

func WaitText(text string, timeoutMs int) (Result, bool)

WaitText 反复识别直到出现包含 text 的文字或超时(timeoutMs)。

上次更新: 2026/9/2 06:21
贡献者: hb
Prev
ime - 输入法
Next
yolo - 目标检测