影刀RPA实操指南:截图与OCR文字识别实战——从页面截图到数据提取

有些网页数据不是以文本形式存在的。图片里的文字、验证码、截图的表格——这些内容你用"获取元素文本"是取不到的。

影刀RPA内置了截图和OCR(光学字符识别)能力,可以识别图片里的文字,把"看得到但抓不到"的数据提取出来。

在这里插入图片描述

什么场景需要OCR

以下几种情况,XPath和文本提取都不好用

  • 网页数据以图片形式展示(部分老系统、图表)
  • 需要识别验证码文字
  • 截取某个区域的表格图片,转成文本
  • 部分防采集的网站,文字渲染在Canvas里
  • 桌面应用的界面文字提取(Windows自动化场景)

OCR不是第一选择——能用元素捕获就尽量不用OCR。OCR的识别率不是100%,文字模糊或背景复杂时准确率会下降。

在这里插入图片描述

影刀的截图指令

影刀RPA中,截图相关的指令有两类:

店群矩阵自动化突破运营极限!

1. 页面截图

在这里插入图片描述

"截图"指令可以截取整个网页或指定区域。参数设置:

  • 截图范围:整个页面/可视区域/指定元素
  • 保存路径C:\截图\screenshot_{{timestamp}}.png
  • 截图格式:PNG(清晰但文件大)/ JPEG(文件小但可能模糊)

{{timestamp}} 是变量占位符,每次截图自动生成不同文件名,不会覆盖。

2. 指定元素截图

在这里插入图片描述

选择"对指定元素截图",先捕获目标元素(比如验证码图片或表格区域),然后截图。这比截整个页面再裁剪高效。

OCR文字识别

截图完成后,拖入"OCR文字识别"指令:

参数说明
在这里插入图片描述

  • 识别引擎:内置OCR(免费)/ 百度OCR(需配置API Key)/ 腾讯OCR(需配置API Key)
  • 识别语言:中文、英文、中英混合
  • 识别区域:完整图片/指定坐标区域

内置OCR vs 第三方OCR

对比项 内置OCR 百度OCR 腾讯OCR
费用 免费 每日免费额度 每月免费额度
准确率 一般(80%-90%) 高(95%+) 高(95%+)
特殊字体
配置复杂度 需申请API Key 需申请SecretId/Key

日常简单文字识别用内置OCR够了。验证码或图片表格这种对准确率要求高的场景,建议配置百度或腾讯OCR。

实战:识别图片中的表格数据

在这里插入图片描述

完整操作流程:

# 步骤1:捕获目标元素(表格图片的区域)
# 在元素捕获模式下选中表格所在的div或img元素

# 步骤2:对指定元素截图
# 指令:对指定元素截图
# 保存路径:C:\temp\table_capture.png

# 步骤3:OCR识别
# 指令:OCR文字识别
# 识别引擎:腾讯OCR(推荐)
# 识别结果存入变量:ocr_result

# 步骤4:解析识别结果
# OCR返回的是纯文本,需要自己用Python解析行列结构

注意:OCR返回的是一段连续文字,不会自动识别行列结构。如果表格有清晰的分隔线,可以用Python按换行符和空格拆分。

temu店群自动化报活动案例


在这里插入图片描述

实战:验证码识别流程

验证码是登录流程最常见的自动化障碍。识别思路:

# 验证码识别流程
# 1. 截取验证码图片元素
# 2. OCR识别图片文字
# 3. 清理识别结果(去掉空格、标点)
code = ocr_result.strip().replace(' ', '')
# 4. 填入验证码输入框
# 5. 判断是否登录成功
#    成功 → 继续
#    失败 → 刷新验证码,重试(最多3次)

提高识别率的技巧

  • 截图前确保图片足够大(验证码元素太小会降低识别率)
  • 截取后先做图片预处理:放大、转灰度、二值化(需要Python的Pillow库)
  • 内置OCR识别4位数字验证码准确率约70%,6位混合字符约50%
  • 在这里插入图片描述

图片预处理提升识别率

from PIL import Image, ImageEnhance

# 打开截图
img = Image.open(r'C:\temp\captcha.png')

# 放大2倍(文字太小OCR识别不准)
img = img.resize((img.width*2, img.height*2), Image.LANCZOS)

# 转灰度图
img = img.convert('L')

# 提高对比度
enhancer = ImageEnhance.Contrast(img)
img = enhancer.enhance(2.0)

# 保存处理后图片
img.save(r'C:\temp\captcha_processed.png')

预处理后再把captcha_processed.png传给OCR,识别率能提高15%~20%。

常见问题

问题 原因 解决
识别结果乱码 语言设置错误 确认OCR引擎选的是"中文"
识别率低 图片不清晰 截图前放大页面(Ctrl+滚轮),或做图片预处理
返回空字符串 截图为空白区域 检查元素是否正确捕获,用"输出日志"打截图路径确认
在这里插入图片描述

| 第三方OCR报错 | API配置问题 | 检查API Key/Secret是否过期,每日额度是否用完 |
| 内置OCR不支持 | 版本太旧 | 升级影刀RPA到最新版 |


#影刀RPA #RPA自动化 #OCR #截图识别 #验证码识别

作者:林焱

在这里插入图片描述

本文为《影刀RPA学习手册》系列文章之一,内容源于实操经验的整理与分享。

更多推荐