影刀RPA实操指南_截图与OCR文字识别实战从页面截图到数据提取
影刀RPA实操指南:截图与OCR文字识别实战——从页面截图到数据提取
有些网页数据不是以文本形式存在的。图片里的文字、验证码、截图的表格——这些内容你用"获取元素文本"是取不到的。
影刀RPA内置了截图和OCR(光学字符识别)能力,可以识别图片里的文字,把"看得到但抓不到"的数据提取出来。

什么场景需要OCR
以下几种情况,XPath和文本提取都不好用:
- 网页数据以图片形式展示(部分老系统、图表)
- 需要识别验证码文字
- 截取某个区域的表格图片,转成文本
- 部分防采集的网站,文字渲染在Canvas里
- 桌面应用的界面文字提取(Windows自动化场景)
OCR不是第一选择——能用元素捕获就尽量不用OCR。OCR的识别率不是100%,文字模糊或背景复杂时准确率会下降。

影刀的截图指令
在影刀RPA中,截图相关的指令有两类:
店群矩阵自动化突破运营极限!
1. 页面截图

"截图"指令可以截取整个网页或指定区域。参数设置:
- 截图范围:整个页面/可视区域/指定元素
- 保存路径:
C:\截图\screenshot_{{timestamp}}.png - 截图格式:PNG(清晰但文件大)/ JPEG(文件小但可能模糊)
{{timestamp}} 是变量占位符,每次截图自动生成不同文件名,不会覆盖。
2. 指定元素截图

选择"对指定元素截图",先捕获目标元素(比如验证码图片或表格区域),然后截图。这比截整个页面再裁剪高效。
OCR文字识别
截图完成后,拖入"OCR文字识别"指令:
参数说明:
- 识别引擎:内置OCR(免费)/ 百度OCR(需配置API Key)/ 腾讯OCR(需配置API Key)
- 识别语言:中文、英文、中英混合
- 识别区域:完整图片/指定坐标区域
内置OCR vs 第三方OCR:
| 对比项 | 内置OCR | 百度OCR | 腾讯OCR |
|---|---|---|---|
| 费用 | 免费 | 每日免费额度 | 每月免费额度 |
| 准确率 | 一般(80%-90%) | 高(95%+) | 高(95%+) |
| 特殊字体 | 弱 | 强 | 强 |
| 配置复杂度 | 零 | 需申请API Key | 需申请SecretId/Key |
日常简单文字识别用内置OCR够了。验证码或图片表格这种对准确率要求高的场景,建议配置百度或腾讯OCR。
实战:识别图片中的表格数据

完整操作流程:
# 步骤1:捕获目标元素(表格图片的区域)
# 在元素捕获模式下选中表格所在的div或img元素
# 步骤2:对指定元素截图
# 指令:对指定元素截图
# 保存路径:C:\temp\table_capture.png
# 步骤3:OCR识别
# 指令:OCR文字识别
# 识别引擎:腾讯OCR(推荐)
# 识别结果存入变量:ocr_result
# 步骤4:解析识别结果
# OCR返回的是纯文本,需要自己用Python解析行列结构
注意:OCR返回的是一段连续文字,不会自动识别行列结构。如果表格有清晰的分隔线,可以用Python按换行符和空格拆分。
temu店群自动化报活动案例
实战:验证码识别流程
验证码是登录流程最常见的自动化障碍。识别思路:
# 验证码识别流程
# 1. 截取验证码图片元素
# 2. OCR识别图片文字
# 3. 清理识别结果(去掉空格、标点)
code = ocr_result.strip().replace(' ', '')
# 4. 填入验证码输入框
# 5. 判断是否登录成功
# 成功 → 继续
# 失败 → 刷新验证码,重试(最多3次)
提高识别率的技巧:
- 截图前确保图片足够大(验证码元素太小会降低识别率)
- 截取后先做图片预处理:放大、转灰度、二值化(需要Python的Pillow库)
- 内置OCR识别4位数字验证码准确率约70%,6位混合字符约50%

图片预处理提升识别率
from PIL import Image, ImageEnhance
# 打开截图
img = Image.open(r'C:\temp\captcha.png')
# 放大2倍(文字太小OCR识别不准)
img = img.resize((img.width*2, img.height*2), Image.LANCZOS)
# 转灰度图
img = img.convert('L')
# 提高对比度
enhancer = ImageEnhance.Contrast(img)
img = enhancer.enhance(2.0)
# 保存处理后图片
img.save(r'C:\temp\captcha_processed.png')
预处理后再把captcha_processed.png传给OCR,识别率能提高15%~20%。
常见问题
| 问题 | 原因 | 解决 |
|---|---|---|
| 识别结果乱码 | 语言设置错误 | 确认OCR引擎选的是"中文" |
| 识别率低 | 图片不清晰 | 截图前放大页面(Ctrl+滚轮),或做图片预处理 |
| 返回空字符串 | 截图为空白区域 | 检查元素是否正确捕获,用"输出日志"打截图路径确认 |
![]() |
| 第三方OCR报错 | API配置问题 | 检查API Key/Secret是否过期,每日额度是否用完 |
| 内置OCR不支持 | 版本太旧 | 升级影刀RPA到最新版 |
#影刀RPA #RPA自动化 #OCR #截图识别 #验证码识别
作者:林焱
本文为《影刀RPA学习手册》系列文章之一,内容源于实操经验的整理与分享。
更多推荐



所有评论(0)