Chandra OCR入门必看:chandra-ocr CLI常用命令速查表(含PDF/图片/目录)

1. 快速了解Chandra OCR

Chandra是Datalab.to在2025年10月开源的"布局感知"OCR模型,它能帮你把图片和PDF文件一键转换成保留完整排版信息的Markdown、HTML或JSON格式。这个工具特别擅长处理复杂文档,包括表格、数学公式、手写文字、表单复选框等各种元素。

简单来说,Chandra就像个超级文档转换器:你给它一张图片或PDF,它还你一个结构清晰的Markdown文档,而且排版样式都给你保留得好好的。

为什么选择Chandra?

  • 只需要4GB显存就能运行,对硬件要求很友好
  • 在权威评测中拿到83.1的高分,比GPT-4o和Gemini Flash 2表现更好
  • 支持40多种语言,中文、英文、日文、韩文都处理得很好
  • 商业使用友好,开源协议很宽松

2. 环境准备与安装

2.1 系统要求

在开始使用之前,确保你的系统满足以下要求:

  • 操作系统:Linux、Windows或macOS都可以
  • Python版本:Python 3.8或更高版本
  • 显存要求:至少4GB GPU显存(推荐8GB以上获得更好体验)
  • 内存:建议16GB以上系统内存

2.2 一键安装

安装Chandra OCR非常简单,只需要一条命令:

pip install chandra-ocr

这个命令会自动安装所有依赖包,包括vLLM后端。安装完成后,你就可以使用chandra-ocr命令行工具了。

2.3 验证安装

安装完成后,可以通过以下命令检查是否安装成功:

chandra-ocr --version

如果显示版本信息,说明安装成功。你也可以查看帮助信息:

chandra-ocr --help

3. CLI常用命令速查表

3.1 基础文件处理

单个图片转Markdown

chandra-ocr image.jpg -o output.md

单个PDF转Markdown

chandra-ocr document.pdf -o output.md

指定输出格式(支持md/html/json)

chandra-ocr image.jpg --format html -o output.html

3.2 批量处理命令

处理整个目录下的图片

chandra-ocr ./images/ -o ./output/

处理目录下的特定类型文件

chandra-ocr ./documents/ --extensions pdf,jpg,png -o ./converted/

递归处理子目录

chandra-ocr ./my_docs/ --recursive -o ./results/

3.3 输出选项控制

同时输出多种格式

chandra-ocr doc.pdf --format md,html,json -o result

保留原始布局信息

chandra-ocr image.jpg --preserve-layout -o output.md

指定语言(提升识别精度)

chandra-ocr doc.pdf --language zh -o output.md

3.4 高级功能选项

处理表格数据

chandra-ocr table.png --enhance-tables -o table.md

识别数学公式

chandra-ocr math_doc.pdf --detect-math -o math_output.md

处理手写内容

chandra-ocr handwritten.jpg --handwriting-mode -o text.md

4. 实际使用示例

4.1 日常办公文档转换

假设你有一堆扫描的合同文件需要数字化,可以这样处理:

# 批量处理合同文件夹
chandra-ocr ./contracts/ --extensions pdf --format md -o ./digital_contracts/

# 处理后的文件会自动保持原有文件名,只是扩展名变为.md

4.2 学术论文处理

对于包含公式和表格的学术论文:

# 处理单篇论文,同时保留公式和表格
chandra-ocr paper.pdf --detect-math --enhance-tables --format md,html -o paper_converted

4.3 多语言文档处理

处理包含中文和英文的混合文档:

# 指定中文优先识别
chandra-ocr mixed_doc.pdf --language zh --format md -o result.md

5. 实用技巧与问题解决

5.1 提升识别准确率

调整识别置信度

# 提高识别阈值,减少错误
chandra-ocr doc.pdf --confidence 0.8 -o output.md

使用GPU加速

# 指定使用GPU设备
chandra-ocr doc.pdf --device cuda:0 -o output.md

5.2 处理大文件

分页处理大PDF

# 只处理前10页
chandra-ocr large.pdf --pages 1-10 -o first_10_pages.md

# 处理指定页码
chandra-ocr large.pdf --pages 1,3,5-10 -o selected_pages.md

5.3 常见问题解决

内存不足问题 如果处理大文件时出现内存不足,可以尝试:

# 降低处理批量大小
chandra-ocr large.pdf --batch-size 2 -o output.md

# 使用CPU模式(速度较慢但省显存)
chandra-ocr doc.pdf --device cpu -o output.md

识别结果不理想 如果某些内容识别不准,可以:

# 尝试不同的语言设置
chandra-ocr doc.jpg --language auto -o output.md

# 调整图像预处理参数
chandra-ocr doc.jpg --preprocess enhance -o output.md

6. 输出结果的使用

6.1 Markdown输出示例

Chandra生成的Markdown会保留原始布局:

# 文档标题

这是正文段落,保留了**加粗**和*斜体*样式。

## 二级标题

表格也被完美转换:

| 姓名 | 年龄 | 职业 |
|------|------|------|
| 张三 | 28   | 工程师 |
| 李四 | 32   | 设计师 |

数学公式:$E = mc^2$

6.2 HTML输出特点

HTML输出包含完整的CSS样式,可以直接在网页中使用:

<div class="paragraph">
    <p>这是一个段落文本</p>
</div>
<div class="table">
    <table>
        <!-- 表格内容 -->
    </table>
</div>

6.3 JSON结构化数据

JSON输出包含详细的结构信息和坐标数据,适合程序处理:

{
  "pages": [
    {
      "blocks": [
        {
          "type": "heading",
          "text": "文档标题",
          "bbox": [100, 50, 400, 80]
        }
      ]
    }
  ]
}

7. 总结

Chandra OCR是一个功能强大且易于使用的文档转换工具,通过本文介绍的CLI命令,你可以快速上手并处理各种文档转换任务。

关键要点回顾:

  • 安装简单:pip install chandra-ocr 即可使用
  • 支持多种格式:图片、PDF都能处理,输出md/html/json
  • 批量处理:支持整个目录的批量转换
  • 保留布局:表格、公式、排版样式都完整保留
  • 多语言支持:中英日韩等40多种语言

下一步建议:

  • 从简单的单个文件开始尝试,熟悉基本命令
  • 探索不同的输出格式,找到最适合你需求的格式
  • 尝试批量处理功能,提高工作效率
  • 根据需要调整识别参数,获得最佳识别效果

记住,遇到问题时可以使用 chandra-ocr --help 查看详细的帮助信息,或者调整识别参数来优化结果。


获取更多AI镜像

想探索更多AI镜像和应用场景?访问 CSDN星图镜像广场,提供丰富的预置镜像,覆盖大模型推理、图像生成、视频生成、模型微调等多个领域,支持一键部署。

更多推荐