OCR PDF:生成可搜索的 PDF
为最多 10 页、10 MiB 的扫描报告 PDF 添加可选中的简体中文、英语、西班牙语或俄语文本,方便搜索和引用其内容。 文件保留在浏览器中。
识别文件首次使用时约 26 MB,另加语言数据。
识别出的文本
这个工具有用吗?
试试示例
下载示例文件语言选择“简体中文”。下载 PDF 后搜索“发票”、148.50、“发货”和 2048。两页外观应与示例一致,文本可以选中并复制。
预期结果
每页按顺序作为图片识别。提供英语、俄语和混合识别。OCR 可能误读字母、数字、列和表格:请检查结果。 将根据渲染的页面图片和不可见的文本层创建新的 PDF。保留可见的页面大小和旋转;不保留表单、链接、书签、附件和数字签名。已有文本会重新识别;图片质量受渲染分辨率限制。
每页渲染最多 4 百万像素。加载和每个处理步骤最长 90 秒;整个任务在 10 分钟后停止。空白页会在文本中标出。处理失败或未识别到文本时,不提供下载。
受保护的 PDF?请先用密码解锁。
首次运行可能需要下载转换器文件,需要稍等片刻。如果失败,请检查网络连接,或尝试更小的文件。“取消”会停止正在进行的处理;之后可以重新选择文件再试。
实用指南
从扫描件中搜索并引用文字
- 选择扫描的报告,不超过 10 页、10 MiB。
- 选择简体中文、英语、西班牙语或俄语进行识别。
- 在结果中搜索一个标题,确认文字层可用。
试试这个示例
识别一份 4 页的英文扫描会议纪要;在结果 PDF 中搜索第 3 页的决议标题,应能找到它。
开始之前: 识别只涵盖简体中文、英语、西班牙语和俄语,限 10 页、10 MiB;低分辨率的扫描件可能出现识别错误。