使用光学字符识别(OCR)让扫描版 PDF 变得可搜索、可复制。上传扫描文档后,我们的服务器会运行 Tesseract 提取文本并将其嵌入 PDF,让原本只是图片的文件也能搜索、选中和复制内容。支持英语及多种其他语言。
OCR(光学字符识别)可将文字图像转换为真正可选中的文本。扫描版 PDF 本质上只是图片,OCR 能让它们变得可搜索,并允许您从中复制文本。
Tesseract 支持数十种语言。转换前请选择文档语言,以获得最准确的结果。
会。OCR 处理需要在我们的服务器上运行 Tesseract。您下载结果后,文件会被自动删除。
处理通常需要 30 到 60 秒,具体取决于页数和文本密度。多页文档所需时间更长。
会。输出的 PDF 保留原始视觉版式,识别出的文本会作为不可见图层嵌入其后,使文档可搜索的同时不改变外观。
通过精准的文字识别,让扫描版 PDF 变得可搜索。
或将文件拖放到此处支持:PDF