掃描的 PDF 複製不了文字?整份轉成可搜尋文字的做法
掃描或拍照產生的 PDF 看得到字卻選不起來、搜尋不到,因為那其實是一張張圖片。教你把整份掃描 PDF 逐頁辨識成文字,含檔案大小上限、辨識品質的關鍵,以及哪些情況不該用 OCR。
本文介紹的工具:PDF 文字辨識
拿到一份 PDF,畫面上明明有字,卻選不起來、也搜尋不到——這代表那份 PDF 裡裝的是圖片,不是文字。
常見來源就那幾種:影印機掃描的合約、手機拍照轉存的講義、對方用截圖組成的報告、年代久遠的公文檔案。
要讓它變成可以複製、可以搜尋的文字,需要的是 OCR(光學文字辨識)。
先判斷你的 PDF 是哪一種
用最簡單的方法:打開 PDF,試著用滑鼠選取一段文字。
- 選得起來 → 這是文字型 PDF,不需要 OCR。直接複製即可,或用 PDF 轉 Word 轉成可編輯檔
- 選不起來、整頁像一張圖 → 需要 OCR,繼續往下看
操作步驟
前往 PDF 文字辨識,上傳檔案即可,最大支援 50MB。
工具會逐頁處理:把每一頁轉成影像、送去辨識、再把結果依頁次組合起來,輸出時會用「--- 第 N 頁 ---」分隔,方便你對照原始頁碼。
處理過程有幾個設計值得知道:
- 空白頁會自動跳過:掃描件常有整頁空白(雙面掃描的背面),偵測到就直接標記略過,不浪費時間
- 某頁辨識失敗不會中斷整份:那一頁會標示辨識失敗,其他頁照常輸出
- 頁數越多花的時間越久:一頁一頁做,五十頁的合約要有等待的心理準備
辨識品質取決於原始檔
同一套辨識引擎,餵不同品質的檔案,結果天差地遠:
| 原始檔狀況 | 結果 |
|---|---|
| 掃描器 300dpi 以上、擺正 | 幾乎全對 |
| 手機拍攝、光線均勻、正對 | 大致可用,需校對 |
| 手機拍攝、傾斜或有陰影 | 錯字明顯增加 |
| 傳真件、多次影印的副本 | 常常慘不忍睹 |
| 有浮水印蓋住文字 | 被蓋住的部分讀不出來 |
能重新掃描就重新掃描,這比事後校對省力得多。真的只有一份模糊的舊檔,就要有「辨識完必須逐字校對」的準備。
這些情況別依賴 OCR
- 需要法律效力的文件:辨識結果不能當正本,只能當工作副本
- 精密的表格與數字報表:欄位對齊常會跑掉,用 表格辨識 專門處理表格會好一些
- 複雜排版的雜誌、報紙:多欄、繞圖排版的閱讀順序常會錯亂
- 手寫內容:改用 手寫辨識,那是為手寫調過的
常見問題
檔案會被保存嗎?
辨識需要把每頁影像送到 AI 服務處理,但檔案與影像都不會被儲存,處理完就結束。內容機敏的文件請自行評估。
超過 50MB 怎麼辦?
先用 PDF 壓縮 縮小,或用 PDF 分割 拆成幾份分批處理。掃描件的體積多半來自影像,壓縮後通常降很多。
辨識完可以直接存成 Word 嗎?
工具輸出的是純文字,複製後貼進 Word 即可。排版不會保留——OCR 還原的是文字內容,不是版面。
只需要其中幾頁怎麼辦?
先用 PDF 頁面提取 取出需要的頁面再辨識,省時間也省等待。
一次要處理很多份檔案?
單張圖片的大量辨識可用 批量 OCR;PDF 目前建議一份一份來。