拖放、貼上或選擇一張圖片
JPG · PNG · WebP · AVIF — 最大 50 MB
圖片轉文字 OCR 如何在瀏覽器中運作
這個工具執行的是開源 OCR 引擎 Tesseract,透過 tesseract.js 編譯成 WebAssembly。它在背景 Worker 中運作,辨識時頁面依然流暢。
先找文字行,再讀字元
Tesseract 會先找出圖片中的文字行和單字,再由 LSTM 神經網路使用所選語言的模型,把每一行當作一串字元來辨識。
語言模型很重要
選擇法文,引擎就能認得重音符號以及「déjà」、「l'œuvre」這類單字。可以混用多種語言,但每多一個模型就多花一些時間。
輸出為純文字
你會得到偵測到的換行,但不含版面:表格、分欄和粗體都會被攤平。複製或下載前,可以先在文字框中編輯結果。
OCR 辨識準確度:什麼有幫助、什麼會出錯
辨識品質取決於圖片的程度遠大於引擎。結果下方的信心度是 Tesseract 自己的估計,適合當作警訊,但不是保證。
| 來源圖片 | 預期效果 | 小技巧 |
|---|---|---|
| 螢幕截圖 | 最理想:清晰、端正、高對比 | 先裁掉工具列和圖示 |
| 平台式掃描 | 300 dpi 時效果非常好 | 用灰階掃描,不要用 1 位元黑白 |
| 手機拍攝的紙本頁面 | 紙面平整、光線均勻時效果不錯 | 正對著拍;避免陰影橫跨文字行 |
| 手寫字 | 效果差 — 模型是以印刷字訓練的 | 改用工整的大寫字母,或直接重打短筆記 |
解析度與對比
內文文字高度最好至少約 20 像素。太小、模糊或低對比的文字(灰底灰字、疊在照片上的字)容易出現 0/O、l/1 之類的誤認。
歪斜與彎曲
文字行應該保持水平。橫躺的掃描檔請先旋轉,書頁請盡量壓平;靠近書脊的明顯彎曲會干擾文字行偵測。
辨識效果不佳的內容
手寫字、花俏的裝飾字型、複雜背景上的文字,以及單一數字這類極短的片段。數字、姓名和金額請務必用肉眼核對。
私密 OCR:哪些資料留在你的裝置上
許多線上 OCR 網站會把你的圖片上傳到它們的伺服器。在這裡,辨識完全在你的瀏覽器分頁中進行。
會下載哪些東西
OCR 引擎來自我們自己的網站。語言模型則會從 jsDelivr 上官方的 tesseract.js 資料套件下載一次,並儲存在你的瀏覽器儲存空間中。
絕不會傳送的內容
你的圖片和擷取出的文字。發票、身分證或醫療文書都能在不離開裝置的情況下轉換。
瀏覽器工具的限制
一次處理一張圖片,最大 50 MB,長邊會縮小至 4000 px。多頁 PDF 請先將各頁匯出成圖片。
圖片轉文字:常見問題
如何免費把圖片轉成文字?
上傳圖片、選擇文字的語言,然後按下「擷取文字」。進度列跑完後,文字會顯示在右側:你可以編輯、複製,或登入後下載成 .txt 檔。
圖片轉文字工具準確嗎?
乾淨的螢幕截圖和掃描檔通常幾乎完美;照片則取決於光線、角度和清晰度。信心度會標示出較不可靠的結果,數字部分請務必再校對。
能辨識帶重音符號的法文嗎?
可以。選擇法文(法文版網站會預先選好),就能正確辨識重音符號、連字和撇號。雙語文書可以同時選擇法文和英文。
能辨識手寫字嗎?
不太可靠。模型是以印刷文字訓練的,所以草寫手寫字大多會變成亂碼。工整的大寫字母有時可以辨識。
為什麼第一次擷取比較慢?
引擎和語言模型(各 1–3 MB)只需下載一次。之後執行會重複使用快取檔案,一兩秒內就能開始。
我的圖片或文字會被儲存在任何地方嗎?
不會。OCR 在你的瀏覽器中執行,圖片和結果都只留在分頁裡,關閉後就會消失。我們從不會收到其中任何一項。
相關工具
大家常搭配使用的其他分析工具。
