跳到主要內容

圖片轉文字

把螢幕截圖、掃描頁面或文書照片轉成可編輯的文字,全程在你自己的裝置上辨識,支援英文、法文及另外四種語言。

拖放、貼上或選擇一張圖片

JPG · PNG · WebP · AVIF — 最大 50 MB

瀏覽器執行

設定

文字語言

最多選 3 種。每多一種語言,辨識速度就會稍微變慢。

第一次執行時會下載 OCR 引擎,以及每種語言 1–3 MB 的模型,之後就會快取起來。你的圖片不會傳送到任何地方。

所有處理都在這個分頁中執行,照片絕不會上傳到伺服器。

圖片轉文字 OCR 如何在瀏覽器中運作

這個工具執行的是開源 OCR 引擎 Tesseract,透過 tesseract.js 編譯成 WebAssembly。它在背景 Worker 中運作,辨識時頁面依然流暢。

先找文字行,再讀字元

Tesseract 會先找出圖片中的文字行和單字,再由 LSTM 神經網路使用所選語言的模型,把每一行當作一串字元來辨識。

語言模型很重要

選擇法文,引擎就能認得重音符號以及「déjà」、「l'œuvre」這類單字。可以混用多種語言,但每多一個模型就多花一些時間。

輸出為純文字

你會得到偵測到的換行,但不含版面:表格、分欄和粗體都會被攤平。複製或下載前,可以先在文字框中編輯結果。

OCR 辨識準確度:什麼有幫助、什麼會出錯

辨識品質取決於圖片的程度遠大於引擎。結果下方的信心度是 Tesseract 自己的估計,適合當作警訊,但不是保證。

來源圖片預期效果小技巧
螢幕截圖最理想:清晰、端正、高對比先裁掉工具列和圖示
平台式掃描300 dpi 時效果非常好用灰階掃描,不要用 1 位元黑白
手機拍攝的紙本頁面紙面平整、光線均勻時效果不錯正對著拍;避免陰影橫跨文字行
手寫字效果差 — 模型是以印刷字訓練的改用工整的大寫字母,或直接重打短筆記

解析度與對比

內文文字高度最好至少約 20 像素。太小、模糊或低對比的文字(灰底灰字、疊在照片上的字)容易出現 0/O、l/1 之類的誤認。

歪斜與彎曲

文字行應該保持水平。橫躺的掃描檔請先旋轉,書頁請盡量壓平;靠近書脊的明顯彎曲會干擾文字行偵測。

辨識效果不佳的內容

手寫字、花俏的裝飾字型、複雜背景上的文字,以及單一數字這類極短的片段。數字、姓名和金額請務必用肉眼核對。

私密 OCR:哪些資料留在你的裝置上

許多線上 OCR 網站會把你的圖片上傳到它們的伺服器。在這裡,辨識完全在你的瀏覽器分頁中進行。

會下載哪些東西

OCR 引擎來自我們自己的網站。語言模型則會從 jsDelivr 上官方的 tesseract.js 資料套件下載一次,並儲存在你的瀏覽器儲存空間中。

絕不會傳送的內容

你的圖片和擷取出的文字。發票、身分證或醫療文書都能在不離開裝置的情況下轉換。

瀏覽器工具的限制

一次處理一張圖片,最大 50 MB,長邊會縮小至 4000 px。多頁 PDF 請先將各頁匯出成圖片。

圖片轉文字:常見問題

如何免費把圖片轉成文字?

上傳圖片、選擇文字的語言,然後按下「擷取文字」。進度列跑完後,文字會顯示在右側:你可以編輯、複製,或登入後下載成 .txt 檔。

圖片轉文字工具準確嗎?

乾淨的螢幕截圖和掃描檔通常幾乎完美;照片則取決於光線、角度和清晰度。信心度會標示出較不可靠的結果,數字部分請務必再校對。

能辨識帶重音符號的法文嗎?

可以。選擇法文(法文版網站會預先選好),就能正確辨識重音符號、連字和撇號。雙語文書可以同時選擇法文和英文。

能辨識手寫字嗎?

不太可靠。模型是以印刷文字訓練的,所以草寫手寫字大多會變成亂碼。工整的大寫字母有時可以辨識。

為什麼第一次擷取比較慢?

引擎和語言模型(各 1–3 MB)只需下載一次。之後執行會重複使用快取檔案,一兩秒內就能開始。

我的圖片或文字會被儲存在任何地方嗎?

不會。OCR 在你的瀏覽器中執行,圖片和結果都只留在分頁裡,關閉後就會消失。我們從不會收到其中任何一項。

大家常搭配使用的其他分析工具。

所有分析工具