PDF OCR 全文檢索系統

上傳掃描 PDF

將 PDF 檔案拖曳到此處,或點擊選擇檔案

文件清單

檔名 期別 上傳者 上傳時間 狀態 頁數 OCR 引擎 操作

重複文件偵測

上傳時系統會自動比對檔案內容(而非檔名),完全相同的檔案不會重複儲存與辨識。這裡可以查一次現有資料庫裡是否已經存在內容重複的文件。

重新辨識舊結果

如果 OCR 引擎換過(例如從 Tesseract 換成 PaddleOCR),這裡可以把用舊引擎辨識過的文件,重新排入佇列用目前引擎再跑一次。

重試失敗文件

把狀態是「失敗」的文件重新排入佇列再辨識一次(例如 GPU 環境暫時性錯誤導致的失敗)。

備份與還原

匯出會把所有文件紀錄、每頁 OCR 文字連同原始 PDF 打包成一個 zip 檔下載;匯入則是還原這個 zip 檔(內容重複的檔案會自動略過,不會產生重複資料)。

匯出整個資料庫(zip)

危險區域

清除資料庫會刪除所有文件紀錄、OCR 文字內容,以及已上傳的 PDF 原始檔案,且無法復原