LINE 諮詢
文件批次處理 自動化 已交付

批次轉檔與欄位萃取

上千份 PDF 由人工逐份打字,改成批次萃取欄位、低信心值標記,只需抽樣校對。

開發期間
約 3 週
技術
Python · PDF 解析 · Pandas

客戶原本的做法

每個月有上千份格式相近的 PDF 需要把欄位打進系統,由工讀生逐份輸入。輸入錯誤要等到後段流程才會發現,屆時得整批重新核對。

交付前後對照

BEFORE · 原本的做法
PDF人工輸入.xlsx
ABCD 1 檔名欄位輸入者狀態 2 0812-112人工重打 3 0812-2?人工待核

上千份 PDF 由人工逐份打字進系統,打錯要重新核對整批。

AFTER · 交付後
batch-extract
1,200 份校對 3%

批次萃取欄位、低信心值標記,只需抽樣校對。

畫面為示意,已去識別化,不含客戶的真實資料。

怎麼做的

  1. 依版面規則萃取欄位,不是整份 OCR — 準確率高很多也快很多。
  2. 每個欄位給一個信心值,低於門檻的自動標記出來讓人優先看。
  3. 產出結果與原始 PDF 並排呈現,校對時不必兩邊切換。

結果

1,200 份的處理時間從 5 天降到 40 分鐘,需要人工校對的比例只剩 3%。

1,200 份 5 天 → 40 分人工校對 只剩 3%

你手上也有類似的狀況嗎?

先聊聊你現在怎麼做這件事,我再告訴你值不值得寫成系統。第一次諮詢不收費。

LINE 諮詢