OCR 訂單辨識 vs AI 訂單理解:差在哪、怎麼選?

早上八點半,做食品材料批發的李小姐打開電腦,桌上已經堆了三種東西:傳真機吐出來的兩張手寫叫貨單、LINE 裡昨晚到今早的十幾條訊息、還有一封 Email 附了張 PDF 訂購單。她要做的事只有一件——把這些變成 ERP 裡一筆一筆乾淨的訂單。
如果你 Google「OCR 訂單」或「AI 訂單辨識」,會看到一堆廠商說「自動辨識、免打字」。但真正動手做過的人都知道,「把圖片變成文字」和「把訂單變成一張正確的單」是兩件事。這中間差的那一層,就是 OCR 和 AI 訂單理解的分界。這篇文章把這條界線畫清楚,讓你知道自己的訂單到底需要哪一種。
先講清楚:OCR 能做什麼、做不到什麼
OCR(光學字元辨識)的工作很單純:把圖片裡的文字,變成電腦能編輯的字元。掃描一張印刷訂購單、拍一張收據,OCR 把上面的字讀出來,這件事它做了幾十年,很成熟。
它的強項是印刷體。在清晰的印刷文件上,主流 OCR 的辨識率可以到 99% 以上。如果你的訂單全部是同一份固定格式的印刷單,欄位位置都一樣,OCR 甚至規則式擷取又快又便宜,根本不必動用更複雜的技術。
問題出在「不乖」的訂單。手寫字跡、潦草的傳真、每家客戶長得都不一樣的格式,OCR 就開始吃力——這類文件從 1970 年代到現在,一直是傳統 OCR 的老難題。更關鍵的是,就算 OCR 把字一個不漏地讀出來,它也不知道這些字是什麼意思。它讀得出「王記 5 箱 老樣子 明天到」,但它不知道「5」是數量、「老樣子」指的是這家客戶固定叫的那三項、「明天到」是交期而不是品名。OCR 交給你的是一串文字,不是一張訂單。
關鍵差異:OCR「看見」文字,AI「理解」語意
這是整件事的核心。傳統 OCR 本質上是比對字元的樣式——它一個一個把圖片上的形狀對上最像的字,不理解意義、不理解上下文。
大型語言模型(LLM)做的事不一樣。它不是逐字辨認,而是把整份文件當成一個有脈絡的整體來理解,同時看懂版面、結構和語意。放到訂單上,這層理解就是實際的差別:
- 「這串 08-2233 是品號還是電話?」——看它出現在品名欄還是聯絡欄。
- 「客戶寫『老樣子』」——對照這家客戶的歷史訂單,推出他固定叫的是哪幾項。
- 「後面又補一句『那個 5 箱改 3 箱』」——知道要回頭把前面那筆蓋掉,而不是新增一筆。
這些判斷 OCR 做不到,因為它們需要的不是「看得更清楚」,而是「讀得懂上下文」。而讀懂上下文,正是 AI 訂單理解補在 OCR 之上的那一層。
五個真實訂單場景,兩種技術差在哪
抽象講不如看實際場景。以下是批發現場最常見的五種訂單來源,兩種技術各自的表現:
| 訂單來源 | 傳統 OCR | AI 訂單理解 |
|---|---|---|
| 固定格式印刷訂購單 | 表現好,欄位固定就準 | 表現好,但這種情境用 OCR 就夠 |
| 手寫傳真叫貨單 | 吃力,字跡一潦草就出錯 | 較佳,能結合品號表與客戶歷史推斷 |
| LINE 對話式下單 | 幾乎無用,沒有欄位可對 | 能從閒聊中抽出品項、數量、交期 |
| 語音訊息轉文字 | 不適用 | 先轉文字,再理解成結構化訂單 |
| Email 往返、追加修改 | 讀得出字,讀不出「哪筆改哪筆」 | 能追蹤修改,合併成最終版本 |
在手寫這一格,差距最值得說清楚。學界一份 2025 年的手寫辨識評測顯示,在現代日常手寫的資料集上,LLM 的字元錯誤率可低到 1.7% 左右,明顯優於專用手寫辨識模型的 9% 上下。要提醒的是,這個優勢集中在現代、日常的手寫;換成古文、多語言或極端潦草的文件,專用模型有時反而更穩,不能一概而論。但批發訂單上的手寫,多半就落在 LLM 擅長的那一區。
為什麼傳統 OCR 每種格式都要建模板,AI 不用
這是很多人導入 OCR 後才踩到的坑。傳統 OCR 方案通常依賴模板或固定規則:你得先告訴系統「品名在這一格、數量在那一格」。A 客戶的訂單格式設好了,換 B 客戶格式不一樣,就得再設一份模板。客戶一多、格式一雜,光維護模板就是一份長期的工。
LLM 的做法反過來。因為它靠理解而非固定位置,丟一百張長得都不一樣的訂單給它,不必為每一張另外設定也能抽出關鍵欄位。市面上已有結合生成式 AI 的辨識方案主打這一點:香港的 Datax 就明說系統「無需訓練」即可從半結構化與非結構化文件擷取資料,涵蓋發票、收據、訂單,「甚至是全新未見過的文件」,客戶不必再花時間設定樣板。
這件事對批發生意的意義很直接:你的客戶各有各的下單方式,有人傳真、有人 LINE、有人 Email 一張自己排版的表。用需要建模板的方案,等於要嘛叫客戶統一格式,要嘛自己扛下沒完沒了的模板維護。而 AI 訂單理解讓你可以不要求客戶改變任何下單習慣——他們照舊用最順手的方式下單,理解格式差異這件事,由 AI 在你這端吸收掉。
AI 的弱點也要講:幻覺風險與人工複核機制
把 AI 講得無懈可擊,是不老實的。LLM 有一個真實的弱點:幻覺。當它對某個欄位沒把握時,傾向生出一個「看起來合理」的答案,而不是承認自己不確定。訂單上這代表什麼?一個模糊的數量,它可能自己填一個值,而且填得煞有其事。
更麻煩的是,傳統 OCR 多半會附一個信心分數,告訴你哪些字它不太確定;而 LLM 本身不會直接給你一個可靠的信心值。所以負責任的做法不是盲信 AI,而是在外面補一套機制:
- 信心門檻:對每個欄位評估把握程度,低於門檻的訂單不自動放行。
- 異常標記:數量異常大、品號對不上品號表、交期不合理,主動標出來。
- 人工複核:把握不足的少數訂單,挑出來交給人確認再入帳。
換句話說,一個能用的 AI 接單系統,長得不是「AI 全自動、人完全不碰」,而是「大部分例行訂單自動完成,最模糊的少數由人把關」。這也是為什麼在文件自動化的實務裡,保留 human-in-the-loop(人在流程中)幾乎是必要的。誠實地把這道防線設好,AI 才敢真的接進你的 ERP。
選型清單:你的訂單來源,決定你需要哪一種
不用糾結誰比較強,回到一個問題就好:你的訂單,主要從哪裡來?
- 幾乎都是固定格式的印刷單、電子檔:傳統 OCR 或規則式擷取就夠,便宜、快、可控,不必為了時髦上 AI。
- 格式雜、但仍是印刷或電子文件:AI 訂單理解省下維護一堆模板的長期成本。
- 大量手寫、傳真、LINE 對話、口語追加:這是 OCR 的死角,也是 AI 訂單理解真正拉開差距的地方。
- 訂單來源混在一起、每天都不一樣:選能同時吃各種來源、又把不確定的挑出來給人複核的方案。
還有一點台灣的現實要放進來。鼎新旗下的內容平台就提到過,國外品牌的 AI-OCR 不一定解得了台灣企業的問題——對本地市場的理解與客製空間,往往才是能不能真的落地的關鍵。批發訂單裡的品號簡稱、行話、時價品項,這些在地脈絡,比辨識率的小數點更決定成敗。
回到李小姐的早上。她要的從來不是「把圖片變成文字」,而是「這三疊東西,早上八點半打開系統就是理好的訂單」。OCR 解得了其中乾淨的那一疊,另外兩疊——手寫的、LINE 的、改來改去的——得靠 AI 訂單理解那一層才接得住。搞清楚自己每天面對的是哪一種,選型這件事就不難了。
常見問題
OCR 訂單辨識和 AI 訂單理解,到底差在哪?
OCR 負責「看見」——把圖片上的文字變成可編輯的字元,準不準看字跡清不清楚。AI 訂單理解多做一層「讀懂」——判斷這串數字是品號還是數量、「老樣子」對應到哪幾項、追加訊息要蓋掉哪一筆。訂單如果格式固定、欄位整齊,OCR 就夠;訂單如果來自 LINE、傳真、口語追加,才需要 AI 補上理解那一層。
AI 會不會讀錯還硬掰?這樣我敢用嗎?
AI 確實有「幻覺」風險,沒把握時可能生出一個看起來合理的答案,這是真實存在的弱點。可用的做法是加一層信心分數與異常標記:AI 對每個欄位標注把握程度,低於門檻的訂單不自動放行,而是挑出來交給人確認。實務上是大部分例行訂單自動完成、少數模糊訂單人工複核,不是全部盲信 AI。
導入 AI 訂單辨識,客戶需要改變下單方式嗎?
不需要,這正是重點。客戶繼續用原本的 LINE、Email、電話、傳真下單,習慣一個字都不用改。改變的是你這端——AI 在訂單進 ERP 之前把各種格式讀成同一份結構化資料。要求客戶改用下單平台或表單,才是多數 B2B 數位化卡關的原因。