AI與科技第 90 期

加拉帕戈斯的反擊:韓文登上 GitHub 第一名的那一天

35 年累積的文件的專業知識,首次被兌換成全球通用的貨幣。

加拉帕戈斯的反擊:韓文登上 GitHub 第一名的那一天

訂閱者您好,我是奧斯華爾德。您是在 Google Discover 上看到我的電子報而進來的嗎?如果您訂閱的話,就能最快收到有趣且實用的電子報。🙇

前言

訂閱者您好。3 月 20 日,PDF 數據提取工具「OpenDataLoader PDF v2.0」登上了 GitHub 全站趨勢榜第一名。僅 21 日一天,Star 數就增加了 1,800 顆,總 Star 數突破了 7,000 顆。起初我根本不知道這個 OpenDataLoader 是誰開發的。後來看到使用條款和韓文頁面,心想「該不會是韓國開發者吧?」,再進一步查證後發現是韓文(Hancom)開發的,當下嚇了一跳。沒錯,就是那家韓文。

我本來可以對這條一則新聞略過不談。「一家韓國公司把一個開源工具做得不錯嘛。」但在我看來,這件事是韓國 IT 產業一個有意義的轉折點。

因為在此之前,韓文一直被視為韓國 IT「加拉帕戈斯化」的代表企業。HWP 格式、依賴政府與公共機構、海外營收微乎其微。韓文 Office 三十多年來幾乎只在國內銷售。在全球辦公軟體市場中,微軟 Office 佔據 95% 以上份額的同時,韓文 Office 守住國內約 30% 的市佔率,這就是韓文的生存之道。

而韓文的技術,首次在全球開發者社群中直接接受了驗證。而且沒有「因為是韓國企業就特別照顧」的加分,純粹以基準測試分數和 Star 數來說話。在 GitHub 上約 4 億個專案中登上趨勢榜第一名,難度堪比穿針引線。

今天我想聊聊這是怎麼做到的,以及這個模式對其他韓國企業和我們個人有什麼啟示。

📊 基準測試告訴我們什麼

先來看看數據。OpenDataLoader 團隊公開的自測基準測試中,閱讀順序、表格、標題提取等項目的每份文件平均得分如下:

  • OpenDataLoader (hybrid):0.907 ← 第一名
  • Docling:0.882
  • Nutrient:0.880
  • Marker:0.861
  • Unstructured (hi_res):0.841

這是自測基準測試,這一點必須老實說。不過韓文已經把測試數據和重現程式碼全部公開在 GitHub 上。想要驗證結果的話,任何人都可以直接跑一遍。

真正令人震驚的不是分數本身,而是速度。OpenDataLoader 每頁處理時間僅 0.015 秒。而準確度相近的 Marker 每頁大約需要 53.9 秒。相差約 1,000 倍,而且 Marker 必須使用 GPU,OpenDataLoader 僅靠 CPU 就能運行。

這為什麼重要?**假設企業實務中需要處理 100 萬頁 PDF,Marker 大約需要 624 天才能完成的工作,OpenDataLoader 大約 4 小時就能搞定。**從構建 AI 訓練數據管線的角度來看,這不是「快了一點」,而是「從不可能變成可能」的領域。連沒有高階 GPU 基礎設施的中小企業和獨立開發者也能跨入這個門檻。

**人們常說,企業持有的實務數據中 80~90% 是 PDF、文件等非結構化格式,但要讓 AI 使用這些數據,一直卡在數據清洗這個環節。**PDF 是一種為在螢幕上美觀呈現而優化的格式,不是為數據提取而設計的格式。一個表格從哪裡開始、到哪裡結束,多欄版面中應該按什麼順序閱讀,嵌在圖片裡的文字該怎麼提取——能準確且快速解決這些問題的工具,正是 RAG1 時代的核心基礎設施。

關鍵在於「混合引擎」。純文字用規則驅動(Rule-based)的方式即時處理,只有複雜的表格或多欄版面才呼叫 AI。這與其他工具對每一頁都跑重量級 AI 模型的設計截然不同。

🏛️ 韓文 35 年累積的真正資產

這裡就產生了一個問題:為什麼偏偏是韓文?

開源 PDF 解析器市場已經有 Docling(基於 IBM Research)、Marker、Unstructured(YC 出身)等強者。然而一家韓國 35 年歷史的文字處理軟體公司,在基準測試中超越了全球大型科技公司和矽谷新創開發的工具。

我認為在這個節點上,應該重新審視韓文 35 年來累積的東西到底是什麼。那就是韓文獨有的「文件本體論2。哪些文字是標題、哪些是正文,表格的行列應該怎麼拆解,多欄結構中閱讀順序該怎麼還原——韓文擁有 35 年來的模式積累。韓文技術應用開發室長朴東賢也在採訪中表示:「基於處理公共機構和多家企業文件數據的經驗,我們累積了獨一無二的技術能力。」

有意思的是,韓文在 2025 年 7 月與全球 PDF 技術專業公司 Duallab 簽訂了 MOU,進行聯合開發。這是韓文的文件處理專業知識加上 Duallab 的 PDF 專業技術的結合產物。必須指出的是,這並非韓文的單一技術。

但核心不變。韓文擁有「文件應該如何拆解」的自有整理體系,而這個體系成為了全球合作的基礎。Duallab 選擇韓文作為合作夥伴,原因正是那 35 年的分量。

從趨勢來看,韓文的全球化步伐在最近一年明顯加快。2025 年 12 月與騰訊雲建立戰略聯盟,2026 年 2 月向日本 Cyberlinks 首次海外交付人臉識別解決方案,4 月參加日本 IT 週。再加上這次 GitHub 趨勢榜第一名。模式非常明確。韓文不是帶著韓文 Office 成品出海,而是把底層的技術資產按領域拆分,以全球合作和開源的形式釋放出來。

🌏 脫離加拉帕戈斯的新公式

韓文並非沒有嘗試過全球化。2016 年韓文就宣布以韓文 Office Neo 進入中南美、中國、印度、中東、俄羅斯五個市場。結果大家都知道了。在微軟 Office 佔據全球 95% 以上份額的市場中,用成品辦公軟體去插旗,幾乎是不可能的任務。

但這次 OpenDataLoader 的打法完全不同。韓文沒有帶著自己的成品(Office)出海,而是把核心能力(文件拆解專業知識)剝離出來,重新包裝成全球開發者最需要的形式(開源 PDF 解析器)。而且把授權條款設為最自由的 Apache 2.03。他們特意從原有的 MPL 2.0 改過來的。

從 GTM(市場進入策略)的角度來看,這是一個非常重要的轉折。從「出口成品」的模式,轉向「將核心能力以標準基礎設施的形式免費發布 → 在其上以商業服務獲利」的模式。這與 NVIDIA 免費開放 CUDA 成為 GPU 計算標準、Stripe 以開發者友好的方式打造支付 API 並壟斷支付基礎設施的模式如出一轍。

事實上,韓文已經佈好了下一步棋。數據提取(OpenDataLoader)→ RAG 連接(Hancompedia)→ 工作輔助(Hancom Assistant),構成了「AI 編排器」產品線。免費開放的 OpenDataLoader 在全球铺开後,在其上運行的商業外掛和 Hancompedia 就能產生收益。第二季度還將新增 MCP4** 支援和商業外掛。**

不過,這是否能成功,目前還沒有保證。GitHub 趨勢榜第一名和實際的全球市場佔有是不同層面的問題。Docling 有 IBM Research 的強大後盾,LlamaIndex 有自己的解析器。第一輪打得漂亮不假,但遊戲才剛剛開始。

奧斯華爾德的視角

觀察 GTM 策略這麼久,韓國 B2B 軟體公司全球化失敗的模式幾乎都一樣:「把在韓國賣得好的成品翻譯成英文然後帶出去。」 韓文 Office 也是,之前無數次嘗試也是這個模式。

這次韓文的動作之所以有意義,在於它打破了這個公式。沒有帶著公司最大最重的資產(Office 成品)出海,而是把創造這個資產的底層核心能力剝離出來,轉換成全球開發者當下最需要的形式。

時機也恰到好處。2026 年是 AI 智能體正式開始呼叫外部工具來工作的時代。當智能體讀取 PDF、提取表格、用 RAG 生成答案時,誰佔據了第一顆扣子——PDF 解析器——的位置,將決定未來幾年企業工作流程的標準。韓文特意把授權從 MPL 改為 Apache 2.0 來降低進入門檻,就是瞄準了這個位置。在標準確立之前進入,然後成為標準本身——這就是 GTM 的正統打法。

我認為這個模式對韓國其他加拉帕戈斯化企業有很大的啟示。Naver 的搜尋專業知識、Kakao 的訊息基礎設施、Toss 的金融 UX、Coupang 的末端配送物流。這些如果以成品服務的形式出海,同樣不容易。但如果把底層的核心能力剝離出來,重新包裝成全球開發者能使用的標準基礎設施,故事就可能不一樣。

而且這對個人同樣適用。AI 時代我們最大的武器不是一般論,因為 LLM 已經掌握了網上的所有一般論。有價值的是只存在於我們腦中的特殊論,也就是自己的整理體系。就像韓文 35 年深耕文件這一個領域所打造的那種精密度一樣。

不過有一個前提條件。就是要把這個特殊論轉換成別人能使用的形式呈現出來。如果只留在腦中,那就不是資產,只是經驗。

✍️ 結語

今天的故事用三句話來總結:

  • 韓文 OpenDataLoader 登上 GitHub 第一名,是韓國加拉帕戈斯化企業首次在全球開發者面前直接接受驗證的案例。沒有加分,純粹以基準測試分數和 Star 數來說話。
  • 這之所以可能,是因為 35 年累積的文件處理「本體論」,而這次他們沒有以成品形式,而是以核心能力為單位剝離出來,以開源形式發布。從 GTM 的角度來看,這是一個新公式。
  • 這個模式對其他韓國企業,以及深耕一個領域的個人都適用。擁有自己整理體系的人,在這個時代擁有絕對優勢。 訂閱者,過去 10 年、20 年,您把最多的時間花在了什麼上面?無論那是什麼,裡面很可能沉澱著您自己的本體論。 下一個問題是:如何把它轉換成別人能使用的形式呈現出來。就像韓文的 35 年被兌換成了 GitHub 第一名一樣。

參考資料 & 延伸閱讀

核心來源

背景知識

  • 「2026 年 AI 和 RAG 工作流程的最佳 PDF 解析器」,Firecrawl Blog。:比較了 Docling、Marker、Unstructured 等競爭工具的優缺點和限制。有助於了解 OpenDataLoader 在市場中的定位。
  • Auer et al., 「Docling 技術報告」,arXiv:2408.09869,2024。:可以透過官方文件了解最強大的競爭工具 Docling 的設計哲學。與 OpenDataLoader 對比後,可以看到兩款工具的方法差異。
  • 韓文 OpenDataLoader GitHub 儲存庫。:可以直接下載使用的官方儲存庫。README 中的基準測試部分也可以看到與其他工具的比較數據。

作者 安光涉(Oswarld) 現任世宗大學兼任教授,INLEVEL9 策略顧問。職涯經歷、研究、著作與近期活動會持續更新在作者介紹。 最新動態 · 2026年7月:HEMA-2: A Consolidation-Aware Tri-Memory Architecture with Multi-Channel Scheduling for Lifelong Conversational AI

각주

  1. RAG(Retrieval-Augmented Generation,檢索增強生成):AI 在回答時不只使用自己腦中的知識(訓練所得),而是先檢索外部文件,參考其內容來作答。可以想像成考試時開放書本作答。因此,外部文件(特別是 PDF)的提取準確度據說決定了 RAG 回答品質的 90%。

  2. 本體論(Ontology):以自有的方式整理某個領域的概念和關係的知識結構。就像圖書館有自己獨特的書籍分類和整理體系一樣,韓文在「文件」這個領域,用 35 年的時間以自有的方式整理了「什麼是標題、什麼是正文、表格該怎麼拆解」。

  3. Apache 2.0 授權條款(Apache License 2.0):屬於開源授權中自由度最高的一類。商業使用、修改、再發布幾乎不受限制,也沒有義務將修改後的程式碼重新公開。企業導入時法律負擔最小,是大型科技公司和新創公司最偏愛的授權條款之一。

  4. MCP(Model Context Protocol,模型上下文協議):AI 智能體呼叫外部工具或數據時使用的標準通訊協議。就像筆記型電腦有 USB 接口,任何設備都可以插入使用一樣,MCP 就是為 AI 打造「通用接口」的標準。