商業第 100 期

我**革命性地**捅穿了**核心**

北韓能否自行開發人工智慧模型?

我**革命性地**捅穿了**核心**

前言

各位訂閱者,我們發現了一份出人意料的資料。刊載於《金日成綜合大學學報・資訊科學》2026 年第 72 卷第 1 期的《智慧檢索系統中問題推薦模型的訓練資料建構方法》是一篇論文。有趣的不是正文,而是參考文獻——其中並列引用了 OpenAI 的「GPT-4 Technical Report」(2023)和 Google 研究團隊撰寫的「REALM」論文(2020)。

北韓研究 ChatGPT 的消息自 2025 年 2 月起已有零星報導。但這次是不同性質的發現。在正式學報中,以規範的引用格式,將美國和 Google 的 LLM 研究作為實際研究方法論的起點呈現出來。

先說結論,這不是「北韓如何取得這些資料」的問題,而是「AI 研究的護城河(moat)如今還剩在哪裡」的問題。對了,先明確說明一下,我們的主要敵人是北韓,而我本人是韓國陸軍上士服役滿期退伍、並已完成所有預備役任務的民防人員。

發生了什麼事

首先,已公開論文的作者是金振範、韓承柱兩位。問題設定出乎意料地平凡:當使用者在搜尋框輸入幾個詞語時,如何訓練一個能自動推薦完整朝鮮語問題句子的模型?就是我們每天在 Google 或 Naver 上看到的那個自動補全功能。

研究團隊提出的方法基於 Transformer 模型,並使用由 5 萬篇文本和 700 萬個詞語對構建的訓練資料來評估效能。學術上並無特別新的嘗試。但引言中的一句話格外醒目。

「目前,GPT-4、Claude-2 等大規模語言模型(LLM)已開發完成,在自然語言處理領域的大多數任務中展現出高效能,並被積極導入應用於檢索系統中。」

接著還精確地提及了 Google、Bing、百度搜尋引擎的變化。也就是說,北韓研究團隊明確認識到全球 LLM 格局,在引用正式資料的同時,於學報層面公開了他們正在將其應用於自身系統的事實。

這裡有兩點事實需要指出。

第一,兩篇參考文獻都是任何人都可以取得的公開資料。GPT-4 Technical Report 已在 arXiv 上公開(arXiv:2303.08774)。REALM 論文是發表於 ICML 2020 的同行評審論文(arXiv:2002.08909)。

第二,時差約為 2 年。考慮到該論文於 2025 年 11 月投稿,而 GPT-4 Technical Report 於 2023 年 3 月公開,差距大約是 1 年 8 個月。與北韓自 1990 年代末以來進行 AI 研究時的過去時差(最短 5 年,最長 10 年以上)相比,縮小的幅度相當大。

為什麼 OpenAI 的論文在平壤也能被閱讀

在這一節點上,有必要釐清一個普遍認知。有一種認知認為「OpenAI 從 GPT-4 開始轉向非公開路線」,這只對了一半。

GPT-4 Technical Report 確實刻意隱去了很多內容。模型規模、訓練所使用的算力、資料集組成、訓練方法論——這些全部未予公開。審查「OpenAI: GPT-4」報告的學術評審(2024)也評價道:「這份報告與其說是嚴格的技術評估,不如說是對當前效能的展示。」

但公開的內容也不亞於隱去的部分。模型的能力評估結果、安全卡(System Card)、後訓練對齊(post-training alignment)方法,以及最重要的——能窺見研究方向的概念性骨架,都完整保留著。從追趕者的角度看,僅憑這些資訊就足以繪製出「該朝哪個方向嘗試什麼」的藍圖。

REALM 論文更加明確。這篇 2020 年發表於 ICML 主會議的論文,首次正式化了檢索增強語言模型(Retrieval-Augmented Language Model,即我們今天所稱的 RAG1​概念的學術原型)的核心想法。程式碼也在 GitHub 上公開。

這不是 OpenAI 或 Google 的疏忽。公開出版是學術界合法性的代價。不發表就得不到學術界的認可,人才不會聚集,後續合作也會變得困難。但同時,一旦發表,任何人都能閱讀。這個取捨自學術界誕生以來從未改變過。

問題在於,這個取捨進入 LLM 時代後變得非對稱了。過去的工程研究,即使讀了論文,要走到實際實現仍需大量後續工作。但 LLM 領域的架構已相對標準化(Transformer + 預訓練 + 對齊),論文中的方向性本身就足以成為追趕的起點。

那麼真正的護城河在哪裡

這裡分析師的觀點產生了分歧。一方認為「這是結構性威脅,美中 AI 差距實際上正在縮小」。另一方則強調「論文是公開的,但計算基礎設施不是」。

我認為後者才是更準確的診斷。原因就在北韓自身的案例中體現得很清楚。

同樣的北韓 AI 研究分析顯示,平壤透過替代渠道部分取得了消費級 GPU(如 GeForce RTX 2070 級別),但對 H1002​等資料中心級 GPU 和大規模訓練基礎設施的獲取則被阻斷。結果北韓 AI 研究的重心集中在輕量模型、效率優化、狹域應用(語音識別「Ryongnamsan」、圍棋「Eunbyul」、人臉識別等)上。 38 North 的分析也一致:「制裁限制了先進晶片和訓練資料集的獲取,這制約了相對於領先經濟體的 AI 部署規模和效能。」

可以這樣總結:

概念性護城河已幾乎消失。關於誰在朝哪個方向研究的資訊,在 2 年內就能抵達受制裁國家的學術期刊。

計算基礎設施護城河依然堅固。訓練前沿級模型需要數萬張 H100,而這個門檻被牢牢鎖在美國政府的出口管制框架之中。

資料與對齊護城河是部分的。用於指令微調、RLHF3​、安全性對齊的高品質人類回饋資料仍是企業資產,但隨著合成資料技術的進步,這個差距也在縮小。

部署護城河正在浮現。使用者數量、分佈、即時回饋迴路——這些是論文無法載入的領域。ChatGPT 真正的護城河很可能不是 GPT-4 的架構,而是在那些使用者資料之上每天運轉的對齊循環。

但北韓真的能做出 LLM 嗎

這裡需要再深入一步。學報引用了 GPT-4 論文,就代表平壤馬上就能擁有自己的 LLM 嗎?有兩道現實的障礙。

第一,電力。 引用 38 North 的《外交學者》2026 年分析直言不諱:「北韓的電力產出不足以驅動資料中心(not enough to power the data centers)。」 平壤的停電已是日常,貧困地區的居民一年只能獲得一次國家供電。在一個 AI 資料中心就要消耗數萬戶家庭電力的時代,這不只是基礎設施問題,而是物理天花板。事實上,2026 年第九次黨代會將 AI 和新能源技術一併納入五年計劃,並明確指出「解決電力短缺是決定五年計劃成敗的關鍵因素」。換句話說,北韓領導層也明白,在 AI 之前,電力才是根本問題。

第二,計算基礎設施。 前面提到的 H100 門檻同樣適用。幾十到幾百張消費級 GPU 根本無法訓練 700 億參數以上的 LLM,推理(inference)也很吃緊。也就是說,自行開發前沿模型是超出現實的選項。

那平壤在學報中引用 GPT-4 的真正原因是什麼?在我看來,不是自行開發,而是「確保應用途徑」。 而這條途徑的最有力候選有一個,就是中國開源 LLM

阿里巴巴的 Qwen 2.5 明確標示支援 29 種語言的多語言能力,並將韓語納入正式評估對象(KMMLU 基準測試)。 DeepSeek 系列也進行了多語言資料訓練。中國有約 200 萬朝鮮族,他們使用的朝鮮語語料在網路上有相當大的存量。也就是說,中國開源模型在發布時已經帶有能處理一定程度朝鮮語的權重(weights)。(實際上,查看中國語言模型的模型卡會發現,他們將朝鮮語標註為朝鮮族少數語言,並持續標明正在進行訓練——出於名義上的考量……)

這意味著什麼很明確。**北韓不需要自行訓練模型。只要取得 Qwen 或 DeepSeek 的權重,在平壤進行微調4​就足以達成學報中「朝鮮語自動補全搜尋引擎」的目標。微調相對於預訓練,所需的計算基礎設施要少幾十到幾百倍,幾十張消費級 GPU 就能進入可行的範圍。

因此,金日成大學報引用 GPT-4 不是自行開發的宣言,而更像是「我們理解全球 LLM 格局,知道該在哪些開源模型上建構什麼」的信號。威脅的性質本身就不同。

OZ 的視角

看到這件事,我想到一個 GTM 模式:「當技術護城河崩塌時,產業會回歸到運營護城河」。這是我在制定多個市場進入策略時經常觀察到的趨勢。半導體 IP 標準化後,TSMC 的運營能力成了核心;雲端基礎設施均衡化後,AWS 的銷售、客戶管理和發布節奏成了差異化要點。

AI 也在走同樣的路。曾經有人說「OpenAI 領先 5 年」。現在那 5 年在哪裡?從模型能力差距來看已縮小到 6~12 個月,連平壤都進入 2 年時差的範圍了。而且,平壤的選項不是自行開發,而是在中國開源權重上進行微調,這表明遊戲規則已經改變了。

在我看來,OpenAI 真正的資產已經轉移到了「運營」上。每天數億次對話中產生的使用者回饋、將這些資料重新投入對齊的管線、快速吸收 B2B 客戶需求的銷售與交付組織……這些是論文和權重下載都無法複製的。

從這個角度看,金日成大學報事件與其說是威脅,不如說是一個信號。AI 產業正在從「更聰明的模型」的遊戲轉向「更快、更廣、更精準地部署」的遊戲。老實說,從軟體產業角度來看並不構成威脅。以前北韓做過一個叫「紅星」的作業系統,是 Linux 和 Macintosh 的混合體……就用下面的影片代替吧。

而且運營護城河對靠近市場和資料的一方更有利,因此韓國企業在韓語領域有機會創造出意想不到的位置。

結語

用三句話總結今天探討的內容。

  • 《金日成綜合大學學報》2026 年第 1 期引用了 GPT-4 Technical Report 和 REALM 論文。追趕時差約為 2 年。
  • 但受電力和計算基礎設施的物理限制,北韓自行開發 LLM 的可能性很低。更現實的場景是在中國開源模型(Qwen、DeepSeek)權重上進行微調。
  • 這個趨勢真正傳遞的信號是另一回事。AI 的護城河正在從模型本身轉向算力、資料,以及最重要的——部署和運營。

另外,上述報導的 NK 經濟即將迎來創刊 8 週年並舉辦研討會,有興趣的朋友可以參加。我因行程問題無法參加,但據說北韓專家將以「AI 時代,北韓數位轉型現狀」為主題,介紹北韓到底如何接受和使用 IT 技術。

NK 經濟創刊 8 週年研討會報名2026 年 6 月 17 日下午,NK 經濟將舉辦創刊 8 週年研討會。希望出席者請依以下表單報名。forms.gle

參考資料 & 延伸閱讀

核心來源

背景知識

作者 安光涉(Oswarld) 現任世宗大學兼任教授,INLEVEL9 策略顧問。職涯經歷、研究、著作與近期活動會持續更新在作者介紹。 最新動態 · 2026年7月:HEMA-2: A Consolidation-Aware Tri-Memory Architecture with Multi-Channel Scheduling for Lifelong Conversational AI

각주

  1. RAG(檢索增強生成):AI 在回答時,先從外部文件資料庫中檢索相關資料,再參考檢索結果來生成答案。比模型僅憑自身訓練知識回答更準確,也能追溯來源。

  2. H100:Nvidia 製造的資料中心級 AI 加速器。是訓練 GPT-4 等大規模模型時幾乎必備的晶片,也是美國對中國、俄羅斯、北韓等實施出口管制的核心品項之一。

  3. RLHF(基於人類回饋的強化學習):以人類評估者標註的「這個回答更好/更差」回饋作為獎勵信號,透過強化學習對 AI 模型進行對齊的技術。是 ChatGPT 能以我們習慣的方式回答的核心關鍵。

  4. 微調(Fine-tuning):在已預訓練的大規模模型上,使用針對特定領域、語言或任務的資料進行額外訓練,使模型專業化的過程。相對於預訓練,所需的計算基礎設施少幾十到幾百倍,是無法自行預訓練的組織獲取 LLM 能力時常用的路徑。