我**革命性地**捅穿了**核心**
北韓能否自行開發人工智慧模型?

前言
各位訂閱者,我們發現了一份出人意料的資料。刊載於《金日成綜合大學學報・資訊科學》2026 年第 72 卷第 1 期的《智慧檢索系統中問題推薦模型的訓練資料建構方法》是一篇論文。有趣的不是正文,而是參考文獻——其中並列引用了 OpenAI 的「GPT-4 Technical Report」(2023)和 Google 研究團隊撰寫的「REALM」論文(2020)。

北韓研究 ChatGPT 的消息自 2025 年 2 月起已有零星報導。但這次是不同性質的發現。在正式學報中,以規範的引用格式,將美國和 Google 的 LLM 研究作為實際研究方法論的起點呈現出來。
先說結論,這不是「北韓如何取得這些資料」的問題,而是「AI 研究的護城河(moat)如今還剩在哪裡」的問題。對了,先明確說明一下,我們的主要敵人是北韓,而我本人是韓國陸軍上士服役滿期退伍、並已完成所有預備役任務的民防人員。
發生了什麼事
首先,已公開論文的作者是金振範、韓承柱兩位。問題設定出乎意料地平凡:當使用者在搜尋框輸入幾個詞語時,如何訓練一個能自動推薦完整朝鮮語問題句子的模型?就是我們每天在 Google 或 Naver 上看到的那個自動補全功能。
研究團隊提出的方法基於 Transformer 模型,並使用由 5 萬篇文本和 700 萬個詞語對構建的訓練資料來評估效能。學術上並無特別新的嘗試。但引言中的一句話格外醒目。
「目前,GPT-4、Claude-2 等大規模語言模型(LLM)已開發完成,在自然語言處理領域的大多數任務中展現出高效能,並被積極導入應用於檢索系統中。」
接著還精確地提及了 Google、Bing、百度搜尋引擎的變化。也就是說,北韓研究團隊明確認識到全球 LLM 格局,在引用正式資料的同時,於學報層面公開了他們正在將其應用於自身系統的事實。
這裡有兩點事實需要指出。
第一,兩篇參考文獻都是任何人都可以取得的公開資料。GPT-4 Technical Report 已在 arXiv 上公開(arXiv:2303.08774)。REALM 論文是發表於 ICML 2020 的同行評審論文(arXiv:2002.08909)。
第二,時差約為 2 年。考慮到該論文於 2025 年 11 月投稿,而 GPT-4 Technical Report 於 2023 年 3 月公開,差距大約是 1 年 8 個月。與北韓自 1990 年代末以來進行 AI 研究時的過去時差(最短 5 年,最長 10 年以上)相比,縮小的幅度相當大。
為什麼 OpenAI 的論文在平壤也能被閱讀
在這一節點上,有必要釐清一個普遍認知。有一種認知認為「OpenAI 從 GPT-4 開始轉向非公開路線」,這只對了一半。
GPT-4 Technical Report 確實刻意隱去了很多內容。模型規模、訓練所使用的算力、資料集組成、訓練方法論——這些全部未予公開。審查「OpenAI: GPT-4」報告的學術評審(2024)也評價道:「這份報告與其說是嚴格的技術評估,不如說是對當前效能的展示。」
但公開的內容也不亞於隱去的部分。模型的能力評估結果、安全卡(System Card)、後訓練對齊(post-training alignment)方法,以及最重要的——能窺見研究方向的概念性骨架,都完整保留著。從追趕者的角度看,僅憑這些資訊就足以繪製出「該朝哪個方向嘗試什麼」的藍圖。
REALM 論文更加明確。這篇 2020 年發表於 ICML 主會議的論文,首次正式化了檢索增強語言模型(Retrieval-Augmented Language Model,即我們今天所稱的 RAG1概念的學術原型)的核心想法。程式碼也在 GitHub 上公開。
這不是 OpenAI 或 Google 的疏忽。公開出版是學術界合法性的代價。不發表就得不到學術界的認可,人才不會聚集,後續合作也會變得困難。但同時,一旦發表,任何人都能閱讀。這個取捨自學術界誕生以來從未改變過。
問題在於,這個取捨進入 LLM 時代後變得非對稱了。過去的工程研究,即使讀了論文,要走到實際實現仍需大量後續工作。但 LLM 領域的架構已相對標準化(Transformer + 預訓練 + 對齊),論文中的方向性本身就足以成為追趕的起點。
那麼真正的護城河在哪裡
這裡分析師的觀點產生了分歧。一方認為「這是結構性威脅,美中 AI 差距實際上正在縮小」。另一方則強調「論文是公開的,但計算基礎設施不是」。
我認為後者才是更準確的診斷。原因就在北韓自身的案例中體現得很清楚。
同樣的北韓 AI 研究分析顯示,平壤透過替代渠道部分取得了消費級 GPU(如 GeForce RTX 2070 級別),但對 H1002等資料中心級 GPU 和大規模訓練基礎設施的獲取則被阻斷。結果北韓 AI 研究的重心集中在輕量模型、效率優化、狹域應用(語音識別「Ryongnamsan」、圍棋「Eunbyul」、人臉識別等)上。 38 North 的分析也一致:「制裁限制了先進晶片和訓練資料集的獲取,這制約了相對於領先經濟體的 AI 部署規模和效能。」

可以這樣總結:
概念性護城河已幾乎消失。關於誰在朝哪個方向研究的資訊,在 2 年內就能抵達受制裁國家的學術期刊。
計算基礎設施護城河依然堅固。訓練前沿級模型需要數萬張 H100,而這個門檻被牢牢鎖在美國政府的出口管制框架之中。
資料與對齊護城河是部分的。用於指令微調、RLHF3、安全性對齊的高品質人類回饋資料仍是企業資產,但隨著合成資料技術的進步,這個差距也在縮小。
部署護城河正在浮現。使用者數量、分佈、即時回饋迴路——這些是論文無法載入的領域。ChatGPT 真正的護城河很可能不是 GPT-4 的架構,而是在那些使用者資料之上每天運轉的對齊循環。
但北韓真的能做出 LLM 嗎
這裡需要再深入一步。學報引用了 GPT-4 論文,就代表平壤馬上就能擁有自己的 LLM 嗎?有兩道現實的障礙。
第一,電力。 引用 38 North 的《外交學者》2026 年分析直言不諱:「北韓的電力產出不足以驅動資料中心(not enough to power the data centers)。」 平壤的停電已是日常,貧困地區的居民一年只能獲得一次國家供電。在一個 AI 資料中心就要消耗數萬戶家庭電力的時代,這不只是基礎設施問題,而是物理天花板。事實上,2026 年第九次黨代會將 AI 和新能源技術一併納入五年計劃,並明確指出「解決電力短缺是決定五年計劃成敗的關鍵因素」。換句話說,北韓領導層也明白,在 AI 之前,電力才是根本問題。
第二,計算基礎設施。 前面提到的 H100 門檻同樣適用。幾十到幾百張消費級 GPU 根本無法訓練 700 億參數以上的 LLM,推理(inference)也很吃緊。也就是說,自行開發前沿模型是超出現實的選項。
那平壤在學報中引用 GPT-4 的真正原因是什麼?在我看來,不是自行開發,而是「確保應用途徑」。 而這條途徑的最有力候選有一個,就是中國開源 LLM。

阿里巴巴的 Qwen 2.5 明確標示支援 29 種語言的多語言能力,並將韓語納入正式評估對象(KMMLU 基準測試)。 DeepSeek 系列也進行了多語言資料訓練。中國有約 200 萬朝鮮族,他們使用的朝鮮語語料在網路上有相當大的存量。也就是說,中國開源模型在發布時已經帶有能處理一定程度朝鮮語的權重(weights)。(實際上,查看中國語言模型的模型卡會發現,他們將朝鮮語標註為朝鮮族少數語言,並持續標明正在進行訓練——出於名義上的考量……)
這意味著什麼很明確。**北韓不需要自行訓練模型。只要取得 Qwen 或 DeepSeek 的權重,在平壤進行微調4就足以達成學報中「朝鮮語自動補全搜尋引擎」的目標。微調相對於預訓練,所需的計算基礎設施要少幾十到幾百倍,幾十張消費級 GPU 就能進入可行的範圍。
因此,金日成大學報引用 GPT-4 不是自行開發的宣言,而更像是「我們理解全球 LLM 格局,知道該在哪些開源模型上建構什麼」的信號。威脅的性質本身就不同。
OZ 的視角
看到這件事,我想到一個 GTM 模式:「當技術護城河崩塌時,產業會回歸到運營護城河」。這是我在制定多個市場進入策略時經常觀察到的趨勢。半導體 IP 標準化後,TSMC 的運營能力成了核心;雲端基礎設施均衡化後,AWS 的銷售、客戶管理和發布節奏成了差異化要點。
AI 也在走同樣的路。曾經有人說「OpenAI 領先 5 年」。現在那 5 年在哪裡?從模型能力差距來看已縮小到 6~12 個月,連平壤都進入 2 年時差的範圍了。而且,平壤的選項不是自行開發,而是在中國開源權重上進行微調,這表明遊戲規則已經改變了。
在我看來,OpenAI 真正的資產已經轉移到了「運營」上。每天數億次對話中產生的使用者回饋、將這些資料重新投入對齊的管線、快速吸收 B2B 客戶需求的銷售與交付組織……這些是論文和權重下載都無法複製的。
從這個角度看,金日成大學報事件與其說是威脅,不如說是一個信號。AI 產業正在從「更聰明的模型」的遊戲轉向「更快、更廣、更精準地部署」的遊戲。老實說,從軟體產業角度來看並不構成威脅。以前北韓做過一個叫「紅星」的作業系統,是 Linux 和 Macintosh 的混合體……就用下面的影片代替吧。
而且運營護城河對靠近市場和資料的一方更有利,因此韓國企業在韓語領域有機會創造出意想不到的位置。
結語
用三句話總結今天探討的內容。
- 《金日成綜合大學學報》2026 年第 1 期引用了 GPT-4 Technical Report 和 REALM 論文。追趕時差約為 2 年。
- 但受電力和計算基礎設施的物理限制,北韓自行開發 LLM 的可能性很低。更現實的場景是在中國開源模型(Qwen、DeepSeek)權重上進行微調。
- 這個趨勢真正傳遞的信號是另一回事。AI 的護城河正在從模型本身轉向算力、資料,以及最重要的——部署和運營。
另外,上述報導的 NK 經濟即將迎來創刊 8 週年並舉辦研討會,有興趣的朋友可以參加。我因行程問題無法參加,但據說北韓專家將以「AI 時代,北韓數位轉型現狀」為主題,介紹北韓到底如何接受和使用 IT 技術。
NK 經濟創刊 8 週年研討會報名2026 年 6 月 17 日下午,NK 經濟將舉辦創刊 8 週年研討會。希望出席者請依以下表單報名。參考資料 & 延伸閱讀
核心來源
- 姜振奎,「追趕全球 LLM 的北韓……金日成綜合大學學報發現引用 OpenAI、Google 論文」,NK 經濟,2026. :可直接查看金日成大學報原文圖片和引用文獻標註的報導。
- OpenAI,「GPT-4 Technical Report」,arXiv:2303.08774,2023. :就是北韓學報引用的那份報告。值得直接比較哪些內容被公開了、哪些被隱去了。
- Kelvin Guu, Kenton Lee, Zora Tung, Panupong Pasupat, Ming-Wei Chang,「REALM: Retrieval-Augmented Language Model Pre-Training」,ICML 2020 (arXiv:2002.08909),2020. :可以稱為今日 RAG 學術原型的論文。北韓學報將這篇論文誤標為「EALM」。哈哈哈
背景知識
- 「制裁塑造了北韓的 AI 策略:平壤如何在沒有 Nvidia H100 的情況下提升效能」,KMJ,2026. :整理分析了在計算基礎設施限制下,北韓 AI 為何固化在效率與輕量方向的分析。
- 「北韓在軍事 AI 上的冒險賭注」,The Diplomat,2026 年 3 月. :引用 38 North 的分析,指出「電力產出不足以驅動資料中心」。是本文電力天花板論述的直接依據。
- Qwen Team,「Qwen2.5 Technical Report」,arXiv:2412.15115,2025. :可了解中國開源 LLM 如何訓練和評估韓語的一手資料。
- 「北韓人工智慧的新興應用與影響」,Asian Politics & Policy,2025. :如需北韓 AI 政策的學術分析,這篇論文是很好的起點。

각주
-
RAG(檢索增強生成):AI 在回答時,先從外部文件資料庫中檢索相關資料,再參考檢索結果來生成答案。比模型僅憑自身訓練知識回答更準確,也能追溯來源。 ↩
-
H100:Nvidia 製造的資料中心級 AI 加速器。是訓練 GPT-4 等大規模模型時幾乎必備的晶片,也是美國對中國、俄羅斯、北韓等實施出口管制的核心品項之一。 ↩
-
RLHF(基於人類回饋的強化學習):以人類評估者標註的「這個回答更好/更差」回饋作為獎勵信號,透過強化學習對 AI 模型進行對齊的技術。是 ChatGPT 能以我們習慣的方式回答的核心關鍵。 ↩
-
微調(Fine-tuning):在已預訓練的大規模模型上,使用針對特定領域、語言或任務的資料進行額外訓練,使模型專業化的過程。相對於預訓練,所需的計算基礎設施少幾十到幾百倍,是無法自行預訓練的組織獲取 LLM 能力時常用的路徑。 ↩


