OpenAI 投資的法律 AI,內核竟是中國模型
兩個月、150 張 GPU。模型是消耗品,工作環境才成了資產

開場
讀者 您好,上週美國法律 AI 業界發生了一件小事。Harvey 在 8 月 18 日推出了首款自研模型「Tenet」。OpenAI 的創投基金早期投資了這家公司,而它在去年 3 月以 110 億美元的估值獲得了認可。然而,這款模型的底層並非 OpenAI,而是北京 Moonshot AI 的 Kimi K3。
更有趣的是三天後的事。就在一個月前財長還把中國模型制裁掛在嘴邊的那座華盛頓,白宮 AI 負責人 David Sacks 竟將這款模型舉為「美國企業正在打造世界級專用模型」的證據。
這裡就產生了一個問題:美國最大的法律 AI 公司,為什麼偏偏選了中國模型?先說結論——這件事的關鍵詞不是「中國」,而是「兩個月」。模型已經變成兩個月就能重新打造的消耗品,而訓練模型的工作環境才是真正的資產。後門的擔憂並非沒有道理,只是瞄準了錯誤的目標。
Harvey 兩個月打造的模型
Harvey 成立於 2022 年,向律所和企業法務團隊提供 AI 輔助,涵蓋研究、合約審查和文件起草。根據 Harvey 的統計,其客戶遍及 60 多個國家、超過 1,500 家,美國營收前 100 大律所中有一半在使用,截至 7 月的年化營收為 3.5 億美元。在此之前,它的架構是根據任務分別選用 OpenAI、Anthropic 和 Google 的模型——本質上是一家借用他人智慧的公司。
Tenet 是這家公司首次自主打造的智慧。其底層是 7 月 27 日公開權重的 Kimi K3,一款 2.8 兆參數的開放權重1模型。Harvey 與推理基礎設施公司 Fireworks 合作,使用約 150 張 NVIDIA B300 GPU,花了兩個月進行後訓練2。方法為強化學習:構建了約 1,750 個模擬律師實際工作場景的環境,讓模型在環境中閱讀文件、使用工具並產出結果,再根據評分標準給分。每個 epoch 進行了超過 1 萬次試行3。評分標準的制定方式與 Harvey 在 5 月公開的法律智能體基準測試 LAB 相同,僅 LAB 就有超過 75,000 個由實際律師撰寫的評分項目。
結果如下:在 LAB 的保留測試集(未用於訓練)中,完整完成的任務數量幾乎是基礎 K3 的兩倍;在合約領域(LAB Contracts)提升了 20%,拿下第一名。LAB 整體排名第二。在與訓練無關的外部基準測試 APEX Agents 和 Redline Bench 上,也優於基礎模型。據 Harvey 說明,成本不到主要前沿模型的 1/4。因為是開放權重,token 單價較低,加上獎勵機制鼓勵模型以更少的 token 達成相同結果,所以訓練出了更省 token 的模型。Harvey 明確表示未使用任何一行客戶數據。
我更花時間研究的是與 Tenet 同時發布的三款專業模型。它們的架構很像律所的部門分工:一款 M&A 盡調模型,能讀取最多 8,000 萬 token(相當於 A4 紙 6 萬頁)的資料室;一款審查模型,能將 1 萬份文件整理成表格;一款「所內知識」模型,將律所的知識直接刻入權重而非依賴檢索,將每次查詢的成本降低了 90%。相當於把合夥人、律師助理和知識管理團隊各自做成了模型。
而这三款的底層也全部是中國開放權重模型。盡調和審查模型用的是智譜(Zhipu)的 GLM-5.2,所內知識模型用的是阿里巴巴的 Qwen3.8-27B。訓練使用的強化學習算法 GSPO 也是阿里巴巴 Qwen 團隊去年 7 月發表的論文,而評分模型也是 Moonshot 的 Kimi 2.6。在美國資本和 NVIDIA GPU 之上,組裝了中國三家研究機構的成果。
為什麼偏偏是中國模型
答案比想像中簡單——那個量級的美國產開放權重模型不存在。
美國不是沒有開放權重模型。OpenAI 的 gpt-oss、Google 的 Gemma、Meta 的 Llama 都在。但量級不同。VentureBeat 去年 3 月整理的量級對比表顯示,去年 4 月發布的 Llama 4 評價不佳,大版本 Behemoth 無限期延期。Gemma 3 最大版本只有 270 億參數,gpt-oss-120b 處理每個 token 時實際運行的參數僅 51 億。要支撐讀取數百萬 token 文件、執行數百步驟的智能體,這些都太薄了。目前能下載 2.8 兆參數開放權重模型的地方,只有中國。
而且基準測試做了選擇。在獨立機構 Artificial Analysis 單獨運行的 Harvey LAB 排行榜上,基礎 Kimi K3 在評分項目達成率方面位居頂尖。對 Harvey 來說,不是「選了中國模型」,而是選了在自家考試中表現最好的開放模型。
Harvey 不是第一個。去年 3 月,編碼工具 Cursor 的自研模型 Composer 2 被發現是建立在 Kimi K2.5 之上的。一位開發者拆解 API 流量時,發現模型名稱中嵌有「kimi-k2p5」。Cursor 幾小時內就承認了,共同創辦人說「一開始沒有披露是我們的失誤」。Cognition 的 SWE-1.6 據推測是建立在智譜 GLM 之上的,Airbnb CEO Brian Chesky 也公開表示「我們非常依賴 Qwen」。 產品負責人 Peter Yang 整理的清單中,還有 Shopify 因切換到 Qwen 而每年節省 500 萬美元。
我關注的是這五個月間的變化。3 月的 Cursor 是被發現後道歉,8 月的 Harvey 是寫在部落格上炫耀,白宮還表揚了。從需要隱藏的事變成了可以自豪的事。回想一個月前財長 Bessent 還警告可能制裁中國模型,7 月我們討論的「美國內部的裂痕」,一個月後就以一款具體產品的形式浮現了。
另外有一個有趣的條款。Kimi K3 授權條款第 3 條要求,月營收超過 2,000 萬美元的產品若使用此模型,必須在畫面上明顯標示「Kimi K3」。Harvey 的月營收按年化計算約為 2,900 萬美元。雖然第 4 條有經認證推理夥伴的例外條款,實際上可能通過合同解決,但按條文規定,美國律所的畫面上應該顯示中國模型的名稱。這不是法律建議,只是我閱讀條文的解讀,建議各位直接查看原文。
後門擔憂瞄準了錯誤的目標
「但畢竟是中國模型,安全嗎?」這個問題是合理的。但需要把擔憂分成兩類。
第一類擔憂是數據會不會流到中國。 這從開放權重的性質就能找到答案。開放權重不是服務,而是檔案。Harvey 的模型運行在美國基礎設施 Fireworks 上,與 Moonshot 的伺服器之間沒有任何數據交換。這與安裝 App 後將問題發送到中國伺服器的 DeepSeek App 是完全不同的問題。此外,Harvey 也明確表示訓練中未使用客戶數據。
第二類擔憂是權重中是否埋了什麼。 這是有一定依據的擔憂。Anthropic 2024 年發表的「Sleeper Agents」研究顯示,特定條件下才觸發的預設行為,即使經過後續的安全訓練也能存活。而且 Harvey 使用的 LoRA4 方法本身就是在幾乎保留原始權重的基礎上添加一層薄薄的適配層,兩個月的後訓練無法「洗掉」底層模型的性質。
但從這個風險的性質來看,對策也是明確的。法律智能體是在隔離的沙箱中閱讀文件、撰寫筆記的存在。阻斷外部通訊、限制工具權限、驗證引用是否與實際文件一致,無論權重中藏了什麼,能做的事都會大幅減少。也就是說,這不是模型的國籍問題,而是部署架構需要管理的風險。與 Jensen Huang 7 月說「在沙箱中可以控制」是同一邏輯,但我想加一句:能控制意味著必須去控制。這不是說沒有風險,而是說處理風險的部門從安全團隊轉移到了架構團隊。
所以真正的信號是:對於有能力處理這種風險的公司來說,中國開放權重模型已經從「需要評估的選項」變成了「預設值」。
「Wrapper 的反擊」只對了一半
圍繞這次發布有一種解讀在流傳:「曾經被稱為 wrapper 的公司開始擁有自己的模型了。前沿實驗室的一個個客戶正在變成競爭者。」我認為這個解讀對了一半,另一半瞄準了錯誤的目標。
對的一半:Cursor 和 Harvey 都是前沿實驗室最重的客戶。這些公司將核心工作負載遷移到自己的模型上,前沿實驗室的 API 營收中最厚的一層就會變薄。這確實是明確的威脅。
偏的一半是「競爭者」這個詞。Harvey 仍然根據任務選用 OpenAI、Anthropic、Google 的模型,LAB 整體第一名也不是 Tenet。與其說它成了競爭者,不如說它在任務分配表中多了一行。最難的工作仍然在借用,最重複的工作開始自建——分工才剛開始。
而且更關鍵的偏差在於:Harvey 的資產不是模型。模型花兩個月和 150 張 GPU 就能重新打造。用本月初「智慧貶值」那篇提到的 Blackwell 租賃費(每小時 5 美元左右)來計算,僅 GPU 成本就在 15 億到 20 億韓元之間。律師數據和環境構建成本肯定更高,但對一家 110 億美元估值的公司來說,哪邊都不是大錢。Harvey 的資產是 1,750 個工作環境、75,000 個評分標準,以及為了使用這些而通過 Mercor 和 Snorkel 僱用的律師們。下一個開放權重模型出來時,底層模型換掉,環境照用。消耗品是模型,資本財是環境。
所以**「Wrapper/包裝」這個說法從一開始就是錯誤的框架。** 不是把工作流程套在模型上,而是工作流程本身就是訓練場。真正的前線不是前沿實驗室對應用公司,而是有環境的公司對沒有環境的公司。
Oswald 的視角
在 Kakao Brain 負責 AI 產品時,我學到一件事:模型變好的速度和產品變好的速度是不同的。填補這個差距的不是更大的模型,而是寫下「什麼算好的結果」的評估標準。所以這次發布中,我看得最久的數字不是 2.8 兆,也不是 150 張,而是 75,000。
從 GTM 角度看,Harvey 的第二個目標才是更大的故事。Harvey 在這次發布中將「讓律所打造自己的模型、擁有自己的智慧」確立為研究目標,並表示「使用同一個 Harvey 的兩家律所將擁有不同的模型和不同的產出」。所內知識模型就是這個方向的樣品。當律所的知識被刻入權重而非檢索索引時,該律所在切換到其他產品時就無法帶走自己的智慧。在制定 GTM 策略時,我見過無數種鎖定設計,但沒有比將客戶知識固化為權重更厚的轉換成本。Harvey 賣的不是模型,而是模型工廠。
拉到韓國的話,有兩點。一是對主權 AI 辯論的提問。在兩個月和 150 張 GPU 就能產出專用模型的時代,稀缺的不是基礎模型,而是行業環境和評分標準。比起「韓國有沒有自主基礎模型」,更迫切的問題是「有沒有地方把韓國的法律、金融、製造業務寫成了 1,750 個環境」。二是現實約束。韓國公共部門和金融業選擇中國模型時需要承擔的政治成本比美國高。所以先行動的組織,不是能回答「哪個國家的模型」,而是能解釋「如何隔離和驗證」的組織。
結語
總結起來三點。第一,OpenAI 投資的 Harvey 用三款中國開放權重模型在兩個月內打造了自己的模型,白宮 AI 負責人將其視為美國企業的典範。第二,原因是那個量級的美國產開放權重模型不存在。後門擔憂已經從模型國籍問題變成了部署架構問題。第三,不是 wrapper 擁有了模型,而是擁有環境的公司把模型變成了消耗品。
建議這週做一件事:列出組織中最常重複的十項工作,分別寫下「什麼結果算合格」的具體條目。那份清單就是 Harvey 75,000 個評分標準的縮影。模型會換,但那份清單會留下來。
讀者 您好,您的組織有評估過中國開放權重模型嗎?如果有,卡在哪裡——是安全團隊、法務團隊還是高層?歡迎在留言中分享。我會把大家卡住的點彙總起來,在下一期寫一篇「通過審查的架構設計」。
💬 歡迎在留言中分享中國開放權重模型評估卡在哪裡。下一期會參考大家的意見。 📨 如果身邊有正在考慮模型選型的同事,請分享這篇文章。
📎 參考資料 & 延伸閱讀
核心來源
- Harvey (Calvin Qi 等), “Update on Harvey’s Post-Training Effort”, Harvey Blog, 2026.8. ··· 本文的一手來源。1,750 個環境、150 張 B300、兩個月、三款專業模型、未使用客戶數據的聲明,都在這裡。建議從開頭說明兩項研究目標的第一段讀起。
- Harvey, “Introducing Harvey’s Legal Agent Benchmark”, Harvey Blog, 2026.5.6. ··· 包含 1,200 個任務、24 個實務領域、75,000 個評分項目,以及「8 題對 8 題得 80 分」而非「錯一題就 0 分」的全數通過評分邏輯。
- Benzinga, “David Sacks Defends Open-Source AI, Cites Harvey’s Tenet Model”, 2026.8. ··· 8 月 21 日 Sacks 在 X 上的發言原文,以及 Harvey 方面「成本不到前沿模型 1/4」的說法都在這裡。
- South China Morning Post, “OpenAI-backed legal tech firm pivots to Chinese Kimi K3 open-weight model”, 2026.8.21. ··· 將此事件放在「西方企業轉向中國開放權重」大趨勢下觀察的報導。
- VentureBeat, “Cursor’s Composer 2 was secretly built on a Chinese AI model”, 2026.3. ··· Cursor 事件的始末,以及 Llama 4、Gemma 3、gpt-oss 為何無法成為替代方案的量級對比。
- Simon Willison, “moonshotai/Kimi-K3”, 2026.7.27. ··· K3 權重公開當天的記錄。包含月營收超過 2,000 萬美元需標示「Kimi K3」的授權條款及其演變。
背景知識
- Chujie Zheng 等, “Group Sequence Policy Optimization”, arXiv, 2025. ··· Harvey 使用的強化學習算法 GSPO 的原始論文。由阿里巴巴 Qwen 團隊撰寫。
- Evan Hubinger 等, “Sleeper Agents: Training Deceptive LLMs that Persist Through Safety Training”, arXiv, 2024. ··· 證明權重中植入的條件行為即使經過安全訓練也能存活的研究。後門擔憂為何「有依據的擔憂」,可以在這裡確認。
- Alex L. Zhang, Tim Kraska, Omar Khattab, “Recursive Language Models”, arXiv, 2025. ··· Harvey 為處理 8,000 萬 token 資料室而引入 Hanes 的「遞迴語言模型」的原始論文。MIT 的研究。
- Artificial Analysis, “Harvey LAB-AA Leaderboard”. ··· 獨立機構單獨運行的 Harvey LAB 排行榜。可以自行查看基礎 Kimi K3 的排名。
- Axios, “David Sacks says Chinese open-weight AI models push China ahead”, 2026.7.17. ··· K3 公開後 Sacks 表示「令人擔憂」但選擇開放而非監管的文章。是 8 月發言的前傳。
- Sacra, “Harvey revenue, valuation & funding”. ··· 年化營收 3.5 億美元、110 億美元估值、客戶數量等數據的來源。
推薦搭配閱讀的往期文章
- 在賣時間的生意裡,AI 把時間縮短了,還能賣什麼? ··· 一篇關於 Harvey 登場後美國法律市場重構的文章。討論的是賣價值而非賣時間。
- Jensen Huang 為什麼讚美中國模型 ··· 本文的前傳。Bessent 的制裁警告和 Huang 的表揚在同一天出現的場景,先讀那篇「美國內部的裂痕」,今天的文章就是下一幕。
- 封鎖催生的中國,現在要關門了 ··· 從中國角度看的同一個故事。美國公司在開始關門的中國開放權重上蓋房子,搭配閱讀更立體。
📝 術語說明
각주
-
開放權重(open weights):將模型訓練結果——權重檔案——公開,讓任何人都可以下載並在自家伺服器上運行和修改的方式。不是服務,而是檔案,所以在哪個國家的伺服器上運行由使用方決定。 ↩
-
後訓練(post-training):在已訓練好的模型上,使用特定領域的數據和獎勵進行額外訓練,以使其適應特定用途的過程。類似於律所將大學畢業生培訓為新律師的實習過程。 ↩
-
試行(rollout):強化學習中,模型在環境中從頭到尾完成一個任務的一次嘗試。根據這次嘗試的結果給分並修正模型,所以試行次數就是練習量。 ↩
-
LoRA(Low-Rank Adaptation,低秩適配):不修改原始模型的權重,而是在旁邊附加一層薄薄的輔助層,只訓練該層的方法。成本較低,但底層模型的性質大部分保留。 ↩



