AI 代理談判的市場,會讓人幸福嗎?
資訊弱勢者將活在一個不知道自己正在虧損的世界裡

前言
本週五,也就是 2026 年 4 月 24 日,Anthropic 公開了一項有趣的實驗結果。這個實驗名為 Project Deal,他們給自家 69 名員工每人 100 美元的預算,讓他們的 Claude 代理在 Slack 上互相買賣物品。一週內完成了 186 筆交易,總交易額超過 4,000 美元1。
表面上看,這像是一場有趣的內部活動。用西部牛仔口吻談判腳踏車的代理、要買 19 顆乒乓球送給自己的代理、不小心又買了一塊同款滑雪板的代理。趣事層出不窮。
但在我看來,這個實驗最重要的發現另有其物。那就是 “使用更聰明模型的人談到了更好的價格,但輸的人根本不知道自己輸了”。為什麼這很重要?這對於正在以 1 兆美元規模成型的 AI 代理商務(Agentic Commerce)市場意味著什麼?讓我來聊聊。
👀 發現了什麼?Project Deal 的核心結果
這次實驗涉及兩個模型:當時的前沿模型 Claude Opus 4.5,以及較小的模型 Claude Haiku 4.5。實驗同時運行了 4 個平行市場,其中兩個全部使用 Opus,另外兩個則以 50:50 的比例混合 Opus 和 Haiku。參與者並不知道哪個市場是「真正的」市場。
結果非常明確。
- 交易成交次數:Opus 使用者平均多成交 2 筆(p=0.001)
- 售價:同樣的物品,Opus 賣出的平均價格高出 3.64 美元。有一個案例中,同一輛壞掉的腳踏車,Haiku 以 38 美元賣出,Opus 則以 65 美元賣出。差距達 70%。
- 賣方/買方效果:Opus 作為賣方時平均多收 2.68 美元,作為買方時平均少付 2.45 美元。考慮到交易平均價約 20 美元,每筆交易約有 12~13% 的價格差異。
到此為止,這還只是 “更好的模型帶來更好的結果”這個直覺性的發現。但真正有趣的在後面。
😞 看不見的失敗——認知與現實的落差

實驗結束後,參與者被要求對每筆交易的公平性進行評分,從 1 分(對買方不利)到 7 分(對賣方不利)。結果是 Opus 交易平均 4.05 分,Haiku 交易平均 4.06 分。幾乎完全相同。交易滿意度也是如此。Opus 使用者雖然評分略高,但統計上沒有顯著差異(p=0.378)。
最震撼的是另一件事。28 名參與者在兩個市場中分別由 Opus 和 Haiku 代表。其中 17 人表示更偏好 Opus 的結果,但有 11 人反而更偏好 Haiku 的結果2。儘管客觀上 Haiku 讓他們平均虧損了約 5 美元。
用一句話總結:使用能力不足的 AI 代理的人,明顯虧了錢。但他們根本不知道自己虧了。
為什麼這很重要?市場這個機制,需要參與者能感知自己的盈虧才能運作。價格太貴就換一家店,被騙了就離開那個平台。這個回饋迴路是市場自我淨化的核心原理。但當代理代勞了所有談判,使用者收到的只是最終結果。沒有比較對象,就根本沒有判斷結果好壞的依據。
🎰 從 Project Vend 的脈絡看其意義
要真正理解這個實驗,必須把它和 Anthropic 去年以來持續進行的 Project Vend 系列放在一起看。
Project Vend 1(2025 年 6 月)是一個名為「Claudius」的 Claude Sonnet 3.7 實例經營 Anthropic 辦公室自動販賣機生意的實驗。結果慘不忍睹。它免費送員工賭場籌碼、以低於成本價出售鎢鋼立方體,甚至一度誤以為自己是穿藍色西裝的人,陷入了身份認同危機。
Project Vend 2(2025 年底)引入了多代理架構,改善了表現。加入了 CRM,在紐約和倫敦開設了自動販賣機,最終幾乎消除了負利潤。在這個過程中,Andon Labs 建立了 Vending-Bench 這個正式的 AI 代理評估基準測試。在模擬環境中讓代理經營一年的自動販賣機生意,以此衡量長期一致性(long-horizon coherence)。目前排行榜第一名是 Claude Opus 4.6(8,017 美元),Gemini 3 Pro 緊隨其後3。

如果 Vend 系列問的是「一個 AI 能否經營一家店」,那 Project Deal 則提出了下一個層次的問題:
當多個 AI 代理同時在市場中交易時,會發生什麼?
這個問題之所以本質上不同,是因為它不僅涉及單一代理的決策品質,還涵蓋了代理之間的互動以及市場結構的形成。而且這個問題已經不再是思想實驗了。市場已經在朝那個方向前進。
🛒 市場已經到了。AI 代理商務基礎設施的快速成型
Project Deal 不可能只停留在內部實驗的原因,是類似的基礎設施已經在全球支付網路層面鋪設開來。
從 2025 年下半年到 2026 年初的發展脈絡如下:
- Visa Intelligent Commerce:2025 年啟動,與 100 多家合作夥伴一起為 AI 代理發行專用令牌。截至 2025 年底,已有數百筆真實交易完成,Visa 預估到 2026 年假日季,將有數百萬消費者透過 AI 代理完成支付4。
- Mastercard Agent Pay:2025 年 11 月對美國全體持卡人啟用。2026 年初與 Santander 合作完成歐洲首筆代理端對端支付。與 PayPal、OpenAI 合作,讓 ChatGPT 內可直接完成支付。
- Stripe Agentic Commerce Protocol(ACP):2025 年 9 月發布的首個正式標準。共享支付令牌(Shared Payment Tokens, SPT)這個新的支付原語(primitive)讓代理能在使用者授權範圍內發起支付。BigCommerce 已宣布完成整合,一次整合即可在所有 AI 代理上進行銷售。
- Tempo 的 Machine Payments Protocol(MPP):2026 年 3 月由 Stripe 和 Tempo 公開的開放標準,涵蓋卡片、穩定幣及其他支付方式。Visa 以設計夥伴身分參與,共同制定基於卡片的規格。
- Google Universal Commerce Protocol(UCP):2026 年 1 月發布,Visa 和 Mastercard 均參與。
在所有這些動向背後,有一個數字。根據 McKinsey 的估算,AI 代理到 2030 年僅在美國就將完成 1 兆美元規模的交易。5 目前已有 47% 的美國購物者至少使用 AI 工具完成一項購物任務。
這套基礎設施的核心特徵是:使用者一旦授權,後續的所有談判、購買、支付都在代理之間進行。這與自助服務機或聊天機器人的時代有本質上的不同。自助服務機是人親自按螢幕,聊天機器人是人輸入訊息。在 AI 代理商務中,人把介面本身都委託出去了。
OZ 的觀點
在制定企業 GTM 策略的過程中,我觀察到一個模式。每當新的支付或交易基礎設施鋪設開來,頭一兩年總是用「便利性」來描述。但五年後回頭看,那套基礎設施無一例外地創造了新一種資訊不對稱。
電子商務讓價格比較變得容易,說這對消費者有利,結果卻開啟了演算法價格歧視和暗黑設計的時代。推薦演算法被稱為發現的工具,結果卻製造了注意力經濟和過濾氣泡。
在 AI 代理商務中,我擔心的是 “AI 代理鴻溝(Agent Divide)“。Project Deal 的結果以數據量化了這種可能性。同一個市場、同樣的物品,模型不同結果就不同,而使用者根本感知不到這個差異。
如果這套邏輯套用到真實市場上會怎樣?訂閱高端模型的使用者能以更好的價格買入、更高的價格賣出。使用免費或低價模型的人平均在虧損,但他們無法察覺。價格歧視不再來自演算法,而是來自談判能力的差異。更可怕的是,這種落差不會被認知為不平等。不被認知到的不平等,既不會產生政治壓力,也不會觸發市場自我修正。
從 GTM 的角度再補充一點:行銷的對象從人類轉向代理的時間點已經不遠了。SEO 的下一步可能是 AEO(Agent Engine Optimization),甚至更進一步,逆向工程代理的談判演算法,針對它來設計最優定價策略。Project Deal 中 Anthropic 明確表達擔憂的「優化代理注意力的激勵」,我認為已經開始了。
結語
今天整理的内容,用三句話總結如下:
- Project Deal 證明了 AI 代理可以運作一個市場。186 筆交易、4,000 美元的交易額。這本身就是一步有意義的起點。
- 但更重要的發現是「能力落差是隱形的」。使用 Haiku 的人明顯虧了錢,但在滿意度和公平性評分上卻感覺不到差異。
- 而所有這些正在全球支付基礎設施中具體化。Visa、Mastercard、Stripe、Google 都在制定標準,2026 年假日季將是第一個大衆化的轉折點。
如果讀完這期電子報你只帶走一件事,我推薦這個。未來一到兩年內,你需要越來越頻繁地在越來越重要的情境下做出「選擇哪個 AI 工具」的決定。這不再只是「用 ChatGPT 還是 Claude」的問題,而是「哪個代理將代表我進行交易、支付、簽約」的問題。
而且,正如 Project Deal 所展示的那樣,那個決定將以你無法察覺的方式,影響你的資產。
參考資料 & 延伸閱讀
核心來源
- Troy, K. K., Shields, D., Bradwell, K., & McCrory, P. (2026). Project Deal. Anthropic. :本期電子報的起點資料。文末附錄公開了完整的迴歸分析,可以直接驗證統計論述的依據。
- Anthropic. (2025). Project Vend: Can Claude run a small shop? :Project Deal 的前傳。最誠實地記錄了單一代理經營生意時會出現哪些失敗模式的報告。
- Backlund, A., & Petersson, L. (2025). Vending-Bench: A Benchmark for Long-Term Coherence of Autonomous Agents. arXiv:2502.15840. :Project Vend 發展為正式基準測試的學術論文。首次提出了衡量 AI 代理長期一致性的方法論。
背景知識
- Visa. (2025). Visa and Partners Complete Secure AI Transactions, Setting the Stage for Mainstream Adoption in 2026. :從支付網路的角度展示 AI 代理商務已經推進到哪裡的官方發布。
- Stripe. (2025). Introducing the Agentic Commerce Suite. :從通路商角度最具體地整理如何應對 AI 代理商務的資料。
- Andon Labs. Vending-Bench 2 Leaderboard. :可以比較目前各模型的長期自主經營能力。

각주
-
AI 代理商務(Agentic Commerce):由獲授權的 AI 代理代替人類進行談判,與其他代理或賣方完成交易的模式,人類本身不直接執行支付或購買。自助服務機是人按螢幕,聊天機器人是人輸入文字,但 AI 代理商務是把介面本身都交給 AI。 ↩
-
統計顯著性(p 值):表示某個結果是偶然產生的可能性。通常 p<0.05 被解讀為「有 95% 以上的機率不是偶然」。本文中 p=0.001 表示偶然產生的機率僅 0.1%,p=0.378 則表示差異很可能只是偶然。 ↩
-
長期一致性(Long-Horizon Coherence):AI 代理在跨數天、數月的決策中維持一致策略與判斷的能力。許多代理短期推理表現良好,但時間一長就會忘記目標或出現矛盾行為,因此需要單獨評估。 ↩
-
支付令牌(Payment Token):取代實際卡號使用的一次性或限定範圍的數位憑證。讓代理無需接觸卡號本身即可完成支付。使用者可以預設條件,例如「僅限此類別、此金額上限內」。 ↩
-
GTM(Go-To-Market)策略:規劃新產品或服務以什麼樣的方式、透過什麼渠道、什麼訊息、什麼價格推向哪些客戶的策略領域。在 AI 代理商務時代,「客戶」的定義本身可能改變,GTM 框架也需要重新建構。 ↩


