商業第 108 期

星巴克從現場撤除人工智慧的原因

承諾了99%的準確度,但現場的選擇還是人的雙手

星巴克從現場撤除人工智慧的原因

前言

各位訂閱者,貨架上放著一瓶薄荷糖漿。緊鄰的香草糖漿被準確識別了,但偏偏這一瓶就像不存在一樣被忽略了。這就是美國星巴克所驕傲的AI庫存管理系統的真實面貌。

去年5月19日,星巴克全面廢除了名為 Deep Brew 的AI庫存盤點工具,該工具曾部署於北美11,000家門市。從導入到停用,僅僅過了9個月。先說結論:這不是AI技術的失敗,而是沒有問過「AI是不是解決這個問題的最佳工具」的失敗。

Deep Brew: The Secret AI Engine Behind Starbucks’ 30% ROI — And Wha…After a brilliant conversation with Jemi Crookes I’ve been diving deep into how world-class brand…linkedin.com

去年星巴克在現場導入人工智慧時做了大規模的宣傳,但從某種意義上說,不過半年多就把這一切全部撤除了。

📦 11,000家門市發生了什麼事

2025年9月,星巴克將西雅圖新創公司 NomadGo 的庫存AI導入北美全門市。該系統利用 LiDAR1感測器與平板相機,自動盤點貨架上的糖漿、牛奶、飲料原料等。NomadGo 宣稱比人工操作快8倍、準確度達99%,星巴克CTO Deep L’Heureux 則表示「讓夥伴們不必花時間盤點庫存,而是專注於製作飲品和與顧客的互動」。

然而,現場的情況截然不同。

據路透報導,該系統反覆出現將外觀相似的牛奶品種搞混、以及完全無法識別貨架上明明存在的產品等錯誤。甚至在星巴克部署時公開的宣傳影片中,就拍到了薄荷糖漿一瓶在兩側產品之間未被識別的畫面。

最大的問題是信任門檻2崩塌了。AI給出的結果,員工每次都得重新核對。原本為了取代人工操作而導入的工具,反而造成了重複作業。 以前用手數一遍就結束了,現在變成AI數一遍、人再數一遍。工具沒有減少工作量,只是增加了認知負荷。

讓我再補充一些背景。這個工具是CEO Brian Niccol「Back to Starbucks」轉型策略的核心支柱之一。2024年9月從Chipotle轉任的Niccol,在診斷出庫存短缺正在侵蝕營收之後,將前任時期就在測試的這項技術快速推向全門市。與此同時,北美營業利潤率從兩年前的18%跌至9.9%,轉型刻不容緩。

NomadGo 表示,2025年一年間在11,000家門市盤點了超過1億8,600萬個品項。光看數字很驚人,但其中有多少經過員工的二次核對,沒有人公開說明。

5月19日,星巴克透過全公司備忘錄正式宣布廢除。“即日起停用自動盤點。飲料原料與牛奶將以與其他庫存項目相同的方式進行盤點。“導入當時的部落格文章已經被刪除。星巴克對路透表示這是「為了專注於門市整體的一致性與執行力所做的決定」,但沒有使用「失敗」這個詞。

🔍 不是技術的問題,而是問錯了問題

為什麼會失敗?許多報導都在指責AI公司NomadGo,將焦點放在「AI準確度不足」上。但在我看來,有更根本的問題。

第一,未經驗證就全面部署。NomadGo 的「99%準確度」是自行測量的數據。在沒有獨立第三方驗證的情況下,就一併導入11,000家門市。 Tech Times 的分析一針見血:「99%準確度的主張,在部署到11,000家門市之前從未經過獨立驗證。」這裡需要關注的是99%這個數字本身。貨架上有20個品項時,99%準確度意味著會錯0.2個。聽起來還行?但在11,000家門市、每天盤點多次的情況下,那0.2個的錯誤會累積成每天數萬筆的失誤。而且現場的實際錯誤率遠低於99%。

RAND 研究所對2,400個以上企業AI專案的分析顯示,80%的AI專案未能達成預期的商業價值。其中34%在進入生產階段前就被中止,28%即使完成也未能創造預期價值,18%雖然創造了部分價值但無法證明投資成本的合理性。MIT 2025年的研究更直接:95%的企業生成式AI試點專案未能產生可量化的收益影響。

Gartner 在2025年的報告中也預測,60%的AI支援數據尚未就緒的專案將在2026年前被中止。根據S&P Global的數據,大型企業(員工1萬人以上)在2025年平均放棄了2.3個AI專案,每個被放棄專案的平均沉沒成本為720萬美元(約100億韓元)。

失敗原因的分布也值得關注。在140個企業AI導入案例的分析中,因模型效能或技術整合問題而失敗的僅佔23%。其餘77%是策略、治理3、變革管理的失敗。不是技術的問題,而是人與組織的問題。

第二,把要解決的問題本身定義錯了。星巴克的庫存問題不是因為「盤點動作」不精確而產生的。 今年初路透的深度報導指出,星巴克的配送只有不到三分之一能準時到達,超過1,500種杯蓋組合讓供應鏈變得極度複雜。不是人工盤點的準確度低,而是供應鏈結構本身就有問題。

這在前任CEO時期也重複出現過。Rajeev Jayashan 任內曾與 o9 Solutions 合作導入「自動下單」系統,但該機器學習系統持續推薦低於實際需求的數量。技術換了,但「沒有定義問題就先導入解決方案」的錯誤如出一轍。

🎯 如何為問題選擇合適的工具

星巴克案例揭示了一個簡單但常被遺忘的原則:不是每個問題都需要最高等級的技術。

咖啡門市的貨架不是受控環境。燈光會變化,產品擺放隨時改變,外觀相似的牛奶容器並排擺放。電腦視覺4系統在一致的條件下訓練後,投入變化劇烈的現場,效能可能急劇下降。 與SKU固定、貨架位置標準化的物流倉庫不同,咖啡師隨時重新擺放的門市貨架,本質上是完全不同的環境。

相對地,人的雙手能靈活地適應這種環境。咖啡師一眼就能分辨燕麥奶和低脂牛奶,也能立即應對昨天剛改過的貨架擺放。演算法再訓練5需要時間和成本,而人能即時處理情境脈絡。而且人還能同時做出「這瓶糖漿快要用完了」的判斷。這不只是單純的盤點,而是包含脈絡的判斷。

星巴克門市員工的回饋精準地點出了這一點:「感謝你們取消自動盤點。初衷是好的,但執行起來很困難。」

這裡的關鍵不是「人比AI好」,而是先選擇與問題特性匹配的工具。 讓我們重新看看星巴克的庫存盤點問題。在高度變動的環境中,視覺上相似的少量產品需要被區分——這個任務其實有多種選擇。除了昂貴的電腦視覺AI,也可以在貨架上安裝重量感測器來偵測庫存量的變化。用條碼掃描器搭配簡單的資料庫整合可能就夠了。或者像現在這樣,人工直接盤點反而最精確。

相對地,如果要分析數千家門市的銷售數據來優化下單模式,那明顯是AI更擅長的領域。同樣是「庫存管理」這個問題,每個階段最適合的工具都不同。

拿著鐵鎚的人,看什麼都像釘子。如果以「必須導入AI」為前提開始思考,就很容易覺得所有問題都能用AI解決。

Oz的視角

老實說,看到這條新聞的那一刻,我腦中浮現的是我在顧問現場每次都會說的話。

我目前為多家企業提供AI導入顧問服務,但絕不會無條件地推薦深度學習或生成式AI。有些情況下,裝一個感測器就高效多了。用Excel VBA就能解決的工作多到令人驚訝。而且即使要用AI,大多數情況下也不需要最高規格的前沿模型6。從嵌入模型7到輕量分類模型,將各種模型適時適地地配置,才是真正的功力。

在制定GTM策略的過程中,我見過無數次這樣的模式:「數位一定優於類比、敏捷一定優於瀑布式、扁平化組織一定優於層級式組織」——這種二元對立。現實並非如此。根據不同的情境和問題,有更高效、更合適的工具和方法論。 找到最優的條件,才是我們真正的課題。星巴克用11,000家門市的規模,證明了這個簡單的原則。

結語

從星巴克廢除AI庫存工具的這個案例中,有三點值得記住。

第一,未經驗證就全面部署供應商的99%主張,成本會加倍回來。第二,AI專案失敗的77%源於策略與問題定義,而非技術。第三,感測器就夠的地方不需要電腦視覺,VBA就能搞定的事不需要上前沿模型。

當組織在評估AI導入時,先問自己這個問題:「這個問題真正需要的技術是什麼?」如果正在為此煩惱,歡迎聯繫我。我會一起與您深入探討,找出最優的解決方案。Oswarld精品顧問公司隨時歡迎您的來信。:) contact@oswarld.com

參考資料 & 延伸閱讀

核心來源

背景知識

作者 安光涉(Oswarld) 現任世宗大學兼任教授,INLEVEL9 策略顧問。職涯經歷、研究、著作與近期活動會持續更新在作者介紹。 最新動態 · 2026年7月:HEMA-2: A Consolidation-Aware Tri-Memory Architecture with Multi-Channel Scheduling for Lifelong Conversational AI

각주

  1. LiDAR(Light Detection and Ranging,光達):透過發射雷射並偵測反射光來測量物體距離與形狀的技術。iPhone Pro 系列背面也搭載了這種用於3D空間感知的感測器。

  2. 信任門檻(Trust Threshold):使用者能不加額外核對就接受系統結果的最低準確度水準。一旦低於這條線,系統產出的結果就需要人工再次驗證,工具的效率便不復存在。

  3. 治理(Governance):組織在導入與營運技術或專案時的決策體系與管理架構。涵蓋誰來決策、以何標準評估、出問題時如何應對等面向。

  4. 電腦視覺(Computer Vision):讓AI分析相機拍攝的影像或影片,從而識別與分類物體的技術。應用於人臉辨識、自駕車的周圍感測等領域。

  5. 再訓練(Retraining):讓AI模型適應新環境或新數據的額外學習過程。現場條件每變化一次就需要重新進行,耗費時間與成本。

  6. 前沿模型(Frontier Model):如 GPT-5.5、Claude、Gemini 等頂尖效能的大規模AI模型。效能卓越,但在成本與處理速度上並非適合所有工作場景。

  7. 嵌入模型(Embedding Model):專精於將文字或影像轉換為數值向量以計算相似度的輕量模型。在搜尋、分類、推薦等任務中,比前沿模型更快、更省成本。