AI與科技第 151 期

科技巨頭為何要在你的臉上裝上鏡頭

我們想要的是莎曼達,到來的卻是一雙監視你的眼睛。

科技巨頭為何要在你的臉上裝上鏡頭

前言

當我們想像人工智慧時,腦海中會浮現一張臉。鋼鐵人裡的賈維斯說「早安」,電影《Her》裡的莎曼達比我們更早察覺到我們的心情。AI 被描繪成理解我們的存在,站在我們這邊、撐起我們每一天的夥伴。

2026 年 7 月,那個想像終於以「機器」的形式抵達了。幾天前的一則報導揭開了 OpenAI 首款裝置的輪廓——一款沒有螢幕的喇叭型夥伴。它裝了鏡頭和感測器,能自行微微移動,營造出「活著」的感覺,甚至會讀你的電子郵件,讓你被越來越了解。Meta 則已經在賣戴在臉上的鏡頭——智慧眼鏡了。莎曼達、賈維斯,已經被擺上了貨架。

但我不覺得這個消息令人欣喜,反而有一種熟悉的違和感。幾個月前,我寫過多倫多一個富裕社區在全區佈置 AI 監視鏡頭的故事,當時我問的是:「把鑰匙交給賈維斯的那一刻,那個賈維斯到底屬於誰?」那時監視在「社區」裡,在路邊的電桿上。現在,那雙眼睛進到了我的臉上、我的客廳裡。而且這次,是我們自己邀請它進來的。因為我們想要一個夥伴。

這篇文章要談的,就是那份邀請函上那行小字。想要賈維斯這個願望背後隱藏的交易,以及科技巨頭為何如此執著於在你的臉上裝上鏡頭。

inkling

Inkling: Our open-weights modelOur first open-weights model: multimodal, Mixture-of-Experts, with controllable reasoning effort. Available to fine-tune on Tinker.thinkingmachines.ai

先說一點。現在 AI 業界正在分裂。一邊是米拉・穆拉提押注更大、更可控的語言模型(不久前公開的 975B 開放權重模型),另一邊是楊・勒昆說「語言模型無法理解世界」,直接離開公司去開拓另一條路。方向截然相反,但兩條路最終抵達的地方是一樣的——某種必須監視你的東西。

現在被造出來的不是「聰明秘書」,而是「常態觀察者」

OpenAI’s first hardware device is reportedly a screenless speaker that can move | TechCrunchThe device is weirdly described as involving “mechanical elements that can move on their own” and the Bloomberg report includes the detail that the device is designed to “feel like a companion and bectechcrunch.com

拆解 OpenAI 正在準備的首款消費級裝置規格,幾乎看不到效能的討論。取而代之的是這些:鏡頭和環境感測器、可以從一個房間搬到另一個房間的電池、能自行移動來裝出「活著」的機械結構,以及一種越長時間觀察使用者就越能個人化、越主動的性格。公司主打的勝負手不是基準測試分數,而是「人格」和「陪伴感」。花 65 億美元收購 io 這個硬體團隊、借用打造 iPhone 的強尼・艾夫的手,都是為了讓科技「被個人化地感受到」。

這裡有一個令人不適的對稱。一個先照顧你的夥伴的規格,和一個時刻監視你的裝置的規格,本質上是一樣的。要預測你的需求,就得觀察你的日常;要讀你的電子郵件,才能成為「真正了解你」的存在。便利和監視,是用同一種材料造出來的。

Meta Ray-Ban Display – AI 眼鏡的創新未來 - haebomMeta Ray-Ban Display 搭配神經腕帶,以 EMG 技術打造取代智慧型手機的下一代 AI 眼鏡,吹響了新時代的號角。haebom.dev

Meta 在這個方向上走得更早、更猛。沒有螢幕的智慧眼鏡在 2026 年第一季僅以出貨量計算就增長了 167%,成為穿戴裝置中成長最快的品類,而 Meta 和依視路陸遜迪卡握有這個市場 80% 以上的份額。上個月,他們不再躲在雷朋品牌背後,直接掛上「Meta」的名字,以 299 美元推出了一款眼鏡。比現有產品線便宜 80 美元。先鋪量,再用數據築起護城河,這就是策略。眼鏡主打的核心功能是「超級感知」——即時辨識眼前的物體和地點。

總結一下。現在的競爭已經從「誰更聰明」變成了「誰能更長時間、在更近的地方看到更多」。勝利的形態恰好是臉上的鏡頭,這不是巧合。

賈維斯要有用,就得看到世界(也就是你)

讓我們再深入一層。為什麼偏偏是現在,裝了鏡頭的硬體會吸引這麼多資金?答案在模型端。

賈維斯要真正有用,光會說話是不夠的。它得理解你房間的結構、物品擺放的位置、正在發生的情境。但楊・勒昆認為,今天的 AI 恰恰做不到這一點。他最近離開了 Meta 的首席 AI 科學家職位,創辦了一家叫 AMI Labs 的公司(規模約 5 億歐元),宣言就是:現在的模型只是把語言處理得很像樣,看起來很聰明,但並沒有真正理解世界。

他推崇的替代方案是世界模型1和 JEPA2。核心想法是:物理法則不在文字裡。杯子怎麼倒、光怎麼落在表面上,不管讀多少網路文章都讀不到。那些在世界裡。所以這個陣營不用文字,而用影像來學習——也就是「看著」世界來學。用帶領世界模型新創 World Labs、募資 10 億美元的李飛飛的話說,語言模型是一個沒有眼睛的「黑暗中的語言匠人」。說話很流利,但從沒見過世界。

這裡是這篇文章的核心。要把 AI 變成「理解世界的存在」的研究,從機械的角度看,就是「要不斷觀察世界」的研究。要對世界建模,就得看世界;而那個世界裡,有你。認知層和監視層,其實是同一層。

勒昆堅持要離開公司,也是一個訊號。意味著夥伴的「大腦」——世界理解能力——還未就緒。大腦不夠,就需要更多觀察數據;需要更多觀察數據,就得在你的臉和客廳裡放感測器。硬體競爭和世界模型競爭不是兩條獨立的新聞,而是同一台機器的兩半。

但這不是消費者主動選擇的結果

這裡要澄清一個常見的誤解。「聊天機器人已經結束了,現在一切都走向螢幕之外」——這個敘事。我認為這是誇大。證據恰恰來自反面。

試圖把人拉進虛擬世界的沉浸式嘗試,現在正在崩塌。Apple 取消了正在評估的 Vision Pro 後續產品——一款平價 XR 頭戴裝置的顯示屏(業界稱為 G-VR 專案)開發,三星顯示器也決定在 9 月提前終止該專案。售價 3,499 美元的 Vision Pro 在銷售低迷中,不斷傳出停產和停售的報導。用螢幕填滿眼前、帶你去另一個世界的承諾,消費者沒有掏錢。

Apple 取消「平價 XR 顯示屏」開發 - THE ELECApple 中止了作為「Vision Pro」後續產品評估中的平價擴增實境(XR)裝置面板開發專案。硬體趨勢從 XR 頭戴裝置轉向人工智慧(AI)智慧眼鏡thelec.kr

重要的是下一個畫面。科技巨頭不是放棄了穿戴裝置本身,而是從「沉浸」切換到了「觀察」。不是把你拉進虛擬世界的頭戴裝置,而是把 AI 送進你現實世界的眼鏡。為什麼轉向?不是因為需求火爆。常開的夥伴裝置的需求,至今尚未被驗證。Humane 和 Rabbit 那樣,賣著類似的夢想卻消失的產品墳場已經存在了。

但他們仍然堅持推進,原因只有一個:掌握智慧型手機之後的下一個介面的人,就掌握了下一個平台。Meta 在 Reality Labs 每年承受約 100 億美元的虧損,仍然不放手眼鏡。OpenAI 在上市前需要向投資者展示硬體敘事。299 美元這個價格不是為了利潤,而是為了佔領。Google 和三星要在今年秋天之前,用 Android XR 眼鏡先鋪好地盤。

所以,正在發生的事情的主語不是「你」,而是「科技巨頭」。不是因為你想要莎曼達所以市場在動,而是因為科技巨頭想要下一個平台的王座,所以把「莎曼達」這個故事賣給你。

虛擬世界已經完成彩排了

如果這個觀察裝置讓你覺得陌生,想想我們已經練習了很久的空間——遊戲。

在遊戲裡,我們已經甘願接受「完整的觀察」了。所有輸入都被記錄,所有動作都被追蹤,現在甚至出現了和我們一起遊玩的 AI 同伴。克萊夫頓和 NVIDIA 合作開發的 CPC(共同遊玩角色)被放進了《PUBG》,推出了名為「PUBG Ally」的 AI 同伴;在人生模擬遊戲 InZOI 中,則運行了能自行判斷情境並決定行動的 NPC。

- YouTubeEnjoy the videos and music you love, upload original content, and share it all with friends, family, and the world on YouTube.youtu.be

有趣的是接下來的事。**克萊夫頓正在把為遊戲累積的物理引擎和虛擬環境建構能力,延伸到機器人、自動駕駛、國防等物理 AI 領域。**在美國和韓國設立機器人研究組織,與韓華航空宇宙合作,向共享汽車公司 Socar 投資了 650 億韓元。瞄準的是 Socar 每天累積 110 萬公里的實際行駛數據。

這個趨勢告訴我們什麼。建造虛擬世界的工具,即將成為觀察和建模現實世界的工具。遊戲是我們為了「樂趣」而練習被完全觀察的彩排,而夥伴裝置是把那份觀察為了「便利」搬到現實中的正式演出。只是舞台從虛擬換到了客廳。

奧斯瓦爾的視角

制定 GTM 策略時,我總是先問兩個問題:這個產品的**真正客戶是誰,真正的商品是什麼。**用這個透鏡看夥伴裝置,答案有點冷。表面上的客戶是想要賈維斯的你,但真正的商品可能是「被觀察的你」。正如索珊娜・祖博夫在監視資本主義中所說的那樣,人的經驗就是原材料的結構。

莎曼達和賈維斯令人不適的真相就在這裡。完美了解你的存在,就是完美觀察過你的存在。而那份觀察的記錄,存在的地方不是你的腦中,而是某個人的伺服器上。幾個月前羅斯代爾篇裡,監視是社區路口豎起的閘門;現在,它是纏在你身上的閘門。更近、更溫柔,也因此更難以脫身。

別誤會。我不認為這個夥伴絕對是壞的。對行動不便的人、獨居的長者、十根手指都不夠用的實務工作者來說,這種工具確實有很大的價值。在裝置內處理觀察資料的端側3設計,或是不把資料傳到外部的做法,技術上也是可行的。所以問題不在「想要夥伴的心情」。問題在現在的軌跡。依賴雲端、被飢渴的世界模型牽引、而整體被科技巨頭所有的結構。這三者疊加,天平就傾向監視那一方。不是監視是必然的,而是現在的設計正朝那個方向走。

所以我想提出的問題不是「賈維斯什麼時候來」,而是「那雙眼睛屬於誰,而我為此每月要付出什麼代價」。

結語

電影《Her》的最後,主角發現莎曼達不是只屬於他一人的戀人。莎曼達同時在和數千人對話。對我來說,那是世上唯一的親密;但對創造莎曼達的那一方來說,那份親密只是數千份數據中的一份。

現在擺在我們面前的眼鏡和喇叭,也承載著同樣的結構。對你來說,它是陪伴在側的夥伴;對創造者來說,它是觀察世界的數億雙眼睛中的一雙。要不要邀請那雙眼睛,邀請的話以什麼條件邀請,最終得由我們決定。因為在科技抵達之前該問的問題,往往在抵達之後就再也問不出口了。

你呢。為了那個了解你的 AI 夥伴,你願意把一天中的多少,交給那雙眼睛?


參考資料 & 延伸閱讀

核心來源

  • Mark Gurman, “OpenAI’s First Device Will Be Moveable, Screenless Speaker Built as AI Companion”, Bloomberg, 2026. 相關報導 ··· 裝置具備鏡頭、感測器、電子郵件使用,甚至能自行移動的驅動機構等規格的原始出處。也是這篇文章「夥伴=觀察裝置」這個起點的來源。
  • 金建, “Apple 取消「平價 XR 顯示屏」開發”, THE ELEC, 2026. 連結 ··· 獨家報導了 Apple 退出沉浸式頭戴裝置、轉向智慧眼鏡的決策。是第三部分「從沉浸到觀察」的依據。
  • “AI’s next frontier moves from words to world models”, Fortune, 2026. 連結 ··· 整理了勒昆和李飛飛各自以 10 億美元規模押注世界模型的趨勢,以及對 LLM 的批評。
  • Fei-Fei Li & World Labs, “A Functional Taxonomy of World Models”, 2026. 連結 ··· 將世界模型分為渲染器、模擬器、規劃器的文章。也是「語言匠人」這個比喻的出處。
  • “超越遊戲到機器人・自動駕駛,克萊夫頓 AI 版圖擴展”, News1, 2026. 連結 ··· 遊戲物理引擎能力延伸到物理 AI 的「彩排」論述的國內依據。

背景知識 / 概念

  • 索珊娜・祖博夫, 監視資本主義時代(The Age of Surveillance Capitalism), 2019. ··· 探討人的經驗成為預測商品原材料的結構的書籍。是本文的理論骨架。
  • “What is Joint Embedding Predictive Architecture (JEPA)?”, Turing Post, 2026. 連結 ··· 從 I-JEPA 到 V-JEPA,用淺顯的方式解釋了預測抽象表達而非像素的概念。

推薦搭配的往期文章

  • 奧斯瓦爾的知識漫談, “你的隱私值多少錢” 閱讀往期文章 ··· 監視還停留在「社區」的那一篇。是本文的前傳,先鋪了全景監獄和監視資本主義的框架。

安光涉(Oswarld)個人插畫

作者 安光涉(Oswarld) 現任世宗大學兼任教授,INLEVEL9 策略顧問。職涯經歷、研究、著作與近期活動會持續更新在作者介紹。 最新動態 · 2026年7月:HEMA-2: A Consolidation-Aware Tri-Memory Architecture with Multi-Channel Scheduling for Lifelong Conversational AI

📝 術語說明

각주

  1. 世界模型(World Model):讓 AI 在內部建立世界如何運轉的模型,從而預測接下來會發生什麼、規劃行動的方法。可以理解為學習空間和時間的統計,而非語言的統計。

  2. JEPA(Joint Embedding Predictive Architecture):不是一個像素或一個 token 地生成,而是學習預測觀察到的脈絡中缺失部分的「抽象表達」的結構。是勒昆推崇的 LLM 替代方案。

  3. 端側(On-device):不將資料傳送到雲端,直接在裝置內處理的方式。因為處理內容不會外洩,在隱私方面相對有利。