想像一下,你坐在辦公桌前登入,準備進行績效考核,而一個AI系統正在分析你們的對話。你長時間工作,努力平衡各種截止日期,當經理問你近況如何時,你說你很好,甚至可能微笑,但語氣中卻帶著一絲猶豫,聲音也有些顫抖。當你調整姿勢時,肩膀也隨之塌陷。

這些都是人類肉眼可能察覺到的微妙線索,暗示著潛在的壓力。然而,對於一個只被訓練來將情緒歸類為「快樂」或「悲傷」的AI模型來說,這些細微之處很可能會被忽略。它只記錄下你的話語和笑容便繼續,除非你的經理介入,否則你疲憊、注意力不集中,甚至可能離過勞只差幾天的事實,根本不會被納入考量。

「情緒AI」透過臉部表情、語氣和行為來判斷人們的感受,如今似乎無處不在;它被應用於員工福祉、招募面試、教育平台以及駕駛監控系統。NiCE 和 Genesys 等科技客服中心平台利用AI偵測客戶何時聽起來很沮喪,並即時提示客服人員放慢語速或給予更多同理心回應。

Meta 等大型公司和 Hume AI 等新創公司,也正在開發更具表現力的語音AI系統,這些系統能夠偵測「對話」對象的情緒線索,並調整其溝通方式。

此外,數百家公司已經提供虛擬AI陪伴應用程式,這是一個快速成長的市場,預計到2035年可能達到5550億美元的市值,機器人夥伴也已加入戰局。例如,Intuition Robotics 的 ElliQ 是一個外形有點像白色檯燈的小型裝置,目前正被用於與老年人進行對話,希望能減少他們的孤獨感。

然而,儘管情緒AI領域正快速發展,大多數現有系統仍專注於偵測有限的訊號,一次只標記一種特定情緒,這對於理解人類狀況來說是遠遠不夠的。在現實世界中,人類的訊號和情緒是情境化的、相互重疊的,並且不斷變化。一聲笑可能代表喜悅、緊張,或兩者兼具;提高的音量可能代表熱情,也可能代表沮喪。更讓情緒偵測工作變得困難的是,人們的反應因人口統計學、文化背景和無數其他變數而異。

換句話說,我們期望AI能理解的,與AI實際能提供的之間存在著一道鴻溝。這正是我們稱之為「人類情境AI」的新研究領域正在努力彌補的。人類情境AI不再僅僅關注單一輸入並進行標記,而是越來越有能力評估個人的性格和特徵,並即時追蹤情緒,同時結合多種輸入,包括臉部動態、語音、語調、語言和行為。

關鍵在於,反應也會在特定環境中進行評估,例如績效考核或專業輔導會議。結果是什麼?電腦正在學習讀懂整個情境,而不僅僅是螢幕上的資訊。

情緒AI的起源

情緒感知AI的故事始於近三十年前的麻省理工學院媒體實驗室,美國電機工程師兼電腦科學家 Rosalind Picard 在那裡創造了「情感運算」(affective computing)這個詞。她的工作引入了一個開創性的想法:電腦可以被教導識別並回應人類情緒。

Picard 早期的實驗專注於單一模態:臉部表情、語氣,以及皮膚電導或心率等生理訊號。目標是為機器提供一個了解人類情感的窗口,幫助它們變得更具同理心。這是一個令人興奮的願景,但當時的科學和硬體條件尚未成熟。運算能力有限,感測器粗糙,資料集也狹窄且存在偏見。

在接下來的幾十年裡,研究人員和公司在測量人類表達自我的多種方式方面取得了進展。在2010年代,情感分析(處理大量文本以找出情感潛台詞)開始普及。同時,包括我所屬公司 Neurologyca 在內的行銷公司,也開始使用視訊和網路攝影機來測量和記錄客戶反應。Fitbits 和 Apple Watch 等生物辨識裝置和活動追蹤器也變得無處不在,產生了關於人們睡眠、步數、壓力水平等的新數據流。

不出所料,科學家們很快證實,更大規模的個人化數據能提高判讀人類情緒的準確性。2019年,康乃爾大學的研究人員證明,結合多種類型的訊號可以改善情緒感知。他們的系統將腦電圖(EEG)測量的腦部活動和心率等生理數據,與臉部表情等視覺線索結合,其表現優於僅依賴單一輸入的系統。

大約在同一時期,Picard 和她在麻省理工學院的團隊發現,經過特定個人數據訓練的人形機器人,在判讀該個人的反應和感受方面,比沒有個人化數據的機器人表現得更好。

最近的研究也與這些發現一致。2024年,韓國科學家指出,融合生理、環境和個人數據來識別情緒,可使錯誤率降低32%。另一篇於2025年發表的論文則證明,使用者特定的資訊能顯著提升情緒識別的效能。

如今,我們的裝置了解我們是誰;我們的習慣、傾向、喜好和厭惡。它們也變得更小、更高效。嵌入在手機、筆記型電腦以及虛擬實境和擴增實境裝置中的微型低功耗攝影機和麥克風,可以同時偵測數十種人類訊號,從眼球運動和微表情,到呼吸節奏、語音調變和姿勢。

運算技術的進步也使得整合音訊、視訊、生物辨識和文本數據成為可能,而且通常無需將原始數據傳輸到雲端。史丹佛大學、劍橋大學和麻省理工學院、日本京都大學以及中國瀋陽東北大學軟體學院的研究人員,正在探索如何融合這些輸入來提升人機互動的敏感度和準確性。

然而,儘管取得了這麼多突破,機器仍然無法可靠地解釋情緒,甚至無法解釋生理壓力。就在去年,《精神病理學與臨床科學期刊》發表的一項調查顯示,智慧手錶上的壓力分數,很少甚至從未與使用者實際感受到的壓力水平相符。事實上,四分之一的受訪者表示,他們感受到的與智慧手錶報告的結果完全相反。

為何會出現這種脫節?我們在捕捉訊號方面做得很好,但在解釋訊號方面卻不然。健身追蹤器可能會從你的心率推斷你感到壓力,並建議你放鬆訓練,但它不知道心率增加是因為興奮、疲勞,還是多喝了一杯咖啡。在真實世界情境中評估情緒甚至更加困難。為了解決這個複雜的問題,機器需要情境脈絡。

從神經行銷學到情緒感知AI

我所屬的公司 Neurologyca 於2015年在西班牙成立,最初從事神經行銷學。我們的共同創辦人 Juan Graña 在與歐洲主要品牌和企業集團合作時意識到,公司缺乏關於消費者的可靠數據。當時,大多數客戶回饋都透過問卷調查,提出諸如「這款汽車廣告讓你感到多快樂(1到10分)?」

或「哪個表情符號最能描述你的心情?」等問題。自然地,這些過於簡化的工具導致了高度的自我報告偏誤,因為人們經常誤判或錯誤陳述自己的反應。

為了解決這個問題,Neurologyca 設立了實驗室,利用神經科學和認知科學更準確地捕捉人類對產品、標誌、廣告和體驗的反應。除了使用心率監測器、眼動追蹤器和腦電圖(EEG)等生物辨識工具外,我們還記錄了數百萬幀人類反應的視訊畫面,記錄每個特定情境以及由此產生的臉部和身體動作。

為此,我們繪製了超過790個參考點,包括嘴角、眼睛和瞳孔大小、眨眼頻率以及頭部角度。所有這些數據都在嚴格的歐洲隱私標準下匿名收集和儲存。

接著,我們將這些資訊與數十年來神經科學和行為科學研究的發現結合,這些研究探討了生物辨識、語音模式和人類動作如何與情緒相關,我們持續從歐洲各地的學術機構收集這些研究。我們還建立了一個情境脈絡資料庫,例如「觀看狗糧廣告」或「聽到一首新歌」,以及它們所引發的人類感受。

在我們與公司合作的過程中,這種方法不僅讓我們能夠識別細微的情緒,還能幫助我們判斷哪些反應預示著正面或負面結果。以恐怖電影預告片為例:我們的研究幫助我們發現,最成功的預告片會引發一種非常特定的情緒組合,即一點點恐懼、一點點焦慮,但也帶有一些喜悅。

有了這些知識,我們就能快速評估觀眾反應,幫助電影公司找出如何調整預告片以達到預期效果。

幾年內,我們發現經過我們資料庫訓練的模型,只需使用網路攝影機就能準確評估情緒。我們不再需要將焦點小組安排在充滿設備的房間裡。相反地,我們能夠做一些事情,例如向全球付費參與者寄送新的香水樣品並附上連結。當人們打開連結時,他們的攝影機就會啟動,讓我們能夠記錄他們第一次聞香水時的臉部表情。

突然間,我們的觸及範圍擴大了:我們不再只在一個或兩個國家使用小型焦點小組,而是可以快速評估全球1000人,比較日本、印度或德國的人對某種產品的感受。

大約四年前,隨著AI變得無處不在,我們意識到我們的模型應用範圍遠超神經行銷學。重要的是,這些模型是基於直接觀察到的人類行為,而不是推斷模式或鬆散標記的開放資料集。

超越品牌和公司,我們確認我們的模型可以整合到AI系統中,幫助它們以更細緻的層次理解人類情緒。換句話說,我們可以提供一層「情境脈絡」。

對於具同理心的AI,情境是關鍵

當我們談論「一層情境脈絡」時,我們指的是三種不同類型的情境。第一種是情境或環境脈絡;例如,績效考核、遠距醫療會診或觀看恐怖電影。第二種是個人脈絡,包括個人的特定歷史、目標和基準狀態。第三種是行為脈絡,它透過評估注意力、自信心、參與度和認知負荷的即時變化,涵蓋了個人在事件或互動過程中的反應。

現今大多數系統僅專注於情境脈絡,儘管有些已開始納入個人脈絡。很少有系統會包含行為脈絡,或以有意義的方式結合這三者。Neurologyca 所建立的是一個邏輯層,它能融合這三種脈絡,並將其轉化為結構化、機器可讀的資訊,從而使AI系統和代理能夠更有效地回應。

我們的技術正被用於增強開發中的系統,以及一些已經部署的系統,包括 Netradyne 等駕駛安全應用程式、Amazon Alexa 等家用助理,以及 Sully.ai 等醫療保健AI平台。

它的運作方式如下:情境脈絡由平台或應用程式決定,無論是專業的