讓機器為你開車的想法可能會讓許多人對自駕車卻步。然而,一項新研究或許能讓乘客像對人類駕駛一樣,對自駕車進行「後座駕駛」指導。

自駕車會仔細平衡多種參數,以確保行車平穩,包括速度、加速度和轉彎的順暢度。但人類的駕駛偏好往往會因趕時間、暈車與否或交通繁忙程度而有所不同。

這些車輛配備一個名為「運動規劃器」(motion planner)的軟體元件,負責在交通中選擇安全且高效的路徑。運動規劃器通常由工程師在車輛上路前進行調校,因此乘客幾乎無法即時調整車輛的駕駛風格。不過,荷蘭台夫特理工大學(TU Delft)的研究人員現已開發出一套系統,利用大型語言模型(LLM)將「我快遲到了,開快一點」等自然語言使用者請求,轉換為自駕控制系統的調整。

研究人員已將其預印本發布於 arXiv,並將在九月的 IEEE 智慧交通系統會議上發表這項成果。

這套系統並未賦予使用者直接控制車輛駕駛決策的權力;它只是微調了具備安全意識的運動規劃演算法參數,有助於將車輛行為維持在安全範圍內。此外,系統透過以非技術性語言描述將如何改變其行為,並在進行變更前要求乘客確認,從而實現「人機協作」(human-in-the-loop)。在模擬測試中,研究人員發現系統能根據自然語言指令調整駕駛速度和順暢度。

台夫特理工大學的博士後研究員兼主要作者 Diego Martinez-Baselga 表示:「運動規劃問題不僅僅是關於在避免碰撞的同時抵達目的地,更關乎你如何做到這一點。」他補充說:「這裡的動機是試圖讓自駕車的駕駛方式能輕鬆地由終端使用者調整,只需與車輛對話即可。」

先前的研究曾探討使用 LLM 和視訊語言模型(VLM)來指導自駕車決策的潛力,但這次研究人員刻意將重點放在駕駛風格上。Martinez-Baselga 指出,直接使用 LLM 和 VLM 控制車輛面臨多項挑戰,包括相對緩慢的反應時間,這使得這些模型不適合駕駛所需的快速決策,以及它們無法像確定性運動規劃器那樣提供具體的性能保證。

相反地,研究人員利用 LLM 的語言和推理能力,將模糊的人類偏好轉化為車輛運動規劃器可用的資訊。該系統依賴於研究人員先前開發的模型預測路徑積分控制器,該控制器會識別車輛可能到達目標的多條路徑,然後根據速度、轉向角和碰撞機率等多種標準進行評估。接著,它會找出在這些評估標準上得分最高的軌跡組合,作為最佳路徑。

該團隊將此控制器與 OpenAI 的 GPT-4o-mini 模型結合,以解析乘客的自然語言建議,並用來調整控制器選擇路徑的方式。模型會接收使用者的提示詞,以及車輛所處情境的自然語言描述。Martinez-Baselga 表示,這份描述在研究中是由研究人員手寫提供,但最終可由車輛的感知系統直接提供。

該模型並非直接調整控制器的設定;它利用提示詞來評估控制器用於評估軌跡的判斷標準之相對重要性。然後,這個評分會被用來在研究人員設定的安全基準線兩側,向上或向下調整每個標準。因此,如果使用者表示他們感到頭暈,LLM 將會提高鼓勵平穩轉向和溫和加速的參數,使車輛傾向於更平穩的行駛方式。

然而,在進行任何變更之前,模型會先向使用者呈現其計畫實施調整的自然語言描述。使用者隨後可以批准該計畫或提出進一步的建議。該系統也具備互動性,因此如果車輛行為不符合預期或使用者偏好改變,使用者可以請求進一步的調整。

Martinez-Baselga 表示,這種「人機協作」系統讓乘客能夠及時發現模型誤解提示詞的情況。同時,它也有助於處理「開快一點」這類建議固有的主觀性,或模型可能無法準確描述其計畫變更的可能性。在這種情況下,乘客可以像「搭計程車或朋友開車時一樣」,簡單地提出額外的提示詞。

研究人員在流行的自駕模擬器 nuPlan 中測試了該系統,情境包括匯入繁忙的高速公路。在八種不同的提示詞下,系統以符合使用者意圖的方式改變了控制器的參數:要求更舒適的行駛會提高平穩度,而表示緊急的請求則會導致更高的速度。

這並非 LLM 首次被用於調整自駕車的運動規劃器。瑞士蘇黎世聯邦理工學院(ETH Zurich)的博士生 Nicolas Baumann 去年發表了一項研究,其中 LLM 微調了模型賽車控制器的參數,讓使用者不僅能改變駕駛風格,還能給出更具體的指令,例如「倒車」或「保持特定速度」。

Baumann 表示,這種方法的優勢在於將 LLM 與主控制器分離,這意味著即使模型產生幻覺,也無法做出任何危險的行為。他說:「你獲得了語言互動的可能性,但可以保證它將在經典控制器的限制範圍內,因此你可以將安全性內建其中。」但他補充說,設定這些限制需要大量的工程工作。

慕尼黑工業大學網路實體系統教授 Matthias Althoff 表示,如果想證明安全性,還需要更進一步。他的團隊建立了一個系統,讓 LLM 提出駕駛決策,然後使用數學流程根據交通規則和其他道路使用者的行為預測來檢查這些決策。這使得在執行決策之前能夠驗證其安全性,這是台夫特大學論文中未提供的。

Althoff 說:「與任何 LLM 一樣,結果不保證是正確的。因此,我們在工作中會保護 LLM 的決策。」