現今,人工智慧聊天機器人如 ChatGPT 和 Claude 能執行多種功能,例如撰寫工作電子郵件和規劃旅行行程。這些聊天機器人是圍繞大型視覺語言模型(VLM)建構的系統,這些 AI 模型經過包含書籍、網站、程式碼和圖像等海量資料集訓練。AI 演算法隨後再透過大量人類回饋進行微調,以遵循指令並避免產生有害或不必要的輸出,並利用這些「知識」根據使用者輸入生成文字或圖像。

儘管聊天機器人有其明顯限制,但它們在廣泛的任務中仍非常有用,包括一些傳統上需要專業技能的領域,例如電腦程式設計。

作為美國空軍部與麻省理工學院 AI 加速器「幻影計畫」(Phantom Program)的一部分,美國空軍學員 Joshua Lynch 在其導師 Laura Niss(麻省理工學院林肯實驗室嵌入式與 AI 系統小組的技術人員)的協助下,希望確認自己作為一個程式設計完全新手,是否能開發出一個功能齊全的程式。

他採用了一種稱為「vibe-coding」的過程,即使用者完全依賴提示詞來引導生成式 AI 聊天機器人編寫和完善程式碼。他的動機是希望賦能任何熟悉軍事問題領域的人,無論其技術背景如何,都能推進他們對實用軟體應用的想法,從根本上繞過傳統軍事軟體開發流程的時間和成本限制。Lynch 旨在建構自己的應用程式,而 Niss 則監測他使用這項技術的經驗。

Niss 表示:「這位幻影計畫的學生想看看他是否能在沒有任何先驗經驗的情況下,透過他自己定義的 vibe-coding 創造出一個有用的應用程式。」她補充說:「在這個專案中,我想了解他對 AI 的看法隨著使用時間的推移如何變化。我們都希望更好地理解 AI 在軍事領域中,如何以及何處能被非技術使用者所運用。」

Lynch 著手研究,在沒有程式設計技能的情況下,是否能利用聊天機器人為他的戰術團隊創建一個特定應用程式,以幫助減少附帶損害,同時提高整體任務的生存能力。這個應用程式將提供多種功能,包括 AI 輔助目標識別、模組化情報、監視與偵察、自主打擊以及戰場通訊管理。

在專案期間,Lynch 完成了多個 AI 專業發展課程,並熟悉了該技術在軍事和非軍事領域的應用。他主要使用三款付費 AI 聊天機器人模型來生成程式碼:Anthropic 的 Claude、OpenAI 的 ChatGPT 和 Google 的 Gemini。

大部分工作僅透過網頁瀏覽器上的聊天機器人主聊天功能完成,而非像現在標準做法那樣在開發環境中作為整合系統。最終應用程式是使用 Google AI Studio App 製作的,該應用程式可以創建與 Gemini 應用程式介面(API)互動的應用程式,並將 AI 整合到開發環境中。

在三個月的時間裡,Lynch 與這些模型合作,建構了他的應用程式,名為「遠端操作模組化增強裝置」(Remote Operating Modular Augmentation Device, ROMAD-AI)。在此期間,他學會了幾種改進程式碼輸出品質的方法。

例如,他經常遇到 AI 聊天機器人缺乏層次結構焦點並修改不相關程式碼區塊的問題。他發現將問題分解成小部分、清晰地提出問題,並在對話偏離目標太遠時將其引導回正題,這些都非常重要。

學習辨識聊天機器人的限制並有效規避這些限制,佔據了專案大部分時間。隨著 Lynch 對聊天機器人經驗的增加,AI 能力和開發時間的限制導致他重新調整了專案範圍,將其從一個能協助戰場的應用程式,轉變為一個能執行基本文件處理的應用程式,例如透過與 VLM 驅動的聊天機器人介面,分析戰場戰術地圖並生成任務規劃文件。

儘管最終的原型並未實現 Lynch 最初設定的所有功能(且在其目前版本中,對於預期的使用情境而言並不安全),但它證明了此類應用程式對軍事人員的能力和實用性。

Niss 表示:「我對這個最終產品印象深刻,它向我展示了這些系統在非專業人士進行原型設計方面的強大能力。」她認為:「我現在認為,這些工具對於非技術專家來說,是向技術專家傳達問題和可能解決方案,並協助溝通預期成果的強大工具。」

Niss 觀察到 Lynch 在使用過程中對 AI 語言模型的看法有所改變。在設定了一個宏偉的目標後,Lynch 逐漸了解了現有技術的能力,並在專案結束時大幅降低了預期。Lynch 和 Niss 對他隨著時間推移和系統更新,對不同 AI 系統的看法變化特別感興趣,其中 Claude 在討喜度、擬人化和感知智慧等特徵上顯示出比 ChatGPT 更高的穩定性。

Lynch 發現 AI 是一個有用的導師,但也指出它在自己熟悉的領域存在不準確之處。

該專案表明,AI 聊天機器人可以賦予非技術軍事人員為其獨特問題開發可行軟體應用程式的能力,儘管在處理敏感資訊和關鍵應用程式時,它更適合作為原型開發助手而非完整的生產工具。程式碼審查不當可能導致安全風險,例如 Lynch 沒有意識到最終應用程式是將輸入文件發送到 Gemini AI 模型進行分析,而不是在本地電腦上解析文件。儘管 AI 可以生成大量功能性程式碼,但程式碼審查仍然是這個領域的瓶頸。

Niss 表示:「對我來說,這個專案再次強調了不同領域專家之間的廣闊差距。」她總結道:「無論 AI 發展得多好,我認為我們始終需要合作,才能為最重要的問題找到最佳解決方案。」這項研究由美國空軍人工智慧加速器贊助,並在合作協議編號 FA8750-19-2-1000 下完成。