全球各地法官因在工作中非法使用生成式 AI 而登上新聞頭條。然而,在巴基斯坦,一項針對法官設計的 AI 工具進行大規模試驗後發現,這項技術若搭配適當訓練,能將案件解決數量提升 6.3%,且判決品質並無明顯下降。

巴基斯坦司法系統面臨 226 萬件案件積壓,每十萬人僅有不到兩名法官,遠低於歐盟的 22 名和巴西的 8 名,因此急需協助。莫斯科新經濟學院的經濟學家 Sultan Mehmood 及其合作夥伴,在與司法部門協商後,測試 AI 是否能減輕此負擔。

他們開發了一款客製化工具,結合 OpenAI 的大型語言模型 GPT-4,並整合近 13 萬份巴基斯坦司法意見和法規知識庫,以協助法官進行法律研究和起草判決。這項工具於 2024 年開始提供給 1,559 名初審法官使用,約佔全國法官總數的一半。Mehmood 表示:「我們確實發現案件解決數量有所增加,且決策品質並未隨之下降。」

麻省理工學院經濟學教授 David Autor 稱讚:「他能做到這點非常了不起。在公務部門進行大規模實地實驗並不容易,尤其是在利害關係如此之高的領域。」他指出,6.3% 的生產力提升雖然不算壓倒性,但具備可信度,且隨著工具的廣泛使用,效果可能還會更好。

巴西和印度已開始推行法官專用的 AI 工具,而美國著名法學教授 Eric Posner 也曾在單一案例研究中比較 LLM 判決與人類判決。然而,迄今為止,尚未有針對司法領域持續使用 AI 進行大規模獨立評估。這項新研究聚焦於巴基斯坦的初審法院;Mehmood 表示,當地的法官從一開始就展現出極大的熱情。

他提到:「他們比我們更樂觀看待科技。案件延遲問題如此嚴重,他們認為無論如何都值得一試,以減輕民眾的痛苦。」Mehmood 也指出,有些法官已經在使用 AI 聊天機器人,但市售產品在處理巴基斯坦法律查詢時表現不佳,經常會產生錯誤的判例。因此,研究團隊開發了一款專為巴基斯坦情境量身打造的工具,名為 JudgeGPT。

他們採用了檢索增強生成(RAG)技術,讓模型能夠查詢包含 128,292 份巴基斯坦司法意見和 943 項法規的資料庫。回應中還附有連結至相關案件和法律的註腳。研究共同作者、蘇黎世聯邦理工學院法律、經濟與數據科學副教授 Elliott Ash 表示:「事實證明,解決幻覺問題的方法,不只是依靠更智慧的模型。而是將模型連接到一個能夠搜尋並驗證來源的工具。」然而,研究人員並未報告幻覺發生率。

研究團隊還對 1,197 名法官進行了六次 90 分鐘的 Zoom 線上培訓課程,由 Ash 講解大型語言模型(LLM)的運作方式、其限制、偏見與幻覺的風險,以及驗證輸出結果的重要性。另有 180 名法官僅接受了法律研究中科技應用的通用訓練,而最後一組則完全沒有接受訓練。

當 487 名法官完成培訓計畫後,中位數地區的案件解決數量增加了 6.3%,且地區內受訓法官越多,效果越顯著。上訴率也略有下降,這表明更快的解決速度並未導致草率的判決。JudgeGPT 可以透過簡單的文字查詢來找出相關判例法,結果會提供相關判決全文的連結。

研究團隊也評估了判決的品質。Mehmood 表示,讓法律專家評估大量判決是不可行的,因此團隊請 OpenAI 的 GPT-5-mini 從同一位法官在訓練前後的判決對中進行選擇。結果顯示,LLM 在 59% 的情況下選擇了訓練後的判決。兩位經驗豐富的巴基斯坦律師也評估了模型對 90 對判決的分析,他們與 GPT-5-mini 的意見一致率為 70.6%,而他們彼此之間的一致率為 73%。

結果顯示,訓練至關重要。在研究期間,接受 JudgeGPT 訓練的法官平均登入 56 次,發送 212 個提示詞,而接受通用訓練的法官則平均登入 10 次,發送 25 個提示詞。Mehmood 指出,那些未受訓練的法官傾向於使用該工具約一個月後就完全放棄。「僅僅提供人們技術,不一定能讓他們持續使用。」他說。

雖然 6.3% 的增長聽起來不大,但研究人員計算出,一名受過訓練的法官每月比基準線多解決 38.5 個案件,這意味著每花費一美元運行該工具,就能節省約 38.50 美元的司法成本。Ash 也指出,這些數據來自試驗開始的九個月期間,此後他們已更新了底層 AI 模型和資料庫。

對於使用者而言,這項工具無疑是救星。一位匿名參與的初審法官表示,他們被分配的案件數量十多年來從未低於 1,000 件。這項工具顯著節省了時間,尤其是在搜尋判例法和總結冗長文件方面。這位法官說:「進行研究時,現在只需一個提示詞就能完成,而以前我必須花數小時搜尋判例和法律。如果我必須閱讀 10 頁的判例,現在我會請 JudgeGPT 為我總結並提供重點,它在幾秒鐘內就能完成這項工作。」

然而,澳洲拉籌伯大學法律與科技教授 John Zeleznikow 指出,效率並非司法系統唯一追求的目標。他說:「他們試圖做到的是有效率地更快處理更多案件,而且他們確實做到了。但目前尚不清楚的是,所謂的司法品質是否因此變得更好。」

Zeleznikow 表示,AI 確實有用,但前提是法官必須勤奮地評估和驗證其輸出結果。然而,這份工作論文的作者發現,約有五分之一的參與者向 JudgeGPT 發出的提示詞涉及他們所謂的「實質性 AI 委託」,即要求工具判斷最佳決策、生成法律推理或在法官輸入極少的情況下撰寫意見。從好的方面來看,訓練降低了不當委託的比例。

但鑑於法官已經在使用 AI,Ash 認為更好的工具和訓練至關重要。他說:「使用這些 AI 當然存在風險,即使有所有這些保障措施。但在某個時候,你必須盡可能讓法官處於有利位置。要有技術保障,但也要鼓勵法官不要過度依賴它。」