現有大型語言模型在法律領域的侷限:義大利法律專業考試圖靈測試研究

arXiv - Computers and SocietyGermana Bertoli, Ilaria Amelia Caggiano, Francesca Lagioia, Riccardo Rovatti, Giovanni Sartor, Emiliano Troisi

本研究透過圖靈測試發現,LLM 在法律辯論表現優異,但在需嚴格規劃與約束的公證人考試中全面失敗。

AI 幫你先抓重點

AI 重點 1

區分「生成式能力」與「目標導向規劃能力」的關鍵差異

滑鼠懸停看 AI 判斷理由
這項發現挑戰了「只要模型夠大就能解決所有問題」的迷思。它提醒我們,AI 在處理發散性、論證性的任務時表現出色,但在需要嚴密邏輯鏈條與多重約束條件的結構化規劃任務中仍有本質缺陷。
AI 重點 2

法律專業能力的評估不應僅依賴單一的語言流暢度

滑鼠懸停看 AI 判斷理由
研究顯示模型能生成與人類無異的文本,卻在專業深度上失分。這對於設計 AI 評量工具的研究者來說至關重要,必須開發能辨識深層邏輯錯誤而非僅僅是語法正確性的評估指標。

核心研究發現

  1. 1

    在對抗性法律論證與學說分析任務中,部分 LLM 的表現能與甚至超越頂尖人類考生水準。

  2. 2

    所有受測模型在公證人考試中均告失敗,顯示其無法處理具備嚴格形式與實質約束的目標導向法律規劃。

  3. 3

    研究識別出不同法律專業任務對 AI 的要求差異,並揭示了模型在處理特定法律邏輯時的重複性錯誤模式。

對教育工作者的啟發

對於教育設計者而言,此研究提供了關於「AI 輔助學習」邊界的警示。在設計法律或高階專業課程時,不應僅依賴 AI 進行論證練習,因為 AI 可能會提供看似正確但邏輯結構錯誤的規劃建議。建議在課程設計中加入「批判性檢驗」環節,訓練學生識別 AI 在處理複雜約束條件時的邏輯斷層,並將教學重點從單純的知識生成,轉向對 AI 生成內容的嚴謹審核與邏輯校對。

原始文獻資訊

英文標題:
What out-of-the-box LLMs can(t) do in law? A Turing test in Italian exams for lawyers, judges and notaries
作者:
Germana Bertoli, Ilaria Amelia Caggiano, Francesca Lagioia, Riccardo Rovatti, Giovanni Sartor, Emiliano Troisi
來源:
arXiv - Computers and Society
AI 摘要模型:
/models/gemma-4-26B-A4B-it
閱讀原文

每週精選研究電子報

每週五信箱收到精選 5 篇教育科技重點研究摘要,零時間壓力掌握學術前沿。