PromptResponse:優化大型語言模型程式碼任務之提示詞研究

arXiv - Human-Computer InteractionErik Thureck, Robert K\"uhnen, Tim Jacobowitz

研究發現統一的格式(如 JSON)能提升程式碼生成的穩定性,但過度使用 LLM 優化提示詞反而可能降低任務表現。

AI 幫你先抓重點

AI 重點 1

低成本的格式優化優於高成本的提示詞調優

滑鼠懸停看 AI 判斷理由
這挑戰了「提示詞越複雜、越經過 AI 優化就越好」的直覺。對於開發者而言,僅僅透過結構化格式(如 JSON)就能獲得穩定性收益,而不必耗費大量資源進行複雜的提示詞工程。
AI 重點 2

警惕 LLM 在提示詞優化中的「對齊失效」問題

滑鼠懸停看 AI 判斷理由
研究顯示 LLM 優化的提示詞反而降低了表現,這提醒我們在利用 AI 輔助設計指令時,必須考慮模型對齊(Alignment)的風險,避免過度優化導致模型偏離原始任務目標。

核心研究發現

  1. 1

    使用一致的格式化方式,特別是 JSON 格式,能顯著提升程式碼生成的效率與語法穩定性,並在任務表現上有微幅提升。

  2. 2

    透過 LLM 自動調整(LLM-tuned)的提示詞雖然看似精進,卻導致程式碼任務的執行表現大幅下降,且未在其他維度帶來顯著改善。

  3. 3

    研究透過對 HumanEval 資料集進行五種不同語法變體(Baseline、JSON、Markdown、YAML 及 LLM 優化版)的對照實驗,進行了超過 8200 次的 GPT-4o 執行測試。

對教育工作者的啟發

在設計 AI 輔助程式學習或自動化評量系統時,應優先採用結構化格式(如 JSON)來規範 AI 的輸出,這能確保系統的穩定性與解析效率。此外,在開發「AI 輔助設計指令」的工具時,應避免盲目追求複雜的提示詞優化,因為這可能導致模型理解偏差。建議實務工作者在設計教學情境時,應專注於指令的結構化與一致性,而非僅依賴 AI 生成的複雜指令,以確保學習者獲得穩定且正確的 AI 反饋。

原始文獻資訊

英文標題:
PromptResponse: Optimizing Prompts for LLM Coding Tasks
作者:
Erik Thureck, Robert K\"uhnen, Tim Jacobowitz
來源:
arXiv - Human-Computer Interaction
AI 摘要模型:
/models/gemma-4-26B-A4B-it
閱讀原文

每週精選研究電子報

每週五信箱收到精選 5 篇教育科技重點研究摘要,零時間壓力掌握學術前沿。