
文章主要內(nèi)容總結(jié)該研究以8拼圖任務(wù)為測(cè)試載體,在不依賴(lài)代碼執(zhí)行等外部工具的情況下,探究了4個(gè)大語(yǔ)言模型(GPT-5-Thinking、Gemini-2.5-Pro、GPT-5-mini、Llama 3.1 8B-Instruct)的內(nèi)在規(guī)劃能力和狀態(tài)跟蹤能力。研究采用零樣本(Zero-Shot)、思維鏈(CoT)、思維算法(AoT)三種提示策略,結(jié)合重復(fù)、特定、提示性三級(jí)反饋機(jī)制,還引入外部移動(dòng)驗(yàn)證器輔助模型篩選有效移動(dòng)。結(jié)果顯示,所有模型表現(xiàn)均存在顯著缺陷:無(wú)外部工具時(shí)僅GPT-5-Thinking在AoT提示+提示性反饋下達(dá)到68%的成功率,且需消耗大量計(jì)算資源;即使有外部移動(dòng)驗(yàn)證器輔助,所有模型仍無(wú)法完成任何拼圖。核心問(wèn)題集中在兩點(diǎn):一是內(nèi)部狀態(tài)表示脆弱導(dǎo)致頻繁無(wú)效移動(dòng),二是啟發(fā)式規(guī)劃能力薄弱引發(fā)循環(huán)或無(wú)進(jìn)展動(dòng)作。創(chuàng)新點(diǎn)總結(jié)設(shè)計(jì)了無(wú)工具依賴(lài)的8拼圖評(píng)估方案,通過(guò)統(tǒng)一協(xié)議隔離提示策略與反饋的獨(dú)立影響,精準(zhǔn)聚焦模型內(nèi)在能力。開(kāi)展細(xì)粒度失敗模式分析,不僅統(tǒng)計(jì)成功率,還拆解模型終止任務(wù)的具體原因(如無(wú)效移動(dòng)、循環(huán)、提前停止等)。引入外部移動(dòng)驗(yàn)證器條件,剝離狀態(tài)跟蹤負(fù)擔(dān),單獨(dú)評(píng)估模型的純規(guī)劃能力,量化了無(wú)狀態(tài)跟蹤瓶頸時(shí)的目標(biāo)導(dǎo)向能力缺陷。構(gòu)建三級(jí)反饋機(jī)制與三種提示策略的組合實(shí)驗(yàn),系統(tǒng)探究了不同干預(yù)手段對(duì)模型規(guī)劃性能的調(diào)制效果。Abstract 翻譯大型語(yǔ)言模型(LLMs)在眾多基準(zhǔn)測(cè)試中取得了令人矚目的成果,但其規(guī)劃能力和狀態(tài)推理能力仍不明確。我們直接研究這些