
論文總結(jié)與翻譯:《Finetuning Large Language Model as an Effective Symbolic Regressor》一、論文主要內(nèi)容該論文聚焦于符號回歸(SR)任務(wù)——從觀測數(shù)據(jù)中推導(dǎo)支配方程,這是科學(xué)發(fā)現(xiàn)的核心環(huán)節(jié)。當(dāng)前基于大型語言模型(LLMs)的符號回歸方法存在局限性,如依賴直接推理或提示工程,需大量推理迭代才能收斂到正確公式,且難以處理復(fù)雜方程,根源在于預(yù)訓(xùn)練LLMs的近似推理能力與SR任務(wù)高精度需求之間的固有矛盾。為解決此問題,論文提出以下核心內(nèi)容:構(gòu)建SymbArena基準(zhǔn)數(shù)據(jù)集:包含148,102個多樣方程,形成18.3億token的語料庫,覆蓋廣泛數(shù)學(xué)結(jié)構(gòu)與復(fù)雜度,且按方程框架劃分訓(xùn)練集(11,000個方程)與測試集(512個方程),避免結(jié)構(gòu)層面信息泄露;同時設(shè)計兼顧數(shù)值精度((R^2)、(Acc_{\tau}))與形式一致性(LLM基于語義的度量、啟發(fā)式字符串相似性度量)的評估方案,彌補(bǔ)傳統(tǒng)數(shù)值導(dǎo)向評估的不足。提出SymbolicChat基線模型:通過三階段訓(xùn)練優(yōu)化LLM的符號回歸能力。第一階段利用90%數(shù)據(jù)進(jìn)行指令微調(diào),將數(shù)據(jù)矩陣轉(zhuǎn)化為包含任務(wù)定義、操作說明與輸入輸出對的提示,采用交叉熵?fù)p失與LoRA實現(xiàn)參數(shù)高效微調(diào);第二階段基于剩余10%數(shù)據(jù),通過Form-GRPO強(qiáng)化微調(diào),設(shè)計形式正確性、形式相似性、數(shù)值擬合、等價性四種獎勵,引導(dǎo)模型生成結(jié)