
文章核心總結(jié)與翻譯一、主要內(nèi)容本文提出了一種可解釋的混合框架,用于大規(guī)模文本語料庫的敘事分析,核心是將詞袋模型(BoW)的主題建模與基于大型語言模型(LLM)的問答(QA)敘事模型相結(jié)合,共享再生核希爾伯特空間(RKHS)的潛在表示。核心流程主題篩選:通過BoW主題模型對(duì)語料庫進(jìn)行無監(jiān)督主題學(xué)習(xí),由LLM篩選出與用戶興趣相關(guān)的主題及對(duì)應(yīng)文檔;問答生成:LLM設(shè)計(jì)分類問題并對(duì)篩選后的文檔作答,將文檔轉(zhuǎn)化為結(jié)構(gòu)化的QA向量;敘事建模:基于QA數(shù)據(jù)構(gòu)建雙softmax敘事模型,每個(gè)敘事對(duì)應(yīng)一組問答概率分布(PMF),可解釋為對(duì)語料的連貫視角;高效推斷與外推:通過函數(shù)梯度下降實(shí)現(xiàn)模型學(xué)習(xí),借鑒Transformer架構(gòu)設(shè)計(jì)上下文問答外推機(jī)制,無需重復(fù)查詢LLM即可預(yù)測(cè)未標(biāo)注文檔的問答結(jié)果;多場(chǎng)景驗(yàn)證:在聯(lián)合國大會(huì)演講(2002-2007)、NeurIPS會(huì)議論文(1987-2019)等數(shù)據(jù)集上驗(yàn)證,支持跨語言分析(中英雙語)。關(guān)鍵優(yōu)勢(shì)可解釋性:從問題設(shè)計(jì)、敘事結(jié)構(gòu)到證據(jù)溯源均透明可審計(jì);高效性:減少LLM重復(fù)調(diào)用成本,支持大規(guī)模語料擴(kuò)展;靈活性:適配多語言、多領(lǐng)域(地