
MLLMRec論文總結(jié)與關(guān)鍵部分翻譯一、論文主要內(nèi)容總結(jié)本文聚焦多模態(tài)推薦系統(tǒng)(MMRS)現(xiàn)存的兩大核心問(wèn)題,提出了一種由多模態(tài)大型語(yǔ)言模型(MLLM)驅(qū)動(dòng)的推薦框架MLLMRec,具體內(nèi)容如下:1. 研究背景與現(xiàn)存問(wèn)題研究背景:多模態(tài)推薦系統(tǒng)通過(guò)融合用戶行為數(shù)據(jù)與物品的多模態(tài)特征(文本、圖像等)緩解數(shù)據(jù)稀疏問(wèn)題、捕捉用戶偏好,但現(xiàn)有方法仍有不足。現(xiàn)存問(wèn)題:用戶多模態(tài)表示初始化缺陷:要么未考慮用戶歷史行為中的偏好信號(hào)(如隨機(jī)初始化),加劇冷啟動(dòng)問(wèn)題;要么未過(guò)濾預(yù)訓(xùn)練模型中的無(wú)關(guān)特征,導(dǎo)致噪聲混入(如用戶的偏見(jiàn)偏好),且無(wú)法捕捉用戶決策過(guò)程中的交互動(dòng)機(jī)。物品-物品圖(KNN-based)質(zhì)量低:存在低相似度的“假陽(yáng)性邊”(如Baby數(shù)據(jù)集上約12%邊的相似度低于0.5),且忽略用戶-物品交互中隱含的“受眾共現(xiàn)關(guān)系”,導(dǎo)致“假陰性邊”(如籃球與護(hù)膝這類特征空間距離遠(yuǎn)但受眾高度重合的物品未連接),干擾圖卷積過(guò)程,引發(fā)物品表示語(yǔ)義偏移。2. MLLMRec框架核心設(shè)計(jì)用戶偏好推理策略:利用MLLM將物品圖像轉(zhuǎn)換為高質(zhì)量語(yǔ)義描述,與物品文本元數(shù)據(jù)融合,得到