多類型網(wǎng)絡(luò)欺凌文本識(shí)別與分類數(shù)據(jù)集)
摘要該數(shù)據(jù)集面向網(wǎng)絡(luò)欺凌自動(dòng)檢測(cè)任務(wù)匯集了來自Twitter、維基百科討論頁和YouTube等不同來源的社交媒體文本。數(shù)據(jù)集概述該數(shù)據(jù)集面向網(wǎng)絡(luò)欺凌自動(dòng)檢測(cè)任務(wù)匯集了來自Twitter、維基百科討論頁和YouTube等不同來源的社交媒體文本。樣本按照是否包含欺凌行為進(jìn)行標(biāo)注并涵蓋仇恨言論、攻擊性表達(dá)、侮辱、毒性內(nèi)容、種族主義和性別歧視等多種網(wǎng)絡(luò)不良行為可為跨平臺(tái)內(nèi)容安全模型的訓(xùn)練和評(píng)估提供數(shù)據(jù)支持。數(shù)據(jù)結(jié)構(gòu)與關(guān)鍵特征數(shù)據(jù)集由多個(gè)經(jīng)過解析的CSV文件組成包括攻擊性、攻擊行為、毒性、Twitter綜合數(shù)據(jù)、Twitter種族主義、Twitter性別歧視、YouTube及Kaggle來源數(shù)據(jù)。各文件保存平臺(tái)文本及其相應(yīng)類別標(biāo)簽既包含欺凌與非欺凌二分類信息也反映不同類型的有害語言。數(shù)據(jù)具有來源平臺(tái)多樣、表達(dá)方式復(fù)雜、類別定義存在差異及文本噪聲較多等特點(diǎn)適合開展跨數(shù)據(jù)源聯(lián)合建模與泛化能力研究。應(yīng)用價(jià)值與研究方向該數(shù)據(jù)集可用于網(wǎng)絡(luò)欺凌識(shí)別、仇恨言論檢測(cè)、毒性評(píng)論過濾、社交平臺(tái)內(nèi)容審核及網(wǎng)絡(luò)環(huán)境風(fēng)險(xiǎn)預(yù)警。研究方向包括傳統(tǒng)機(jī)器學(xué)習(xí)與Transformer文本分類、多任務(wù)和多標(biāo)簽學(xué)習(xí)、跨平臺(tái)領(lǐng)域適應(yīng)、類別不平衡處理、隱晦攻擊識(shí)別、對(duì)抗魯棒性、模型可解釋性及實(shí)時(shí)審核系統(tǒng)開發(fā)還應(yīng)關(guān)注數(shù)據(jù)偏差、群體公平性、語境誤判和用戶隱私保護(hù)避免模型對(duì)特定身份群體或語言表達(dá)產(chǎn)生不合理歧視。數(shù)據(jù)集來源由張家梁(Bob)整理并于2026年在7zcode平臺(tái)公開發(fā)布。數(shù)據(jù)集信息免責(zé)聲明與引用數(shù)據(jù)僅用于科研與教學(xué)用途。若用于商業(yè)場(chǎng)景請(qǐng)自行核驗(yàn)數(shù)據(jù)許可。如需引用請(qǐng)?jiān)谡撐幕驁?bào)告中注明數(shù)據(jù)集名稱與版本號(hào)。作者信息作者Bob (張家梁)項(xiàng)目編號(hào)Datasets-588文件大小64M原創(chuàng)聲明本數(shù)據(jù)集為整理作品