国内刊号:44-1251/T
国际刊号:1000-565X
发布日期:
作者:刘勘 黄哲英
单位:1. 中南财经政法大学 信息与安全工程学院,湖北 武汉 430073; 2. 南开大学 商学院,天津 300071
关键词:新冠疫情,谣言识别,生成模型,文本增强
基金:国家自然科学基金面上项目 ( 71573196) ; 中南财经政法大学中央高校基本科研业务费专项资金资助项目( 2722020JX007)
新冠疫情暴发以来,相关谣言时有传播,但传统的谣言识别模型却难以有效判别疫情谣言,因为相较于大量历史谣言数据,疫情谣言的数量还不足以训练出良好的分类器。因此,建立一个以少量谣言数据为基础的疫情谣言识别模型紧迫且重要。针对训练数据量不足的问题,为了提高疫情谣言鉴别效果,文中提出了一种基于文本增强和生成对抗网络 ( GAN) 的疫情谣言识别方法。首先,分析疫情谣言的文本特征,提取能表征疫情谣言的特征词; 然后,基于 GAN 构建疫情谣言生成模型,将不含疫情谣言特征的历史谣言,利用疫情谣言特征词库进行文本增强,并生成大量含有疫情谣言特征的新谣言数据; 最后,在疫情谣言中补充新生成的谣言数据,从而训练出更准确的疫情谣言分类模型。实验结果表明,使用 GAN 扩充训练集后,识别效果提高了 3 个百分点,明显优于传统机器学习和深度学习算法,为重大突发疫情事件中谣言的识别提供了新的途径。
来源:2021年第1期
《华南理工大学学报(自然科学版)》期刊编辑部