国内刊号:44-1251/T
国际刊号:1000-565X
发布日期:
作者:涂新辉, 郭聪, 宗宇航
单位:华中师范大学 计算机学院,湖北 武汉 430079
关键词:信息检索,大语言模型,查询扩展,文档扩展
基金:国家自然科学基金项目(62472192)
随着大语言模型(LLM)的快速发展,信息检索中的文本匹配和文本扩展技术均取得了显著进展。查询扩展和文档扩展作为增强文本表征的2种重要方法,已广泛应用于现代信息检索系统中。目前,主流的文本扩展方法主要依赖大语言模型实现,然而这些模型生成的文本与人工创作的文本在语言多样性和风格上存在明显差异。这种差异可能会影响查询-文档相关性的计算准确度,最终导致整个信息检索系统的性能下降。为此,该文提出了一种基于双向文本扩展的信息检索重排方法(BTE-IRRM)。首先,采用零样本提示使大语言模型生成文档的伪查询和查询的伪文档;然后,计算伪查询和伪文档之间的语义相似度;最后,把原始查询-文档的相似度得分和伪查询-伪文档的语义相似度得分进行加权融合,得到最终的文档排序结果。为验证所提方法的有效性,该文在2个公开数据集(DL19和DL20)上进行了实验。结果表明,相比于现有基线方法,BTE-IRRM方法的多项评价指标均取得了显著提升。因此,该文提出的双向文本扩展方法能够进一步增强查询与文档之间的相关性匹配,从而提升整个信息检索系统的性能。
来源:2025年第9期
《华南理工大学学报(自然科学版)》期刊编辑部