国内刊号:44-1251/T
国际刊号:1000-565X
发布日期:
作者:张志清, 于晓正, 朱雷鹏, 孙玉凤, 李祎昕
单位:北京工业大学 交通工程北京市重点实验室,北京 100124
关键词:自动驾驶车辆,小样本量,数据不平衡,条件表格生成对抗网络,事故预测
基金:国家自然科学基金项目(52178403)
明晰自动驾驶车辆交通事故机理是有效防控安全风险的重要前提。自动驾驶车辆交通事故诱因分析通常基于小样本和不平衡数据进行建模,但这类模型对于少数类预测精度低。基于数据增强的分析框架可以提高模型对于少数类的预测精度。通过条件表格生成对抗网络(CTGAN)、联合生成对抗网络(CopulaGAN)以及合成少数过采样(SMOTE)、自适应过采样(ADASYN)技术增加样本量,平衡数据集,对比不同方法的合成数据质量;基于合成数据,对逻辑回归(LR)、决策树(DT)、随机森林(RF)、极端梯度提升(XGB)、支持向量机(SVM)5种分类算法进行评估,采用召回率、特异性、加权F1分数及曲线下面积(AUC)等指标确定最优组合;最后结合沙普利可加解释(SHAP)框架量化事故关键诱因重要度。结果表明:CTGAN生成数据的边际分布得分(0.96)和相关性得分(0.92)最高,合成数据的平均质量为0.94,显著优于其他方法;CTGAN与随机森林算法结合时,模型在召回率(0.82)、特异性(0.84)、AUC(0.86)等指标上均表现优异,在包含10%标签噪声的测试集中仍保持鲁棒性(召回率提升至0.88),进一步验证了其在复杂场景中的适用性。关键诱因分析表明,路面状况(潮湿状态显著增加受伤风险)、夜间行车(低光照导致传感器性能下降)、交叉口及街道化程度(复杂场景增加检测延迟)是导致事故的核心因素。该研究为自动驾驶测试场景搭建及道路基础设施改造提供了关键依据。
来源:2025年第10期
《华南理工大学学报(自然科学版)》期刊编辑部