Dazzle: Using Optimized Generative Adversarial Networks to Address Security Data Class Imbalance Issue

Dazzle: Using Optimized Generative Adversarial Networks to Address Security Data Class Imbalance Issue
复制标题

DOI:
10.1145/3524842.3528437
复制
发表时间:
2022-03
期刊:
2022 IEEE/ACM 19th International Conference on Mining Software Repositories (MSR)
影响因子:
--
通讯作者:
Rui Shu;Tianpei Xia;Laurie A. Williams;T. Menzies
Rui Shu;Tianpei Xia;Laurie A. Williams;T. Menzies
中科院分区:
其他
文献类型:
--
作者:
Rui Shu;Tianpei Xia;Laurie A. Williams;T. Menzies

文献摘要

被引文献

相似文献

背景:机器学习技术已被广泛使用,并在软件漏洞预测等许多软件安全任务中表现出良好的性能。然而,软件漏洞数据集中的类别比率通常高度不平衡(因为观察到的漏洞的百分比通常非常低)。目标:帮助安全从业者解决软件安全数据类不平衡问题,并进一步帮助使用重采样数据集构建更好的预测模型。方法:我们引入了一种称为 Dazzle 的方法,它是具有梯度惩罚的条件 Wasserstein 生成对抗网络 (cWGAN-GP) 的优化版本。 Dazzle 使用称为贝叶斯优化的新型优化器探索 cWGAN-GP 的架构超参数。我们使用 Dazzle 生成少数类样本,以对原始不平衡训练数据集进行重新采样。结果:我们使用三个软件安全数据集(即 Moodle 易受攻击的文件、Ambari 错误报告和 JavaScript 函数代码)评估 Dazzle。我们展示了 Dazzle 的实用性,并展示了对 SMOTE 等现有最先进的过采样技术的有希望的改进(例如,在所有数据集的召回率方面,与 SMOTE 相比,平均提高了 60% 左右)。结论:基于这项研究,我们建议使用优化的 GAN 作为解决安全漏洞数据类不平衡问题的替代方法。
Background: Machine learning techniques have been widely used and demonstrate promising performance in many software security tasks such as software vulnerability prediction. However, the class ratio within software vulnerability datasets is often highly imbalanced (since the percentage of observed vulnerability is usually very low). Goal: To help security practitioners address software security data class imbalanced issues and further help build better prediction models with resampled datasets. Method: We introduce an approach called Dazzle which is an optimized version of conditional Wasserstein Generative Adversarial Networks with gradient penalty (cWGAN-GP). Dazzle explores the architecture hyperparameters of cWGAN-GP with a novel optimizer called Bayesian Optimization. We use Dazzle to generate minority class samples to resample the original imbalanced training dataset. Results: We evaluate Dazzle with three software security datasets, i.e., Moodle vulnerable files, Ambari bug reports, and JavaScript function code. We show that Dazzle is practical to use and demonstrates promising improvement over existing state-of-the-art oversampling techniques such as SMOTE (e.g., with an average of about 60% improvement rate over SMOTE in recall among all datasets). Conclusion: Based on this study, we would suggest the use of optimized GANs as an alternative method for security vulnerability data class imbalanced issues.