Case consistency: a necessary data quality property for software engineering data sets
Case consistency: a necessary data quality property for software engineering data sets
复制标题
DOI:
10.1145/2745802.2745820
复制
发表时间:
2015-04
期刊:
影响因子:
--
通讯作者:
Passakorn Phannachitta;Akito Monden;J. Keung;Ken-ichi Matsumoto
中科院分区:
文献类型:
--
作者:
Passakorn Phannachitta;Akito Monden;J. Keung;Ken-ichi Matsumoto
Data quality is an essential aspect in any empirical study, because the validity of models and/or analysis results derived from an empirical data is inherently influenced by its quality. In this empirical study, we focus on data consistency as a critical factor influencing the accuracy of prediction models in software engineering. We propose a software metric called Cases Inconsistency Level (CIL) for analyzing conflicts within software engineering data sets by leveraging probability statistics on project cases and counting the number of conflicting pairs. The result demonstrated that CIL is able to be used as a metric to identify either consistent data sets or inconsistent data sets, which are valuable for building robust prediction models. In addition to measuring the level of consistency, CIL is proved to be applicable to predict whether or not an effort model built from data set can achieve higher accuracy, an important indicator for empirical experiments in software engineering.