课题基金 / 基金详情

密度函数回归模型中的数据缩减方法

批准号:
72101058
项目类别:
青年科学基金项目(C类)
资助金额:
30.0 万元
负责人:
张楠
依托单位:
学科分类:
管理统计理论与方法
结题年份:
2024
批准年份:
2021
项目状态:
已结题
项目参与者:
张楠

项目摘要

结项摘要

相似基金

相关文献

中文摘要
密度函数回归模型描述了响应变量密度函数与协变量之间的关系。相比于常用的条件均值、条件分位数回归模型,该模型更为灵活,能够提供更为丰富的信息。然而,密度函数回归模型在分析海量数据时,会面临由于数据样本量巨大带来的计算困难,无法有效地满足实际应用需求。数据缩减方法通过在原始观测数据中选取具有代表性的数据子集来进行统计建模,经常被用来降低模型计算复杂度。本项目将发展基于支撑点的数据缩减方法,解决密度函数回归模型在分析海量数据时的计算瓶颈。新方法将利用能量距离、连续排序得分以及Kullback-Leibler距离之间的联系,建立最优数据子集选择标准。理论方面,本项目将基于函数型方差分析模型及核函数偏差理论,对结构化模型进行分析,研究数据子集分布收敛性质和估计量误差收敛速率;实际应用方面,本项目拟将新方法应用到风能发电工程中涌现的实际问题中,为其提供高效的数据科学解决方案。
英文摘要
Density regression characterizes the conditional density of the response variable given the covariates, and provides much more information than the commonly used conditional mean or quantile regression. However, it is often computationally prohibitive and fails to deliver timely results when analyzing massive data sets. Data reduction aims at identifying representative data points from the original observations for downstream modeling to resolve the computational burden effectively. This project focuses on developing a novel data reduction approach with support points for density regression. The optimal selection rule will be based on the connections among energy distance, continuously ranked probabilistic score and the Kullback-Leibler distance. In theory, the project will study the structured model with functional ANOVA and kernel discrepancy methods, and establish the distributional convergence of the representative data set and the error convergence rate for the estimator. In application, the new method will be applied to solve real challenges in the wind energy industry. Efficient data analytics solutions will be developed.
本项目旨在解决密度函数回归模型在处理海量数据时的计算瓶颈问题,提出基于支撑点的数据缩减方法,以提高模型的计算效率和实用性。密度函数回归模型能够描述响应变量的条件密度函数与协变量之间的关系,相比传统的条件均值或分位数回归模型,提供了更丰富的分布信息,具有更强的实际应用价值。然而,随着数据量的增加,传统的非参数方法在处理大规模数据时面临计算复杂度高、存储需求大的问题,难以满足实际应用的需求。..项目的主要研究内容包括:1)在协变量维度较低的情况下,研究支撑点方法在条件分布意义下的统计性质,设计最优数据缩减算法;2)在协变量维度较高的情况下,针对模型的结构化假设(如加性、交互结构),设计基于支撑点的数据缩减算法,并论证其最优统计收敛性;3)将所提出的方法应用于风能发电工程中,对风车能量输出分布进行高效建模,解决多维度环境因素影响下的计算难题。..项目的重要结果包括:1)提出了基于支撑点的数据缩减方法,能够在条件分布意义下有效压缩原始数据,显著降低计算复杂度;2)通过能量距离、连续排序得分和Kullback-Leibler距离之间的联系,建立了最优数据子集选择标准,并论证了估计量的误差收敛速率;3)在风能发电应用中,成功将新方法应用于风车能量输出分布的建模,提供了高效的数据科学解决方案。..本项目的科学意义在于:1)解决了密度函数回归模型在大数据分析中的计算瓶颈问题,推动了非参数统计方法在大数据领域的应用;2)提出的数据缩减方法具有广泛的应用前景,特别是在风能发电等工程领域,能够为实际问题的解决提供高效的计算工具;3)通过理论分析和实际应用的结合,推动了数据科学和统计学的交叉研究,具有重要的学术价值和应用价值。
国内基金
海外基金