大数据应用中非概率性抽样的评估及算法研究
批准号:
62072153
项目类别:
面上项目
资助金额:
56.0 万元
负责人:
杨矫云
依托单位:
学科分类:
数据科学与大数据计算
结题年份:
2024
批准年份:
2020
项目状态:
已结题
项目参与者:
杨矫云
中文摘要
非概率性抽样指样本选择受限条件下的抽样。尽管很多大数据计算方法要求独立同分布抽样(i.i.d.抽样),但是这一要求往往受到各种限制而难以满足。这些限制可能由各种主观或客观因素导致,如由于成本、隐私、存储环境等限制,部分样本难以访问,由于数据开放中信息保护等限制,部分属性的分布信息需要脱敏等,均限制了样本选择的独立性和随机性,导致非概率性抽样。为此,本项目开展非概率性抽样的评估及算法研究,具体包括:1)通过高维分布分解与假设检验构建高维大数据非概率性抽样的分布评估模型,实现抽样结果的分布检验;2)基于评估模型分析满足高维同分布约束的抽样下界与上界,指导抽样算法设计;3)样本约束及部分属性分布约束下的非概率性抽样算法设计,获取满足约束条件的最小抽样;4)集成前述成果开发高维大数据抽样的评估及算法工具包。本项目可为复杂环境下数据的共享和分析提供新的理论和工具支撑,提高数据共享利用效率。
英文摘要
Nonprobability sampling is to select samples under constraints. Although many big data analysis methods require independent identically distributed sampling (i.i.d. sampling), this requirement is hardly to meet due to various constraints. These constraints may be caused by objective or subjective factors, e.g. due to the limitation of cost, privacy, storage environments, some samples are hard to access; due to the limitation of information protection in data publication, the distributions of some features need to be masked. These factors restrict the independence and randomness for sample selection, resulting in nonprobability sampling. Therefore, this project conducts research on evaluation and algorithms for nonprobability sampling. First, we establish an evaluation model for nonprobability sampling by distribution decomposition and hypothesis testing to realize the distribution test for sampling results. Second, we analyze the upper boundary and the lower boundary under the identical distribution constraint for high dimensional data based on the evaluation model to guide the design of sampling algorithms. Third, nonprobability sampling algorithms are designed to find the minimum sampled subsets under samples constraints and partially distribution constraints. Fourth, we develop the corresponding tools for big data sampling. The project will provide novel theories and methods for data share and analysis under complex environment, which will improve the efficiency for data share and utilization.
独立同分布抽样是很多大数据计算方法的基本要求,但是这一要求往往受到各种限制而难以满足。如何评估抽样数据与原始数据的分布一致性以及实际应用中抽样数据的规模要求是需要解决的重要问题。为此,本项目针对高维数据非概率性抽样问题展开研究。首先,为进行抽样数据的分布一致性评估,本项目构建了基于因果贝叶斯网络的高维分布分解,其中因果贝叶斯网络采用了融合文献知识的构建策略。为获取文献知识,本项目发展了小样本下的多种实体命名识别方法以及实体因果关系抽取方法构建因果关系图。对于小样本实体命名识别,特别是嵌套实体识别,本项目提出了全局双仿射正增强框架(GBPE)、原型注意力对比学习框架(PACL)和基于标签提示的实体命名识别方法(LPNER),这些方法在多个数据集上取得了显著的性能提升。对于实体间的因果关系抽取,本项目提出了因果模式表示学习(CPRL)方法和基于实体表示干预的偏差调整方法,实现因果关系图构建,支撑因果贝叶斯网络学习,提升了因果关系抽取的准确性和公平性。在分布分解的基础上,本项目通过相对误差和绝对误差评估抽样数据与原始数据的分布差异,进一步推导了抽样上下界,其中抽样下界转化为整数线性规划问题,抽样上界应用概率近似正确理论进行形式化表述并应用霍夫丁不等式进行了推导,最终给出了上下界的定理。在此基础上,本项目针对流数据Top-K查询和因果效应估计给出了抽样算法与样本量估计。最终整合这些成果进行了相应代码开源。在上述研究的基础上,本项目发表了第一标注高水平论文10篇,申报发明专利4项。培养硕士研究生6名,成果转化1项,转化金额10万。
状态空间搜索的anytime模式及其高效算法研究
-
批准号:61502135
-
项目类别:青年科学基金项目
-
资助金额:20.0万元
-
批准年份:2015
-
负责人:杨矫云
-
依托单位:
国内基金
海外基金