Tab-Cleaner: Weakly Supervised Tabular Data Cleaning via Pre-training for E-commerce Catalog

Tab-Cleaner: Weakly Supervised Tabular Data Cleaning via Pre-training for E-commerce Catalog
复制标题

DOI:
10.18653/v1/2023.acl-industry.18
复制
发表时间:
2023
期刊:
--
影响因子:
--
通讯作者:
Kewei Cheng;Xian Li;Zhengyang Wang;Chenwei Zhang;Binxuan Huang;Y. Xu;X. Dong;Yizhou Sun
Kewei Cheng;Xian Li;Zhengyang Wang;Chenwei Zhang;Binxuan Huang;Y. Xu;X. Dong;Yizhou Sun
中科院分区:
其他
文献类型:
--
作者:
Kewei Cheng;Xian Li;Zhengyang Wang;Chenwei Zhang;Binxuan Huang;Y. Xu;X. Dong;Yizhou Sun

文献摘要

相似文献

产品目录,概念上是文本丰富的表格形式,由个体零售商自我报告,因此不可避免地包含嘈杂的事实。在产品目录中添加这些文本属性对于提高其可靠性至关重要。然而,用于处理自由文本内容的流行方法,例如预先训练的语言模型,对结构化表格数据并不特别有效,因为它们通常是在自由形式的自然语言文本上训练的。在本文中,我们提出了Tab-Cleaner,这是一种旨在处理富文本表格数据的错误检测的模型,该模型遵循预训练/微调范式。我们在现实世界的亚马逊产品目录表上训练Tab-Cleaner,其中包含数百万种产品,并在PR AUC属性适用性分类任务和PR AUC属性值验证任务上显示了16\ %的最先进方法的改进。
Product catalogs, conceptually in the form of text-rich tables, are self-reported by individual retailers and thus inevitably contain noisy facts. Verifying such textual attributes in product catalogs is essential to improve their reliability. However, popular methods for processing free-text content, such as pre-trained language models, are not particularly effective on structured tabular data since they are typically trained on free-form natural language texts. In this paper, we present Tab-Cleaner, a model designed to handle error detection over text-rich tabular data following a pre-training / fine-tuning paradigm. We train Tab-Cleaner on a real-world Amazon Product Catalog table w.r.t millions of products and show improvements over state-of-the-art methods by 16\% on PR AUC over attribute applicability classification task and by 11\% on PR AUC over attribute value validation task.