Synthesizing Parallel Data of User-Generated Texts with Zero-Shot Neural Machine Translation

Synthesizing Parallel Data of User-Generated Texts with Zero-Shot Neural Machine Translation
复制标题

DOI:
10.1162/tacl_a_00341
复制
发表时间:
2020-11
影响因子:
10.9
通讯作者:
Benjamin Marie;Atsushi Fujita
Benjamin Marie;Atsushi Fujita
中科院分区:
人文科学1区
文献类型:
--
作者:
Benjamin Marie;Atsushi Fujita

文献摘要

相似文献

神经机器翻译(NMT)系统通常在干净的并行数据上训练。它们可以很好地翻译干净的域内文本。然而,如以前的工作所示,翻译质量显着时,翻译嘈杂的文本,如用户生成的文本(UGT)从在线社交媒体。由于缺乏可用于训练或适应NMT系统的UGT并行数据,我们合成UGT并行数据,通过跨语言语言模型预训练和零镜头NMT系统利用UGT单语数据。本文提出了两种不同但互补的方法:一种是将给定的干净并行数据转换为UGT类并行数据,另一种是从UGT的单语数据生成翻译。在MTNT翻译任务中,我们证明了我们合成的并行数据可以为UGT带来更好的NMT系统,同时使它们在翻译各种领域和风格的文本时更加强大。
Abstract Neural machine translation (NMT) systems are usually trained on clean parallel data. They can perform very well for translating clean in-domain texts. However, as demonstrated by previous work, the translation quality significantly worsens when translating noisy texts, such as user-generated texts (UGT) from online social media. Given the lack of parallel data of UGT that can be used to train or adapt NMT systems, we synthesize parallel data of UGT, exploiting monolingual data of UGT through crosslingual language model pre-training and zero-shot NMT systems. This paper presents two different but complementary approaches: One alters given clean parallel data into UGT-like parallel data whereas the other generates translations from monolingual data of UGT. On the MTNT translation tasks, we show that our synthesized parallel data can lead to better NMT systems for UGT while making them more robust in translating texts from various domains and styles.