Machine Translation into Low-resource Language Varieties

Machine Translation into Low-resource Language Varieties
复制标题

DOI:
10.18653/v1/2021.acl-short.16
复制
发表时间:
2021-06
期刊:
ArXiv
影响因子:
--
通讯作者:
Sachin Kumar;Antonios Anastasopoulos;S. Wintner;Yulia Tsvetkov
Sachin Kumar;Antonios Anastasopoulos;S. Wintner;Yulia Tsvetkov
中科院分区:
其他
文献类型:
--
作者:
Sachin Kumar;Antonios Anastasopoulos;S. Wintner;Yulia Tsvetkov

文献摘要

相似文献

最先进的机器翻译(MT)系统通常被训练成生成“标准”目标语言;然而,许多语言具有与标准语言不同的多种变体(区域变体,方言,社会语,非母语变体)。这些品种通常是低资源的,因此不能从当代的NLP解决方案中受益,包括MT。我们提出了一个通用的框架,以快速适应MT系统生成语言品种接近,但不同的标准目标语言,不使用并行(源品种)数据。这也包括机器翻译系统适应低资源类型相关的目标语言。我们尝试采用英语-俄语MT系统生成乌克兰语和白俄罗斯语,英语-挪威Bokmål系统生成Nynorsk,英语-阿拉伯语系统生成四种阿拉伯语方言,在竞争基线上获得了显着改进。
State-of-the-art machine translation (MT) systems are typically trained to generate “standard” target language; however, many languages have multiple varieties (regional varieties, dialects, sociolects, non-native varieties) that are different from the standard language. Such varieties are often low-resource, and hence do not benefit from contemporary NLP solutions, MT included. We propose a general framework to rapidly adapt MT systems to generate language varieties that are close to, but different from, the standard target language, using no parallel (source–variety) data. This also includes adaptation of MT systems to low-resource typologically-related target languages. We experiment with adapting an English–Russian MT system to generate Ukrainian and Belarusian, an English–Norwegian Bokmål system to generate Nynorsk, and an English–Arabic system to generate four Arabic dialects, obtaining significant improvements over competitive baselines.