Detecting Cyber Threats in Non-English Hacker Forums: An Adversarial Cross-Lingual Knowledge Transfer Approach

Detecting Cyber Threats in Non-English Hacker Forums: An Adversarial Cross-Lingual Knowledge Transfer Approach
复制标题

DOI:
10.1109/spw50608.2020.00021
复制
发表时间:
2020-05
期刊:
2020 IEEE Security and Privacy Workshops (SPW)
影响因子:
--
通讯作者:
Mohammadreza Ebrahimi;Sagar Samtani;Yidong Chai;Hsinchun Chen
Mohammadreza Ebrahimi;Sagar Samtani;Yidong Chai;Hsinchun Chen
中科院分区:
其他
文献类型:
--
作者:
Mohammadreza Ebrahimi;Sagar Samtani;Yidong Chai;Hsinchun Chen

文献摘要

被引文献

相似文献

毁灭性网络攻击的频繁发生使网络安全成为一项重大的社会挑战。许多网络安全专业人员正在密切研究国际暗网,以主动查明潜在的网络威胁。尽管暗网有其潜在价值,但其中包含数十万条非英语帖子。虽然机器翻译是处理非英语文本的主流方法,但将机器翻译应用于黑客论坛文本会导致误译。在这项研究中,我们利用长短期记忆(LSTM)、跨语言知识迁移(CLKT)和生成对抗网络(GANs)原理,设计了一种新的对抗性跨语言知识迁移(A - CLKT)方法。A - CLKT对未翻译的文本进行操作,以保留语言的原始语义,并利用跨语言的网络威胁相关知识来创建一种不受语言影响的表示形式,且无需任何人工特征工程或外部资源。三项实验证明了A - CLKT在识别法语和俄语论坛中的网络威胁方面,如何优于最先进的机器学习、深度学习和CLKT算法。
The regularity of devastating cyber-attacks has made cybersecurity a grand societal challenge. Many cybersecurity professionals are closely examining the international Dark Web to proactively pinpoint potential cyber threats. Despite its potential, the Dark Web contains hundreds of thousands of non-English posts. While machine translation is the prevailing approach to process non-English text, applying MT on hacker forum text results in mistranslations. In this study, we draw upon Long-Short Term Memory (LSTM), Cross-Lingual Knowledge Transfer (CLKT), and Generative Adversarial Networks (GANs) principles to design a novel Adversarial CLKT (A-CLKT) approach. A-CLKT operates on untranslated text to retain the original semantics of the language and leverages the collective knowledge about cyber threats across languages to create a language invariant representation without any manual feature engineering or external resources. Three experiments demonstrate how A-CLKT outperforms state-of-the-art machine learning, deep learning, and CLKT algorithms in identifying cyber-threats in French and Russian forums.