课题基金 / 基金详情

Semantische Duplikaterkennung mithilfe von Textual Entailment

Semantische Duplikaterkennung mithilfe von Textual Entailment
使用文本蕴涵进行语义重复检测
批准号:
81487564
负责人:
Professor Dr. Hermann Helbig
金额:
$0.0万
依托单位国家:
德国
项目类别:
Research Grants
财政年份:
2008
资助国家:
德国
项目状态:
已结题
起止时间:
2007-12-31 至 2011-12-31

项目摘要

项目成果

相关文献

中文摘要
翻译
点击翻译按钮获取中文摘要
英文摘要
Die automatische Erkennung von Duplikaten bzw. Plagiaten textuell gegebener Informationen, und nur auf diese wollen wir uns in dem vorgeschlagenen Projekt konzentrieren, hat nicht nur erhebliche rechtliche und ethische Konsequenzen, sondern auch eine zunehmende wirtschaftliche Bedeutung. Das Spektrum der relevanten gesellschaftlichen bzw. ökonomischen Phänomene reicht dabei vom Patentdiebstahl über Produktpiraterie bis hin zu wissenschaftlichen Fälschungen. Aber auch im Bereich der Informationsrecherche über hochredundanten Quellen (wie z. B. dem Internet) ist es wichtig, Dubletten oder Redundanzen in den Antworten zu erkennen und auf eine Kerninformation zu reduzieren. Es werden also dringend Systeme benötigt, die automatisch semantisch ähnliche oder gar äquivalente Texte erkennen können. Das Ziel dieses Projektantrags ist es, genau ein solches semantisch orientiertes Duplikaterkennungssystem (kurz SemDupl genannt) zu entwickeln. Die Technik bzw. das theoretische Gebiet, das diesem System zugrunde liegt, nennt man Textual Entailment (textuelles Schlussfolgern), oder kurz TE. Während die meisten TE-Systeme syntax- oder oberflächenbasiert sind, wird in diesem Projekt ein semantischer Ansatz verfolgt. Letzterer setzt eine voll ausgebaute syntaktisch-semantische Analyse von Texten voraus, die natürlichsprachliche Ausdrücke (Phrasen, Sätze, Texte) automatisch in entsprechende Bedeutungsstrukturen übersetzen kann. Da einer solchen Analyse alle Sprachebenen (Oberflächenform des Satzes, lemmatisierte Form, syntaktische und semantische Struktur) zur Verfügung stehen, können auf dieser Basis flache, statistisch basierte Verfahren mit tiefen semantischen und damit auch logikbasierten Verfahren kombiniert werden. Damit lassen sich robuste Erkennungssysteme mit hoher Erkennungsrate realisieren. Im Rahmen des beantragten Projektes soll das System SemDupl zwar schwerpunktmäßig für das Deutsche entwickelt werden. Es ist aber gleichzeitig anhand eines Pilotsystems zu zeigen, dass die vorgeschlagenen tiefen semantischen Verfahren auch für multilinguale Anwendungen, angefangen von Duplikat-/Plagiaterkennung bis hin zur automatischen Übersetzung (genauer: für den Nachweis der semantischen Äquivalenz von Übersetzungen), geeignet sind.
期刊论文(1)
专著(0)
科研奖励(0)
会议论文
Synonymy Extraction From Semantic Networks Using String and Graph Kernel Methods
使用字符串和图核方法从语义网络中提取同义词
DOI: 10.3233/978-1-61499-098-7-822
发表时间: 2012
期刊:
影响因子: --
作者: [vor der Brück, Yu-FangWang]
通讯作者: Yu-FangWang