Semantische Duplikaterkennung mithilfe von Textual Entailment
Semantische Duplikaterkennung mithilfe von Textual Entailment
批准号:
81487564
负责人:
Professor Dr. Hermann Helbig
金额:
$0.0万
依托单位国家:
德国
项目类别:
Research Grants
财政年份:
2008
资助国家:
德国
项目状态:
已结题
起止时间:
2007-12-31 至 2011-12-31
中文摘要
他说:“这是一件非常重要的事情,因为它是一件非常重要的事情。”与此相关的是专利产品的生产和销售。这是一种新的信息技术和信息技术,在信息技术和信息技术领域具有重要意义。我们还定义了自动生成语义的系统,以及自动生成文本的方法。他说:“这是一件很重要的事情,因为这是一件很重要的事情。这是一种新的技术,它是一种新的技术,是一种新的技术,它是一种新的技术。Während de meisten te-system语法--oder Oberflächenbasiert sind,wird in Diesem Projekt ein Semantischer Anatz verfolgt.Letzterer setzt eine voll augebaute syntaktisch-Semantische analytics von tex ten voraus,die natürlichsprachliche Ausdrücke(Phrasen,Sätze,Textte)在Ensprechende Bedeutungsstrukturenübersetzen kann中实现了自动化。他分析了所有的逻辑和语义结构,包括基本结构和基本结构,并统计了它们的逻辑关系。他妈的我很健壮,我也不知道怎么回事。我是Rahman des beantragten Projektes soll das system SemDupl Zwar schwerpenktmäúig für das Deutsche entwickelt wickelt den.这是一个试点系统的zu zeigen,dass die vorgeschlagenen tiefen Semantischen verfahren aeh für多语种Anwendungen,angefangen von Duplikat-/plagiaterkennung bis hin zur zur Automatischenúbersetzung(Genauer:Für den Nachweis der Semantischen der Semantischen re quivalenz vonäbersetzungen),Geeignet sind。
英文摘要
Die automatische Erkennung von Duplikaten bzw. Plagiaten textuell gegebener Informationen, und nur auf diese wollen wir uns in dem vorgeschlagenen Projekt konzentrieren, hat nicht nur erhebliche rechtliche und ethische Konsequenzen, sondern auch eine zunehmende wirtschaftliche Bedeutung. Das Spektrum der relevanten gesellschaftlichen bzw. ökonomischen Phänomene reicht dabei vom Patentdiebstahl über Produktpiraterie bis hin zu wissenschaftlichen Fälschungen. Aber auch im Bereich der Informationsrecherche über hochredundanten Quellen (wie z. B. dem Internet) ist es wichtig, Dubletten oder Redundanzen in den Antworten zu erkennen und auf eine Kerninformation zu reduzieren. Es werden also dringend Systeme benötigt, die automatisch semantisch ähnliche oder gar äquivalente Texte erkennen können. Das Ziel dieses Projektantrags ist es, genau ein solches semantisch orientiertes Duplikaterkennungssystem (kurz SemDupl genannt) zu entwickeln. Die Technik bzw. das theoretische Gebiet, das diesem System zugrunde liegt, nennt man Textual Entailment (textuelles Schlussfolgern), oder kurz TE. Während die meisten TE-Systeme syntax- oder oberflächenbasiert sind, wird in diesem Projekt ein semantischer Ansatz verfolgt. Letzterer setzt eine voll ausgebaute syntaktisch-semantische Analyse von Texten voraus, die natürlichsprachliche Ausdrücke (Phrasen, Sätze, Texte) automatisch in entsprechende Bedeutungsstrukturen übersetzen kann. Da einer solchen Analyse alle Sprachebenen (Oberflächenform des Satzes, lemmatisierte Form, syntaktische und semantische Struktur) zur Verfügung stehen, können auf dieser Basis flache, statistisch basierte Verfahren mit tiefen semantischen und damit auch logikbasierten Verfahren kombiniert werden. Damit lassen sich robuste Erkennungssysteme mit hoher Erkennungsrate realisieren. Im Rahmen des beantragten Projektes soll das System SemDupl zwar schwerpunktmäßig für das Deutsche entwickelt werden. Es ist aber gleichzeitig anhand eines Pilotsystems zu zeigen, dass die vorgeschlagenen tiefen semantischen Verfahren auch für multilinguale Anwendungen, angefangen von Duplikat-/Plagiaterkennung bis hin zur automatischen Übersetzung (genauer: für den Nachweis der semantischen Äquivalenz von Übersetzungen), geeignet sind.
期刊论文(1)
专著(0)
科研奖励(0)
会议论文
Synonymy Extraction From Semantic Networks Using String and Graph Kernel Methods
使用字符串和图核方法从语义网络中提取同义词
DOI:
10.3233/978-1-61499-098-7-822
发表时间:
2012
期刊:
影响因子:
--
作者:
[vor der Brück, Yu-FangWang]
通讯作者:
Yu-FangWang