Sentence Boundary Detection in Adjudicatory Decisions in the United States

Sentence Boundary Detection in Adjudicatory Decisions in the United States
复制标题

美国判决中的句子边界检测

DOI:
10.18653/v1/w19-2204
复制
发表时间:
2017
期刊:
Proceedings of the Natural Legal Language Processing Workshop 2019
影响因子:
--
通讯作者:
Kevin D. Ashley
Kevin D. Ashley
中科院分区:
--
文献类型:
--
作者:
Jaromír Šavelka;Vern R. Walker;Matthias Grabmair;Kevin D. Ashley

文献摘要

被引文献

相似文献

我们报告的结果,努力使计算机分割成句子美国的裁决决定。我们创建了一个包含来自四个不同领域的80个法院判决的数据集。我们表明,法律的决定是更具有挑战性的现有的句子边界检测系统比非法律的文本。现有的句子边界检测系统是基于一些假设,不成立的法律的文本,因此,他们的性能受损。我们表明,一般的统计序列标记模型能够更有效地学习定义。我们已经训练了一些条件随机场模型,当应用于判决时,它们的性能优于传统的句子边界检测系统。简历。我们提出的结果是,我们努力要求协调员将各国家统一委员会的仲裁决定分段为短语。我们在五个不同领域作出了80项司法判决。我们必须认识到,司法决定对于非司法文本的现有范围的侦查制度来说是极其困难的。现有的短语界限检测系统是基于一种对文本不具有价值的假设名称,这种假设名称在不同的情况下具有不同的表现。Nous montrons qu'un modèle général d'étiquetage de séquence statistique est capable d'estridre la definition plus efficacement.我们制定了一个特定的名称,该名称超越了适用于司法判决的传统佩内界限检测制度。
We report results of an effort to enable computers to segment US adjudicatory decisions into sentences. We created a data set of 80 court decisions from four different domains. We show that legal decisions are more challenging for existing sentence boundary detection systems than for non-legal texts. Existing sentence boundary detection systems are based on a number of assumptions that do not hold for legal texts, hence their performance is impaired. We show that a general statistical sequence labeling model is capable of learning the definition more efficiently. We have trained a number of conditional random fields models that outperform the traditional sentence boundary detection systems when applied to adjudicatory decisions. RÉSUMÉ. Nous présentons les résultats d’un effort visant à permettre aux ordinateurs de segmenter les décisions arbitrales des États-Unis en phrases. Nous avons créé un ensemble de données de 80 décisions de justice de quatre domaines différents. Nous montrons que les décisions juridiques sont plus difficiles pour les systèmes de détection des limites de peines existantes que pour les textes non juridiques. Les systèmes existants de détection des limites de phrases sont basés sur un certain nombre d’hypothèses qui ne sont pas valables pour les textes légaux, leur performance en est donc altérée. Nous montrons qu’un modèle général d’étiquetage de séquence statistique est capable d’apprendre la définition plus efficacement. Nous avons formé un certain nombre de modèles de champs aléatoires conditionnels qui surpassent les systèmes traditionnels de détection des limites de la peine lorsqu’ils sont appliqués aux décisions juridictionnelles.