Sentence Boundary Detection in Adjudicatory Decisions in the United States
Sentence Boundary Detection in Adjudicatory Decisions in the United States
复制标题
美国判决中的句子边界检测
DOI:
10.18653/v1/w19-2204
复制
发表时间:
2017
期刊:
影响因子:
--
通讯作者:
Kevin D. Ashley
中科院分区:
文献类型:
--
作者:
Jaromír Šavelka;Vern R. Walker;Matthias Grabmair;Kevin D. Ashley
We report results of an effort to enable computers to segment US adjudicatory decisions into sentences. We created a data set of 80 court decisions from four different domains. We show that legal decisions are more challenging for existing sentence boundary detection systems than for non-legal texts. Existing sentence boundary detection systems are based on a number of assumptions that do not hold for legal texts, hence their performance is impaired. We show that a general statistical sequence labeling model is capable of learning the definition more efficiently. We have trained a number of conditional random fields models that outperform the traditional sentence boundary detection systems when applied to adjudicatory decisions. RÉSUMÉ. Nous présentons les résultats d’un effort visant à permettre aux ordinateurs de segmenter les décisions arbitrales des États-Unis en phrases. Nous avons créé un ensemble de données de 80 décisions de justice de quatre domaines différents. Nous montrons que les décisions juridiques sont plus difficiles pour les systèmes de détection des limites de peines existantes que pour les textes non juridiques. Les systèmes existants de détection des limites de phrases sont basés sur un certain nombre d’hypothèses qui ne sont pas valables pour les textes légaux, leur performance en est donc altérée. Nous montrons qu’un modèle général d’étiquetage de séquence statistique est capable d’apprendre la définition plus efficacement. Nous avons formé un certain nombre de modèles de champs aléatoires conditionnels qui surpassent les systèmes traditionnels de détection des limites de la peine lorsqu’ils sont appliqués aux décisions juridictionnelles.