Bitte benutzen Sie diese Referenz, um auf diese Ressource zu verweisen: doi:10.22028/D291-37888
Titel: Tracing Syntactic Change in the Scientific Genre: Two Universal Dependency-parsed Diachronic Corpora of Scientific English and German
VerfasserIn: Krielke, Marie-Pauline
Talamo, Luigi
Fawzi, Mahmoud
Knappen, Jörg
Sprache: Englisch
Titel: Proceedings of the Thirteenth Language Resources and Evaluation Conference
Seiten: 4808-4816
Verlag/Plattform: European Language Resources Association
Erscheinungsjahr: 2022
Erscheinungsort: Marseille, France
Konferenzort: Marseille, France
Freie Schlagwörter: universal dependencies
evaluation
English-German contrastive
diachronic linguistics
scientific language
DDC-Sachgruppe: 420 Englisch
430 Deutsch
Dokumenttyp: Konferenzbeitrag (in einem Konferenzband / InProceedings erschienener Beitrag)
Abstract: We present two comparable diachronic corpora of scientific English and German from the Late Modern Period (17th c.--19th c.) annotated with Universal Dependencies. We describe several steps of data pre-processing and evaluate the resulting parsing accuracy showing how our pre-processing steps significantly improve output quality. As a sanity check for the representativity of our data, we conduct a case study comparing previously gained insights on grammatical change in the scientific genre with our data. Our results reflect the often reported trend of English scientific discourse towards heavy noun phrases and a simplification of the sentence structure (Halliday, 1988; Halliday and Martin, 1993; Biber and Gray, 2011; Biber and Gray, 2016). We also show that this trend applies to German scientific discourse as well. The presented corpora are valuable resources suitable for the contrastive analysis of syntactic diachronic change in the scientific genre between 1650 and 1900. The presented pre-processing procedures and their evaluations are applicable to other languages and can be useful for a variety of Natural Language Processing tasks such as syntactic parsing.
URL der Erstveröffentlichung: https://aclanthology.org/2022.lrec-1.514
Link zu diesem Datensatz: urn:nbn:de:bsz:291--ds-378883
hdl:20.500.11880/34331
http://dx.doi.org/10.22028/D291-37888
ISBN: 979-10-95546-72-6
Datum des Eintrags: 14-Nov-2022
Drittmittel / Förderung: This work is supported by the Deutsche Forschungsgemeinschaft (DFG, German Research Foundation) – Project-ID 232722074 – SFB 1102.
Fakultät: P - Philosophische Fakultät
Fachrichtung: P - Sprachwissenschaft und Sprachtechnologie
Professur: P - Prof. Dr. Elke Teich
Sammlung:SciDok - Der Wissenschaftsserver der Universität des Saarlandes

Dateien zu diesem Datensatz:
Datei Beschreibung GrößeFormat 
2022.lrec-1.514.pdf350,18 kBAdobe PDFÖffnen/Anzeigen


Diese Ressource wurde unter folgender Copyright-Bestimmung veröffentlicht: Lizenz von Creative Commons Creative Commons