Outperforming Multilingual Models: Character-level Processing and Custom Word Embeddings for Old English.
We evaluate a Stanza-based pipeline for Old English that combines character-level processing with language-specific word embeddings derived from the Dictionary of Old English Corpus. On a 25,000-word dataset annotated with Universal Dependencies, character-level models yield consistent gains over to...
| Publicado en: | International Journal of Humanities & Arts Computing: A Journal of Digital Humanities Vol. 20; no. 1; pp. 18 - 36 |
|---|---|
| Autores principales: | , |
| Formato: | Artículo |
| Publicado: |
Edinburgh University Press
Mar2026
|
| Materias: | |
| Acceso en línea: | Ver este registro en EBSCOhost |
| fields | @attributes: recordID: 1 pdfLink: plink: https://search.ebscohost.com/login.aspx?direct=true&db=hlh&AN=192442237&site=ehost-live header: @attributes: shortDbName: hlh uiTerm: 192442237 longDbName: Humanities International Complete uiTag: AN controlInfo: bkinfo: jinfo: jid: 17538548 2QD7 jtl: International Journal of Humanities & Arts Computing: A Journal of Digital Humanities issn: 17538548 maglogo: N pubinfo: dt: Mar2026 vid: 20 iid: 1 pid: 2327 pub: Edinburgh University Press artinfo: ui: 192442237 10.3366/ijhac.2026.0362 ppf: 18 ppct: 18 formats: tig: atl: Outperforming Multilingual Models: Character-level Processing and Custom Word Embeddings for Old English. aug: au: Arista, Javier Martín Rodríguez, Darío Metola affil: University of La Rioja su: Old English language Parsing (Grammar) Natural language processing Language models Low-resource languages Text processing (Computer science) sug: subj: Old English language Parsing (Grammar) Natural language processing Language models Low-resource languages Text processing (Computer science) keyword: character-level embeddings dependency parsing language-specific word embeddings neural network models Old English processing ab: We evaluate a Stanza-based pipeline for Old English that combines character-level processing with language-specific word embeddings derived from the Dictionary of Old English Corpus. On a 25,000-word dataset annotated with Universal Dependencies, character-level models yield consistent gains over token-based variants for lemmatization and dependency parsing (test UAS 88.92 per cent; LAS 79.65 per cent). Relative to a multilingual baseline for Old English, our best parser improves LAS by approximately 20 per cent; compared with a recent monolingual spaCy baseline on similar data sizes, gains are approximately 5 per cent on our split. We complement scores with qualitative analyses to illustrate strengths and limitations, and we provide implementation details to support replication. The main conclusion of this work is that, under low-resource conditions, language-specific embeddings and character-level modelling are more effective for Old English processing than cross-linguistic transfer learning. pubtype: Academic Journal doctype: Article src: R language: English refInfo: copyright: @attributes: flag: Y dt: @attributes: year: 2026 holdings: @attributes: islocal: N |
|---|