Outperforming Multilingual Models: Character-level Processing and Custom Word Embeddings for Old English.

We evaluate a Stanza-based pipeline for Old English that combines character-level processing with language-specific word embeddings derived from the Dictionary of Old English Corpus. On a 25,000-word dataset annotated with Universal Dependencies, character-level models yield consistent gains over to...

Descripción completa

Detalles Bibliográficos
Publicado en:International Journal of Humanities & Arts Computing: A Journal of Digital Humanities Vol. 20; no. 1; pp. 18 - 36
Autores principales: Arista, Javier Martín, Rodríguez, Darío Metola
Formato: Artículo
Publicado: Edinburgh University Press Mar2026
Materias:
Acceso en línea:Ver este registro en EBSCOhost
fields @attributes:
  recordID: 1
pdfLink:
plink: https://search.ebscohost.com/login.aspx?direct=true&db=hlh&AN=192442237&site=ehost-live
header:
  @attributes:
    shortDbName: hlh
    uiTerm: 192442237
    longDbName: Humanities International Complete
    uiTag: AN
  controlInfo:
    bkinfo:
    jinfo:
      jid:
        17538548
        2QD7
      jtl: International Journal of Humanities & Arts Computing: A Journal of Digital Humanities
      issn: 17538548
      maglogo: N
    pubinfo:
      dt: Mar2026
      vid: 20
      iid: 1
      pid: 2327
      pub: Edinburgh University Press
    artinfo:
      ui:
        192442237
        10.3366/ijhac.2026.0362
      ppf: 18
      ppct: 18
      formats:
      tig:
        atl: Outperforming Multilingual Models: Character-level Processing and Custom Word Embeddings for Old English.
      aug:
        au:
          Arista, Javier Martín
          Rodríguez, Darío Metola
        affil:
          University of La Rioja
          Reddit
      su:
        Old English language
        Parsing (Grammar)
        Natural language processing
        Language models
        Low-resource languages
        Text processing (Computer science)
      sug:
        subj:
          Old English language
          Parsing (Grammar)
          Natural language processing
          Language models
          Low-resource languages
          Text processing (Computer science)
      keyword:
        character-level embeddings
        dependency parsing
        language-specific word embeddings
        neural network models
        Old English processing
      ab: We evaluate a Stanza-based pipeline for Old English that combines character-level processing with language-specific word embeddings derived from the Dictionary of Old English Corpus. On a 25,000-word dataset annotated with Universal Dependencies, character-level models yield consistent gains over token-based variants for lemmatization and dependency parsing (test UAS 88.92 per cent; LAS 79.65 per cent). Relative to a multilingual baseline for Old English, our best parser improves LAS by approximately 20 per cent; compared with a recent monolingual spaCy baseline on similar data sizes, gains are approximately 5 per cent on our split. We complement scores with qualitative analyses to illustrate strengths and limitations, and we provide implementation details to support replication. The main conclusion of this work is that, under low-resource conditions, language-specific embeddings and character-level modelling are more effective for Old English processing than cross-linguistic transfer learning.
      pubtype: Academic Journal
      doctype: Article
      src: R
    language: English
    refInfo:
    copyright:
      @attributes:
        flag: Y
      dt:
        @attributes:
          year: 2026
    holdings:
      @attributes:
        islocal: N