Reconceptualizing Scoring Reliability Through Linguistic Similarity.

Conventional cross-country scoring reliability in international large-scale assessments often depends on double scoring, which typically involves relatively small samples of multilingual responses. To extend the reach of reliability estimation, this study introduces the Linguistic-integrated Reliabi...

Descripción completa

Detalles Bibliográficos
Publicado en:Educational & Psychological Measurement Vol. 86; no. 4; pp. 738 - 769
Autores principales: Jung, Ji Yoon, Bezirhan, Ummugul, von Davier, Matthias
Formato: Artículo
Publicado: Sage Publications Inc. Aug2026
Materias:
Acceso en línea:Ver este registro en EBSCOhost
Descripción
Sumario:Conventional cross-country scoring reliability in international large-scale assessments often depends on double scoring, which typically involves relatively small samples of multilingual responses. To extend the reach of reliability estimation, this study introduces the Linguistic-integrated Reliability Audit (LiRA), a novel method that measures scoring reliability using an entire dataset in a large-scale, multilingual context. LiRA automatically generates a second score for each response by analyzing its semantic alignment within a neighborhood of similar responses, then applies a weighted majority voting to determine a consensus score. Results demonstrate that LiRA provides a more comprehensive and systematic estimation of scoring reliability at the item, country, and language levels, while preserving the fundamental concepts of traditional reliability.