Evaluating large language model performance and reliability in scoring picture description tasks for neuropsychological assessment.

Bibliographic Details
Published in:PLoS Digital Health Vol. 5; no. 4; pp. 1 - 17
Main Author: Kleiman, Michael J.
Format: research tables/charts Journal Article
Published: Public Library of Science 4/21/2026
Online Access:View this record in EBSCOhost
fields @attributes:
  recordID: 1
pdfLink:
plink: https://search.ebscohost.com/login.aspx?direct=true&db=ccm&AN=193141181&site=ehost-live
header:
  @attributes:
    shortDbName: ccm
    uiTerm: 193141181
    longDbName: CINAHL Complete
    uiTag: AN
  controlInfo:
    bkinfo:
    dissinfo:
    jinfo:
      jid:
        27673170
        MP8B
      jtl: PLoS Digital Health
      issn: 27673170
      maglogo: N
    pubinfo:
      dt: 4/21/2026
      vid: 5
      iid: 4
      pid: 16707
      pub: Public Library of Science
      place: San Francisco, California
    artinfo:
      ui:
        193141181
        193141181
        193141181
        10.1371/journal.pdig.0001385
        193141181
      ppf: 1
      ppct: 16
      formats:
      tig:
        atl: Evaluating large language model performance and reliability in scoring picture description tasks for neuropsychological assessment.
      aug:
        au: Kleiman, Michael J.
        affil: Comprehensive Center for Brain Health, Department of Neurology, University of Miami Miller School of Medicine, Boca Raton, Florida, United States of America
      sug:
        subj:
          Natural Language Processing
          Neuropsychological Tests
          Prediction Models Evaluation
          Task Performance and Analysis
          Reliability
          Chatbot
          Human
          Funding Source
          Dementia Patients
          Descriptive Statistics
          Data Analysis Software
          Repeated Measures
          Analysis of Variance
          Male
          Female
          Middle Age
          Aged
          Reproducibility of Results
          Observer Bias
          Paired T-Tests
          Cognition Disorders Diagnosis
          Middle Aged: 45-64 years
          Aged: 65+ years
          Male
          Female
      pubtype: Academic Journal
      doctype:
        research
        tables/charts
        Journal Article
      ougenre: Article
      ab:
    language: English
    refInfo:
    holdings:
      @attributes:
        islocal: N