Describir: Evaluating large language model performance and reliability in scoring picture description tasks for neuropsychological assessment.