大语言模型能否以低成本、可扩展的方式,从学生书信中测量大五人格特质?这些测量 能否有效预测未来表现?我们使用中国农村约 1,000 名七年级学生书写的笔友信件, 让 GPT-4o 对 60 题的大五人格量表(BFI-2)逐题评分,并把 LLM 当作与学生、 教师、家长并列的一个额外评分者。
AI 评分表现出很高的内部一致性,复现了已知的人口统计学相关关系,并能预测学生 后续的学业表现与心理健康。在多评分者联合模型中,AI 评分保有独立的预测力—— 其 Shapley–Owen 贡献与教师报告相当,高于学生自评和家长报告。我们还用 LLM 提取的信件主题与情感倾向来解释 AI 的评分,找到了有意义的文本相关关系。