Assessing the Quality of Personality Measures Generated by Large Language Models 待投稿 · PNAS

大语言模型能否以低成本、可扩展的方式,从学生书信中测量大五人格特质?这些测量 能否有效预测未来表现?我们使用中国农村约 1,000 名七年级学生书写的笔友信件, 让 GPT-4o 对 60 题的大五人格量表(BFI-2)逐题评分,并把 LLM 当作与学生、 教师、家长并列的一个额外评分者。

AI 评分表现出很高的内部一致性,复现了已知的人口统计学相关关系,并能预测学生 后续的学业表现与心理健康。在多评分者联合模型中,AI 评分保有独立的预测力—— 其 Shapley–Owen 贡献与教师报告相当,高于学生自评和家长报告。我们还用 LLM 提取的信件主题与情感倾向来解释 AI 的评分,找到了有意义的文本相关关系。

The Effects of China–US Tensions on Science: Evidence from the arXiv Dataset 进行中

中美紧张局势是否降低了科学影响力?如果是,通过哪些渠道?我们将约 54.1 万篇 arXiv 计算机科学预印本(2010–2024)与 OpenAlex 文献计量数据关联,围绕 2018 年 8 月 NIH“涉外影响”调查浪潮估计连续双重差分。处理强度定义为 2017 年各研究领域 海外华人作者的占比。

2018 年 8 月之后,高海外华人占比的领域经历了持续的引用下降,而发表量并未减少。 以中国大陆作者占比构造的安慰剂检验没有可比效应,三重差分估计也确认下降集中在 海外华人署名的论文上。首年引用不受影响;下降出现在第 12–23 个月并持续存在, 而基于文本的新颖度指标保持稳定——这与“长期知识传播受损”一致,而非研究内容 质量的下降。