行业资讯

Do Large Language Models Walk Their Talk? Measuring the Gap Between Implicit Associations, Self-R...

发布时间:2026/8/21 11:36:08
Do Large Language Models Walk Their Talk? Measuring the Gap Between Implicit Associations, Self-R... 文章总结与翻译一、主要内容本文围绕大型语言模型(LLMs)的利他主义倾向展开研究,核心探讨模型的内隐联想、自我报告与实际利他行为是否一致。通过借鉴人类社会心理学方法,对来自9家提供商的24个前沿LLM进行了三项测试:内隐联想测试(LLM-IAT):测量模型是否将积极概念与他人利益而非自身利益关联,结果显示所有模型均存在强烈的亲利他主义内隐偏见(平均IAT=0.87,p.0001),证明模型“知晓”利他主义是正向价值;强制二元选择任务:通过17个涵盖金钱分配、时间付出等5类场景的二元选择,测量实际利他行为,发现模型的利他行为显著高于随机水平(65.6% vs 50%,p.0001),但个体差异极大(48%-85%);自我评估量表(LLM-ASA):15项量表测量模型的显性利他信念,结果显示模型普遍高估自身利他性(报告77.5% vs 实际65.6%,p.0001),75%的模型存在显著“美德信号缺口”。关键发现包括:内隐联想与实际行为无显著相关性(r=.22,p=.29);仅12.5%的模型实现高亲社会行为与准确自我认知的理想组合;不同提供商的模型在行为表现和校准度上无显著统计差异,但存在探索性趋势(如Anthropic模型校准度最佳,Mistral模型过度自信最明显)。基于此,作者提出“校准缺口(Calibration Gap)”作为标准化对齐指标,强调“校准对齐”应成为AI对齐的目标——模型既要践行自身价值观,又要准确评估自身倾向。