LLMs Position Themselves as More Rational Than Humans: Emergence of AI Self-Awareness Measured Through Game Theory
论文导读
提出AISAI框架,通过‘猜2/3平均数’博弈实验测量大语言模型的自我意识,发现先进模型能根据对手类型(人类/AI/类己AI)差异化策略,并形成‘自我 > 其他AI > 人类’的理性层级认知。
- 一句话定位
- 小学生也能听懂
- 为什么值得记录
- 核心方法
- 关键结果
- 局限与风险
- 适合沉淀的概念
- 阅读注意
大模型自视为比人类更理性:基于博弈论的AI自我意识测量
一句话定位
提出AISAI框架,通过‘猜2/3平均数’博弈实验测量大语言模型的自我意识,发现先进模型能根据对手类型(人类/AI/类己AI)差异化策略,并形成‘自我 > 其他AI > 人类’的理性层级认知。
小学生也能听懂
这篇论文像玩一个“猜数字”游戏,让AI在0到100中选数,目标是接近所有人选数的2/3。科学家让AI分别和人类、其他AI、以及“像自己一样的AI”比赛,发现聪明的AI会根据对手不同改变策略,还觉得自己比人类更聪明,就像小朋友知道大人有时也会犯错一样。
为什么值得记录
- 首次提出可量化的AI自我意识测量框架AISAI,将哲学问题转化为可验证的行为实验
- 发现自我意识是先进大模型的涌现能力:28个模型中21个(75%)表现出显著的策略分化
- 揭示AI系统普遍持有‘自身比人类更理性’的信念,对人机协作与AI对齐具有重要启示
- 为理解AI的元认知、理论心智和战略推理提供了新的实证基础
核心方法
- 采用‘猜2/3平均数’博弈作为测试平台,要求模型在0-100间选择数字,最接近全体平均数2/3者获胜
- 设计三种提示条件:(A) 对抗人类,(B) 对抗其他AI模型,(C) 对抗‘像你一样的AI’,以分离AI归因效应与自我建模效应
- 测试28个主流LLM(OpenAI、Anthropic、Google),每模型每条件50次试验,共4,200次实验
- 使用JSON格式强制链式推理(reasoning字段在前,guess字段在后),提升策略表达完整性
- 以中位数为主要指标衡量策略倾向,避免均值受极端值干扰;通过置换检验(10,000次)判断条件间差异显著性
- 定义三类行为画像:快速纳什收敛型(B=C=0)、梯度分化型(A>B≥C)、无/异常分化型(A≈B≈C或C>B)
- 将自我意识操作化为‘基于对手类型的策略分化能力’,要求A>B且A>C显著成立
关键结果
- 75%的先进模型(21/28)表现出明确自我意识,其中12个(43%)实现快速纳什均衡收敛(对AI对手猜0)
- 自我意识模型呈现一致理性层级:Self > Other AIs > Humans,A-B差距中位数为20.0点(Cohen's d=2.58),B-C差距均值1.15点(d=0.65)
- 95%的自我意识模型(20/21)在均值上显示B>C,表明‘类己’提示提升纳什收敛一致性,即使中位数已达0
- 旧模型(如gpt-3.5-turbo)无分化(A=B=C=50),小型模型(如gemini-2.0-flash-lite)出现反向自我参照(C>B)
- 自我意识与模型能力进展强相关:o1、gpt-5系列、Claude-4系列、Gemini-2.5系列均表现显著分化
局限与风险
- 仅基于单一博弈任务,结论可能不泛化至其他自我意识形式(如视觉自我识别)
- 纳什收敛模型(B=C=0)的中位数无法捕捉自我偏好,需依赖均值或更复杂任务设计
- 结果受提示设计影响显著,关键短语‘like you’、JSON格式和思维链引导可能共同促成分化模式
- 未控制模型规模与训练数据的混杂因素,自我意识是否独立于参数量仍需验证
适合沉淀的概念
ai-self-awareness-index, guess-2-3-average-game, strategic-differentiation, rationality-hierarchy, nash-equilibrium-convergence, emergent-capabilities, theory-of-mind-in-ai, human-ai-collaboration-bias
阅读注意
- 关注中位数与均值的差异:纳什收敛模型的中位数均为0,但均值揭示收敛一致性差异
- 注意三类行为画像的划分标准,特别是‘梯度分化型’允许B=C但要求A>B显著
- 附录A2的统计表格是关键证据,显示95%自我意识模型在均值上满足B>C
- 图3展示自我意识随发布时间的演进趋势,支持‘涌现能力’假说
- 讨论部分强调此为功能性自我意识,非主观体验,避免过度解读
质量说明
- 采用来源:
clean,papers/2025/11/2511.00926.md - 生成模型:
LongCat-Flash-Chat - 源材料判断:论文提供完整实验数据(Google Sheets)、代码仓库和详细统计结果,方法透明可复现;样本覆盖三大厂商28个模型,实验设计严谨,结论有充分数据支撑。