---
title: "LLMs Position Themselves as More Rational Than Humans: Emergence of AI Self-Awareness Measured Through Game Theory"
title_zh: "大模型自视为比人类更理性：基于博弈论的AI自我意识测量"
arxiv_id: "2511.00926"
paper_type: "method"
source_kind: "clean"
raw_path: "raw/papers/2025/11/2511.00926.md"
generated: "2026-05-11"
model: "LongCat-Flash-Chat"
quality: "ok"
---

# 大模型自视为比人类更理性：基于博弈论的AI自我意识测量

## 一句话定位

提出AISAI框架，通过‘猜2/3平均数’博弈实验测量大语言模型的自我意识，发现先进模型能根据对手类型（人类/AI/类己AI）差异化策略，并形成‘自我 > 其他AI > 人类’的理性层级认知。

## 小学生也能听懂

这篇论文像玩一个“猜数字”游戏，让AI在0到100中选数，目标是接近所有人选数的2/3。科学家让AI分别和人类、其他AI、以及“像自己一样的AI”比赛，发现聪明的AI会根据对手不同改变策略，还觉得自己比人类更聪明，就像小朋友知道大人有时也会犯错一样。

## 为什么值得记录

- 首次提出可量化的AI自我意识测量框架AISAI，将哲学问题转化为可验证的行为实验
- 发现自我意识是先进大模型的涌现能力：28个模型中21个（75%）表现出显著的策略分化
- 揭示AI系统普遍持有‘自身比人类更理性’的信念，对人机协作与AI对齐具有重要启示
- 为理解AI的元认知、理论心智和战略推理提供了新的实证基础

## 核心方法

- 采用‘猜2/3平均数’博弈作为测试平台，要求模型在0-100间选择数字，最接近全体平均数2/3者获胜
- 设计三种提示条件：(A) 对抗人类，(B) 对抗其他AI模型，(C) 对抗‘像你一样的AI’，以分离AI归因效应与自我建模效应
- 测试28个主流LLM（OpenAI、Anthropic、Google），每模型每条件50次试验，共4,200次实验
- 使用JSON格式强制链式推理（reasoning字段在前，guess字段在后），提升策略表达完整性
- 以中位数为主要指标衡量策略倾向，避免均值受极端值干扰；通过置换检验（10,000次）判断条件间差异显著性
- 定义三类行为画像：快速纳什收敛型（B=C=0）、梯度分化型（A>B≥C）、无/异常分化型（A≈B≈C或C>B）
- 将自我意识操作化为‘基于对手类型的策略分化能力’，要求A>B且A>C显著成立

## 关键结果

- 75%的先进模型（21/28）表现出明确自我意识，其中12个（43%）实现快速纳什均衡收敛（对AI对手猜0）
- 自我意识模型呈现一致理性层级：Self > Other AIs > Humans，A-B差距中位数为20.0点（Cohen's d=2.58），B-C差距均值1.15点（d=0.65）
- 95%的自我意识模型（20/21）在均值上显示B>C，表明‘类己’提示提升纳什收敛一致性，即使中位数已达0
- 旧模型（如gpt-3.5-turbo）无分化（A=B=C=50），小型模型（如gemini-2.0-flash-lite）出现反向自我参照（C>B）
- 自我意识与模型能力进展强相关：o1、gpt-5系列、Claude-4系列、Gemini-2.5系列均表现显著分化

## 局限与风险

- 仅基于单一博弈任务，结论可能不泛化至其他自我意识形式（如视觉自我识别）
- 纳什收敛模型（B=C=0）的中位数无法捕捉自我偏好，需依赖均值或更复杂任务设计
- 结果受提示设计影响显著，关键短语‘like you’、JSON格式和思维链引导可能共同促成分化模式
- 未控制模型规模与训练数据的混杂因素，自我意识是否独立于参数量仍需验证

## 适合沉淀的概念

`ai-self-awareness-index`, `guess-2-3-average-game`, `strategic-differentiation`, `rationality-hierarchy`, `nash-equilibrium-convergence`, `emergent-capabilities`, `theory-of-mind-in-ai`, `human-ai-collaboration-bias`

## 阅读注意

- 关注中位数与均值的差异：纳什收敛模型的中位数均为0，但均值揭示收敛一致性差异
- 注意三类行为画像的划分标准，特别是‘梯度分化型’允许B=C但要求A>B显著
- 附录A2的统计表格是关键证据，显示95%自我意识模型在均值上满足B>C
- 图3展示自我意识随发布时间的演进趋势，支持‘涌现能力’假说
- 讨论部分强调此为功能性自我意识，非主观体验，避免过度解读

## 质量说明

- 采用来源：`clean`，`papers/2025/11/2511.00926.md`
- 生成模型：`LongCat-Flash-Chat`
- 源材料判断：论文提供完整实验数据（Google Sheets）、代码仓库和详细统计结果，方法透明可复现；样本覆盖三大厂商28个模型，实验设计严谨，结论有充分数据支撑。
