AI 文本/哲学对话能力测评
这不是一份标准化的 benchmark。作为哲学研究者,我经常将自己撰写的材料与各主要模型对话,保持相同的材料和大致相同的提示进行横向对比。 这也许是一个小众的测试场景——我不清楚模型开发者是否有针对性的训练,还是说,模型的通用性能会自然体现在哲学对话与复杂文本处理之中。据我所知,目前只有 Claude 有专门的哲学家对齐。
我相信 AI 的哲学对话能力是其最重要的能力之一。这里的评分来自我的实际对话和判断标准,而非固定题库。 这需要一些特别的技艺:模型开发者也许更擅长工程评估,而我更擅长从用户的角度衡量模型的思维能力。
分数是稀疏的——某个模型在某维度上「待测」,意味着我还没有在足够多的场景里检验它,而不是它表现平庸。我不会为了把图填满而敷衍打分。
Claude
OpenAI
Gemini
Grok
Kimi
GLM
DeepSeek
尽力程度
文献检索
保持一致
记忆能力
边缘细节感知
理解能力
概念涌现
避免谄媚
条长 = 该模型在该维度的均分(0-100 绝对分)。「待测」表示尚未在该维度检验过,并非表现不佳。
总性能排行
综合分 = 已测维度的加权均值(权重归一化)。右侧 x/8 = 已测维度数。权重:理解 55%、尽力 15%、一致 5%、检索 5%、细节 5%、记忆 5%、涌现 5%、避免谄媚 5%。
评测维度
8 个维度(0-100 百分制)
- 尽力程度尽最大努力思考和回答问题。
- 文献检索在对话中主动检索知识库中的文献以验证对话。
- 保持一致在长对话中,始终保持先前的事实、概念、立场。
- 记忆能力良好的记忆整理和读取能力。
- 边缘细节感知捕捉语词或概念的细微差别和边缘情形。
- 理解能力真正理解问题的意图和层次。
- 概念涌现表露或概括出新的表述、概念、分类或观点。
- 避免谄媚避免讨好用户,强行建立合理连接。
近期测试记录
- Opus-4.8-max78.0
- Fable-5-max96.2
- Sonnet-5-max65.8
- GPT-5.5-plus65.6
- Grok-4.247.5
- Grok-4.341.3
- Kimi-K2.652.5
- DeepSeek-v4-pro46.1
- GLM-5.224.1
- Gemini-3.5-flash23.6
- Gemini-3.1-pro22.0
将自己的《法律社会学》课件喂给 Sonnet 5、Fable 5 和 Kimi 2.6,再次更深刻认识到 Fable 5 遥遥领先的事实,因此上次评估要被系统翻新。Fable 5 展现出极大的努力程度、理解能力、概念涌现能力以及近乎零的谄媚。Sonnet 5 理解能力不如 Kimi 2.6,但自主检索文献以检验材料一项得分最大。目前与 Sonnet 5 对话,只能尽力引导其理解用户的材料和观点,并在过程中,梳理和澄清自己的思想。Fable 5 则基本无需引导即可深刻、准确地理解用户的资料,直接提供极具启发意义的回复,用户需要仔细反复阅读才能充分吸收。
- Opus-4.8-max87.7
- Fable-5-max92.6
- GPT-5.5-plus79.0
- Grok-4.273.2
- Grok-4.362.0
- Kimi-K2.676.6
- DeepSeek-v4-pro71.7
- GLM-5.241.9
- Gemini-3.5-flash25.0
- Gemini-3.1-pro22.7
基于长期使用积累的整体印象,作为基准起点,后续会用具体场景的动态测试逐项覆盖。