LLM 排行榜

集合多个公开 LLM 评测榜单的信号,整理成一个可读、可追溯、每日自动更新的模型排名快照。

模型

20

信号

44

更新日期

2026-09-08

香港时间每日 00:00 自动更新

共识快照

多个公开评测信号,整理成一张决策表。

#1Claude Fable 5.1Anthropic · 综合推理 第 1 位 · 文本偏好 第 3 位 · 智能体任务 第 1 位98
#2Claude Fable 5Anthropic · 综合推理 第 4 位 · 文本偏好 第 1 位 · 智能体任务 第 3 位93
#3GPT-6 AstraOpenAI · 综合推理 第 2 位90
#4Claude Opus 5Anthropic · 综合推理 第 3 位 · 文本偏好 第 7 位 · 智能体任务 第 2 位88

共识排名

共识分数并非原始跑分,而是跨评测排名位置的加权结果;同一产品线的不同推理强度与版本会合并,只取最佳成绩。

权重设置综合推理 40%文本偏好 30%智能体任务 30%
排名01专有模型

Claude Fable 5.1

Anthropic

  • 综合推理 第 1 位
  • 文本偏好 第 3 位
  • 智能体任务 第 1 位

98

100%

3 项评测信号

排名02专有模型

Claude Fable 5

Anthropic

  • 综合推理 第 4 位
  • 文本偏好 第 1 位
  • 智能体任务 第 3 位

93

100%

3 项评测信号

排名03专有模型

GPT-6 Astra

OpenAI

  • 综合推理 第 2 位

90

40%

1 项评测信号

排名04专有模型

Claude Opus 5

Anthropic

  • 综合推理 第 3 位
  • 文本偏好 第 7 位
  • 智能体任务 第 2 位

88

100%

3 项评测信号

排名05专有模型

Muse Spark 1.3

Meta

  • 综合推理 第 5 位

79

40%

1 项评测信号

排名06专有模型

GPT-5.6 Sol

OpenAI

  • 综合推理 第 6 位
  • 文本偏好 第 14 位
  • 智能体任务 第 4 位

73

100%

3 项评测信号

排名07专有模型

Claude Opus 4.7

Anthropic

  • 文本偏好 第 4 位
  • 智能体任务 第 10 位

73

60%

2 项评测信号

排名08开放权重

Kimi K3

Kimi

  • 综合推理 第 10 位
  • 文本偏好 第 10 位
  • 智能体任务 第 6 位

69

100%

3 项评测信号

排名09专有模型

Claude Opus 4.6

Anthropic

  • 文本偏好 第 2 位
  • 智能体任务 第 17 位

63

60%

2 项评测信号

排名10开放权重

Hy4 preview

Tencent

  • 智能体任务 第 9 位

63

30%

1 项评测信号

排名11专有模型

Claude Opus 4.8

Anthropic

  • 文本偏好 第 15 位
  • 智能体任务 第 5 位

61

60%

2 项评测信号

排名12专有模型

Gemini 3.8 Flash

Google

  • 综合推理 第 14 位
  • 文本偏好 第 6 位
  • 智能体任务 第 14 位

58

100%

3 项评测信号

排名13专有模型

Muse Spark

Meta

  • 文本偏好 第 11 位

56

30%

1 项评测信号

排名14专有模型

Qwen3.8 Max

Alibaba

  • 综合推理 第 7 位
  • 文本偏好 第 19 位
  • 智能体任务 第 13 位

54

100%

3 项评测信号

排名15专有模型

GPT 5.5

OpenAI

  • 文本偏好 第 16 位
  • 智能体任务 第 8 位

54

60%

2 项评测信号

排名16开放权重

GLM-5.3

Z AI

  • 综合推理 第 8 位
  • 文本偏好 第 17 位
  • 智能体任务 第 18 位

49

100%

3 项评测信号

排名17专有模型

Gemini 3 Pro

Google

  • 文本偏好 第 13 位

48

30%

1 项评测信号

排名18专有模型

Muse Spark 1.2

Meta

  • 综合推理 第 16 位
  • 文本偏好 第 5 位
  • 智能体任务 第 28 位

41

100%

3 项评测信号

排名19开放权重

Qwen3.8 2.4T A95B

Alibaba

  • 综合推理 第 15 位

41

40%

1 项评测信号

排名20专有模型

Grok 4.6

SpaceXAI

  • 综合推理 第 9 位
  • 文本偏好 第 42 位
  • 智能体任务 第 16 位

39

100%

3 项评测信号

计算方法

加权共识,而非单一评测定胜负。

  1. 01每日香港时间 00:00 自动抓取三个公开评测榜单,结果缓存 24 小时。
  2. 02每个评测先按模型排名转换成位置分数,再以本版权重加权平均。
  3. 03同一产品线的不同推理强度或版本会合并,只取该产品线在各评测的最佳成绩。
  4. 04缺少部分评测覆盖的模型会按覆盖率略作折扣,避免单一榜单的短期第一名压过多评测稳定的模型。
  5. 05排名只是选型与实验的入口,并非绝对答案;实际应用仍要按成本、延迟、上下文长度、数据政策和任务测试决定。

想把排行变成可落地的模型选型?

如果要把这个排行榜接到贵公司的模型选型、提示词测试或智能体工作流程,我们可以帮你拆成可重跑的评测流程。

讨论 AI 工作流程