LLM 排行榜

集合多個公開 LLM 評測榜單的訊號,整理成一個可讀、可追溯、每日自動更新的模型排名快照。

模型

20

訊號

44

更新日期

2026-09-08

香港時間每日 00:00 自動更新

共識快照

多個公開評測訊號,整理成一張決策表。

#1Claude Fable 5.1Anthropic · 綜合推理 第 1 位 · 文本偏好 第 3 位 · 智能代理任務 第 1 位98
#2Claude Fable 5Anthropic · 綜合推理 第 4 位 · 文本偏好 第 1 位 · 智能代理任務 第 3 位93
#3GPT-6 AstraOpenAI · 綜合推理 第 2 位90
#4Claude Opus 5Anthropic · 綜合推理 第 3 位 · 文本偏好 第 7 位 · 智能代理任務 第 2 位88

共識排名

共識分數並非原始跑分,而是跨評測排名位置的加權結果;同一產品線的不同推理強度與版本會合併,只取最佳成績。

權重設定綜合推理 40%文本偏好 30%智能代理任務 30%
排名01專有模型

Claude Fable 5.1

Anthropic

  • 綜合推理 第 1 位
  • 文本偏好 第 3 位
  • 智能代理任務 第 1 位

98

100%

3 項評測訊號

排名02專有模型

Claude Fable 5

Anthropic

  • 綜合推理 第 4 位
  • 文本偏好 第 1 位
  • 智能代理任務 第 3 位

93

100%

3 項評測訊號

排名03專有模型

GPT-6 Astra

OpenAI

  • 綜合推理 第 2 位

90

40%

1 項評測訊號

排名04專有模型

Claude Opus 5

Anthropic

  • 綜合推理 第 3 位
  • 文本偏好 第 7 位
  • 智能代理任務 第 2 位

88

100%

3 項評測訊號

排名05專有模型

Muse Spark 1.3

Meta

  • 綜合推理 第 5 位

79

40%

1 項評測訊號

排名06專有模型

GPT-5.6 Sol

OpenAI

  • 綜合推理 第 6 位
  • 文本偏好 第 14 位
  • 智能代理任務 第 4 位

73

100%

3 項評測訊號

排名07專有模型

Claude Opus 4.7

Anthropic

  • 文本偏好 第 4 位
  • 智能代理任務 第 10 位

73

60%

2 項評測訊號

排名08開放權重

Kimi K3

Kimi

  • 綜合推理 第 10 位
  • 文本偏好 第 10 位
  • 智能代理任務 第 6 位

69

100%

3 項評測訊號

排名09專有模型

Claude Opus 4.6

Anthropic

  • 文本偏好 第 2 位
  • 智能代理任務 第 17 位

63

60%

2 項評測訊號

排名10開放權重

Hy4 preview

Tencent

  • 智能代理任務 第 9 位

63

30%

1 項評測訊號

排名11專有模型

Claude Opus 4.8

Anthropic

  • 文本偏好 第 15 位
  • 智能代理任務 第 5 位

61

60%

2 項評測訊號

排名12專有模型

Gemini 3.8 Flash

Google

  • 綜合推理 第 14 位
  • 文本偏好 第 6 位
  • 智能代理任務 第 14 位

58

100%

3 項評測訊號

排名13專有模型

Muse Spark

Meta

  • 文本偏好 第 11 位

56

30%

1 項評測訊號

排名14專有模型

Qwen3.8 Max

Alibaba

  • 綜合推理 第 7 位
  • 文本偏好 第 19 位
  • 智能代理任務 第 13 位

54

100%

3 項評測訊號

排名15專有模型

GPT 5.5

OpenAI

  • 文本偏好 第 16 位
  • 智能代理任務 第 8 位

54

60%

2 項評測訊號

排名16開放權重

GLM-5.3

Z AI

  • 綜合推理 第 8 位
  • 文本偏好 第 17 位
  • 智能代理任務 第 18 位

49

100%

3 項評測訊號

排名17專有模型

Gemini 3 Pro

Google

  • 文本偏好 第 13 位

48

30%

1 項評測訊號

排名18專有模型

Muse Spark 1.2

Meta

  • 綜合推理 第 16 位
  • 文本偏好 第 5 位
  • 智能代理任務 第 28 位

41

100%

3 項評測訊號

排名19開放權重

Qwen3.8 2.4T A95B

Alibaba

  • 綜合推理 第 15 位

41

40%

1 項評測訊號

排名20專有模型

Grok 4.6

SpaceXAI

  • 綜合推理 第 9 位
  • 文本偏好 第 42 位
  • 智能代理任務 第 16 位

39

100%

3 項評測訊號

計算方法

加權共識,而非單一評測定勝負。

  1. 01每日香港時間 00:00 自動抓取三個公開評測榜單,結果快取 24 小時。
  2. 02每個評測先按模型排名轉換成位置分數,再以本版權重加權平均。
  3. 03同一產品線的不同推理強度或版本會合併,只取該產品線在各評測的最佳成績。
  4. 04缺少部分評測覆蓋的模型會按覆蓋率略作折扣,避免單一榜單的短期第一名壓過多評測穩定的模型。
  5. 05排名只是選型與實驗的入口,並非絕對答案;實際應用仍要按成本、延遲、上下文長度、資料政策和任務測試決定。

想把排行變成可落地的模型選型?

如果要把這個排行榜接到貴公司的模型選型、提示詞測試或智能代理工作流程,我們可以幫你拆成可重跑的評測流程。

討論 AI 工作流程