登录

EVALUATION / MODEL SELECTION

評測榜單

按任务对比模型表现,再进入原始评测平台查看方法与完整结果。

5榜单
72模型
08-29更新

选择评测维度

站内参考分,随资源目录一并维护。

综合能力

9/9

综合参考對话、推理、代碼與多模態表現。

来源LiveBench 2026-06-25数据版本 2026-06-25更新于 2026-08-29查看评测来源
站内参考分
01+3
GPT-5.6OpenAI
81/ 100
推理代码工具调用
按平台计费
看详情
02+2
GPT-5.5OpenAI
80/ 100
通用推理代码多轮
按平台计费
看详情
03+1
GPT-5.4OpenAI
78/ 100
视觉文档推理
按平台计费
看详情
04+4
Qwen3.8-Flash-Next通义千问 · 开源
76/ 100
长上下文开源成本
按平台计费
看详情
050
75/ 100
实时信息推理工具
USD 3.0 / 1M
看详情
06+2
73/ 100
代码Agent长文档
按平台计费
看详情
07-4
73/ 100
复杂任务代码长文档
USD 5.0 / 1M
看详情
080
Qwen3通义千问 · 开源
72/ 100
中文开源多语言
按平台计费
看详情
09+2
GLM-5.3 Flash智谱 · 开源
71/ 100
中文Agent低延迟
按平台计费
看详情

评测来源

进入原始评测平台

方法说明、原始结果和社区讨论请以外部平台为准。

通過真實用户投票對比 LLM 輸出質量的公開評測平台。

全球更新于 2026-08-29

独立的模型與 API 性能分析站:質量、速度、價格。

全球更新于 2026-08-29
L
LiveBench开源

題目持續更新的防污染基準測試,結果更可信。

全球更新于 2026-08-29
S
SWE-bench开源

以真實 GitHub issue 評測模型编程能力的基準。

全球更新于 2026-08-29
A

Aider 的代碼编辑排行榜,贴近真實開發任務。

全球更新于 2026-08-29

上海 AI 實驗室的開源評測體系,中文榜單權威。

国内更新于 2026-08-29
S

中文大模型综合測評基準,按月發布榜單。

国内更新于 2026-08-29

基於真實 API 用量的模型热度榜,反映實際采用。

全球更新于 2026-08-29