登录

EVALUATION / MODEL SELECTION

评测榜单

按任务对比模型表现,再进入原始评测平台查看方法与完整结果。

5榜单
72模型
08-29更新

选择评测维度

站内参考分,随资源目录一并维护。

综合能力

9/9

综合参考对话、推理、代码与多模态表现。

来源LiveBench 2026-06-25数据版本 2026-06-25更新于 2026-08-29查看评测来源
站内参考分
01+3
GPT-5.6OpenAI
81/ 100
推理代码工具调用
按平台计费
看详情
02+2
GPT-5.5OpenAI
80/ 100
通用推理代码多轮
按平台计费
看详情
03+1
GPT-5.4OpenAI
78/ 100
视觉文档推理
按平台计费
看详情
04+4
Qwen3.8-Flash-Next通义千问 · 开源
76/ 100
长上下文开源成本
按平台计费
看详情
050
75/ 100
实时信息推理工具
USD 3.0 / 1M
看详情
06+2
73/ 100
代码Agent长文档
按平台计费
看详情
07-4
73/ 100
复杂任务代码长文档
USD 5.0 / 1M
看详情
080
Qwen3通义千问 · 开源
72/ 100
中文开源多语言
按平台计费
看详情
09+2
GLM-5.3 Flash智谱 · 开源
71/ 100
中文Agent低延迟
按平台计费
看详情

评测来源

进入原始评测平台

方法说明、原始结果和社区讨论请以外部平台为准。

通过真实用户投票对比 LLM 输出质量的公开评测平台。

全球更新于 2026-08-29

独立的模型与 API 性能分析站:质量、速度、价格。

全球更新于 2026-08-29
L
LiveBench开源

题目持续更新的防污染基准测试,结果更可信。

全球更新于 2026-08-29
S
SWE-bench开源

以真实 GitHub issue 评测模型编程能力的基准。

全球更新于 2026-08-29
A

Aider 的代码编辑排行榜,贴近真实开发任务。

全球更新于 2026-08-29

上海 AI 实验室的开源评测体系,中文榜单权威。

国内更新于 2026-08-29
S

中文大模型综合测评基准,按月发布榜单。

国内更新于 2026-08-29

基于真实 API 用量的模型热度榜,反映实际采用。

全球更新于 2026-08-29