评测指标说明

以下为榜单中使用的各级指标口径。数值型指标为 0-1 的得分率,指数型指标为 0-100 的相对评分。

智能指数
综合指数型

Artificial Analysis 综合智能指数,由多个基准加权得出,反映模型整体推理能力。

来源:Artificial Analysis

代码指数
代码指数型

Artificial Analysis 代码能力指数,综合 LiveCodeBench 等代码基准。

来源:Artificial Analysis

数学指数
数学指数型

Artificial Analysis 数学能力指数,综合 AIME 等数学基准。

来源:Artificial Analysis

MMLU Pro
学科知识

大规模多任务语言理解进阶版,衡量跨学科知识广度。

来源:MMLU Pro

GPQA
知识

研究生水平知识问答(GPQA Diamond),考察专家级科学知识。

来源:GPQA

HLE
评估

人类最后一场考试(Humanity's Last Exam),极难的综合知识测试。

来源:HLE

LiveCodeBench
代码

持续更新的代码生成基准,降低数据污染影响。

来源:LiveCodeBench

SciCode
代码

面向科研场景的数据科学编程题集。

来源:SciCode

Math 500
数学

OpenAI 收集的 500 道竞赛数学题子集(MATH500)。

来源:MATHEMATICA/MATH500

AIME
数学

美国数学邀请赛题(老版口径,2023 及以前)。

来源:AIME

AIME 2025
数学

2025 版美国数学邀请赛题。

来源:AIME 2025

IFBench
指令遵循

指令遵循能力基准(IFEval 中文扩展)。

来源:IFBench

LCR
代码

代码审查与修复基准(LLM Code Review)。

来源:LCR

TerminalBench Hard
命令行

终端 CLI 使用能力高难度子集评测。

来源:TerminalBench

Tau2
综合

第三代整体智能基准测试(Tau-Bench 的升级版),综合对话与工具使用。

来源:Tau2

价格与速度

价格为每百万 tokens 的官方公开价(USD),人民币价按实时汇率换算展示(当前 1 USD = 6.7597 CNY,来自 open.er-api.com,每日同步)。速度指标由社区抽样实测中位数得出。