模型测评:Artificial Analysis 指标

公开 LLM 指标聚合展示,包含智能、代码、数学、速度、价格、延迟和性价比等维度。

智能

Artificial Analysis Intelligence Index · 越高越好

Anthropic Claude Fable 5.1 (Adaptive Reasoning, Max Effort, Default Fallback)

Top 53.4平均 51.3910 项

代码

Artificial Analysis Coding Index · 越高越好

Anthropic Claude Fable 5.1 (Adaptive Reasoning, Max Effort, Default Fallback)

Top 81.6平均 78.3510 项

数学

Artificial Analysis Math Index · 越高越好

OpenAI GPT-5.2 (xhigh)

Top 99平均 96.5510 项

速度

输出 tokens/s · 越高越好

Celeris Celeris-1

Top 2362.6平均 616.4310 项

各维度 Top 3 差距

每个维度以第 1 名为 100,对比第 2、3 名与头名的接近程度。

智能
#1Anthropic Claude Fable 5.1 (Adaptive Reasoning, Max Effort, Default Fallback)53.4
#2Anthropic Claude Fable 5.1 (Adaptive Reasoning, Xhigh Effort, Default Fallback)53.2
#3OpenAI GPT-6 Astra (max)52.8
代码
#1Anthropic Claude Fable 5.1 (Adaptive Reasoning, Max Effort, Default Fallback)81.6
#2Anthropic Claude Fable 5.1 (Adaptive Reasoning, Xhigh Effort, Default Fallback)80.7
#3Anthropic Claude Fable 5.1 (Adaptive Reasoning, High Effort, Default Fallback)79.1
数学
#1OpenAI GPT-5.2 (xhigh)99
#2OpenAI GPT-5 Codex (high)98.7
#3Google Gemini 3 Flash Preview (Reasoning)97
速度
#1Celeris Celeris-12362.6
#2Inception Mercury 2933.5
#3Meta Muse Spark 1.3 (max)454.8
混合价格
#1Meta Llama 3.1 Instruct 8B0.028
#2Google Gemma 4 E4B (Non-reasoning)0.04
#3Google Gemma 4 E4B (Reasoning)0.04
输入价格
#1Google Gemma 4 E4B (Non-reasoning)0.02
#2Google Gemma 4 E4B (Reasoning)0.02
#3Meta Llama 3.1 Instruct 8B0.02
输出价格
#1Meta Llama 3.1 Instruct 8B0.05
#2Google Gemma 4 E4B (Non-reasoning)0.1
#3Google Gemma 4 E4B (Reasoning)0.1
首响延迟
#1Cohere Command A+0.17
#2IBM Granite 4.2 3B0.21
#3IBM Granite 4.2 30B0.25
性价比
#1Meta Llama 3.1 Instruct 8B246.4
#2Sapiens AI Agnes 2.5 Pro Beta234.7
#3Tencent Hy3-preview (Reasoning)227
供应商覆盖
#1OpenAI92
#2Alibaba88
#3Google65

智能 Top 5

直接对比头部 5 个模型的实际分数,比占比图更适合看排名差距。

#1Anthropic Claude Fable 5.1 (Adaptive Reasoning, Max Effort, Default Fallback)53.4
#2Anthropic Claude Fable 5.1 (Adaptive Reasoning, Xhigh Effort, Default Fallback)53.2
#3OpenAI GPT-6 Astra (max)52.8
#4OpenAI GPT-6 Astra (xhigh)52.5
#5Anthropic Claude Fable 5.1 (Adaptive Reasoning, High Effort, Default Fallback)51.2

智能

Artificial Analysis Intelligence Index · 越高越好

#1Anthropic Claude Fable 5.1 (Adaptive Reasoning, Max Effort, Default Fallback)53.4
#2Anthropic Claude Fable 5.1 (Adaptive Reasoning, Xhigh Effort, Default Fallback)53.2
#3OpenAI GPT-6 Astra (max)52.8
#4OpenAI GPT-6 Astra (xhigh)52.5
#5Anthropic Claude Fable 5.1 (Adaptive Reasoning, High Effort, Default Fallback)51.2
#6OpenAI GPT-6 Astra (high)51
#7Anthropic Claude Opus 5 (Adaptive Reasoning, Max Effort)50.7
#8OpenAI GPT-6 Astra (medium)49.7
#9Anthropic Claude Fable 5 (Adaptive Reasoning, Max Effort, Opus 4.8 Fallback)49.7
#10Anthropic Claude Opus 5 (Adaptive Reasoning, Xhigh Effort)49.7

显示前 10 项,完整模型名见图表下方列表。

代码

Artificial Analysis Coding Index · 越高越好

#1Anthropic Claude Fable 5.1 (Adaptive Reasoning, Max Effort, Default Fallback)81.6
#2Anthropic Claude Fable 5.1 (Adaptive Reasoning, Xhigh Effort, Default Fallback)80.7
#3Anthropic Claude Fable 5.1 (Adaptive Reasoning, High Effort, Default Fallback)79.1
#4OpenAI GPT-5.6 Sol (xhigh)78.3
#5Anthropic Claude Opus 5 (Adaptive Reasoning, Max Effort)78
#6OpenAI GPT-5.6 Sol (max)77.4
#7OpenAI GPT-5.6 Sol (high)77.2
#8OpenAI GPT-6 Astra (high)77.1
#9Anthropic Claude Fable 5.1 (Adaptive Reasoning, Medium Effort, Default Fallback)77.1
#10Anthropic Claude Opus 5 (Adaptive Reasoning, Xhigh Effort)77

显示前 10 项,完整模型名见图表下方列表。

数学

Artificial Analysis Math Index · 越高越好

#1OpenAI GPT-5.2 (xhigh)99
#2OpenAI GPT-5 Codex (high)98.7
#3Google Gemini 3 Flash Preview (Reasoning)97
#4OpenAI GPT-5.2 (medium)96.7
#5DeepSeek V3.2 Speciale96.7
#6Xiaomi MiMo-V2-Flash (Reasoning)96.3
#7OpenAI GPT-5.1 Codex (high)95.7
#8Google Gemini 3 Pro Preview (high)95.7
#9Z AI GLM-4.7 (Reasoning)95
#10Kimi K2 Thinking94.7

显示前 10 项,完整模型名见图表下方列表。

速度

输出 tokens/s · 越高越好

#1Celeris Celeris-12362.6
#2Inception Mercury 2933.5
#3Meta Muse Spark 1.3 (max)454.8
#4Multiverse Computing HyperNova 60B 2605 (high, based on gpt-oss-120b)371.8
#5Google Gemini 3.7 Flash (medium)353.4
#6Arcee AI Trinity Large Thinking351.4
#7Google Gemini 3.5 Flash-Lite349.9
#8Google Gemini 3.7 Flash (high)333.3
#9Google Gemini 3.8 Flash (high)330.6
#10Meta Muse Spark 1.3 (xhigh)323

显示前 10 项,完整模型名见图表下方列表。

混合价格

每 100 万 tokens 混合价格 · 越低越好

#1Meta Llama 3.1 Instruct 8B0.028
#2Google Gemma 4 E4B (Non-reasoning)0.04
#3Google Gemma 4 E4B (Reasoning)0.04
#4Sarvam 30B (high)0.047
#5IBM Granite 4.2 3B0.052
#6Alibaba Qwen3.5 4B (Reasoning)0.06
#7Alibaba Qwen3.5 4B (Non-reasoning)0.06
#8Amazon Nova Micro0.061
#9IBM Granite 4.1 8B0.063
#10Multiverse Computing HyperNova 60B 2605 (high, based on gpt-oss-120b)0.065

显示前 10 项,完整模型名见图表下方列表。

输入价格

每 100 万输入 tokens · 越低越好

#1Google Gemma 4 E4B (Non-reasoning)0.02
#2Google Gemma 4 E4B (Reasoning)0.02
#3Meta Llama 3.1 Instruct 8B0.02
#4Sarvam 30B (high)0.026
#5IBM Granite 4.2 3B0.03
#6Alibaba Qwen3.5 4B (Reasoning)0.03
#7Alibaba Qwen3.5 4B (Non-reasoning)0.03
#8IBM Granite 3.3 8B (Non-reasoning)0.03
#9Amazon Nova Micro0.035
#10NVIDIA Nemotron Nano 9B V2 (Reasoning)0.04

显示前 10 项,完整模型名见图表下方列表。

输出价格

每 100 万输出 tokens · 越低越好

#1Meta Llama 3.1 Instruct 8B0.05
#2Google Gemma 4 E4B (Non-reasoning)0.1
#3Google Gemma 4 E4B (Reasoning)0.1
#4Mistral Ministral 3 3B0.1
#5IBM Granite 4.1 8B0.1
#6Sarvam 30B (high)0.11
#7IBM Granite 4.2 3B0.12
#8Amazon Nova Micro0.14
#9Multiverse Computing HyperNova 60B 2605 (high, based on gpt-oss-120b)0.14
#10Meta Llama 3 Instruct 8B0.145

显示前 10 项,完整模型名见图表下方列表。

首响延迟

Median time to first token · 越低越好

#1Cohere Command A+0.17
#2IBM Granite 4.2 3B0.21
#3IBM Granite 4.2 30B0.25
#4Cohere North Mini Code0.25
#5IBM Granite 4.2 8B0.26
#6Google Gemma 4 E4B (Non-reasoning)0.3
#7Cohere Command A0.32
#8Cohere Tiny Aya Global0.32
#9Microsoft Phi-4 Mini Instruct0.37
#10Multiverse Computing HyperNova 60B 2605 (high, based on gpt-oss-120b)0.38

显示前 10 项,完整模型名见图表下方列表。

性价比

智能指数 / 混合价格 · 越高越好

#1Meta Llama 3.1 Instruct 8B246.4
#2Sapiens AI Agnes 2.5 Pro Beta234.7
#3Tencent Hy3-preview (Reasoning)227
#4InclusionAI Ling 3.0 Flash224.3
#5Google Gemma 4 E4B (Reasoning)222.5
#6Alibaba Qwen3.5 4B (Reasoning)218.3
#7Google Gemma 4 E4B (Non-reasoning)187.5
#8Multiverse Computing HyperNova 60B 2605 (high, based on gpt-oss-120b)180
#9Alibaba Qwen3.5 4B (Non-reasoning)180
#10Z AI GLM-5.3-Flash176.8

显示前 10 项,完整模型名见图表下方列表。

供应商覆盖

当前 API 返回的模型数量 · 越高代表覆盖更多

#1OpenAI92
#2Alibaba88
#3Google65
#4Anthropic48
#5DeepSeek35
#6Mistral32
#7SpaceXAI26
#8Z AI22
#9Meta22
#10NVIDIA19

显示前 10 项,完整模型名见图表下方列表。