⚠ 示意資料 — 第一版所有數字為合成測試值,正式可重現的量測即將上線。

GPU 基準排名

晶片商
精度
框架
顯示 36 筆,共 36 筆 · 排序依據: 主力指標 ↓
Compare # 晶片 主力指標
1
NVIDIA GB200 NVL72
×72 · vLLM
412,000 tokens/sec
2
NVIDIA GB200 NVL72
×36 · TensorRT-LLM
268,000 tokens/sec
3
NVIDIA B200
×8 · TensorRT-LLM
38,400 tokens/sec
4
NVIDIA H100 80GB
×4 · TensorRT-LLM
24,600 tokens/sec
5
NVIDIA B200
×4 · vLLM
22,800 tokens/sec
6
NVIDIA H200 141GB
×8 · SGLang
21,200 tokens/sec
7
NVIDIA H100 80GB
×8 · vLLM
18,420 tokens/sec
8
AMD MI300X 192GB
×8 · vLLM
13,800 tokens/sec
9
NVIDIA H200 141GB
×4 · vLLM
11,800 tokens/sec
10
NVIDIA RTX 5090 32GB
×1 · TensorRT-LLM
11,200 tokens/sec
11
NVIDIA H200 141GB
×1 · vLLM
10,400 tokens/sec
12
NVIDIA H100 80GB
×1 · vLLM
9,800 tokens/sec
13
NVIDIA H100 PCIe 80GB
×4 · vLLM
8,800 tokens/sec
14
NVIDIA A100 80GB
×8 · vLLM
8,400 tokens/sec
15
NVIDIA H100 PCIe 80GB
×1 · TensorRT-LLM
8,400 tokens/sec
16
NVIDIA RTX 5090 32GB
×1 · vLLM
8,200 tokens/sec
17
NVIDIA RTX 6000 Ada 48GB
×1 · TensorRT-LLM
7,400 tokens/sec
18
NVIDIA L40S 48GB
×1 · vLLM
6,900 tokens/sec
19
AMD MI250X 128GB
×8 · vLLM
6,800 tokens/sec
20
NVIDIA RTX 4090 24GB
×1 · TensorRT-LLM
6,400 tokens/sec
21
AMD MI250X 128GB
×4 · vLLM
5,800 tokens/sec
22
NVIDIA RTX 6000 Ada 48GB
×1 · vLLM
5,600 tokens/sec
23
NVIDIA L40S 48GB
×1 · TGI
5,200 tokens/sec
24
NVIDIA GB200 NVL72
×72 · vLLM
4,800 samples/hour
25
NVIDIA L4 24GB
×1 · TensorRT-LLM
4,800 tokens/sec
26
NVIDIA RTX 4090 24GB
×1 · vLLM
4,600 tokens/sec
27
AMD RX 7900 XTX 24GB
×1 · vLLM
4,400 tokens/sec
28
NVIDIA A100 PCIe 40GB
×4 · vLLM
4,200 tokens/sec
29
NVIDIA A100 PCIe 40GB
×1 · TensorRT-LLM
4,200 tokens/sec
30
NVIDIA RTX 4080 SUPER 16GB
×1 · TensorRT-LLM
3,800 tokens/sec
31
NVIDIA RTX 5090 32GB
×1 · vLLM
3,400 tokens/sec
32
AMD RX 7900 XTX 24GB
×1 · vLLM
3,400 tokens/sec
33
NVIDIA L4 24GB
×1 · vLLM
3,200 tokens/sec
34
NVIDIA RTX 3090 24GB
×1 · vLLM
3,100 tokens/sec
35
NVIDIA RTX 4080 SUPER 16GB
×1 · vLLM
2,800 tokens/sec
36
NVIDIA RTX 3090 24GB
×1 · TensorRT-LLM
2,200 tokens/sec
37
NVIDIA GB200 NVL72
×36 · TensorRT-LLM
2,120 samples/hour
38
NVIDIA RTX 4090 24GB
×1 · vLLM
1,800 tokens/sec
39
NVIDIA GB200 NVL72
×72 · vLLM
1,480 queries/sec
40
NVIDIA GB200 NVL72
×36 · SGLang
920 queries/sec
41
NVIDIA B200
×8 · TensorRT-LLM
740 samples/hour
42
NVIDIA H200 141GB
×8 · vLLM
468 samples/hour
43
NVIDIA H100 80GB
×8 · vLLM
412 samples/hour
44
NVIDIA B200
×4 · vLLM
396 samples/hour
45
AMD MI300X 192GB
×8 · vLLM
312 samples/hour
46
NVIDIA B200
×8 · TensorRT-LLM
248 queries/sec
47
NVIDIA H200 141GB
×4 · SGLang
246 samples/hour
48
NVIDIA H100 80GB
×4 · vLLM
218 samples/hour
49
NVIDIA A100 80GB
×8 · vLLM
184 samples/hour
50
NVIDIA H200 141GB
×8 · vLLM
158 queries/sec
51
NVIDIA H100 80GB
×8 · vLLM
142 queries/sec
52
NVIDIA B200
×4 · vLLM
132 queries/sec
53
NVIDIA H100 PCIe 80GB
×4 · vLLM
132 samples/hour
54
NVIDIA H200 141GB
×1 · vLLM
108 samples/hour
55
NVIDIA H100 80GB
×1 · vLLM
96 samples/hour
56
AMD MI300X 192GB
×8 · vLLM
96 queries/sec
57
NVIDIA H200 141GB
×4 · SGLang
84 queries/sec
58
NVIDIA H100 80GB
×4 · SGLang
78 queries/sec
59
NVIDIA H100 PCIe 80GB
×4 · vLLM
78 queries/sec
60
NVIDIA A100 80GB
×8 · vLLM
64 queries/sec
61
NVIDIA H100 PCIe 80GB
×2 · TensorRT-LLM
62 queries/sec
62
AMD MI250X 128GB
×4 · vLLM
56 samples/hour
63
AMD MI250X 128GB
×4 · vLLM
48 queries/sec
64
NVIDIA H100 PCIe 80GB
×1 · SGLang
46 samples/hour
65
NVIDIA RTX 5090 32GB
×1 · TensorRT-LLM
42 samples/hour
66
NVIDIA RTX 5090 32GB
×1 · vLLM
42 queries/sec
67
NVIDIA L40S 48GB
×1 · TGI
38 samples/hour
68
NVIDIA A100 PCIe 40GB
×4 · vLLM
38 queries/sec
69
NVIDIA H200 141GB
×1 · vLLM
35 queries/sec
70
NVIDIA RTX 6000 Ada 48GB
×1 · TensorRT-LLM
34 queries/sec
71
NVIDIA H100 80GB
×1 · vLLM
32 queries/sec
72
AMD MI250X 128GB
×2 · vLLM
32 queries/sec
73
NVIDIA A100 PCIe 40GB
×2 · vLLM
28 samples/hour
74
NVIDIA RTX 5090 32GB
×1 · vLLM
28 samples/hour
75
NVIDIA RTX 4090 24GB
×1 · SGLang
26 samples/hour
76
NVIDIA RTX 4090 24GB
×1 · vLLM
26 queries/sec
77
NVIDIA RTX 6000 Ada 48GB
×1 · vLLM
24 queries/sec
78
NVIDIA L4 24GB
×1 · TensorRT-LLM
22 queries/sec
79
NVIDIA A100 PCIe 40GB
×1 · TensorRT-LLM
22 queries/sec
80
NVIDIA RTX 6000 Ada 48GB
×1 · SGLang
22 samples/hour
81
AMD MI250X 128GB
×2 · SGLang
22 samples/hour
82
NVIDIA L40S 48GB
×1 · TGI
18 queries/sec
83
NVIDIA RTX 4090 24GB
×1 · vLLM
18 samples/hour
84
AMD RX 7900 XTX 24GB
×1 · vLLM
18 queries/sec
85
NVIDIA RTX 6000 Ada 48GB
×1 · vLLM
16 samples/hour
86
NVIDIA RTX 4080 SUPER 16GB
×1 · TensorRT-LLM
16 queries/sec
87
NVIDIA L4 24GB
×1 · SGLang
14.2 samples/hour
88
NVIDIA L4 24GB
×1 · vLLM
14 queries/sec
89
NVIDIA A100 PCIe 40GB
×1 · SGLang
13 samples/hour
90
AMD RX 7900 XTX 24GB
×1 · vLLM
13 samples/hour
91
NVIDIA RTX 4080 SUPER 16GB
×1 · vLLM
12 samples/hour
92
NVIDIA RTX 3090 24GB
×1 · TensorRT-LLM
12 queries/sec
93
NVIDIA L4 24GB
×1 · vLLM
9.4 samples/hour
94
NVIDIA RTX 3090 24GB
×1 · vLLM
8.5 samples/hour