⚠ 示意資料 — 第一版所有數字為合成測試值,正式可重現的量測即將上線。
94
筆測試結果
17
款 GPU 型號
3
個測試套件
3
種提交等級
01 · 探索
配方地景
每格都是一組 recipe × 晶片在三個套件下的覆蓋。點的顏色標示所屬套件;空格代表尚未有測試的真正缺口,也是最值得提交的格子。
12 種 recipe · 9 張晶片 94 筆測試 · 覆蓋 36 格 依測試數量排序,取前 9 張晶片
| 配方 | H100 80GB | H200 141GB | B200 | H100 PCIe 80GB | GB200 NVL72 | L4 24GB | A100 PCIe 40GB | RTX 6000 Ada 48GB | MI250X 128GB |
|---|---|---|---|---|---|---|---|---|---|
| SGLang BF16 | |||||||||
| SGLang FP16 | |||||||||
| SGLang FP8 | |||||||||
| TensorRT-LLM BF16 | |||||||||
| TensorRT-LLM FP16 | |||||||||
| TensorRT-LLM FP8 | |||||||||
| TensorRT-LLM INT8 | |||||||||
| TGI FP16 | |||||||||
| vLLM BF16 | |||||||||
| vLLM FP16 | |||||||||
| vLLM FP8 | |||||||||
| vLLM INT8 |
LLM 推論 LLM 微調 RAG 端到端 AMD 晶片 缺口
三大測試套件
選擇工作負載,即可查看最佳成績與完整排名。
LLM 推論
最佳成績量測 Llama-3.1-8B / 70B 在批量 8 下的端到端吞吐量,涵蓋線上與離線兩種情境。
NVIDIA GB200 NVL72 ×72 · vLLM
412,000
tokens/sec
NT$ 7,800,000/hr · twcompute-lab
查看排名 →
LLM 微調
最佳成績Qwen2.5-7B LoRA 微調吞吐量,衡量訓練效率與 GPU 利用率。
NVIDIA GB200 NVL72 ×72 · vLLM
4,800
samples/hour
NT$ 7,800,000/hr · twcompute-lab
查看排名 →
RAG 端到端
最佳成績在 100 篇雙語文件中檢索 + 生成的端到端查詢吞吐量。
NVIDIA GB200 NVL72 ×72 · vLLM
1,480
queries/sec
NT$ 7,800,000/hr · twcompute-lab
查看排名 →
硬體覆蓋
NVIDIA 系列
- NVIDIA A100 80GB
- NVIDIA A100 PCIe 40GB
- NVIDIA B200
- NVIDIA GB200 NVL72
- NVIDIA H100 80GB
- NVIDIA H100 PCIe 80GB
- NVIDIA H200 141GB
- NVIDIA L4 24GB
- NVIDIA L40S 48GB
- NVIDIA RTX 3090 24GB
- NVIDIA RTX 4080 SUPER 16GB
- NVIDIA RTX 4090 24GB
- NVIDIA RTX 5090 32GB
- NVIDIA RTX 6000 Ada 48GB
AMD 系列
- AMD MI250X 128GB
- AMD MI300X 192GB
- AMD RX 7900 XTX 24GB
資料主權備註: 了解主權 AI 模型訂製
最新提交
看全部 →| 晶片 | 模型 | 框架 | 套件 | 主力指標 | 日期 |
|---|---|---|---|---|---|
| NVIDIA GB200 NVL72 ×36 | Llama-3.1-8B-Instruct | SGLang | RAG 端到端 | 920 queries/sec | 2026-09-21 |
| NVIDIA GB200 NVL72 ×36 | Qwen2.5-7B | TensorRT-LLM | LLM 微調 | 2,120 samples/hour | 2026-09-20 |
| NVIDIA GB200 NVL72 ×36 | Llama-3.1-70B-Instruct | TensorRT-LLM | LLM 推論 | 268,000 tokens/sec | 2026-09-19 |
| NVIDIA GB200 NVL72 ×72 | Qwen2.5-7B | vLLM | LLM 微調 | 4,800 samples/hour | 2026-09-18 |
| NVIDIA GB200 NVL72 ×72 | Llama-3.1-8B-Instruct | vLLM | RAG 端到端 | 1,480 queries/sec | 2026-09-15 |