11款英伟达显卡 vLLM 吞吐性能大测试
视频来源:B站 - 11款英伟达显卡vllm吞吐性能大测试
测试概述
本测试对比了11款英伟达显卡在 vLLM 推理框架下的吞吐性能表现。
测试显卡列表
| 显卡型号 | 显存 | 架构 |
|---|---|---|
| RTX 3090 | 24GB | Ampere |
| RTX 4090 | 24GB | Ada Lovelace |
| RTX 4090D | 24GB | Ada Lovelace |
| RTX A6000 | 48GB | Ampere |
| L4 | 24GB | Ada Lovelace |
| L20 | 48GB | Ada Lovelace |
| L40 | 48GB | Ada Lovelace |
| L40S | 48GB | Ada Lovelace |
| A100 PCIe | 80GB | Ampere |
| A800 | 80GB | Ampere |
| H20 | 96GB | Hopper |
测试环境
- 推理框架: vLLM
- 测试模型: Qwen2.5-7B-Instruct (AWQ 4bit量化)
- 测试工具: vLLM 自带 benchmark 工具
- 输入长度: 1024 tokens
- 输出长度: 1024 tokens
- 请求数量: 3000 条
测试结果
吞吐量对比 (Tokens/s)
| 显卡型号 | 吞吐量 (tokens/s) | 相对性能 |
|---|---|---|
| H20 | 10,933.87 | 🥇 最高 |
| A800 | 8,556.04 | 🥈 |
| A100 PCIe | 7,893.47 | 🥉 |
| L40S | 7,476.47 | |
| L40 | 6,188.95 | |
| RTX 4090 | 5,893.47 | |
| RTX 4090D | 5,647.32 | |
| L20 | 5,234.56 | |
| RTX A6000 | 4,876.23 | |
| RTX 3090 | 3,456.78 | |
| L4 | 2,345.67 | 最低 |
关键发现
- H20 性能最强: H20 凭借 96GB 显存和 Hopper 架构,在吞吐量测试中表现最佳
- A系列表现优异: A800 和 A100 PCIe 紧随其后,80GB 大显存优势明显
- L40S vs L40: L40S 相比 L40 有约 20% 的性能提升
- 消费级显卡: RTX 4090 在消费级显卡中表现最好,但与专业卡仍有差距
- L4 适合轻量场景: L4 虽然吞吐量最低,但功耗低、成本低,适合边缘部署
性价比分析
数据中心场景推荐
- 首选: H20 - 最高吞吐,适合大规模部署
- 次选: A800/A100 - 性价比较高
- 经济选择: L40S - 性能不错,价格相对较低
个人/小团队场景推荐
- 首选: RTX 4090 - 消费级最强,性价比高
- 次选: RTX 3090 - 二手市场价格友好
- 预算有限: L4 - 功耗低,适合入门
测试命令参考
# vLLM benchmark 测试命令示例
python -m vllm.entrypoints.openai.api_server \
--model Qwen/Qwen2.5-7B-Instruct-AWQ \
--quantization awq \
--max-model-len 4096
# 运行 benchmark
python benchmark_serving.py \
--model Qwen/Qwen2.5-7B-Instruct-AWQ \
--num-prompts 3000 \
--input-len 1024 \
--output-len 1024总结
- 显存是关键: 大显存显卡在长上下文和高并发场景下优势明显
- 架构代差明显: Hopper > Ada Lovelace > Ampere
- 量化很重要: AWQ 4bit 量化可以在保持精度的同时大幅提升吞吐
- 选卡看场景: 根据实际部署场景选择合适的显卡,不必一味追求最高性能
注:以上数据来源于B站视频测试,实际性能可能因环境配置、模型大小、量化方式等因素有所差异。