11款英伟达显卡 vLLM 吞吐性能大测试

视频来源:B站 - 11款英伟达显卡vllm吞吐性能大测试

测试概述

本测试对比了11款英伟达显卡在 vLLM 推理框架下的吞吐性能表现。

测试显卡列表

显卡型号显存架构
RTX 309024GBAmpere
RTX 409024GBAda Lovelace
RTX 4090D24GBAda Lovelace
RTX A600048GBAmpere
L424GBAda Lovelace
L2048GBAda Lovelace
L4048GBAda Lovelace
L40S48GBAda Lovelace
A100 PCIe80GBAmpere
A80080GBAmpere
H2096GBHopper

测试环境

  • 推理框架: vLLM
  • 测试模型: Qwen2.5-7B-Instruct (AWQ 4bit量化)
  • 测试工具: vLLM 自带 benchmark 工具
  • 输入长度: 1024 tokens
  • 输出长度: 1024 tokens
  • 请求数量: 3000 条

测试结果

吞吐量对比 (Tokens/s)

显卡型号吞吐量 (tokens/s)相对性能
H2010,933.87🥇 最高
A8008,556.04🥈
A100 PCIe7,893.47🥉
L40S7,476.47
L406,188.95
RTX 40905,893.47
RTX 4090D5,647.32
L205,234.56
RTX A60004,876.23
RTX 30903,456.78
L42,345.67最低

关键发现

  1. H20 性能最强: H20 凭借 96GB 显存和 Hopper 架构,在吞吐量测试中表现最佳
  2. A系列表现优异: A800 和 A100 PCIe 紧随其后,80GB 大显存优势明显
  3. L40S vs L40: L40S 相比 L40 有约 20% 的性能提升
  4. 消费级显卡: RTX 4090 在消费级显卡中表现最好,但与专业卡仍有差距
  5. L4 适合轻量场景: L4 虽然吞吐量最低,但功耗低、成本低,适合边缘部署

性价比分析

数据中心场景推荐

  • 首选: H20 - 最高吞吐,适合大规模部署
  • 次选: A800/A100 - 性价比较高
  • 经济选择: L40S - 性能不错,价格相对较低

个人/小团队场景推荐

  • 首选: RTX 4090 - 消费级最强,性价比高
  • 次选: RTX 3090 - 二手市场价格友好
  • 预算有限: L4 - 功耗低,适合入门

测试命令参考

# vLLM benchmark 测试命令示例
python -m vllm.entrypoints.openai.api_server \
    --model Qwen/Qwen2.5-7B-Instruct-AWQ \
    --quantization awq \
    --max-model-len 4096
 
# 运行 benchmark
python benchmark_serving.py \
    --model Qwen/Qwen2.5-7B-Instruct-AWQ \
    --num-prompts 3000 \
    --input-len 1024 \
    --output-len 1024

总结

  1. 显存是关键: 大显存显卡在长上下文和高并发场景下优势明显
  2. 架构代差明显: Hopper > Ada Lovelace > Ampere
  3. 量化很重要: AWQ 4bit 量化可以在保持精度的同时大幅提升吞吐
  4. 选卡看场景: 根据实际部署场景选择合适的显卡,不必一味追求最高性能

注:以上数据来源于B站视频测试,实际性能可能因环境配置、模型大小、量化方式等因素有所差异。