选择AI推理服务器时应该关注哪些性能指标?

选择 AI 推理服务器时,核心逻辑与训练场景有显著不同:训练追求“算力峰值”和“大显存”,而推理更看重单位成本下的吞吐量(Throughput)延迟(Latency)以及资源利用率

以下是从技术落地角度梳理的关键性能指标及选型建议:

1. 核心计算指标:FP16/INT8 算力

AI 推理模型大多经过量化处理(如 FP16, INT8, BF16),因此标称的 FP32 算力参考意义有限。

  • INT8/FP16 TOPS (Tera Operations Per Second):这是衡量推理吞吐量的硬指标。对于 Transformer 类大模型,INT8 精度通常能带来数倍的推理提速且精度损失可控。需关注厂商提供的实测数据而非理论峰值。
  • 稀疏化支持(Sparsity):部分硬件(如 NVIDIA Hopper 架构或特定国产芯片)支持结构化稀疏,能在不降低精度的情况下进一步提升有效算力,这对长上下文推理至关重要。

2. 显存(VRAM)相关指标

显存是制约推理并发数和上下文长度的瓶颈。

  • 显存容量:直接决定能加载多大的模型权重。例如,70B 参数量的模型在 INT4 量化下需要约 40GB+ 显存,若需开启 KV Cache(键值缓存)以支持长文本,需求会成倍增加。
  • 显存带宽(Memory Bandwidth)这是推理阶段最关键的指标之一。LLM 推理往往是“访存受限(Memory Bound)”而非“计算受限”。高带宽意味着模型权重能更快被读取到计算单元,直接降低首字生成时间(TTFT)。HBM3e 相比 GDDR6X 在带宽上有数量级优势。
  • 显存互联技术:在多卡推理场景下,NVLink、PCIe Gen5 或 CXL 等互联技术的带宽决定了多卡并行时的效率损耗。

3. 业务性能指标(用户感知层)

这些指标直接关联 SLA(服务等级协议)和用户体验。

  • 首字延迟(Time to First Token, TTFT):用户发出请求到看到第一个字的时间。主要受网络 IO、模型加载速度和预填充(Prefill)阶段算力影响。
  • 令牌生成速率(Tokens per Second, TPS):持续生成文字的速度。直接影响长文本回答的流畅度。
  • 并发吞吐量(Concurrency / QPS):单台服务器同时处理的请求数。这取决于显存大小和算力的调度策略。
  • P99 延迟:不要只看平均延迟,生产环境需关注 99% 的请求在多少时间内完成,以应对流量波峰。

4. 功耗与能效比(TCO 考量)

推理业务通常是 7×24 小时运行,电费是巨大的隐性成本。

  • 每瓦特算力(TOPS/Watt):在同等算力下,选择功耗更低的产品能显著降低 TCO(总拥有成本)。
  • 散热设计:高密度推理集群对风冷或液冷方案有严格要求,需评估机房现有的制冷能力是否匹配服务器的热设计功率(TDP)。

5. 软件生态与兼容性

硬件只是底座,软件栈决定了能否“跑得动”、“跑得好”。

  • 推理引擎支持:是否原生支持 vLLM, TensorRT-LLM, TGI (Text Generation Inference), ONNX Runtime 等主流框架?
  • 算子覆盖度:针对特定模型(如 Llama 3, Qwen, Baichuan 等)是否有优化的算子?
  • 国产芯片适配:若考虑国产化替代,需重点考察华为昇腾(CANN)、寒武纪、海光等芯片在主流开源框架上的适配成熟度及迁移成本。

6. 部署形态与扩展性

  • 异构计算能力:是否支持 CPU + GPU/NPU 协同卸载?在模型较大或并发较低时,CPU 辅助推理往往更具性价比。
  • 弹性伸缩:在云环境下,是否支持 Serverless 模式或快速扩缩容?
  • 多租户隔离:如果是共享集群,需关注虚拟化层面的安全隔离机制(如 MIG, SR-IOV),防止邻居噪声干扰。

选型总结建议

在实际选型中,不存在“全能型”设备,需根据业务场景权衡:

  1. 实时交互场景(如对话机器人):优先看低延迟高显存带宽,小批量并发即可,无需极致吞吐量。
  2. 批处理场景(如文档摘要、代码生成):优先看高吞吐量大显存,允许一定的排队等待时间。
  3. 边缘侧场景:优先看低功耗体积端侧推理框架支持

最后,务必进行POC(概念验证)测试。使用真实的业务模型和负载数据,对比不同硬件在真实环境下的 TTFT 和 TPS,避免仅凭纸面参数决策。

未经允许不得转载:CLOUD云枢 » 选择AI推理服务器时应该关注哪些性能指标?