选择 AI 推理服务器时,核心逻辑与训练场景有显著不同:训练追求“算力峰值”和“大显存”,而推理更看重单位成本下的吞吐量(Throughput)、延迟(Latency)以及资源利用率。
以下是从技术落地角度梳理的关键性能指标及选型建议:
1. 核心计算指标:FP16/INT8 算力
AI 推理模型大多经过量化处理(如 FP16, INT8, BF16),因此标称的 FP32 算力参考意义有限。
- INT8/FP16 TOPS (Tera Operations Per Second):这是衡量推理吞吐量的硬指标。对于 Transformer 类大模型,INT8 精度通常能带来数倍的推理提速且精度损失可控。需关注厂商提供的实测数据而非理论峰值。
- 稀疏化支持(Sparsity):部分硬件(如 NVIDIA Hopper 架构或特定国产芯片)支持结构化稀疏,能在不降低精度的情况下进一步提升有效算力,这对长上下文推理至关重要。
2. 显存(VRAM)相关指标
显存是制约推理并发数和上下文长度的瓶颈。
- 显存容量:直接决定能加载多大的模型权重。例如,70B 参数量的模型在 INT4 量化下需要约 40GB+ 显存,若需开启 KV Cache(键值缓存)以支持长文本,需求会成倍增加。
- 显存带宽(Memory Bandwidth):这是推理阶段最关键的指标之一。LLM 推理往往是“访存受限(Memory Bound)”而非“计算受限”。高带宽意味着模型权重能更快被读取到计算单元,直接降低首字生成时间(TTFT)。HBM3e 相比 GDDR6X 在带宽上有数量级优势。
- 显存互联技术:在多卡推理场景下,NVLink、PCIe Gen5 或 CXL 等互联技术的带宽决定了多卡并行时的效率损耗。
3. 业务性能指标(用户感知层)
这些指标直接关联 SLA(服务等级协议)和用户体验。
- 首字延迟(Time to First Token, TTFT):用户发出请求到看到第一个字的时间。主要受网络 IO、模型加载速度和预填充(Prefill)阶段算力影响。
- 令牌生成速率(Tokens per Second, TPS):持续生成文字的速度。直接影响长文本回答的流畅度。
- 并发吞吐量(Concurrency / QPS):单台服务器同时处理的请求数。这取决于显存大小和算力的调度策略。
- P99 延迟:不要只看平均延迟,生产环境需关注 99% 的请求在多少时间内完成,以应对流量波峰。
4. 功耗与能效比(TCO 考量)
推理业务通常是 7×24 小时运行,电费是巨大的隐性成本。
- 每瓦特算力(TOPS/Watt):在同等算力下,选择功耗更低的产品能显著降低 TCO(总拥有成本)。
- 散热设计:高密度推理集群对风冷或液冷方案有严格要求,需评估机房现有的制冷能力是否匹配服务器的热设计功率(TDP)。
5. 软件生态与兼容性
硬件只是底座,软件栈决定了能否“跑得动”、“跑得好”。
- 推理引擎支持:是否原生支持 vLLM, TensorRT-LLM, TGI (Text Generation Inference), ONNX Runtime 等主流框架?
- 算子覆盖度:针对特定模型(如 Llama 3, Qwen, Baichuan 等)是否有优化的算子?
- 国产芯片适配:若考虑国产化替代,需重点考察华为昇腾(CANN)、寒武纪、海光等芯片在主流开源框架上的适配成熟度及迁移成本。
6. 部署形态与扩展性
- 异构计算能力:是否支持 CPU + GPU/NPU 协同卸载?在模型较大或并发较低时,CPU 辅助推理往往更具性价比。
- 弹性伸缩:在云环境下,是否支持 Serverless 模式或快速扩缩容?
- 多租户隔离:如果是共享集群,需关注虚拟化层面的安全隔离机制(如 MIG, SR-IOV),防止邻居噪声干扰。
选型总结建议
在实际选型中,不存在“全能型”设备,需根据业务场景权衡:
- 实时交互场景(如对话机器人):优先看低延迟和高显存带宽,小批量并发即可,无需极致吞吐量。
- 批处理场景(如文档摘要、代码生成):优先看高吞吐量和大显存,允许一定的排队等待时间。
- 边缘侧场景:优先看低功耗、体积和端侧推理框架支持。
最后,务必进行POC(概念验证)测试。使用真实的业务模型和负载数据,对比不同硬件在真实环境下的 TTFT 和 TPS,避免仅凭纸面参数决策。
CLOUD云枢