如何评估 vLLM 部署 87B 参数 MoE 模型时的推理吞吐量?需要从哪些因素和基准结果来估算每秒生成的 token 数?
考察说明
考察对 LLM 推理吞吐量影响因素和评估方法的理解,以及是否会给绝对数字而非合理估算
回答思路
- 明确 MoE 模型参数量与激活参数量的区别及其对吞吐量的影响
- 列举硬件(GPU 类型、显存带宽)和软件(vLLM 特性、批处理)关键因素
- 说明应根据环境实测或官方基准来估算,而非依赖任何人给出的固定数字
- 能给出量级区间并结合具体假设说明推导逻辑
考察对 LLM 推理吞吐量影响因素和评估方法的理解,以及是否会给绝对数字而非合理估算