团队考虑在私有环境部署一个 MoE 模型。相比稠密模型,你会重点评估哪些推理和运维问题?
考察说明
考查对混合专家模型稀疏激活机制及部署取舍的理解。
回答思路
- MoE 通过路由器为每个令牌选择部分专家参与计算,因此总参数量较大并不等于每个令牌都会执行全部参数,不能只按参数规模估算计算成本。
- 未被激活的专家权重仍需要存储或分布在设备上,私有部署首先要核算显存、主存、加载时间和多机拓扑是否匹配。
- 专家分布在不同设备时会产生通信和同步开销,实际延迟取决于路由模式、并行策略和网络条件,而不只取决于理论激活参数量。
- 路由不均衡可能使少数专家过载并造成请求尾延迟或容量丢弃,需要监控专家负载、路由分布和被拒绝的令牌。
- 量化、批处理和并发调度可能对不同专家产生不一致影响,应使用真实输入分布进行压力测试,而不是沿用稠密模型的默认配置。
- 最终应在相同硬件和目标任务上比较质量、吞吐、高分位延迟、稳定性和运维复杂度,不能因模型标注为 MoE 就预设它更便宜。