阿里巴巴面试题 · DeepSpeed
阿里巴巴相关面试题,按最终去重题目聚合。
共 2826 道真题 · 当前筛选命中 13 道 · 更新 2026-08-05
筛选题目已选:DeepSpeed
考察点
技术栈
第 1 题请说明 DeepSpeed 的 ZeRO-1、ZeRO-2 和 ZeRO-3 分别优化了什么? 考察对 ZeRO 各阶段内存优化策略的理解与区分第 2 题DeepSpeed ZeRO-1/2/3之间有什么区别?请说明各阶段对显存占用的影响。 考察对分布式训练优化技术ZeRO分阶段原理及显存收益的理解第 3 题你了解DeepSpeed吗?请说明ZeRO-1、ZeRO-2和ZeRO-3分别做了哪些优化? 考察对DeepSpeed ZeRO系列优化的理解与区分第 4 题介绍一下DeepSpeed的关键配置参数及其含义。 考察对DeepSpeed配置体系的理解及分布式训练实践深度第 5 题显存不够时,一般怎么解决,有哪些常见的优化方法? 考察对深度学习训练显存优化的常见策略和工程实践能力第 6 题请说明DeepSpeed ZeRO Stage 1、2、3之间的区别,以及在何种场景下更适合使用PyTorch FSDP。 考察对分布式训练显存优化技术的理解与选型能力第 7 题并行框架:你对 DeepSpeed 这一加速推理与训练框架有多少了解? 考察对 DeepSpeed 训练与推理加速能力的理解深度第 8 题ZeRO-2和ZeRO-3是什么并行策略方式? 考察对深度学习分布式训练中深层优化器状态和权重切分的理解第 9 题DeepSpeed 用过吗?分布式训练中如何提升效率? 考察分布式训练框架理解与效率优化方法第 10 题DeepSpeed ZeRO-3 为什么比 ZeRO-2 更省显存? 考察对 ZeRO 并行策略内存优化原理的理解第 11 题请解释 DeepSpeed 的原理,以及 ZeRO 的 stage 1、2、3 分别是怎么实现的? 考察对大规模模型训练内存优化机制的理解第 12 题DeepSpeed 的三个阶段在分配参数时,单机 8 卡和双机 16 卡,每张卡上分配的参数量是一样的吗?为什么? 考察对 DeepSpeed ZeRO 分片机制和集群规模对参数分配影响的理解第 13 题训练大模型的框架都有哪些呢? 考察对深度学习框架及其在大模型训练场景中的适用性的了解