阿里巴巴面试题 · 技术原理 · PyTorch

阿里巴巴相关面试题,按最终去重题目聚合。

2826 道真题 · 当前筛选命中 17 · 更新 2026-08-05

筛选题目已选:技术原理 · PyTorch
第 1 题分布式训练中有哪些并行策略? 考察对分布式训练并行维度的理解与选型能力技术原理方案权衡PyTorchTensorFlow第 2 题请介绍大模型分布式训练中常见的通信协议及其作用。 考察对分布式训练通信方式的理解,涵盖集合通信和点对点通信系统设计技术原理PyTorch第 3 题请介绍二元交叉熵损失函数 BCELoss 的计算公式及其含义。 考察对分类损失函数数学原理的理解技术原理技术选型PyTorch第 4 题请解释PyTorch中计算图的概念,并说明它的构建和动态特性,以及这对反向传播有何影响。 考察对PyTorch计算图机制及其与反向传播关系的理解问题拆解技术原理PyTorch第 5 题显存不够时,一般怎么解决,有哪些常见的优化方法? 考察对深度学习训练显存优化的常见策略和工程实践能力性能优化技术原理方案权衡DeepSpeedPyTorch第 6 题请介绍RLHF的整体流程,并说明PPO与DPO的核心思想,写出两者的Loss表达式。 考察强化学习与人类反馈对齐算法的原理理解和公式掌握问题拆解技术原理PyTorch第 7 题请你手写实现分组注意力机制(Grouped Attention),说明其与多头注意力的区别。 考察分组注意力的实现理解、维度计算及与标准多头注意力的对比编码实现技术原理PyTorch第 8 题请说明DeepSpeed ZeRO Stage 1、2、3之间的区别,以及在何种场景下更适合使用PyTorch FSDP。 考察对分布式训练显存优化技术的理解与选型能力系统设计技术原理技术选型DeepSpeedPyTorch第 9 题在SFT训练中,如何确保只对指定部分(如响应)计算loss? 考察对训练实现中loss掩码机制的理解编码实现技术原理PyTorch第 10 题请手写并解释多头注意力(Multi-Head Attention)机制的代码实现。 考察多头注意力的实现细节与原理理解编码实现技术原理PyTorch第 11 题请解释梯度检查点(gradient checkpointing)的原理。 考察对显存优化技术原理和实现机制的理解技术原理方案权衡PyTorch第 12 题了解半精度训练吗?展开讲讲原理和优点,在实际应用中有哪些挑战。 考察对半精度训练原理、收益和实际工程挑战的理解技术原理方案权衡PyTorch第 13 题torchrun 在分布式训练中的用途是什么?请说明其核心功能和典型使用场景。 考察对分布式训练启动工具的理解,包括进程管理和初始化机制技术原理问题排查PyTorch第 14 题训练大模型的框架都有哪些呢? 考察对深度学习框架及其在大模型训练场景中的适用性的了解技术原理技术选型DeepSpeedPyTorchTensorFlow第 15 题解释一下梯度消失的处理策略 考察对深度学习训练中梯度消失问题及其解决方法的理解技术原理方案权衡PyTorch第 16 题请介绍BCELoss的公式,并说明其优势在哪里 考察对二分类交叉熵损失函数的理解及其在深度学习中的优势技术原理PyTorch第 17 题请说明大模型训练时显存的组成,并解释除模型参数、梯度、优化器状态(Model States)外还有哪些显存开销。 考察对大模型训练显存构成的理解,包括必要开销与附加开销的区分性能优化技术原理PyTorch