人工智能面试题 · 技术原理 · PyTorch
人工智能相关岗位面试题。
共 11389 道真题 · 当前筛选命中 199 道 · 更新 2026-08-05
筛选题目已选:技术原理 · PyTorch
考察点
技术栈
第 61 题请实现并解释SE-Net的关键模块 考察对SE-Net核心模块的编码实现与原理理解第 62 题FFN(前馈神经网络)有什么不同,请写出ReLU和SwiGLU的实现。 考察对不同FFN变体的理解及动手实现能力第 63 题请比较TensorFlow和PyTorch在模型开发、调试和部署方面的主要差异。 考察深度学习框架选型与实际使用经验第 64 题请手写实现一个Casual Self-Attention模块,说明其输入输出维度与计算流程。 考察注意力机制的实现细节与因果掩码处理能力第 65 题请手动实现多头注意力机制(MHA)的核心代码。 考察对Transformer多头注意力机制的深入理解与编码实现能力第 66 题对于一个约 7B 参数的模型,如果使用 AdamW 优化器进行训练,大致需要多少显存? 考察对训练显存构成(参数、梯度、优化器状态)的整体估算能力第 67 题显存不够时,一般怎么解决,有哪些常见的优化方法? 考察对深度学习训练显存优化的常见策略和工程实践能力第 68 题请手写实现Attention机制的代码,并解释其计算过程。 考察对Attention机制的理解以及代码实现能力第 69 题请介绍RLHF的整体流程,并说明PPO与DPO的核心思想,写出两者的Loss表达式。 考察强化学习与人类反馈对齐算法的原理理解和公式掌握第 70 题你了解哪些大模型训练和推理优化的方法? 考察对模型训练与推理阶段常见优化手段的理解广度与深度第 71 题请你手写实现分组注意力机制(Grouped Attention),说明其与多头注意力的区别。 考察分组注意力的实现理解、维度计算及与标准多头注意力的对比第 72 题大模型训练有哪几种并行方式,各自解决什么问题? 考察对分布式训练并行策略的整体认知第 73 题请介绍模型量化算法的基本原理、常见的量化方法(如 PTQ 和 QAT)以及改进方向。 考察对模型量化核心概念、PTQ 与 QAT 差异及演进方向的系统性理解第 74 题请介绍你对 DeepSpeed 的理解,包括其核心功能和典型应用场景。 考察对分布式训练优化框架的了解程度第 75 题DeepSpeed的ZeRO优化器在不同阶段(Stage 1、2、3)分别能节省哪些显存?各阶段的主要区别是什么? 考察对分布式训练显存优化原理的理解第 76 题请手写实现一个多门控专家混合(MMoE)模型的核心结构。 考察对多任务学习模型MMoE的理解与编码实现能力第 77 题讲一下知识蒸馏的原理,以及其中 KL 散度的公式是什么? 考察对知识蒸馏机制和核心数学工具的理解第 78 题请手写实现多头注意力机制(Multi-head Attention)的核心部分。 考察对Transformer注意力机制的理解与代码实现能力第 79 题在PyTorch中,如何查看模型中某一层的输出数据或参数? 考察对PyTorch模型内部张量访问与钩子机制的理解第 80 题是否了解不同的模型框架? 考察候选人对常用模型框架的掌握广度和理解深度