人工智能面试题 · 技术原理 · PyTorch
人工智能相关岗位面试题。
共 11389 道真题 · 当前筛选命中 199 道 · 更新 2026-08-05
筛选题目已选:技术原理 · PyTorch
考察点
技术栈
第 1 题讲解Transformer结构时,通常使用哪些深度学习训练框架? 考察对Transformer实现与主流深度学习框架的熟悉程度第 2 题tensor.detach()和tensor.item()有哪些区别,分别对应什么使用场景? 考察对PyTorch张量操作语义和梯度传播机制的理解第 3 题LayerNorm 的计算的维度呢? 考察对 LayerNorm 归一化维度的理解第 4 题请手写实现多头注意力的核心计算过程。 考察对自注意力机制、多头拆分与拼接的编码实现能力第 5 题请介绍你在项目中使用PyTorch或TensorFlow进行API调用的具体场景和做法。 考察深度学习框架的实践经验和API使用能力第 6 题二分类任务通常使用什么损失函数?请写出 PyTorch 中 BCE 损失函数的代码。 考察二分类损失函数的选择与代码实现第 7 题请解释什么是计算图,并说明它在深度学习中如何构建和使用。 考察对计算图概念的理解及其在深度学习框架中的应用第 8 题在训练 DPO(Direct Preference Optimization)模型时,你通常会选择哪些主流的机器学习或深度学习库?请说明理由。 考察对 DPO 训练相关技术栈的了解及工具选型能力第 9 题在大模型微调过程中,你通常使用哪些框架?请结合你的实际项目说明选择理由。 考察对大模型微调常用工具链的掌握及选型逻辑第 10 题请阐述ViT的结构、计算复杂度以及它如何应用于图像分类。 考察对ViT架构原理、复杂度来源和任务适配的理解第 11 题DDP和DP的区别 考察对深度学习中数据并行与模型并行训练策略的理解第 12 题请说明使用 PyTorch/CUDA 实现四线性插值的思路,并给出基本伪代码。 考察对高维插值的理解、PyTorch 与 CUDA 并行编程设计能力第 13 题请手写实现 Multi-Head Attention(MHA),并说明其计算过程。 考察对 Transformer 注意力机制的深入理解与编码实现能力第 14 题影响大语言模型训练和推理显存占用的关键因素有哪些?请从训练和推理两个场景分别说明。 考察对显存占用核心因素的全面理解与对比能力第 15 题手写双塔模型的损失函数(Batch内负采样实现) 考察双塔模型Batch内负采样损失的实现能力与理解第 16 题分布式训练中有哪些并行策略? 考察对分布式训练并行维度的理解与选型能力第 17 题手写Attention机制代码 考察对注意力机制原理的理解与代码实现能力第 18 题请描述将 PyTorch 模型转换为 ONNX 格式的完整流程,并说明转换过程中可能遇到的难点及应对方法。 考察模型导出流程的掌握程度与对算子兼容性等实际问题的处理能力第 19 题请实现一个简单的多层感知机(MLP),并从 CSV 文件读取训练数据。 考察深度学习基础建模与数据读取、训练流程实现能力第 20 题手撕全连接层,实现forward 考察对神经网络全连接层前向传播的数学原理和代码实现能力