互联网/IT行业面试题 · 问题拆解 · Transformer
互联网/IT行业相关面试题,按题目行业基础数据聚合。
共 47588 道真题 · 当前筛选命中 77 道 · 更新 2026-08-05
筛选题目已选:问题拆解 · Transformer
考察点
技术栈
第 21 题LLM和NLP有什么关系? 考察对LLM与NLP学科基础和演进关系的理解第 22 题在Transformer的Decoder中,为什么需要Mask来遮住未来的信息? 考察对自回归生成与注意力机制因果性的理解第 23 题请讲讲Transformer中的并行化,以及为什么注意力计算中要除以根号dk? 考察对Transformer并行化原理和注意力机制缩放因子的理解第 24 题请简要介绍Transformer的基本结构,并说明它相比传统RNN的优势。 考察对Transformer架构和序列建模演进的理解第 25 题请解释BERT模型的原理。 考察对BERT架构、预训练任务及模型应用的理解程度第 26 题为什么 Transformer 的注意力分数要除以根号 dk? 考察注意力机制数学设计的直觉与稳定性理解第 27 题在典型Transformer模型中,Attention模块和MLP模块的参数规模通常哪个更大?请说明原因。 考察对Transformer结构参数分布的准确理解第 28 题Transformer的注意力为什么要多个头,多个头为什么能注意到不同信息,为什么一个头不能呢,反正最终输出都是相同维度,难道一起就学不到分开的东西吗 考察多头注意力机制的设计动机与信息多样性第 29 题请介绍你对 Transformer 模型的了解。 考察对 Transformer 架构核心组件和原理的理解深度第 30 题请计算给定Transformer模型在一次前向推理中的FLOPs和内存开销。 考察对模型计算复杂度和显存占用的量化分析能力第 31 题手写实现Transformer编码器中的多头注意力机制(MHA),并简要说明各步骤。 考察对Transformer编码器与多头注意力机制的理解及代码实现能力第 32 题请介绍Self-Attention机制的原理,以及它在大模型中的作用。 考察对注意力机制核心原理及其对模型能力贡献的理解第 33 题Attention为什么要除以根号dk? 考察对Transformer中缩放点积注意力机制原理的理解第 34 题介绍Transformer结构,并说明各个部分的重要性。 考察对Transformer核心组件及其作用的理解深度第 35 题请手写并讲解 Transformer Encoder 的核心实现,包括多头注意力、前馈网络、残差连接与层归一化。 考察对 Transformer Encoder 结构、注意力计算细节及实现的掌握程度第 36 题请分析Transformer前向推理时Attention模块的计算量与时间复杂度。 考察对Transformer中自注意力计算复杂度与推理阶段计算特性的理解第 37 题请介绍DIN的注意力池化机制,并说明它与Transformer的self-attention有什么区别。 考察对DIN注意力机制的理解及与Transformer的对比第 38 题手写自注意力机制,并说明Q、K、V的线性变换矩阵能否共享权重? 考察自注意力机制的编码实现与对QKV投影空间的理解第 39 题详细描述,如果给一个txt存储的文本,从预处理到SFT的训练流程,要包括对数据的预处理、tokenize、forward、loss计算、参数更新,越细越好。 考察大模型SFT全流程的技术细节与工程实现能力第 40 题解码器的输出形状是什么,如何做自回归过程? 考察对自回归生成流程和存储结构的理解