互联网/IT行业面试题 · Transformer
互联网/IT行业相关面试题,按题目行业基础数据聚合。
共 47588 道真题 · 当前筛选命中 348 道 · 更新 2026-08-05
筛选题目已选:Transformer
考察点
技术栈
第 41 题请说明 Transformer 中编码器与解码器的注意力机制有何区别,并解释在缩放点积注意力中除以√dk 的原因。 考察对 Transformer 注意力机制的理解深度,包括结构差异与数学原理第 42 题Transformer中Pre-Norm和Post-Norm的设计差异是什么?对模型训练稳定性和性能有何影响? 考察对Transformer归一化层位置差异及其对训练稳定性和性能影响的理解第 43 题如何解决decoder-attention中无法看到后面信息的问题? 考察对decoder自注意力机制原理及mask矩阵作用的理解第 44 题在Transformer的训练和推理过程中,如何处理输入序列中的padding?请说明mask的作用及实现方式。 考察对Transformer中padding处理和注意力掩码机制的理解第 45 题分析一下 DIN 的注意力机制和 Transformer 的注意力机制有什么不同。 考察对注意力机制的深入理解,辨析其在推荐系统与序列建模中的差异第 46 题介绍一下Transformer的结构? 考察对Transformer核心组件的理解与整体架构掌握第 47 题Transformer和传统seq2seq模型有什么区别? 考察对序列建模架构演进的理解及两者核心机制差异第 48 题请手写实现一个 Transformer Encoder 的核心结构。 考察对 Transformer Encoder 的结构理解与代码实现能力第 49 题在Transformer编码器内部,如果仅考虑自注意力操作,将K去掉改成QQV,具体会导致哪些计算或效果上的问题? 考察对注意力计算细节和技术后果的具体分析能力第 50 题为什么Transformer使用三角函数位置编码,相比于[1,2,3..]这种硬编码的好处在哪? 考察位置编码设计动机与相对位置信息建模第 51 题请解释一下 BERT 和 Transformer 是什么,以及它们之间的关系。 考察对预训练语言模型和基础架构的概念理解与区分能力第 52 题BERT和Transformer的区别是什么? 考察对模型架构演进和预训练任务的理解第 53 题你对大模型的基础原理(如 Transformer、预训练与微调)有哪些了解? 考察对大模型核心概念的理解深度第 54 题请介绍 Transformer 的核心架构和关键组件。 考察对 Transformer 模型的原理理解和表达能力第 55 题请解释Self-Attention机制的原理及其在Transformer中的作用。 考察对注意力机制核心思想与计算流程的理解第 56 题请解释Cross Attention(交叉注意力)机制,并说明它与Self Attention的区别及应用场景。 考察对注意力机制变体的理解深度及其在NLP/CV跨模态任务中的应用第 57 题请描述一个 prompt 从输入到输出完整经过 Transformer 的处理流程。 考察对 Transformer 架构从输入嵌入到输出生成的端到端理解第 58 题RNN和Transformer的区别 考察对两种序列建模架构的核心差异及其适用场景的理解第 59 题Transformer的全局依赖是怎么做的 考察Transformer自注意力机制对全局依赖的建模原理第 60 题在多头注意力中,存在哪些常见的变体?如何设计新的变体? 考察对注意力机制变体的了解与设计思考