人工智能面试题 · 问题拆解 · Transformer
人工智能相关岗位面试题。
共 11389 道真题 · 当前筛选命中 180 道 · 更新 2026-08-05
筛选题目已选:问题拆解 · Transformer
考察点
技术栈
第 161 题Transformer的Encoder-Decoder过程展开讲,Encoder怎么实现? 考察对Transformer架构中编码器内部机制的理解第 162 题请解释 Transformer 中 self-attention 的计算公式及各部分的意义,并说明为什么要除以缩放因子。 考察对 self-attention 数学原理和设计动机的理解第 163 题在Transformer架构中,Self Attention和Cross Attention分别出现在什么位置,各自的作用是什么? 考察对Transformer各模块中注意力机制角色定位的理解第 164 题请手写实现一个Transformer的核心模块,并说明各部分的作用。 考察对Transformer架构的深入理解和编码实现能力第 165 题多模态大模型中的ViT,解释其原理以及它是如何训练的? 考察对Vision Transformer(ViT)架构原理及其训练流程的理解第 166 题分析Transformer的复杂度 考察对Transformer网络结构和计算复杂度的理解第 167 题请详细说明Transformer中Attention机制的q、k、v分别代表什么,以及它们如何通过计算得到最终输出,其中Softmax起到什么作用? 考察对注意力机制核心原理、计算流程及Softmax作用的理解第 168 题Transformer的时间复杂度是多少?请说明其来源及典型的优化手段。 考察对Transformer复杂度来源的理解及优化方案的掌握第 169 题怎么理解Transformer的Attention 考察对注意力机制原理、计算流程及应用的理解第 170 题请介绍 Transformer 模型的核心结构,并说明自注意力机制的作用及其计算过程。 考察对 Transformer 架构和自注意力机制的理解深度第 171 题Masked Multi-Head Attention的mask怎么做的 考察对Masked Multi-Head Attention中mask机制的理解和实现细节第 172 题位置编码的类别介绍,及其在序列拓长场景下的应用 考察对位置编码原理、类别划分及长序列外推能力的理解第 173 题讲讲MHA、Attention公式,为什么需要除以根号 dk。 考察对Transformer核心组件及缩放点积注意力原理的掌握第 174 题请解释Attention机制及其变体的原理,并说明Cross Attention中Q、K、V分别来自哪里。 考察对Transformer注意力机制及其变体的理解,特别是Cross Attention中QKV的来源第 175 题Transformer的复杂度推导 考察对Transformer架构时间与空间复杂度的理解及推导能力第 176 题请介绍BERT模型的结构和核心原理。 考察对预训练模型架构与训练机制的理解深度第 177 题请分析Transformer前向推理时Attention模块的计算量与时间复杂度。 考察对Transformer中自注意力计算复杂度与推理阶段计算特性的理解第 178 题Mask Attention是怎么做的? 考察对Transformer中Masked Attention机制的理解,包括实现原理和不同应用场景第 179 题请讲讲Transformer中的并行化,以及为什么注意力计算中要除以根号dk? 考察对Transformer并行化原理和注意力机制缩放因子的理解第 180 题Transformer的全局依赖是怎么做的 考察Transformer自注意力机制对全局依赖的建模原理