人工智能面试题 · Transformer
人工智能相关岗位面试题。
共 11389 道真题 · 当前筛选命中 804 道 · 更新 2026-08-05
筛选题目已选:Transformer
考察点
技术栈
第 781 题讲讲MHA、Attention公式,为什么需要除以根号 dk。 考察对Transformer核心组件及缩放点积注意力原理的掌握第 782 题请解释Attention机制及其变体的原理,并说明Cross Attention中Q、K、V分别来自哪里。 考察对Transformer注意力机制及其变体的理解,特别是Cross Attention中QKV的来源第 783 题Transformer的复杂度推导 考察对Transformer架构时间与空间复杂度的理解及推导能力第 784 题请手写Transformer的核心结构,并解释各模块的作用。 考察对Transformer架构细节的理解和编码实现能力第 785 题为什么Attention公式中要除以√dk?这个操作有什么作用? 考察对Transformer中缩放点积注意力原理的理解第 786 题请手写实现 Multi-Head Attention,并说明其计算过程。 考察对注意力机制原理的理解和代码实现能力第 787 题请介绍BERT模型的结构和核心原理。 考察对预训练模型架构与训练机制的理解深度第 788 题请介绍你熟悉的一种最新文本识别算法或模型,并说明其技术特点和适用场景。 考察对文本识别技术前沿的了解深度与实际应用能力第 789 题在机器学习和深度学习中,你最熟悉或最常用的算法或模型有哪些?请说明你的熟悉程度和实际应用场景。 考察候选人对机器学习/深度学习算法实际掌握程度和应用能力第 790 题如何解决decoder-attention中无法看到后面信息的问题? 考察对decoder自注意力机制原理及mask矩阵作用的理解第 791 题请分析Transformer前向推理时Attention模块的计算量与时间复杂度。 考察对Transformer中自注意力计算复杂度与推理阶段计算特性的理解第 792 题Transformer的位置编码中为什么将基底设为10000? 考察对Transformer位置编码设计原理和参数选择的理解第 793 题Transformer 中编码器和解码器的注意力机制有什么区别? 考察对 Transformer 多头注意力机制的类型、掩码与更新范围的理解第 794 题Transformer中Attention的计算公式是什么? 考察注意力机制的基础计算流程第 795 题Transformer 的位置 embedding 怎么计算? 考察对 Transformer 正弦位置编码原理和性质的理解第 796 题Mask Attention是怎么做的? 考察对Transformer中Masked Attention机制的理解,包括实现原理和不同应用场景第 797 题在计算注意力分数时,为什么要除以根号 d_k? 考察对注意力缩放原因的理解第 798 题请讲讲Transformer中的并行化,以及为什么注意力计算中要除以根号dk? 考察对Transformer并行化原理和注意力机制缩放因子的理解第 799 题请介绍 Transformer 的核心结构和工作原理。 考察对 Transformer 架构核心组件及其作用的理解第 800 题Transformer的全局依赖是怎么做的 考察Transformer自注意力机制对全局依赖的建模原理