人工智能面试题 · 技术原理 · Transformer
人工智能相关岗位面试题。
共 11389 道真题 · 当前筛选命中 794 道 · 更新 2026-08-05
筛选题目已选:技术原理 · Transformer
考察点
技术栈
第 1 题推导并计算多头注意力机制的时间与空间复杂度 考察对Transformer注意力机制计算复杂度的理解与推导能力第 2 题Self-Attention和Cross-Attention分别介绍有什么异同,Transformer的encoder和decoder都用了什么? 考察对Transformer注意力机制原理及编码器解码器架构细节的理解第 3 题在标准Transformer架构中,哪个模块的计算量最大? 考察对Transformer组件计算复杂度的理解第 4 题请解释Transformer中的位置编码及其作用。 考察对Transformer位置编码原理和作用的理解第 5 题对于一个BERT模型,假设序列长度为n、隐藏维度为d、层数为l,如何计算其总参数量?请给出估算公式。 考察对Transformer/BERT模型结构的理解及参数量估算能力第 6 题Transformer 中的 mask 是如何实现的?它在模型中的位置在哪里?如何处理掩码位置的无穷小值(-inf)问题? 考察对 Transformer 掩码机制实现细节、使用位置及数值处理的理解第 7 题请系统介绍 Transformer 的基本原理、关键组件及其相较于传统序列模型的优势,并简要说明其典型应用场景。 考察对 Transformer 架构原理的理解、对比分析能力及知识系统性第 8 题请口述Transformer模型的整体工作流程,从输入到输出。 考察对Transformer架构核心组件及数据流顺序的理解第 9 题请简述Transformer的基本结构和工作原理。 考察对Transformer架构核心组件及运作流程的理解第 10 题CNN和Transformer有什么区别? 考察对两类主流神经网络架构在原理、适用场景和差异上的理解第 11 题Attention机制有哪些常见类型?位置编码有哪些常见方式? 考察对Transformer核心组件Attention机制和位置编码的分类与原理理解第 12 题Qwen2.5-VL 中的 Transformer 结构与普通 Transformer 结构有哪些不同? 考察对现代 LLM 架构演进及视觉语言模型适配机制的理解第 13 题请解释Transformer的注意力机制的原理,并说明其在模型中的作用。 考察对Transformer核心机制的理解深度及表达能力第 14 题在 Transformer 的缩放点积注意力中,为什么 Q 和 K 的点积要除以根号下 d_k,能不能用其他数值?请从数学原理上解释。 考察对注意力机制数学原理的理解,特别是方差分析与缩放因子的作用第 15 题为什么大模型会有效?请结合 ChatGPT 相关内容说明。 考察对大规模语言模型原理、能力来源与局限性的理解第 16 题Transformer中的降维操作通常是如何进行的?请结合具体场景说明。 考察对Transformer中降维技术(如维度压缩、池化、投影)的理解与应用。第 17 题Llama的Decoder结构和位置编码相比原始Transformer有哪些改进? 考察对Llama模型架构细节及其设计意图的理解第 18 题Pre Norm 与 Post Norm 的区别是什么? 考察对 Transformer 归一化位置及其对训练稳定性和性能影响的理解第 19 题Multi-Head Attention 现在有一些优化,现在主流的优化都有哪些方向,每个方向下有什么优化方法? 考察对注意力机制优化的体系化理解与前沿认知第 20 题请简要介绍Transformer的基本结构,并说明它相比传统RNN的优势。 考察对Transformer架构和序列建模演进的理解