人工智能面试题 · Transformer
人工智能相关岗位面试题。
共 11389 道真题 · 当前筛选命中 804 道 · 更新 2026-08-05
筛选题目已选:Transformer
考察点
技术栈
第 181 题分析RNN和Transformer各自的优缺点,并重点说明Transformer的并行性优势。 考察对两种序列模型架构的深入理解及并行计算差异第 182 题请在白板/代码中实现Transformer的Decoder Block(含Masked Self-Attention与Cross-Attention)。 考察对Transformer Decoder结构、子层顺序及掩码细节的掌握与编码能力第 183 题你了解哪些 Transformer 的位置编码方式?它们分别有什么特点? 考察对位置编码常见方案及其设计动机的掌握第 184 题有哪些Encoder-Decoder结构模型? 考察对序列到序列模型架构的掌握与分类能力第 185 题ViT为什么要结合卷积或采用类似卷积的归纳偏置?请从Transformer和卷积的特性角度解释。 考察对Transformer序列建模与卷积局部性差异的理解第 186 题请实现多头注意力机制。 考察对多头注意力机制的理解与代码实现能力第 187 题请介绍你对Transformer模型的理解,并结合你的实际业务,说明你做过哪些针对性的修改或优化? 考察对Transformer原理的理解深度和实际业务中的模型定制能力第 188 题CNN、Transformer的区别,分别更适合怎样的任务? 考察对两种主流深度学习架构原理差异与适用场景的理解第 189 题介绍Transformer,编码器和解码器的注意力有什么区别? 考察对Transformer架构中自注意力与交叉注意力的理解第 190 题请手写Transformer的伪代码,重点覆盖Encoder和Decoder的完整流程。 考察对Transformer架构的深入理解与代码实现能力第 191 题为什么现在 Decoder-only 成为大模型的主流架构? 考察对 Transformer 架构变体演进及大模型训练/推理权衡的理解第 192 题请解释注意力机制中self-attention的计算复杂度,并说明其瓶颈。 考察对Transformer核心机制的计算复杂度理解及性能瓶颈识别第 193 题为什么目前主流的大模型采用 Decoder-only 架构? 考察对 Transformer 架构演进、训练目标与能力差异的理解第 194 题Transformer中带Mask的Attention是如何实现的? 考察掩码机制的原理与实现方式第 195 题说说Transformer中是如何实现Padding的 考察对Transformer输入序列对齐和mask机制的理解第 196 题讲讲UniAD端到端大致是怎样做的 考察对UniAD端到端自动驾驶框架的整体理解与关键组件认知第 197 题除标准多头注意力(MHA)之外,你还了解哪些注意力机制的变体,比如GQA、MQA?它们各自解决了什么问题,分别适用于什么场景? 考察对注意力机制演进脉络的理解及对计算与效果权衡的把握第 198 题ViT怎么将注意力用于视觉? 考察对Vision Transformer核心机制的理解及与CNN的差异第 199 题请分析Self-Attention的时间复杂度,并与RNN进行对比。 考察时间复杂度分析与模型特性比较能力第 200 题请解释Transformer模型中Encoder和Decoder的结构差异,以及它们各自的作用。 考察对Transformer核心架构的理解与表达能力