人工智能面试题 · Transformer
人工智能相关岗位面试题。
共 11389 道真题 · 当前筛选命中 804 道 · 更新 2026-08-05
筛选题目已选:Transformer
考察点
技术栈
第 41 题请介绍 Qwen2.5-VL 与普通 Transformer 在结构上的主要差异,并说明这些设计选择的目的。 考察多模态大模型的架构理解及设计权衡分析第 42 题讲讲transformers架构 考察对Transformer核心机制的理解与讲解能力第 43 题Encoder中的self-attention和Decoder中的self-attention有什么区别? 考察对Transformer编码器与解码器注意力机制差异的理解第 44 题请介绍ChatGLM模型的整体架构及其关键设计特点。 考察对大语言模型架构原理的理解与表达能力第 45 题在Transformer框架下,CV、NLP、语音是否可能实现“大一统”? 考察对Transformer统一架构潜力的理解与跨模态技术判断第 46 题请具体说明在Transformer中如何实现多头注意力机制(Multi-Head Attention)。 考察对注意力机制实现细节的理解,包括Q/K/V投影、缩放点积和拼接输出第 47 题请介绍LLaMA的模型结构及其设计特点。 考察对LLaMA模型架构的理解及关键设计细节第 48 题多头注意力机制的计算复杂度是多少? 考察对Transformer中多头注意力计算复杂度的理解第 49 题请解释从Embedding到Transformer的核心工作原理。 考察对Transformer基础架构和Embedding机制的理解第 50 题注意力公式中为什么要除以根号d? 考察对自注意力机制缩放因子原理的理解第 51 题请阐述ViT的结构、计算复杂度以及它如何应用于图像分类。 考察对ViT架构原理、复杂度来源和任务适配的理解第 52 题在 ResNet 或 Transformer 中,残差连接的作用是什么?请展开说明。 考察对残差连接原理、作用及在典型架构中应用的理解深度第 53 题请写出Transformer中自注意力的表达式,并解释为什么要除以√dk。 考察对注意力机制数学原理和数值稳定性设计的理解第 54 题在 Transformer 模型推理的 Attention 计算中,有哪些显存优化策略?请分别说明其思路和适用场景。 考察对大模型推理显存优化技术的理解深度与工程实践认知第 55 题描述一下典型的encoder-only如Bert的结构细节 考察Transformer编码器架构及BERT模型的结构理解第 56 题请解释多头自注意力机制的原理,并举例说明它在实际模型中的应用。 考察对注意力计算过程的理解及其实践场景第 57 题在序列建模任务中,你会从哪些方面考虑效率优化?请结合具体技术手段说明。 考察对序列模型计算瓶颈的认识及工程优化能力第 58 题请介绍你在GPT、ViT或Transformer相关项目中的具体工作。 考察对Transformer架构相关项目的理解深度和实际落地能力第 59 题请介绍除 DIN 之外的序列建模方法,并对比 Transformer 与 DIN 在推荐场景中的区别。 考察序列建模技术积累与推荐场景下的模型选型能力第 60 题Transformer的mask是如何操作的? 考察对Transformer中padding mask和attention mask原理及实现的理解