人工智能面试题 · 技术原理 · Transformer
人工智能相关岗位面试题。
共 11389 道真题 · 当前筛选命中 794 道 · 更新 2026-08-05
筛选题目已选:技术原理 · Transformer
考察点
技术栈
第 41 题讲讲transformers架构 考察对Transformer核心机制的理解与讲解能力第 42 题Encoder中的self-attention和Decoder中的self-attention有什么区别? 考察对Transformer编码器与解码器注意力机制差异的理解第 43 题请介绍ChatGLM模型的整体架构及其关键设计特点。 考察对大语言模型架构原理的理解与表达能力第 44 题在Transformer框架下,CV、NLP、语音是否可能实现“大一统”? 考察对Transformer统一架构潜力的理解与跨模态技术判断第 45 题请具体说明在Transformer中如何实现多头注意力机制(Multi-Head Attention)。 考察对注意力机制实现细节的理解,包括Q/K/V投影、缩放点积和拼接输出第 46 题请介绍LLaMA的模型结构及其设计特点。 考察对LLaMA模型架构的理解及关键设计细节第 47 题多头注意力机制的计算复杂度是多少? 考察对Transformer中多头注意力计算复杂度的理解第 48 题请解释从Embedding到Transformer的核心工作原理。 考察对Transformer基础架构和Embedding机制的理解第 49 题注意力公式中为什么要除以根号d? 考察对自注意力机制缩放因子原理的理解第 50 题请阐述ViT的结构、计算复杂度以及它如何应用于图像分类。 考察对ViT架构原理、复杂度来源和任务适配的理解第 51 题在 ResNet 或 Transformer 中,残差连接的作用是什么?请展开说明。 考察对残差连接原理、作用及在典型架构中应用的理解深度第 52 题请写出Transformer中自注意力的表达式,并解释为什么要除以√dk。 考察对注意力机制数学原理和数值稳定性设计的理解第 53 题在 Transformer 模型推理的 Attention 计算中,有哪些显存优化策略?请分别说明其思路和适用场景。 考察对大模型推理显存优化技术的理解深度与工程实践认知第 54 题描述一下典型的encoder-only如Bert的结构细节 考察Transformer编码器架构及BERT模型的结构理解第 55 题请解释多头自注意力机制的原理,并举例说明它在实际模型中的应用。 考察对注意力计算过程的理解及其实践场景第 56 题在序列建模任务中,你会从哪些方面考虑效率优化?请结合具体技术手段说明。 考察对序列模型计算瓶颈的认识及工程优化能力第 57 题请介绍你在GPT、ViT或Transformer相关项目中的具体工作。 考察对Transformer架构相关项目的理解深度和实际落地能力第 58 题请介绍除 DIN 之外的序列建模方法,并对比 Transformer 与 DIN 在推荐场景中的区别。 考察序列建模技术积累与推荐场景下的模型选型能力第 59 题Transformer的mask是如何操作的? 考察对Transformer中padding mask和attention mask原理及实现的理解第 60 题请介绍Transformer的架构组成和工作原理,并说明它与传统RNN/LSTM相比的主要优势。 考察对Transformer核心机制的理解及其相对循环模型的优势