人工智能面试题 · Transformer
人工智能相关岗位面试题。
共 11389 道真题 · 当前筛选命中 804 道 · 更新 2026-08-05
筛选题目已选:Transformer
考察点
技术栈
第 81 题请解释KV Cache在Transformer推理中的原理及其作用。 考察对Transformer推理优化中KV Cache机制的理解第 82 题在Transformer中为什么要使用位置编码?为什么常采用正弦余弦(sin/cos)函数形式? 考察对Transformer位置信息建模原理及sin/cos编码设计动机的理解第 83 题请详细说明Transformer模型的核心结构组成及其各组件的作用。 考察对Transformer架构的深入理解与模块间关系的把握第 84 题Position Embedding 有哪些常见类型? 考察对位置编码技术演进和原理的理解第 85 题请解释Transformer的多头注意力机制原理。 考察对自注意力机制和多头结构设计的理解第 86 题Transformer 中 LayerNorm 放在 Attention 前还是后?有什么区别? 考察对 Transformer 架构细节的理解及两种归一化位置的设计差异第 87 题讲解Transformer的Decoder结构,包括它包含几层Attention,以及Cross Attention在其中的位置和作用。 考察对Transformer Decoder内部结构、Attention层组成及跨注意力机制的理解第 88 题在Transformer中,为什么Q、K、V要分别通过三个不同的线性映射获得? 考察对Transformer注意力机制中QKV映射作用的理解第 89 题什么是大语言模型的“上下文窗口”?扩展上下文窗口对模型性能有何影响? 考察对大语言模型上下文窗口概念的理解及其扩展带来的性能权衡第 90 题Transformer 为什么使用 LayerNorm 而不是 BatchNorm? 考察对归一化机制在序列建模中适用性的理解第 91 题请介绍对编码模型(如代码生成模型)的了解,包括原理和优缺点。 考察对代码生成模型原理及局限的认知第 92 题计算Attention的softmax之前为什么要除根号dk? 考察对Transformer中注意力机制缩放因子原理的理解第 93 题请介绍Fast Transformer的优化原理,并说明它在长序列场景下的优势。 考察对Transformer加速技术原理的理解和应用能力第 94 题请介绍一下 TIGER 模型。 考察对用户行为序列建模模型 TIGER 的理解第 95 题请介绍 Transformer 的结构组成及各部分作用。 考察对 Transformer 核心组件及其功能的理解第 96 题当输入的文本长度超出模型的上下文窗口时,目前有哪些主流的处理方案或模型架构来应对? 考察对超长文本处理技术的掌握程度和方案选型能力第 97 题除了标准多头注意力(MHA)之外,你还了解哪些注意力机制(如 GQA、MQA、MLA)?请讲解其原理。 考察对高效注意力变体的原理理解,包括参数共享、KV缓存和推理效率第 98 题请介绍Transformer模型中的注意力掩码类型及其计算流程,特别说明padding mask和causal mask的区别。 考察对Transformer注意力机制中掩码原理和整体计算逻辑的理解第 99 题Transformer和CNN、ViT的区别和关系是什么? 考察对主流视觉与序列模型架构原理及演进关系的理解第 100 题Transformer和CNN在目标检测中有什么相同和不同点 考察对CNN与Transformer在目标检测中结构差异和适用场景的理解