人工智能面试题 · Transformer
人工智能相关岗位面试题。
共 11389 道真题 · 当前筛选命中 804 道 · 更新 2026-08-05
筛选题目已选:Transformer
考察点
技术栈
第 741 题请解释 Transformer 中 self-attention 的计算公式及各部分的意义,并说明为什么要除以缩放因子。 考察对 self-attention 数学原理和设计动机的理解第 742 题Attention计算中为什么要除以缩放因子? 考察对Transformer中Attention缩放机制原理的理解第 743 题如何节省 Transformer Block 的计算量? 考察对 Transformer 结构各组件计算开销来源及常见优化策略的掌握第 744 题在计算attention score时如何对padding做mask操作? 考察Transformer中padding mask的原理与实现细节第 745 题目前大模型架构有哪些? 考察对大模型主流架构类型的掌握与分类能力第 746 题请解释主流大语言模型与传统Transformer模型在架构、训练目标和应用方式上的主要区别? 考察对Transformer基座与大模型技术演进的系统理解第 747 题注意力机制的类型(MHA,MQA,GQA,MLA)各自的优缺点 考察对注意力机制变体的原理理解与权衡分析能力第 748 题请解释Grouped-Query Attention(GQA)的原理及其实现方式。 考察对GQA机制原理和高效实现的理解第 749 题在Transformer架构中,Self Attention和Cross Attention分别出现在什么位置,各自的作用是什么? 考察对Transformer各模块中注意力机制角色定位的理解第 750 题Transformer 中为何使用 LayerNorm 而非 BatchNorm?这对大模型训练的稳定性有何影响? 考察对归一化机制差异及其对训练稳定性的影响的理解第 751 题多头和单头的区别在哪里? 考察对多头注意力机制与单头注意力机制的理解和对比能力第 752 题介绍Transformer架构 考察对Transformer核心组件、设计动机和整体工作原理的理解第 753 题请手写实现一个Transformer的核心模块,并说明各部分的作用。 考察对Transformer架构的深入理解和编码实现能力第 754 题请解释Transformer中KV Cache的作用及其机制。 考察对Transformer推理优化中KV Cache原理和效益的理解第 755 题在多头注意力中,存在哪些常见的变体?如何设计新的变体? 考察对注意力机制变体的了解与设计思考第 756 题请解释 Self-Attention、Cross-Attention 和 GQA(Grouped Query Attention)在 Transformer 中的作用与区别。 考察对 Transformer 注意力机制变体及原理的理解第 757 题请简单介绍你对Transformer的了解。 考察对Transformer核心机制与基本结构的理解深度第 758 题Transformer中embedding怎么做的? 考察对Transformer输入表示机制的理解第 759 题多模态大模型中的ViT,解释其原理以及它是如何训练的? 考察对Vision Transformer(ViT)架构原理及其训练流程的理解第 760 题分析Transformer的复杂度 考察对Transformer网络结构和计算复杂度的理解