字节跳动面试题 · 问题拆解 · Transformer
字节跳动相关面试题,按最终去重题目聚合。
共 3252 道真题 · 当前筛选命中 17 道 · 更新 2026-08-05
筛选题目已选:问题拆解 · Transformer
考察点
技术栈
第 1 题请介绍你对 Transformer 模型的了解。 考察对 Transformer 架构核心组件和原理的理解深度第 2 题计算Attention的softmax之前为什么要除根号dk? 考察对Transformer中注意力机制缩放因子原理的理解第 3 题请介绍 Self-Attention 的机制,并分析其时间复杂度。 考察 Transformer 核心机制的理解与复杂度分析能力第 4 题Transformer的encoder和decoder结构有什么区别? 考察对Transformer核心组件差异的理解第 5 题请描述 Qwen2 的模型架构,包括其主要组件和设计特点。 考察对大语言模型基础架构的理解,特别是 Qwen2 的具体设计第 6 题八股:Transformer Encoder 中 FFN 的作用是什么? 考察对 Transformer 前馈网络功能与设计原理的理解第 7 题Transformer 中 Encoder 与 Decoder 的自注意力机制有何区别? 考察对 Transformer 注意力机制结构差异及训练阶段行为的理解第 8 题手写实现Transformer编码器中的多头注意力机制(MHA),并简要说明各步骤。 考察对Transformer编码器与多头注意力机制的理解及代码实现能力第 9 题请计算给定Transformer模型在一次前向推理中的FLOPs和内存开销。 考察对模型计算复杂度和显存占用的量化分析能力第 10 题Transformer 中的 Q、K、V 分别是什么含义? 考察对注意力机制核心概念的理解第 11 题请解释Self-Attention机制的原理及其在Transformer中的作用。 考察对注意力机制核心思想与计算流程的理解第 12 题请介绍BERT的模型结构及其核心组件。 考察对BERT架构的理解,包括Transformer层、注意力机制和预训练任务第 13 题如果Transformer的注意力机制中把K去掉,变成QQV,会有什么问题? 考察对注意力机制中键(K)作用的理解,以及去掉K后带来的影响第 14 题实习时你微调过Qwen2,请说说Qwen2的模型结构,以及相比Qwen1做了哪些改进? 考察对大语言模型结构演进的理解和对比分析能力第 15 题详细描述,如果给一个txt存储的文本,从预处理到SFT的训练流程,要包括对数据的预处理、tokenize、forward、loss计算、参数更新,越细越好。 考察大模型SFT全流程的技术细节与工程实现能力第 16 题Transformer 中因果注意力和双向注意力的区别是什么? 考察对 Transformer 注意力机制在不同任务中应用差异的理解第 17 题请介绍 Transformer 模型的核心结构,并说明自注意力机制的作用及其计算过程。 考察对 Transformer 架构和自注意力机制的理解深度