淘天集团面试题 · Transformer

淘天集团相关面试题,按最终去重题目聚合。

2775 道真题 · 当前筛选命中 23 · 更新 2026-08-05

筛选题目已选:Transformer
第 1 题后来有哪些比较经典的基于Transformer的语言模型,Qwen相比于原始Transformer有哪些结构上的改动,Qwen2又有哪些改进? 考察对Transformer架构演进、Qwen系列模型结构差异及版本改进的理解持续改进技术原理技术选型Transformer第 2 题请实现多头自注意力机制。 考察对Transformer核心组件的理解与编码实现能力编码实现问题拆解技术原理Transformer第 3 题请介绍对编码模型(如代码生成模型)的了解,包括原理和优缺点。 考察对代码生成模型原理及局限的认知风险判断技术原理LLMTransformer第 4 题请解释 Transformer 编码器和解码器在注意力机制上的区别。 考察对 Transformer 结构差异的理解技术原理Transformer第 5 题请详细介绍一下Transformer的整体结构及其核心组件的作用。 考察对Transformer架构各组成部分的理解及其设计动机技术原理技术选型Transformer第 6 题从代码实现上讲,Decoder中的Mask是如何作用在Self-Attention分数上的? 考察对注意力分数加权与掩码矩阵应用的代码级理解编码实现技术原理Transformer第 7 题介绍Transformer,编码器和解码器的注意力有什么区别? 考察对Transformer架构中自注意力与交叉注意力的理解技术原理Transformer第 8 题多头注意力机制与单头注意力机制相比,在计算量和参数量上有什么变化? 考察对多头注意力机制计算复杂度和参数规模的理解问题拆解技术原理Transformer第 9 题请解释位置编码在Transformer中的作用,并说明正弦位置编码与可学习位置编码的差异及适用场景。 考察对Transformer位置编码原理及其不同实现方式的理解技术原理方案权衡Transformer第 10 题用BERT做分类时,softmax应该添加在哪个层级,维度如何选择? 考察BERT分类头的实现细节与输出维度设计编码实现技术原理BERTTransformer第 11 题Transformer 中 Attention 的本质是什么?你能从数学角度简要解释一下吗? 考察对注意力机制本质和数学原理的理解技术原理Transformer第 12 题在Transformer的Decoder中,为什么需要Mask来遮住未来的信息? 考察对自回归生成与注意力机制因果性的理解问题拆解技术原理Transformer第 13 题请说明 Transformer 中编码器与解码器的注意力机制有何区别,并解释在缩放点积注意力中除以√dk 的原因。 考察对 Transformer 注意力机制的理解深度,包括结构差异与数学原理问题拆解技术原理Transformer第 14 题请介绍你对大语言模型和多模态大模型发展脉络的了解,并谈谈 Transformer、BERT、GPT、LLaMA、Qwen 系列以及 o1 推理模型各自的关键贡献与联系。 考察对生成式AI技术演进、代表性模型核心贡献及代际关系的理解业务理解技术原理BERTTransformer第 15 题请谈谈你对大模型底层原理的理解。 考察对大模型核心技术的理解深度与系统性业务理解技术原理Transformer第 16 题请列举几个基于 Transformer 的经典语言模型,并说明 Qwen 相比原始 Transformer 在结构上做了哪些主要改动? 考察对 Transformer 架构演进和主流模型结构差异的理解技术原理技术选型Transformer第 17 题LLaMA和GLM在模型架构等方面有哪些主要区别? 考察对主流开源大模型架构差异的理解和对比分析能力技术原理方案权衡Transformer第 18 题请手写实现Transformer Decoder层,并说明如何实现mask机制以支持自回归生成。 考察对Transformer Decoder结构、自注意力mask和因果掩码的实现能力编码实现问题拆解技术原理PyTorchTransformer第 19 题Transformer的注意力为什么要多个头,多个头为什么能注意到不同信息,为什么一个头不能呢,反正最终输出都是相同维度,难道一起就学不到分开的东西吗 考察多头注意力机制的设计动机与信息多样性问题拆解技术原理Transformer第 20 题在Transformer中,如何降低注意力机制的计算复杂度? 考察对注意力机制复杂度问题的理解及优化方案性能优化技术原理方案权衡Transformer