人工智能面试题 · Transformer

人工智能相关岗位面试题。

共 11389 道真题 · 当前筛选命中 804 道 · 更新 2026-08-05

筛选题目已选:Transformer
第 661 题Transformer中除了注意力模块,还有哪些关键组件?各自的作用是什么? 考察对Transformer整体架构的全面理解技术原理Transformer第 662 题Transformer的注意力为什么要多个头,多个头为什么能注意到不同信息,为什么一个头不能呢,反正最终输出都是相同维度,难道一起就学不到分开的东西吗 考察多头注意力机制的设计动机与信息多样性问题拆解技术原理Transformer第 663 题Batch Normalization和Layer Normalization有什么区别?在Transformer中通常使用哪种? 考察归一化方法原理及在Transformer中的选用原因技术原理方案权衡Transformer第 664 题Qwen系列模型和GPT-2的区别是什么? 考察对两类大规模语言模型架构、训练方式与应用定位的理解业务理解技术原理Transformer第 665 题请解释多模态大模型(如视觉-语言模型)的核心架构组成,并说明各模块如何协同工作。 考察对多模态大模型整体架构和模块协作的理解系统设计技术原理Transformer第 666 题请写出自注意力机制的公式,并解释各符号含义。 考察对Transformer自注意力机制原理和公式的理解技术原理Transformer第 667 题请解释 Layer Normalization(LN)的作用及其在 Transformer 中的应用。 考察对 LN 原理与作用位置的理解风险判断技术原理Transformer第 668 题Transformer架构中FFN层的作用是什么? 考察对Transformer中前馈网络功能的理解技术原理Transformer第 669 题Transformer的并行计算能力体现在哪些方面? 考察对Transformer架构并行化原理的理解,包括注意力计算、层内模块和数据流问题拆解技术原理Transformer第 670 题请介绍Transformer中的Block(编码器块)结构,并说明各组成部分的作用。 考察对Transformer核心组件及其设计意图的理解技术原理Transformer第 671 题softmax缩放因子为什么是根号d而不是其他数? 考察对缩放因子推导逻辑和边界条件理解技术原理Transformer第 672 题请介绍你了解的生成式模型,并重点介绍 GLM 系列模型的整体结构。 考察对生成式模型的基本认知及对 GLM 模型结构的理解技术原理技术选型Transformer第 673 题比较一下几种常见的LLM架构,例如Encoder-Only、Decoder-Only和Encoder-Decoder,并说明它们各自最擅长的任务类型。 考察对主流大语言模型架构的原理理解与任务适配能力技术原理技术选型BERTTransformer第 674 题请对比Transformer与RNN、LSTM在结构和建模能力上的区别。 考察对主流序列模型核心差异的理解技术原理方案权衡Transformer第 675 题大模型的Attention层结构有什么区别? 考察对不同Transformer架构中Attention变体的原理理解与对比能力技术原理方案权衡Transformer第 676 题请介绍你了解的BERT模型,包括它的核心结构、预训练任务,以及它在实际应用中的适用场景。 考察对BERT模型原理的理解与实际应用意识业务理解技术原理技术选型BERTTransformer第 677 题详细描述,如果给一个txt存储的文本,从预处理到SFT的训练流程,要包括对数据的预处理、tokenize、forward、loss计算、参数更新,越细越好。 考察大模型SFT全流程的技术细节与工程实现能力编码实现问题拆解技术原理PyTorchTransformer第 678 题请解释Transformer中Attention的计算过程,包括为什么除以根号d_k、时间复杂度分析以及为什么要使用多头注意力机制。 考察对Transformer注意力机制原理、数学细节和设计动机的理解技术原理方案权衡Transformer第 679 题推理时若图像尺寸不一致,切分 patch 后多出的 patch 应如何进行位置编码? 考察视觉 Transformer 中针对变长输入的位置编码处理策略问题拆解技术原理方案权衡Transformer第 680 题请解释 Encoder、Decoder 和 Decoder-only 架构的区别。 考察对 Transformer 三种主要架构形态及其适用场景的理解技术原理技术选型Transformer