互联网/IT行业面试题 · Transformer

互联网/IT行业相关面试题,按题目行业基础数据聚合。

47588 道真题 · 当前筛选命中 348 · 更新 2026-08-05

筛选题目已选:Transformer
第 321 题Qwen2.5-VL 中的 Transformer 结构与普通 Transformer 结构有哪些不同? 考察对现代 LLM 架构演进及视觉语言模型适配机制的理解技术原理方案权衡Transformer第 322 题说一下Attention是怎么做的,Encoder和Decoder的Attention一样吗? 考察对Attention机制原理及Encoder-Decoder中差异的理解技术原理Transformer第 323 题请介绍BERT模型的结构和核心原理。 考察对预训练模型架构与训练机制的理解深度问题拆解技术原理BERTTransformer第 324 题CLIP 中文本编码器的结构是什么样的,输入输出是什么? 考察对 CLIP 模型架构细节的理解以及多模态模型中文本分支的处理方式系统设计技术原理Transformer第 325 题transformer的 attention 中的 QKV 是一样的吗? 考察注意力机制中 Q、K、V 的角色和来源技术原理Transformer第 326 题三角函数位置编码有哪些好处?旋转位置编码相比它有什么优势? 考察位置编码的设计动机与在长序列、相对位置建模上的差异技术原理Transformer第 327 题请在白板/代码中实现Transformer的Decoder Block(含Masked Self-Attention与Cross-Attention)。 考察对Transformer Decoder结构、子层顺序及掩码细节的掌握与编码能力编码实现问题拆解技术原理Transformer第 328 题你了解大模型的基本原理吗?请简要介绍你熟悉的大模型架构和核心概念。 考察对大模型基础知识和核心概念的掌握程度自我认知技术原理LLMTransformer第 329 题Transformer架构为什么要切分为多头? 考察对多头注意力机制设计动机与效果的理解技术原理方案权衡Transformer第 330 题为什么Transformer模型要采用多头注意力机制而不是单头注意力? 考察对多头注意力机制设计动机与效果的理解技术原理方案权衡Transformer第 331 题介绍Attention的计算,Self-Attention和Cross-Attention区别。 考察注意力机制的计算过程与两种注意力变体的理解问题拆解技术原理Transformer第 332 题请解释 Encoder、Decoder 和 Decoder-only 架构的区别。 考察对 Transformer 三种主要架构形态及其适用场景的理解技术原理技术选型Transformer第 333 题请对比主流大模型架构(如Transformer、MoE等)的差异,并说明各自适用的业务场景。 考察对大模型架构差异的理解及场景适配能力风险判断技术原理技术选型Transformer第 334 题什么是 KV Cache?它在 Transformer 推理中扮演什么角色? 考察对 Transformer 自回归解码中键值缓存机制的理解技术原理Transformer第 335 题讲讲MHA、Attention公式,为什么需要除以根号 dk。 考察对Transformer核心组件及缩放点积注意力原理的掌握问题拆解技术原理Transformer第 336 题Transformer中Encoder和Decoder的区别和联系,以及如果单独分开使用的话,各自的优缺点是什么? 考察对Transformer架构的理解、模块职责划分及独立使用的适用场景分析技术原理方案权衡Transformer第 337 题请详细说明Transformer中Attention机制的q、k、v分别代表什么,以及它们如何通过计算得到最终输出,其中Softmax起到什么作用? 考察对注意力机制核心原理、计算流程及Softmax作用的理解问题拆解技术原理Transformer第 338 题请解释KV Cache在Transformer推理中的原理及其作用。 考察对Transformer推理优化中KV Cache机制的理解性能优化技术原理Transformer第 339 题请详细讲解Transformer架构的整体工作流程,包括从输入到输出的主要步骤。 考察对Transformer整体流程的清晰理解与关键机制掌握问题拆解系统设计技术原理Transformer第 340 题请详细解释 Transformer 解码器的结构及其工作原理。 考察对 Transformer 解码器核心机制的理解技术原理Transformer