深圳虾皮信息科技有限公司面试题 · tech:transformer

深圳虾皮信息科技有限公司相关面试题,按最终去重题目聚合。

共 2768 道真题 · 当前筛选命中 11 道 · 更新 2026-08-05

筛选题目已选:tech:transformer
第 1 题为什么目前主流的大模型采用 Decoder-only 架构? 考察对 Transformer 架构演进、训练目标与能力差异的理解技术原理方案权衡Transformer第 2 题为什么Tiger模型采用encoder-decoder架构而不是decoder-only架构? 考察对Transformer架构设计权衡和模型选型的理解技术原理技术选型方案权衡Transformer第 3 题Transformer注意力分数为何要做缩放(即为什么除以根号d)? 考察对注意力机制数学动机和数值稳定性的理解技术原理方案权衡Transformer第 4 题请解释 Transformer 中的自注意力机制,并说明其计算流程与优势。 考察对自注意力机制原理、计算细节和优势的理解问题拆解技术原理Transformer第 5 题你说你之前做过深度学习,那你知道为什么AI会容易忘记上下文吗? 考察对上下文管理机制与长文本处理瓶颈的理解技术原理问题排查Transformer第 6 题请介绍Transformer中多头注意力机制(MHA)的工作原理及其作用。 考察对Transformer核心组件多头注意力机制的理解深度技术原理Transformer第 7 题除 Decoder-only 外,Transformer 的 Encoder-only 与 Encoder-Decoder 架构分别适合什么任务? 考察对 Transformer 变体任务适配的理解业务理解技术选型Transformer第 8 题请详细讲解Transformer的整体结构及其各组成部分的作用。 考察对Transformer架构的理解深度与关键组件原理技术原理Transformer第 9 题经典的微调算法有哪些? 考察对预训练模型常见微调范式的理解和区分能力技术原理技术选型LoRATransformer第 10 题在Transformer中,多头注意力机制相比单头注意力有哪些优势?头数增加会如何影响算法复杂度? 考察对多头注意力机制原理及其计算复杂度的理解技术原理方案权衡Transformer第 11 题Encoder-Decoder、Decoder-Only 哪种方式更好? 考察对两类模型架构的适用场景和技术权衡的理解技术原理技术选型方案权衡Transformer