度小满面试题 · Transformer
度小满相关面试题,按最终去重题目聚合。
共 807 道真题 · 当前筛选命中 14 道 · 更新 2026-08-05
筛选题目已选:Transformer
考察点
技术栈
第 1 题对于一个BERT模型,假设序列长度为n、隐藏维度为d、层数为l,如何计算其总参数量?请给出估算公式。 考察对Transformer/BERT模型结构的理解及参数量估算能力第 2 题Pre Norm 与 Post Norm 的区别是什么? 考察对 Transformer 归一化位置及其对训练稳定性和性能影响的理解第 3 题请介绍ChatGLM模型的整体架构及其关键设计特点。 考察对大语言模型架构原理的理解与表达能力第 4 题你对大模型基础原理的了解是? 考察对大模型核心概念和训练流程的基础认知第 5 题请说明KV Cache在推理时占用的内存量级,并计算它相比不缓存键值时降低了多少时间复杂度。 考察对KV Cache内存代价与计算复杂度收益的量化理解第 6 题分析Transformer的空间复杂度 考察Transformer模型空间复杂度分析能力第 7 题请解释旋转位置编码(RoPE)的原理。 考察对RoPE位置编码数学原理和实现细节的理解第 8 题请介绍LLaMA模型的整体结构,并说明你在实际部署或训练时使用的模型规模及硬件配置。 考察对LLaMA架构的理解以及模型部署和训练的实际经验第 9 题请介绍 BERT 的网络结构及其两个预训练任务。 考察对 BERT 模型架构和预训练目标的理解第 10 题在Transformer模型中,哪个部分通常最占用显存(GPU内存)? 考察对Transformer各组件显存开销来源的理解第 11 题请谈谈你对大模型底层逻辑的理解。 考察对大模型基本原理和技术细节的掌握程度第 12 题为什么目前主流的模型都是用的decoder-only结构? 考察对Transformer架构变体及其权衡的理解第 13 题请介绍Transformer的核心原理,包括其主要组件和工作流程。 考察对Transformer架构的整体理解与关键组件作用的掌握第 14 题请解释 CLIP 模型的基本原理以及 Vision Transformer 的可行性。 考察对多模态模型 CLIP 和 Vision Transformer 的理解