人工智能面试题 · 问题拆解 · Transformer

人工智能相关岗位面试题。

11389 道真题 · 当前筛选命中 180 · 更新 2026-08-05

筛选题目已选:问题拆解 · Transformer
第 41 题为什么Transformer的注意力计算要除以根号dk? 考察对注意力缩放原因的理解及数值稳定性知识问题拆解技术原理Transformer第 42 题请说明 Transformer 模型参数量主要受哪些因素影响,并给出一个典型的估算公式。 考察对 Transformer 模型结构参数的理解和估算能力问题拆解技术原理Transformer第 43 题请介绍 Self-Attention 的机制,并分析其时间复杂度。 考察 Transformer 核心机制的理解与复杂度分析能力问题拆解技术原理Transformer第 44 题请完整描述CLIP模型的原理、架构、工作过程、对齐方式,以及基于CLIP实现图像字幕生成(image captioning)的方式。 考察对多模态预训练模型CLIP的深层理解及迁移应用能力问题拆解技术原理技术选型Transformer第 45 题介绍一下Transformer的整体结构及其核心组成部分。 考察对Transformer架构的整体理解与关键组件的作用问题拆解技术原理Transformer第 46 题Transformer的自注意力机制及相比RNN的优势? 考察对自注意力机制原理的理解及与RNN架构的对比分析能力问题拆解技术原理Transformer第 47 题详细介绍一下Transformer的结构? 考察对Transformer核心组件、设计原理和整体架构的理解问题拆解技术原理Transformer第 48 题为什么注意力机制要除以根号 d_k?如果不缩放会怎样? 考察对注意力分数缩放动机与数值稳定性的理解问题拆解技术原理Transformer第 49 题请在白板/代码中实现Transformer的Decoder Block(含Masked Self-Attention与Cross-Attention)。 考察对Transformer Decoder结构、子层顺序及掩码细节的掌握与编码能力编码实现问题拆解技术原理Transformer第 50 题请手写Transformer的伪代码,重点覆盖Encoder和Decoder的完整流程。 考察对Transformer架构的深入理解与代码实现能力编码实现问题拆解技术原理Transformer第 51 题说说Transformer中是如何实现Padding的 考察对Transformer输入序列对齐和mask机制的理解问题拆解技术原理Transformer第 52 题请描述Transformer模型中不同模块(如词嵌入、多头注意力、前馈网络)输入输出张量的维度变化过程。 考察对Transformer内部张量维度流转及多头注意力机制的理解问题拆解技术原理Transformer第 53 题请分析 Decoder-only 文本模型的结构特点,并说明其参数量主要由哪些部分组成。 考察对 Decoder-only 架构的理解及参数量估算能力问题拆解技术原理Transformer第 54 题多头注意力机制与单头注意力机制相比,在计算量和参数量上有什么变化? 考察对多头注意力机制计算复杂度和参数规模的理解问题拆解技术原理Transformer第 55 题你了解 Transformer 这种网络结构吗?请谈谈它的核心组成和工作原理。 考察对 Transformer 架构的基本理解和表达清晰度问题拆解技术原理Transformer第 56 题Transformer为什么可以感知全局 考察对Transformer自注意力机制原理及全局建模能力的理解问题拆解技术原理Transformer第 57 题序列中每个token的embedding经过多层self-attention后变得越来越相似,原因是什么? 考察对Transformer中self-attention各层表征退化和各向异性现象的理解问题拆解技术原理Transformer第 58 题Transformer的encoder和decoder结构有什么区别? 考察对Transformer核心组件差异的理解问题拆解技术原理Transformer第 59 题Transformer 中 Padding 的策略是什么? 考察对 Transformer 输入处理中 Padding 机制的理解问题拆解技术原理Transformer第 60 题请描述 Qwen2 的模型架构,包括其主要组件和设计特点。 考察对大语言模型基础架构的理解,特别是 Qwen2 的具体设计问题拆解技术原理Transformer