互联网/IT行业面试题 · 方案权衡 · tech:pytorch
互联网/IT行业相关面试题,按题目行业基础数据聚合。
共 47588 道真题 · 当前筛选命中 17 道 · 更新 2026-08-05
筛选题目已选:方案权衡 · tech:pytorch
考察点
技术栈
第 1 题训练一个 7B 参数规模的模型大约需要多少显存?不同 DeepSpeed ZeRO 阶段分别能节省多少显存? 考察对大模型训练显存开销构成及 ZeRO 优化策略的理解第 2 题请介绍DeepSpeed中并行训练的关键知识点,包括数据并行、模型并行、流水线并行和ZeRO等。 考察对深度学习分布式并行训练中DeepSpeed框架核心机制的理解第 3 题Agentic长文本训练时候容易OOM,你有什么好的优化吗? 考察大模型长文本训练的内存优化策略与工程实践第 4 题请介绍 Qwen 2.5 VL 的图片输入处理与 Loss 设计细节。 考察对多模态模型图像编码、输入拼接与训练目标的深入理解第 5 题神经网络训练参数初始化方式有哪些,分别会有什么问题? 考察对常见权重初始化方法及其影响模型收敛效果的原理性理解第 6 题LN和BN的区别 考察对BatchNorm与LayerNorm原理、适用场景及差异的理解第 7 题DeepSpeed的ZeRO优化器在不同阶段(Stage 1、2、3)分别能节省哪些显存?各阶段的主要区别是什么? 考察对分布式训练显存优化原理的理解第 8 题介绍FSDP(Fully Sharded Data Parallel)的原理与使用场景。 考察对分布式训练中模型并行策略的理解与实际应用能力第 9 题请介绍常见的量化方法、原理及适用场景,并分析它们在计算复杂度和精度损失上的差异。 考察对量化方法原理、适用场景及复杂度与精度权衡的理解第 10 题你了解哪些大模型训练和推理优化的方法? 考察对模型训练与推理阶段常见优化手段的理解广度与深度第 11 题请介绍你了解的深度学习优化器,包括它们的工作原理、适用场景和优缺点。 考察对优化算法原理的理解、对比分析能力和实际选型意识第 12 题怎么阻止某些参数梯度回传? 考察对深度学习梯度流控制机制的理解第 13 题对一个7B参数的模型进行参数高效微调,大致需要多少GPU显存,通常需要保存哪些参数和状态? 考察大模型微调的显存开销构成与参数保存范围的估算能力第 14 题请比较分布式训练中 DP 与 DDP 的区别。 考察对分布式训练并行策略的理解,包括通信、同步与适用场景第 15 题DDP和DP的区别 考察对深度学习中数据并行与模型并行训练策略的理解第 16 题请基于RankMixer架构,实现mixup数据增强和AFFN前馈网络的核心逻辑,并说明它们在模型中的作用。 考察对RankMixer架构中mixup与AFFN的实现理解和设计意图第 17 题解释一下梯度消失的处理策略 考察对深度学习训练中梯度消失问题及其解决方法的理解