旷视大模型一面面经

1. 自我介绍
2. 拷打实习项目

先介绍了一下实习的业务背景,我的是一个智能npc的,我讲了模型训练、数据处 理、调优探索几个方面,他问我让模型更加遵循人设是怎么做的、数据分布是怎么调的、评估是怎么做的,然后问我deepspeed原理、vllm原理、kvcache原理

3. 拷打第一个项目

我的是一个rag的项目,我先整体讲了一下,然后他问我向量模型选的哪个、为什么不选别的、向量数据库选的哪个、还知道哪些、模型幻觉的解决有什么方法、模型长上下文解决的方法,我各答了我的理解

4.拷打论文项目

我把我论文讲了一遍,讲的时间有点长,他没问啥问题

5.代码题

他临时想出来的,说给定一个json串,写一段代码进行大中小括号、单引号和双引号的匹配检查,我用栈做的,做出来之后其实会在引号那里有bug,但是跑了样例他没看出来;然后问我假如说想做成一个直接把它改成正确的,该怎么做,我说了一下我的理解

6.反问

问部门做什么的,说是预研部门,是具身智能的,大小模型协同,应该是类似于agent

商汤 AI先锋计划 一面面经

拷打项目30min,拷打力度较大,对预训练数据挖掘,增强部分比较感兴趣。

八股问了LN和BN,BPE,GQA,前两个都回答的不好,第一个回答1. NLP任务中不同batch的同一特征不具有统计分布,2. batch数量不够大,3. LN让词向量分布约束在一维高斯球内让参数更加稳定。面试官觉得不触及本质,第二个太久没看答错了,第三个倒是没什么问题。

编程:给了一堆邮件地址,需要把账户名带*.的去掉标点,带+的分割成两个账户,最后统计一共有几个不同的账户。

比如x., x, x+就是三个不同的账户x ********** **********

非常简单。

总共就面了60min,感觉可能不是kpi面,面试官对数据这块挺关注的。之前看了网上各种佬的面经被吓到了,疯狂去看各种外推,分布式,并行,量化,vllm,megatron这些技术。

但可能是我简历上体现的能力一般,或者一面一般都比较轻松,就目前面过的场次来看,问的问题意外的很基础。但看了太多乱七八糟的简单的倒反而忘了,基础还是不能松呀。

滴滴 大模型一面面经

8.13滴滴一面挂,llab大模型岗。

  1. 自我介绍,为什么想做大模型方向?

  2. 拷打项目和实习

  3. reward bench上的reward model分哪几类?reward model如何训练的,训练目标是什么?

  4. dpo训练的损失函数和训练目标,dpo如何改进

  5. 指令跟随能力的评估集有什么,如何评估的?

  6. gsm8k和math评估集有什么区别?

  7. mbpp和hella swag评估集有什么区别?

  8. 阿尔法狗强化学习策略是什么?

  9. 提升推理能力和指令跟随能力哪个更难,为什么,提升指令跟随能力的优化方式和其他的比如推理有什么不一样的地方

  10. dpo训完了一般输出长度会变化吗?如何解决这个问题

  11. 注意力机制为什么除以根号dk,为什么不是dk

  12. transformer里边norm的位置在哪里,norm如何计算的

  13. 大模型训练过程学习率一般如何变化的,退火阶段学习率如何变化的

代码:

  1. 写了个注意力层

  2. 手撕,一个数组,输出这个数组每个位置之外的其他元素的乘机,不能用除法,要求尽量减少时间复杂度,然后要求仅用一个数组存储

字节 大模型算法 一二三面 面经

一面
  1. 拷打论文

  2. transformer和llama的LN有什么区别,手写RMSNorm

  3. FFN有什么不同,写Relu和SwiGLU

  4. 数据清洗流程

  5. 质量过滤用什么模型

  6. PPL公式是什么

  7. BERT的预训练任务、embedding

  8. 讲讲位置编码

  9. 你认为好的prompt的范式是什么

  10. 开放性问题:端到端的大模型和多个小模型,各自的优缺点是什么

  11. 手撕:两道easy

当天约面

二面
  1. 拷打论文

  2. 介绍模型

  3. 数据清洗流程

  4. 采用什么样的策略、什么样的数据才会便于模型学习

  5. 数据配比能说下思路吗

  6. 主流LLM模型结构设计有什么特点

  7. 如何评估LLM

  8. 训LLM最大的困难是什么

  9. 前沿LLM有了解哪些

  10. 工具调用怎么实现

  11. 国内LLM有了解哪些

  12. LLM推理能力的天花板现在是什么程度

  13. 无手撕

> 面我1h,口干舌燥 当天约面

三面
  1. 问硬件、硬件利用率

  2. 讲讲deepspeed几个阶段,分别分片什么、代价是什么

  3. 模型训练时间如何估计

  4. DP和DDP的区别

  5. 最多用过多少张卡

  6. 训练过程如何做模型监控

  7. 数据配比怎么量化才是一个好的方案

  8. 讲一下预训练数据处理

  9. 预训练和SFT如何评估

  10. encoder-decoder、encoder、decoder区别

  11. 讲一下文本输入大模型到输出的过程

  12. decoding策略

  13. 大模型结构有哪些变化

  14. 拷打论文

  15. 手撕:cross-attention

快手 Java开发

八股
  1. linux下创建进程是怎么做的?怎么去找你这个进程的进程号?

  2. jstack这个命令执行之前有什么依赖?或者有什么限制条件吗?

  3. 进程的调度或者进程的切换和线程的切换,它们之间有什么区别?

  4. java语言中 interface关键字?和class之间你是怎么理解的

  5. 用两个队列实现一个栈,说思路?

  6. 说一下归并排序流程?

手撕

(都是acm模式,需要自己构造案例进行测试)

  1. 给你一个float类型的数组,[1.0],[2.0],[3.0],然后给你几个数,找最接近他的那个下标

  2. 手撕堆排

  3. lru说思路

评价
  1. 刚开始面试都这样,面的多了就好了,所以我很鼓励大家去面试,你不去面试根本不知道自己哪方面准备的不好

  2. 放到简历上的东西一定是你很熟悉的,这个我在给每个看简历的人都会说

韶音科技 C++开发

一面
  1. const关键字

  2. static关键字

  3. 讲一下对多态的理解

  4. 常见排序算法的复杂度,最坏情况

  5. 详细讲一下快排

  6. STL用到的容器

  7. vector和list的区别

  8. map的底层讲解一下

  9. 进程和线程的区别

  10. TCP和UDP的区别

  11. 简单讲一下对设计模式的理解,设计模式的七大原则

更多推荐