鹏城的秋雨来得突然,打在书房的窗户上,噼啪作响。林晨关掉Mini-GPT的训练日志页面,屏幕上最后一行显示着验证集上的困惑度(Perplexity)——一个比初始值低了不少的数字,证明他那个玩具模型确实学到了东西。
成就感是实实在在的,但短暂的兴奋过后,一种更深层的“虚”感浮现出来。
他能搭出架构,能跑通代码,甚至能训练出一个能生成像样句子的小模型。可如果面试官追问:“为什么Transformer要用LayerNorm而不是BatchNorm”?“多头注意力的‘头’数选择依据是什么?除了论文里说的,你有没有自己的见解”?“最近MoE(Mixture of Experts)架构火起来了,你觉得它和标准Transformer的优劣对比,核心矛盾在哪里”?
他恐怕只能回答出教科书和博客里的标准答案,而缺乏那种基于大量文献阅读和独立思考形成的、属于自己的“技术观”。
“地基还不够深”。林晨对自己说。实践让他有了“手感”,但要想在顶尖技术面试中脱颖而出,甚至未来在T厂那样的地方站稳脚跟,必须对前沿动向和理论基础有系统性的把握。光会调包和实现是远远不够的。
他打开了那个新建的“面试准备”文件夹,在里面又创建了一个子文件夹,命名为“Paper_Reading”。
目标明确:系统阅读最近五年(主要2021-2025)AI顶级会议的论文。优先级:NeurIPS(神经信息处理系统大会)、ICML(国际机器学习大会)、CVPR(计算机视觉与模式识别会议,虽然偏视觉,但很多架构思想通用)。自然语言处理顶会ACL、EMNLP也需关注。
第一步是收集。arXiv(预印本网站)是主战场,但海量论文让人眼花缭乱。他记得一些技术大佬的博客提到过筛选方法:关注最佳论文(Best Paper)、口头报告(Oral)和亮点论文(Spotlight);关注谷歌、Meta、OpenAI等巨头实验室以及斯坦福、MIT、CMU等顶尖高校知名课题组的工作;在知乎、Twitter(现X)上跟随一些活跃的研究者,看他们推荐什么。
他花了一上午时间,像蜘蛛结网一样,从一篇引用率极高的2022年NeurIPS最佳论文《Transformers are SSMs:》开始,通过它的参考文献和引用它的文章,不断延伸,初步筛选出了三十多篇他认为必须精读或至少泛读的论文。主题涵盖:Transformer变体与效率优化(如Linear Attention、FlashAttention)、大模型训练技巧(如LLaMA系列技术报告)、扩散模型(Diffusion)基础、多模态(尤其是视觉-语言模型)最新进展,以及一些看起来就很有意思的新方向,如基于状态空间模型(SSM)的Mamba架构。
下午,雨势稍歇。林晨泡了杯浓茶,正式开始了他的“论文攻坚战”。
第一篇选择的是谷歌关于MoE架构在大语言模型中应用的详细研究论文。光是摘要和引言就让他反复看了三遍。满眼的“sparsely-activated”、“conditional putation”、“expert capacity”、“load balancing loss”……每个词似乎都认识,连起来却构成了一堵坚硬的术语墙。
他深吸一口气,没有跳过,也没有急着去搜中文博客。而是拿出一个崭新的墨绿色硬壳笔记本——这是苏婉前两天买给他的,说是“奖励他学习用功”——和一支顺滑的钢笔。
“第一步,抄写摘要和核心问题定义,用自己的话复述一遍”。他定下规矩。
笔尖在纸上沙沙作响。遇到不理解的术语,他就在旁边划条线,转到浏览器打开Google Scholar或相关开源项目文档去查。这个过程极其缓慢,读了两页正文,花了一个多小时,笔记本上才记了不到一页。其中大半是他自己的批注和疑问:
“这里说的‘专家’(Expert)其实就是前馈网络(FFN)层?每个Token根据路由(Router)选择激活少数几个‘专家’……目的是大幅增加模型总参数量(万亿级别)但保持实际计算量(激活参数量)相对恒定?核心是解决‘大模型’与‘计算成本’的矛盾”?
“负载均衡损失函数……是为了防止某些‘专家’总是被选到,而其他‘专家’闲置?如何确保路由学习的稳定性?”
“Figure 2 的示意图看了半天才懂,路由网络和专家网络是并行的……嗯,有点像去一个超大型自助餐厅,每个顾客(Token)先到导购台(Router)拿到推荐菜牌(选择少数几个专家),然后只去这几个对应的餐台(Expert)取菜(计算),而不是跑遍所有餐台。效率的关键在于导购台推荐得准,且各个餐台客流相对
>>>点击查看《AI时代:码农的涅盘重生》最新章节