清华演讲结束后的第三天,林晨收到了一封很长的邮件。
发件人是一个叫小李的研二学生——那天坐在报告厅后排的角落里,全程没有提问,但演讲结束后专门在走廊里等了他十几分钟。林晨记得他——因为他的眼神里有那种拼命想找一条出路的焦虑。
林老师:
我是那天坐在后排角落的学生。您的演讲结束之后我在走廊里站了很久,本来想跟您说几句话,但是人多没排上。后来回到实验室,一整个晚上脑子里都在回放您说的那句话——三十五岁一点也不晚。
我今年二十六岁,研二,研究方向是计算机视觉。但最近一年我觉得CV这个方向已经到了瓶颈——论文好发,但落地太难。我想转大模型方向,又担心已经太晚了——实验室的师弟师妹们从研一就开始搞LLM,论文已经发了好几篇。
您的经历让我看到了另一种可能性——不是赢在起跑线上,而是赢在每一个今天没有放弃。
我想问您一个具体的问题:对于一个有ML基础但没接触过LLM的学生来说,从零开始学大模型,最有效的方法是什么?
林晨在工位上看到这封邮件的时候正在吃午饭——一份从楼下食堂打包上来的青椒肉丝盖浇饭。他放下筷子,把这封邮件又看了一遍,然后写了回复:
小李:
谢谢你的邮件。你的问题我认真想了一下,给你几个建议,按优先级排序:
别报付费速成班。任何标榜三个月入行大模型的课程都是收智商税。大模型需要的知识密度不是三个月能压缩的。
从Andrej Karpathy的nanoGPT教程开始。一行一行敲他的代码,理解每一个张量维度变换的含义。这不是抄——是在理解Transformer的骨架子。跑通之后自己从头复写一遍。
精读五篇论文。GPT-1、GPT-2、GPT-3、InstructGPT、LLaMA。不是随便翻——每一篇做三页以上的笔记,理解每一组实验设计的逻辑。
找一个具体的问题做微调实验。可以是情感分析、文本摘要、对话生成——什么都行,关键是亲自跑通训练、评估、分析和改进的完整链路。一个亲手调出来的烂模型比看一百篇论文学到的多。
二十六岁一点也不晚。我三十五岁才开始——比你晚了九年。你现在有比当年我好得多的基础——ML你是懂的,PyTorch你是熟的,实验室有GPU给你用。二十六岁转大模型不是弯道超车——是在正确的赛道上正常起步。
最后说一句:在清华这种地方,很容易被周围人的进度裹挟——别人论文发了、offer拿了,我还在学基础。这种横向比较是效率的毒药。你唯一要比的人,是昨天的自己。
林晨
他点了发送,然后继续吃饭。
这件事他本来没放在心上。但两周之后——十月底——小林发来了第二封邮件。这次短了很多,只附了一个GitHub链接。
林晨点进去,是一个大模型微调项目。用LLaMA的架构在中文对话数据集上做了一次SFT,评测结果显示模型在对话连贯性和事实准确性上都有不错的提升。README写得密密麻麻——每一个训练参数的设置理由都解释得很清楚,每一个失败实验的教训都写在实验日志那节里,每一个消融实验的结论都配了表格。
邮件正文只有一段话:
林老师,谢谢您上次的回复。按照您的建议,我从nanoGPT开始写起,读完了五篇论文,然后做了这个微调项目。这是我这辈子第一次完整地从头开始做一个大模型项目——从数据准备到训练到评测全部一个人完成。两周前我拿到了某大厂大模型部门的实习offer。谢谢您。
林晨看着屏幕。心里涌起一种很难描述的感觉。
不是因为收到感谢——他对感谢这种东西早就不在意了。是因为他看到了一个年轻人用两周时间证明了二十六岁转行一点也不晚。当年他花了两年从零学到能面试,这个小李只用了两周就做出了一个有质量的微调项目。不是说他比自己厉害——是说他比自己幸运,因为有人在前面给他画过地图。
窗外的海面被十月的阳光晒得明亮而柔和。远处几艘训练帆船正在回港——帆都收了,剩下桅杆在波浪里缓缓摇摆。
晚上他在笔记本上多写了一页纸,标题叫为什么帮别人是对的。
帮一个人找到方向,比多赚一笔钱更有价值。赚钱是线性增长的——投一万赚五千,投十万赚五万。但帮人改变选择是杠杆的——你花一个小时回复一封邮件,那个人可能因此改变了整个职业路径。这种杠杆效应是任何量化策略都比不了的。
苏婉端着茶走进书房,看到他桌上摊开的笔记本上写着这一页,站住看了一会儿。
你在写什么?
复盘。帮了一个清华的学生——二十六岁转大模型拿到实习offer了。
你帮他什么了?
>>>点击查看《AI时代:码农的涅盘重生》最新章节