转到大模型部门的第一周,林晨就感受到了一种久违的陌生感。
不是因为新环境——办公区还是同一个,茶水间还是那个,食堂的酸菜鱼还是那个味道。陌生的是他面前的技术栈。
过去他做的是传统机器学习和深度学习:XGBoost、LSTM、Transformer,这些他都熟得不能再熟。但大模型的世界远不止这些——预训练、指令微调、RLHF、LoRA、量化推理、分布式训练……每一个概念都是一扇新门,门后面是一片他还没完全探索过的森林。
周一晚上,他坐在书房里,面前摊着一堆论文和技术文档。屏幕上开着三个浏览器窗口:一个是Hugging Face的模型页面,一个是PyTorch的分布式训练文档,还有一个是OpenAI的技术报告。
苏婉端着两杯茶走进来,看了一眼他桌上的论文堆:这阵仗,像回到了两年前你学AI的时候。
差不多,林晨接过茶,但这次有基础,学起来快一些。大模型的底层还是Transformer,我之前在投资系统里用过,只是规模不同。
规模不同就是质的不同吧?苏婉说,就像从自行车到汽车,虽然都是交通工具,但操作方式完全不一样。
林晨想了一下,点了点头:你说的对。从几百万参数的模型到几百亿参数的模型,不只是量的变化,而是方法论的变化。训练方式、推理优化、部署方案,全都不一样。
他给自己列了一个学习计划:
大模型学习路线:
基础理论:Transformer架构、注意力机制、预训练原理
微调方法:全量微调、LoRA、QLoRA、指令微调、RLHF
分布式训练:数据并行、模型并行、DeepSpeed、FSDP
推理优化:量化、剪枝、蒸馏、KV Cache
应用落地:Prompt Engineering、RAG、Agent
实战:从0到1完成一次大模型微调
他给每个模块安排了时间,总计大约三周。白天在公司工作,晚上在家学习,周末做实战练习。
第一周,他啃了三篇核心论文:《Attention Is All You Need》、《Scaling Laws for Neural Language Models》、《Training Language Models to Follow Instructions with Human Feedback》。第一篇他早就读过,但重新读一遍,在大模型的语境下有了新的理解。第二篇和第三篇是全新的内容,他花了两个晚上才消化完。
第二周,他开始做实战练习。在公司的GPU集群上,他用LoRA方法对Llama-7B模型做了金融领域的微调。数据是金融部门提供的研报摘要和问答对,总共两万条。
训练的过程比他想象的要顺利——LoRA的优势在于参数量小,微调成本低,7B模型在8张A100上只跑了两小时就完成了。
但评测结果让他不太满意:金融场景下的准确率只比通用模型高了8%,远低于预期的20%。他分析了原因,发现是数据质量的问题——两万条数据里有不少噪声,需要进一步清洗和标注。
数据,还是数据。他在笔记本上写下这个结论。
大模型的能力上限取决于数据的质量,这一点跟他的投资系统是一样的。投资系统如果喂的是垃圾数据,输出的也是垃圾信号;大模型如果用杂乱的数据微调,效果也好不到哪去。
第三周,他把注意力转向推理优化。大模型的推理成本是一个不能忽视的问题——7B模型单次推理需要几秒钟,70B模型可能需要几十秒甚至几分钟。如果要做商业化落地,推理速度和成本必须控制在合理范围内。
他研究了量化和蒸馏两种方案。量化是把模型的参数从FP16(16位浮点)压缩到INT8(8位整数)甚至INT4(4位整数),代价是精度损失,但速度可以提升2-4倍。蒸馏是把大模型的知识转移到小模型上,用小模型做推理,速度更快但需要大量训练。
他选择先做量化方案,因为实现更简单,效果更直接。
三周学习结束的时候,他在笔记本上写下了学习总结:
大模型核心认知:
数据质量决定模型上限
微调方法的本质是高效的参数更新
推理优化是商业落地的关键瓶颈
大模型不是万能的,但在特定领域微调后可以超越通用模型
下一步:在13B模型上做金融微调,目标超越通用模型30%以上
合上笔记本,他看了一眼时间。凌晨一点。
苏婉和乐乐早就睡了。客厅的灯关着,只有书房的台灯还亮着。
他关掉台灯,走出书房,在走廊里站了一会
>>>点击查看《AI时代:码农的涅盘重生》最新章节