大模型部门的组建比林晨预想的要快得多。
他原以为从零组建一个二十人的新部门至少要两个月——走HR流程、筛简历、面试、谈薪资、办入职,每一步都有不可控的因素。但公司的支持力度远超他的预期。陈博士在背后做了很多工作,HRVP亲自盯进度,财务特批了招聘预算。
三周。从拿到编制到二十人全部到岗,只用了三周。
八个从应用中心转过来,包括陈铭和大模型小组的原班人马。陈铭是他最放心的人——两人从应用中心就开始搭档,配合默契。五个从其他部门调入,做过后端架构、数据工程和产品落地,经验丰富。剩下七个是社招新入职的,有从大厂跳过来的NLP工程师,有从金融行业转行的数据分析师,还有两个刚从顶尖高校毕业的博士。
林晨看着HR发来的人员清单,在陈铭的名字旁边打了个勾。这个人是他点名要的。陈铭在AI应用中心的时候就是最有冲劲的工程师之一,对新技术有一种本能的好奇心。当初在7B模型上做LoRA微调,就是陈铭第一个跑通了全流程。
新团队的第一次全员会议定在周一上午十点。
会议室不大,二十个人挤在一起,椅子不够,有人靠在墙上站着。林晨走进来的时候,所有人同时安静了。
他扫了一圈。有认识的面孔——陈铭、李婷,应用中心的老人;张雨,新来的博士,简历上写着自然语言处理方向,顶会论文六篇;还有几张他面试过的脸,记得每个人的技术方向,但不记得名字。
我叫林晨。他在白板上写下自己的名字,这个部门是新成立的,所有人都是新来的——包括我。
他转过身,手撑在桌沿上。
我们没有历史包袱。没有旧系统需要兼容,没有老流程需要遵守,没有以前都是这么做的这种话。我们要做的只有一件事:让大模型在金融领域超越所有通用模型。
台下的人看着他。有人眼神里有期待——尤其是那两个刚毕业的博士,坐得笔直,像等着听教授讲课。有人眼神里有不确定——那几个从其他部门调过来的老员工,双手交叉抱在胸前,态度审慎。有人眼神里有压力——陈铭知道林晨说的一件事背后是多少工作量。
这个目标听起来很大,林晨说,但拆解之后其实很清楚。基座模型用开源的13B,我们在上面做领域微调。数据用金融部门的研报和问答对,标注标准我们自己定。评测框架专门针对金融场景设计,不套用通用评测。三条线并行,两个月出第一版。
一个从数据部门转过来的工程师举了手:林总,数据质量这方面,金融部门现有的数据很乱,之前的团队试过标注,但标准不统一,效果不好。
我知道。林晨说,所以数据这条线我亲自盯。
工程师点了点头,收回了手。
第一件事,林晨在白板上写了四个字:技术分享。
每周五下午,每人三十分钟,主题自选。可以讲你做过的项目,可以讲你读过的论文,可以讲任何技术发现。目的就一个——让所有人了解彼此的能力和思维方式。
这是他之前带应用中心团队时摸索出来的经验。技术分享看起来跟KPI没关系,但它解决的是信息不对称的问题。当一个工程师知道坐在隔壁的同事擅长什么、正在做什么、遇到了什么坑,协作会自然发生。
第二个做决定的是部门架构。
他没有按传统的职能分组——算法组、工程组、数据组这样的划分。而是按任务线分了三个小组:微调组负责模型训练和优化,数据组负责语料清洗和标注质量,评测组负责构建金融场景的测试集。三个组的目标都指向同一个产出——一个能在金融场景下跑赢通用模型的大模型。
三个月,林晨在白板上写了日期,十二月底之前,我要看到一个能在金融问答、研报摘要、风险提示三个核心任务上全面超越通用模型的系统。不是实验室里的效果好两三个点,而是真正能用、能上线、能让金融部门愿意切换的。做不到的话,这个部门的存在就没有意义。
会议室里安静了几秒。
陈铭第一个开口:微调组这边,我之前在7B上做过完整的验证,LoRA方案可以直接复用到13B。但13B的参数量是7B的四倍,训练时间也会是四倍,8张A100一次微调大概需要十二个小时。如果申请不到更多算力,迭代周期会拉长。
算力的事我来解决,林晨说,已经跟陈博士申请了,下周有回复。你先按8张A100的方案排期,不够再加。
张雨推了推眼镜:林总,评测方面我有个建议。通用评测集对金融场景的区分度不高,比如MMLU里的金融题太基础了,测不出真正的差异。我建议我们自己构建一套多维度的金融评测集,覆盖问答、摘要、风控、合规这几个方向。工作量会大,但区分度会好很多。
可以。林晨看了她一眼。这个博士的思路很清晰,不是只会写公式的那种。你来牵头,评测组的人归你调。
会议
>>>点击查看《AI时代:码农的涅盘重生》最新章节