拒绝了所有外部邀约之后,林晨把全部精力投回了技术本身。
这是一种回归。过去两个月,他的注意力被演讲、采访、行业影响力分散了不少。虽然那些事情也重要,但他最擅长的、最该做的,还是写代码、调模型、做系统。
九月中旬的一个周六上午,他坐在书房里,面前是两块显示器。左边是投资系统的管理面板,右边是T厂大模型项目的代码仓库。
他在做两件事:一是投资系统的月度复盘,二是大模型微调的新方案设计。
投资系统的复盘很快。9月份各子策略表现稳定,总资产从62万增长到67万,月度收益8%。夏普比率2.4,最大回撤-3.2%(一次小的市场波动),风控机制正常触发。系统在健康运行,不需要大的调整。
他花更多时间在大模型项目上。
项目的目标是做一个金融领域的大模型微调方案,在T厂的基座模型上叠加金融语料和任务数据,让模型在金融场景下的表现超过通用模型。
陈铭做的7B微调模型已经有了不错的效果,在金融问答任务上超过基线12%。但12%的领先优势不够大——如果通用模型迭代升级,这个优势可能会被抹平。
林晨的思路是:不跟通用模型拼参数量,而是拼领域深度。金融领域有大量专业术语、逻辑链条和合规要求,这些是通用模型做不好的。如果能在微调数据上下功夫——用更高质量的金融数据、更精准的任务标注、更贴近实战的评测指标——就有可能做出一个在金融场景下真正有用的模型。
他在笔记本上写下方案框架:
金融大模型微调方案V2:
数据:收集10万条高质量金融问答数据(研报解读、市场分析、风险提示等)
标注:人工+AI混合标注,确保专业性和准确性
微调:LoRA+QLoRA混合方案,降低算力成本
评测:自建金融场景评测集,覆盖8个子任务
目标:金融场景下超越通用模型20%以上
他给陈铭发了消息,约了周一上午的讨论会。
周一上午十点,陈铭坐在他对面,看着这份方案框架,眼睛越看越亮。
数据质量是关键,陈铭指着第一条说,我们之前用的微调数据集有10万条,但质量参差不齐。如果能把数据清洗到5万条高质量数据,效果可能比10万条杂乱数据还好。
对,这就是我的思路。林晨说,与其拼数据量,不如拼数据质量。金融领域的容错率很低,一个错误的回答可能导致用户做出错误的投资决策。所以我们的模型不仅要,更要。
那标注成本呢?陈铭问,5万条数据全部人工标注,需要多少钱?
我算过,林晨打开一个表格,按每条数据标注成本5元计算,5万条需要25万。加上质检和项目管理费用,总预算大约40万。
40万?陈铭倒吸一口气,这比我们之前的标注预算多了四倍。
之前的数据是自动标注的,质量不行。林晨说,这次我们用混合标注:先让模型做初标注,然后人工审核和修正。这样可以把成本控制在25万以内,同时保证每条数据至少经过一次人工审核。
陈铭想了一下,点了点头:这个方案可行。但有个问题——标注需要金融专业人士来做,不是随便找几个数据标注员就行。我们上哪找这么多懂金融的人?
我已经想好了,林晨说,跟金融部门合作。他们有大量的研报和分析师,我们提供技术框架,他们提供专业内容。双赢。
这个方案他在心里想了一个周末。金融部门需要AI能力,他们需要金融数据,两边的需求完美互补。他甚至在脑子里拟好了合作框架:技术部门提供模型和工具,金融部门提供数据和标注,最终成果共享。
我来找金融部门谈。林晨说。
陈铭站起来,眼神里有一种久违的兴奋:林晨哥,这个方向比之前纯做微调有意思多了。
那就好好干。林晨拍了拍他的肩膀。
下午,他约了金融部门的负责人李总开了一个小时的会。李总是个四十多岁的中年人,说话干脆利落,对技术不太懂但很清楚业务需求。
你们需要什么?李总问。
高质量的金融数据,以及懂金融的人帮我们做数据标注。林晨说。
我们能得到什么?
一个在金融场景下超越通用模型20%以上的大模型,你们可以用来做智能投研、风险提示和客户服务。
李总想了两秒:数据我们可以提供,研报数据有几百万条。标注需要多少人手?
初期5万条,大约需要10个金融分析师兼职标注一个月。
10个人兼职一个月,这个我们可以安排。但模型做出来之后,产权怎么分?
合作框架下,模型产权归T厂,金融部门有优先使用权。林晨说,具体细节可以让法务去谈。
李总点了点
>>>点击查看《AI时代:码农的涅盘重生》最新章节