您的位置:首 页 > 言情小说 > AI时代:码农的涅盘重生 > AI时代:码农的涅盘重生目录 > 第238章 大模型项目(第1页/共2页)
返回目录 | 加入书签 | 推荐本书 | 收藏本页

AI时代:码农的涅盘重生 第238章 大模型项目(第1页/共2页)


****3*6*0**小**说**阅**读**网**欢**迎**您****

请用户自行鉴定本站广告的真实性及其合法性,本站对于广告内容不承担任何责任。

    新年后第一周的周三,林晨召开了新团队的正式启动会议。

    会议室里坐了二十个人。陈铭坐在左手第一排,面前是打开的笔记本电脑。张雨坐在陈铭旁边,手里端着一杯还在冒热气的咖啡。李婷负责投屏,正在调试PPT的显示比例。其他人依次坐在长桌两侧,有人拿着笔记本,有人只带了手机,有人面前什么也没有——新人还不知道该带什么。

    林晨站在投屏前,第一页PPT上只有一行字:

    FinGPT:金融大模型的微调项目,代号FinGPT。目标:在13B基座模型上,通过金融领域数据微调,实现金融场景下超越通用模型30%以上的效果。

    他拿起马克笔,在旁边的白板上写下了三个词:数据、标注、评测。

    这三个词就是FinGPT的全部。他转过身,数据质量决定模型能力的上限。标注精度决定微调效果的天花板。评测标准决定我们是否真的比别人好。三个环节,任何一个掉了链子,整个项目就是白做。

    他花了四十分钟讲解技术方案。从基座模型选型——为什么选13B而不是7B或70B,到LoRA的参数设置——rank、alpha和dropout的初步配置,再到训练方案——8张A100的并行策略和预估训练时间。

    数据组负责收集和清洗金融语料。来自金融部门的研报数据、内部研究报告和客户问答记录,总量超过五十万条。但林晨对数据组说了一句让数据组长有些意外的话:五十万条太多了。大部分是垃圾。你的第一件事不是收集更多数据,而是删数据。

    删多少?数据组长问。

    删到剩下五万条。每一轮删完之后让我看删除记录,我要知道哪些被删了、为什么删。删数据比加数据更需要判断力。

    标注组负责对筛选后的五万条核心数据做人工标注。标注不是贴标签那么简单——金融场景下的标注需要专业知识。每条数据至少由两个标注员独立标注,不一致的需要第三方仲裁。标注标准要用金融从业者的专业能力作为参照,不能用通用的众包标注。

    评测组由张雨牵头,负责构建专门的金融评测集。张雨在会前已经把方案发给林晨了——评测集覆盖八个金融子任务,从金融问答到研报摘要,从风险提示到合规检查。每个任务有独立的参考答案和评分标准,不依赖通用评测集。

    通用评测集里的金融题太基础了,张雨对着PPT解释说,比如MMLU里的金融题考的是什么是通货膨胀——这种题目只测了基础知识,完全区分不出模型在真实金融场景下的能力。我们自己的评测集要能测出——模型能不能读懂一份四十页的研报,能不能从一个两百页的招股说明书里找到关键风险提示。

    这个工作量多大?林晨问。

    很大。评测集每道题都需要专业金融人员审核——不是标注员,是真正的金融从业者,分析师级别的。我已经跟金融部沟通过了,他们愿意出人配合。

    好。评测的质量比速度重要,不用赶。

    会议结束后,陈铭留了下来。

    13B模型比7B大四倍,他说,8张A100做一次微调大约需要十二个小时。如果效果不好,我们要反复调参数,一轮一轮地试。一个礼拜最多跑两次。如果微调效果达不到30%怎么办?

    那就分析原因,调整方法,再训一版。林晨把PPT关了,电脑盖合上,第一版达不到目标是正常的。重点是找原因——是数据的问题还是方法的问题。数据不好就继续删,方法不对就换方法。不要指望第一版就完美。

    但时间呢?我们只有三个月。

    三个月是底线,不是天花板。如果时间不够,我去跟陈博士争取更多时间。但前提是我们的每一版都要比上一版更好。他拍了拍陈铭的肩膀,别焦虑。做就行了。

    接下来的两个月,是林晨在T厂最忙的一段时间。

    早上七点到公司,晚上十一点离开。除了吃饭和必需的会议,几乎所有时间都花在了FinGPT上。苏婉有一次凌晨两点起来上卫生间,发现书房灯还亮着,推门进去看到林晨对着三篇论文的对比表格在记笔记,旁边半杯速溶咖啡已经干了,杯壁上结了一层褐色的垢。

    她没有说话。去厨房换了一杯热水,放在他手边,然后默默退出去。

    她知道林晨在做什么。他在做一个他真正相信的东西——不是被安排的任务,不是KPI要求的指标,而是一件他自己想做的事。这样的人不需要被催,也不需要被叫去睡觉。

    第一个月底,问题出现了。

    数据组把清洗后的数据交上来,林晨花了两个晚上逐一检查。他随机抽检了五百条标注结果,发现其中约百分之十五有明显问题——术语翻译错误、日期标注不一致、风险等级的判断缺乏一致性。

    他把数据组长叫到会议室。

    十五个点的错误率太高了。这些数据喂给模型,效果会大打折扣。

    数据组长是一个从金融部门转来
>>>点击查看《AI时代:码农的涅盘重生》最新章节