林晨坐在书桌前,窗外是科技园不变的灯火通明,而他的电脑屏幕上,正同时打开着两个截然不同的编程环境。
那个 97.1% 准确率的 MNIST 模型带来的兴奋感尚未完全消退,但理性很快占据了上风。林晨清楚,偶然的成功不能复制,要想真正把 AI 技术变成自己手中的利器,尤其是未来应用到变幻莫测的金融市场分析上,他必须系统性地掌握工具,而不仅仅是跟着教程跑通一个例子。
深度学习框架,就是这最重要的工具。
当前主流的两大巨头——TensorFlow 和 PyTorch,如同武林中的两大门派,各有拥趸,各有优劣。林晨决定,花上一周时间,把这两个框架都深入体验一遍,再决定自己的主攻方向。
他首先打开了 TensorFlow 的官方文档。作为谷歌出品的老牌框架,TensorFlow 以其工业级的稳定性、强大的分布式训练能力和成熟的部署生态着称。
林晨按照指南安装配置,开始了第一个 TensorFlow 程序——依旧是手写数字识别。
“静态计算图……”林晨一边敲代码,一边琢磨着这个核心概念。
在 TensorFlow 1.x 时代,需要先定义计算图(Graph),然后在会话(Session)中运行,这种“先构图,后执行”的模式,对于习惯了 Python 即时执行思维的程序员来说,确实有些绕。
好在现在主流已是 TensorFlow 2.x,默认开启了 Eager Execution(急切执行),像普通 Python 代码一样即时运行,大大降低了入门门槛。通过高级 API tf.keras,构建模型变得相当直观。
import tensorflow as tf
model = tf.keras.Sequential([
tf.keras.layers.Flatten(input_shape=(28, 28)),
tf.keras.layers.Dense(128, activation=relu),
tf.keras.layers.Dense(10, activation=softmax)
])
model.pile(optimizer=adam, loss=sparse_categorical_crossentropy, metrics=[accuracy])
代码简洁明了。
训练过程也顺利,最终准确率跑到了 97.5%,比上次自己用“原生” PyTorch 略高一点点。但林晨在尝试自定义一个损失函数,并想深入查看中间某层梯度时,遇到了一些麻烦。
TensorFlow 的调试体验,尤其是想要深入其计算过程时,总觉得隔着一层,不如直接写 Python 代码那样透明和易于介入。它的优势似乎更在于“生产部署”——一旦模型确定,转换成 SavedModel 或 TFLite 格式,在各种终端和服务器上的部署非常成熟。
“这就像一套精密的自动化生产线”,林晨在笔记上写道,“设计好了流程,它就能稳定高效地运转,但如果你想中途调整某个零件的加工参数,可能需要专门的工具和接口”。
接下来,他切换到了 PyTorch 的环境。
其实上一章的 MNIST 就是用 PyTorch 的教程完成的,但那次更多是“跟随”。这次,他打算以“研究者”和“探索者”的心态重新审视它。
PyTorch 由 Facebook(现 Meta)AI 研究院推出,核心设计哲学是“Python 优先”和动态计算图。林晨从最基本的张量(Tensor)操作开始,感受其与 NumPy 的相似性带来的亲切感。
构建模型时,他需要自己定义一个继承自 torch.nn.Module 的类,并在 forward 方法中明确写出数据流动的过程。
import torch
import torch.nn as nn
import torch.optim as optim
class SimpleNN(nn.Module):
def __init__(self):
super.__init__
self.flatten = nn.Flatten
self.linear_relu_stack = nn.Sequential(
nn.Linear(28*28, 128),
nn.ReLU,
nn.Linear(128, 10)
>>>点击查看《AI时代:码农的涅盘重生》最新章节