TensorFlow Keras

TensorFlow Keras

TensorFlow Keras 指的是将 Keras API 集成到 TensorFlow 框架中。Keras 最初是一个独立的,用于构建和训练深度学习模型的高级 API,现在已成为 TensorFlow 的官方高级 API。
TensorFlow Keras 的关键:
高级 API:Keras 提供了一个用户友好且直观的接口,用于定义、训练和评估深度学习模型,并抽象化了底层 TensorFlow 操作的大部分复杂性。

快速原型开发:其简洁性和模块化特性使得在开发机器学习模型时,能够快速进行实验和迭代。

核心抽象:Keras 的核心抽象包括层(具有可训练权重的输入/输出转换)和模型(构成计算图的层组)。

与 TensorFlow 集成:作为 tf.keras,它与整个 TensorFlow 生态系统无缝集成,从而可以访问 TensorFlow 的高级功能、分布式训练功能和部署工具。

灵活性:Keras 在提供高级接口,同时,还允许通过对层和模型进行子类化来实现高级自定义,从而创建自定义组件和训练循环。

跨后端兼容性(Keras 3):借助 Keras 3,模型可以实例化为 PyTorch 模块或导出为 TensorFlow SavedModels,从而增强不同深度学习框架之间的互操作性。

TensorFlow API

Keras的核心数据结构是层和模型。层是一个简单的输入/输出转换,而模型是由层构成的有向无环图 (DAG)。

tf.keras.layers.Layer类是Keras中的基本抽象概念。一个层封装了状态(权重)和一些计算(在 tf.keras.layers.Layer.call 方法中定义)。

层创建的权重可以是可训练的,也可以是不可训练的。层是递归可组合的:如果您将一个层实例作为另一个层的属性,则外层将开始跟踪内层创建的权重。

您还可以使用层来处理数据预处理任务,例如归一化和文本向量化。预处理层可以直接包含在模型中,无论是在训练期间还是训练之后,这使得模型具有可移植性。

层是具有已知数学结构的函数,可以重用并具有可训练变量。在 TensorFlow 中,大多数层和模型的高级实现,例如 Keras 或 Sonnet,都是基于同一个基础类:tf.Module 构建的。

模型

模型是一个将层组合在一起,并可使用数据进行训练的对象。

最简单的模型类型是序列模型,它是一个线性堆叠的层。对于更复杂的架构,您可以使用Keras函数式API构建任意层图,或者使用子类化从头开始编写模型。

tf.keras.Model类具有内置的训练和评估方法:

  • tf.keras.Model.fit:训练模型指定轮数。
  • tf.keras.Model.predict:生成输入样本的输出预测。
  • tf.keras.Model.evaluate:返回模型的损失和指标值;通过tf.keras.Model.compile方法配置。

这些方法使您可以访问以下内置训练功能:

  • 回调。可以利用内置回调,进行提前停止、模型检查点和TensorBoard监控。您还可以实现自定义回调。
  • 分布式训练。可以轻松地将训练扩展到多个GPU、TPU或设备。
  • 步长融合。通过tf.keras.Model.compile中的steps_per_execution参数,您可以在单个tf.function调用中,处理多个批次,从而显著提高TPU的设备利用率。

序列模型

产生顺序模型

顺序模型适用于简单的层堆叠结构,其中每一层都恰好有一个输入张量和一个输出张量。

Sequential构造函数接受一个名称参数,就像Keras中的任何层或模型一样。这对于使用语义有意义的名称来标注TensorBoard图非常有用。

顺序模型示意图如下:

定义一个包含3个层的序列模型。

复制代码
model = keras.Sequential(
    [
        layers.Dense(2, activation="relu", name="layer1"),
        layers.Dense(3, activation="relu", name="layer2"),
        layers.Dense(4, name="layer3"),
    ]
)

# Call model on a test input
x = tf.ones((3, 3))
y = model(x)

上述的序列模型与下列的层定义是等价的

复制代码
layer1 = layers.Dense(2, activation="relu", name="layer1")
layer2 = layers.Dense(3, activation="relu", name="layer2")
layer3 = layers.Dense(4, name="layer3")

# Call layers on a test input
x = tf.ones((3, 3))
y = layer3(layer2(layer1(x)))

存取顺序模型的层

序列模型的层可以通过layers属性访问。

下面展示一些 内联代码片

复制代码
print(model.layers)

增加顺序模型层

可以通过 add() 方法逐步创建 Sequential 模型

复制代码
model = keras.Sequential(name="my_sequential")
model.add(layers.Dense(2, activation="relu", name="layer1"))
model.add(layers.Dense(3, activation="relu", name="layer2"))
model.add(layers.Dense(4, name="layer3"))

删除顺序模型层

pop() 方法可以用来删​​除层。

输入形状(shape)

一个tensor的形状描述了它的结构和维度。它通常表示为一个整数元组,其中每个整数表示tensor沿特定维度(或轴)的大小。

在没有输入形状的情况下,实例化一个Sequential模型时,它不会被"构建",它没有权重(调用 model.weights 会报错,指出这一点)。

权重是在模型首次接收到输入数据时创建的:

复制代码
model = keras.Sequential(
    [
        layers.Dense(2, activation="relu"),
        layers.Dense(3, activation="relu"),
        layers.Dense(4),
    ]
)  # No weights at this stage!

# At this point, you can't do this:
# model.weights

# You also can't do this:
# model.summary()

# Call the model on a test input
x = tf.ones((1, 4))
y = model(x)
print("Number of weights after calling the model:", len(model.weights))  # 6

其他API和工具

Keras 提供了许多其他用于深度学习的 API 和工具,包括:

  • 优化器
  • 指标
  • 损失函数
  • 数据加载工具
相关推荐
txg6667 分钟前
机器人领域简报(2026年6月7日—14日)
大数据·人工智能·机器人
4A广告文案11 分钟前
品牌负面评论难排查?AI情绪分析实时抓取全网评论,提前规避公关翻车
人工智能
Z-D-K13 分钟前
S-44的周末”旅行“-周日
人工智能·ai·aigc·交互·agi
Shota Kishi13 分钟前
在 Solana 上实现稳定币基础设施支付:SOL / USDC / EURC 付款与 EURC 结算的工程实践
人工智能·区块链
Z-D-K15 分钟前
S-44的周末”旅行“-周六
人工智能·机器学习·aigc·交互·agi
意图共鸣16 分钟前
能力对等器技术解析:意图共鸣科技《AI记忆链商业化白皮书3.0》——为什么每个开发者都需要一个属于自己的AI
人工智能·科技
星落zx17 分钟前
在CI/CD流水线里接入多模型自动Code Review,踩坑与方案分享
人工智能·ci/cd·代码复审
IT_陈寒17 分钟前
Vue的响应式让我原地裂开,你们也有这情况吗
前端·人工智能·后端
下班走回家20 分钟前
Qwen2.5 模型架构解读:国产大模型的进化
人工智能·架构
皮皮蟹虾饺20 分钟前
MiniMind 预训练详解:从零训练一个 64M 参数的语言模型
人工智能·语言模型·自然语言处理