《WAM 系列》Fast-WAM|视频共训练|跳过未来想象|实时WAM

Fast-WAM 基于 Wan2.2-5B 视频模型改造,采用 Video DiT + Action DiT 的双专家结构。核心思路是:训练时保留未来视频预测,推理时不再生成未来视频。论文用受控实验说明,WAM 的主要收益更可能来自训练阶段的视频共训练,而不是测试阶段显式生成未来画面。

  1. 训练机制:当前帧、未来视频潜变量和动作块共同训练;结构化 Attention Mask 禁止动作 token 读取未来帧,避免信息泄漏。
  2. 推理机制:只编码当前观测并缓存 Video DiT 的 KV,再通过 10 步 Flow Matching 生成连续动作块;不需要未来图像,也不进行未来视频去噪。

论文地址:Fast-WAM: Do World Action Models Need Test-time Future Imagination?

项目主页:Fast-WAM Project Page

开源地址:https://github.com/yuantianyuan01/FastWAM

模型权重:https://huggingface.co/yuanty/fastwam

1、模型架构

如下图所示,论文把 WAM 分成三类:视频和动作联合去噪、先预测未来视频再生成动作,以及 Fast-WAM 的"训练时预测视频、推理时直接生成动作"。

Fast-WAM 的重点不是删掉世界模型,而是把视频建模目标测试时视频生成拆开。思路流程要点如下。

1.1、输入组件:任务指令+当前观测+本体状态

  • 任务指令:如"Fold the cloth",由 Wan 自带的 T5 编码器转换为文本特征。
  • 当前观测:来自多路相机。LIBERO 使用主视角和腕部相机,RoboTwin 使用高位、左腕和右腕相机。
  • 本体状态:机械臂当前状态。源码把它编码后追加到文本上下文中。
  • 噪声动作:推理时从高斯噪声初始化,用于 Flow Matching 的动作生成过程。
  • 未来视频帧:只在训练时使用,用来提供视频预测监督;推理时不存在。

1.2、核心模块

  • Video VAE:把当前图像和训练期未来视频压缩为潜变量。
  • Video DiT:来自 Wan2.2-TI2V-5B,隐藏维度为 3072,负责学习视频动态与当前观测的潜在世界表征。
  • Action DiT:约 1B 参数,隐藏维度为 1024,负责生成连续动作块。
  • MoT共享注意力:Video DiT 与 Action DiT 各自保留专家参数,但每层的 Q/K/V 在同一注意力计算中交互。
  • 结构化Attention Mask:规定哪些 token 可以互相读取,是隔离未来信息的关键。

Fast-WAM 总参数约 6B,其中视频骨架约 5B,动作专家约 1B。这里的 Mixture-of-Transformer(MoT)不是按 token 路由的传统 MoE,而是让视频专家和动作专家通过共享注意力交换信息。

1.3、处理流程:视频共训练+连续动作生成

训练阶段:

① 当前帧和未来帧先经过 Video VAE,动作块经过动作编码器。

② 第一帧潜变量保持干净;未来视频潜变量和动作块分别加入高斯噪声。

③ Video DiT 预测未来视频潜变量的速度场,Action DiT 预测动作速度场。

④ 动作 token 只能读取当前帧和动作 token,不能读取未来视频 token,防止训练时"偷看答案"。

⑤ 视频损失与动作损失相加,共同更新模型。

推理阶段:

① 只将当前多相机图像送入 VAE 和 Video DiT。

② Video DiT 前向一次,并缓存各层的 K/V。

③ Action DiT 从动作噪声开始,通过 10 步 Flow Matching 生成动作块。

④ 每个动作去噪步复用视频 KV,不再重复执行视频分支,也不生成未来视频。

1.4、输出结果

模型输出长度为 32 的连续动作块。LIBERO 每步动作为 7 维,包括 6 维末端位姿变化和 1 维夹爪控制;RoboTwin 为 14 维双臂动作。

需要注意,"单次前向"只指当前帧在 Video DiT 中处理一次。动作分支仍要执行 10 步去噪,因此不能把 Fast-WAM 理解为整个模型只计算一次 Transformer。

1.5、Fast-WAM与两类WAM变体的区别

对比维度 Fast-WAM-Joint Fast-WAM-IDM Fast-WAM
训练时视频目标
推理时未来视频 视频与动作联合生成 先生成视频,再预测动作 不生成
动作是否读取未来视频
当前帧视频分支 随联合去噪重复计算 先完成视频去噪 单次前向并缓存KV
论文延迟 580 ms 810 ms 190 ms
代表范式 Motus、UWM LingBot-VA、ViDAR 训练期世界建模+直接策略接口

论文还构造了 Fast-WAM w.o. video co-train:架构和推理过程与 Fast-WAM 相同,只删除训练期视频损失,用它直接检验视频共训练是否重要。

2、Fast-WAM架构设计思路

2.1、核心目标

WAM 面临一个直接矛盾:预测未来视频可以迫使模型学习物体运动和交互规律,但测试时迭代生成视频又会带来较高延迟。

Fast-WAM 的目标是把两部分收益拆开:训练时继续利用未来视频监督学习世界表征,推理时只保留对动作有用的潜在特征,从而降低实时控制成本。

2.2、具体实现

标准视觉运动策略直接建模:

p ( a 1 : H ∣ o , l ) p(a_{1:H}\mid o,l) p(a1:H∣o,l)

其中, o o o 是当前视觉观测, l l l 是语言任务指令, a 1 : H a_{1:H} a1:H 表示从第 1 步到第 H H H 步的连续动作块,论文设置 H = 32 H=32 H=32; p ( ⋅ ) p(\cdot) p(⋅) 表示模型学习的条件动作分布。

传统 imagine-then-execute WAM 引入未来视觉观测:

p ( a 1 : H ∣ o , l ) = ∫ p ( v 1 : T ∣ o , l ) p ( a 1 : H ∣ o , l , v 1 : T )   d v 1 : T p(a_{1:H}\mid o,l)=\int p(v_{1:T}\mid o,l)p(a_{1:H}\mid o,l,v_{1:T})\,dv_{1:T} p(a1:H∣o,l)=∫p(v1:T∣o,l)p(a1:H∣o,l,v1:T)dv1:T

v 1 : T v_{1:T} v1:T 表示未来第 1 到第 T T T 个视觉观测; p ( v 1 : T ∣ o , l ) p(v_{1:T}\mid o,l) p(v1:T∣o,l) 负责生成未来视频; p ( a 1 : H ∣ o , l , v 1 : T ) p(a_{1:H}\mid o,l,v_{1:T}) p(a1:H∣o,l,v1:T) 根据当前信息和想象结果生成动作。积分表示对可能的未来轨迹进行边缘化,实际系统通常用一条或少量生成轨迹近似。

Fast-WAM 则改为:

p θ ( a 1 : H ∣ o , l ) = p θ ( a 1 : H ∣ z ( o , l ) ) p_{\theta}(a_{1:H}\mid o,l)=p_{\theta}(a_{1:H}\mid z(o,l)) pθ(a1:H∣o,l)=pθ(a1:H∣z(o,l))

θ \theta θ 表示模型参数; z ( o , l ) z(o,l) z(o,l) 是 Video DiT 对当前观测和语言条件进行单次编码后得到的潜在世界表征;动作分布只依赖该表征,不依赖测试时生成的未来视频。

2.3、关键细节:未来信息不能进入动作分支

训练时共有三组 token:干净当前帧潜变量 f 0 f_0 f0、加噪未来视频潜变量 f 1 , ... , f h f_1,\ldots,f_h f1,...,fh、加噪动作 token a 1 , ... , a H a_1,\ldots,a_H a1,...,aH。

Attention Mask 的信息流如下:

  • 未来视频 token 可以读取当前帧和视频分支内部 token;
  • 动作 token 可以读取当前帧和动作分支内部 token;
  • 动作 token 不能读取未来视频 token;
  • 当前帧不读取未来视频或动作 token。

如果不做这一隔离,动作模型可能直接利用训练数据中的未来画面,而不是根据当前观测学习动作。推理时未来画面消失,训练和推理条件就会不一致。

2.4、设计意义

Fast-WAM 的核心判断是:视频预测的价值不一定要通过"在线生成未来画面"体现,也可能已经固化在 Video DiT 的参数和隐藏特征中。

从工程角度看,它接近"训练时使用世界模型辅助目标,推理时采用直接策略接口"。如果严格把 WAM 定义为"预测未来必须进入测试时动作链路",Fast-WAM 更像受世界建模监督增强的 VLA;论文采用的是更宽的 WAM 定义。

3、视频与动作的联合Flow Matching训练

3.1、核心目标

Fast-WAM 用同一种 Flow Matching 形式学习未来视频潜变量和连续动作。视频损失负责塑造世界表征,动作损失负责学习实际控制,两者通过共享注意力在同一个模型中训练。

3.2、带噪目标构造

给定目标变量 y y y,采样高斯噪声 ϵ \epsilon ϵ 和生成模型内部时间 t t t,构造:

y t = ( 1 − t ) y + t ϵ y_t=(1-t)y+t\epsilon yt=(1−t)y+tϵ

该公式把干净目标和高斯噪声进行线性插值。 t t t 越接近 0, y t y_t yt 越接近真实数据; t t t 越接近 1, y t y_t yt 越接近纯噪声。这里的 t t t 是 Flow Matching 的噪声时间,不是机器人执行时刻,也不是未来视频的帧编号。

3.3、联合损失函数

模型学习速度场:

L F M ( y ) = E y , ϵ , t ∥ f θ ( y t , t , o , l ) − ( ϵ − y ) ∥ 2 2 \mathcal{L}{\mathrm{FM}}(y)=\mathbb{E}{y,\epsilon,t}\left\\left\\\|f_{\\theta}(y_t,t,o,l)-(\\epsilon-y)\\right\\\|_2\^2\\right LFM(y)=Ey,ϵ,t∥fθ(yt,t,o,l)−(ϵ−y)∥22

动作和视频分别代入该目标:

L a c t = L F M ( a 1 : H ) \mathcal{L}{\mathrm{act}}=\mathcal{L}{\mathrm{FM}}(a_{1:H}) Lact=LFM(a1:H)

L v i d = L F M ( z 1 : T ) \mathcal{L}{\mathrm{vid}}=\mathcal{L}{\mathrm{FM}}(z_{1:T}) Lvid=LFM(z1:T)

最终损失为:

L = L a c t + λ L v i d \mathcal{L}=\mathcal{L}{\mathrm{act}}+\lambda\mathcal{L}{\mathrm{vid}} L=Lact+λLvid

L a c t \mathcal{L}{\mathrm{act}} Lact 优化动作速度场, L v i d \mathcal{L}{\mathrm{vid}} Lvid 优化未来视频潜变量速度场, z 1 : T z_{1:T} z1:T 是 Video VAE 得到的未来视频 latent, λ \lambda λ 用于平衡两项损失。

论文正文没有给出 λ \lambda λ 的明确数值;当前开源实现中视频和动作损失默认权重均为 1.0。这是源码默认设置,不能写成论文明确报告的超参数。

3.4、训练与推理的阶段化分工

**训练阶段:**未来视频与动作都加噪并计算损失;视频和动作噪声时间独立采样;第一帧 latent 被替换回干净观测。

**推理阶段:**完全删除未来视频 token 与视频损失,只保留当前帧编码、Video KV Cache 和动作去噪。

这说明未来视频是训练监督,不是 Fast-WAM 测试时动作生成的输入。

4、关键公式详细分析

4.1、Flow Matching公式逐符号解析

理解 Fast-WAM 损失的关键,是理解下面这个速度场目标:

L F M ( y ) = E y , ϵ , t ∥ f θ ( y t , t , o , l ) − ( ϵ − y ) ∥ 2 2 \mathcal{L}{\mathrm{FM}}(y)=\mathbb{E}{y,\epsilon,t}\left\\left\\\|f_{\\theta}(y_t,t,o,l)-(\\epsilon-y)\\right\\\|_2\^2\\right LFM(y)=Ey,ϵ,t∥fθ(yt,t,o,l)−(ϵ−y)∥22

符号 类型 具体含义 在Fast-WAM中的落点
y y y 干净目标 模型希望还原的数据 动作块 a 1 : H a_{1:H} a1:H 或未来视频 latent z 1 : T z_{1:T} z1:T
ϵ \epsilon ϵ 随机变量 标准高斯噪声, ϵ ∼ N ( 0 , I ) \epsilon\sim\mathcal{N}(0,I) ϵ∼N(0,I) 代码用 torch.randn_like 生成
I I I 矩阵 单位协方差矩阵 表示各维标准高斯噪声
t t t 标量 Flow Matching 噪声时间 与机器人物理时间无关
y t y_t yt 带噪目标 干净数据与噪声的插值结果 视频和动作分别构造
f θ f_\theta fθ 模型输出 预测的速度场 Video DiT 或 Action DiT 输出
ϵ − y \epsilon-y ϵ−y 监督目标 线性插值路径上的真实速度 源码 training_target 的返回值
E \mathbb{E} E 数学期望 对数据、噪声、时间采样求均值 实际由 batch 均值近似
∣ ⋅ ∣ 2 2 |\cdot|_2^2 ∣⋅∣22 平方L2范数 衡量预测与目标速度的差异 源码使用逐元素MSE

4.2、公式核心逻辑

训练时,模型不是直接回归干净动作或未来视频,而是学习带噪样本应该沿什么方向变化。

  • 对动作分支, y = a 1 : H y=a_{1:H} y=a1:H,模型学习把动作噪声还原成连续动作块。
  • 对视频分支, y = z 1 : T y=z_{1:T} y=z1:T,模型学习把噪声 latent 还原成未来视频 latent。
  • 两个任务共享当前帧与语言条件,但动作不能读取未来 latent。

推理调度器从噪声侧逐步积分到数据侧。源码使用 Euler 形式更新:

x k + 1 = x k + Δ k f θ ( x k , t k , o , l ) x_{k+1}=x_k+\Delta_k f_{\theta}(x_k,t_k,o,l) xk+1=xk+Δkfθ(xk,tk,o,l)

x k x_k xk 是第 k k k 个去噪步的动作状态, t k t_k tk 是该步噪声时间, Δ k \Delta_k Δk 是相邻时间点差值, f θ f_\theta fθ 是 Action DiT 预测的速度场。论文评测使用 10 个动作更新步。

4.3、用"折叠毛巾"理解训练与推理

以论文真机任务"Fold the cloth"为例。

**训练阶段:**当前观测是毛巾尚未折叠的多相机画面;未来视频监督展示毛巾被双臂抓取、拉平、折叠后的变化;动作监督是对应的 32 步连续控制。Video DiT 学习毛巾形变,Action DiT 学习动作速度场,Mask 保证 Action DiT 不能直接读取未来毛巾画面。

**推理阶段:**模型只看到当前毛巾画面、任务指令和机器人状态;Video DiT 对当前画面前向一次并缓存 KV;Action DiT 从高斯噪声出发,经过 10 步更新得到 32 步动作。机器人执行动作后获取新观测,再进入下一个闭环控制周期。

Fast-WAM 并不会先生成"毛巾接下来如何折叠"的视频,再根据这段视频控制机器人。

5、源码解析

本节核对官方仓库 main 分支,commit 为 45d8e1458921d83f8ad6cf9ce993d371208dabd0,提交时间为 2026-04-03。

5.1、项目目录

text 复制代码
FastWAM/
├── configs/
│   ├── data/libero_2cam.yaml
│   ├── data/robotwin.yaml
│   ├── model/fastwam.yaml
│   ├── model/fastwam_joint.yaml
│   └── model/fastwam_idm.yaml
├── scripts/
│   ├── train.py
│   ├── preprocess_action_dit_backbone.py
│   └── precompute_text_embeds.py
├── experiments/
│   ├── libero/eval_libero_single.py
│   └── robotwin/fastwam_policy/deploy_policy.py
└── src/fastwam/models/wan22/
    ├── fastwam.py
    ├── fastwam_joint.py
    ├── fastwam_idm.py
    ├── mot.py
    └── schedulers/scheduler_continuous.py

5.2、论文模块与源码对应关系

论文模块 源码文件/函数 实际作用
Fast-WAM主模型 fastwam.py::FastWAM 组装Video DiT、Action DiT、VAE、调度器和损失
结构化Mask FastWAM._build_mot_attention_mask 控制video/action token的可见关系
视频+动作损失 FastWAM.training_loss 分别加噪、预测速度场并计算加权MSE
MoT共享注意力 mot.py::MoT 拼接不同专家的Q/K/V并执行统一注意力
视频KV缓存 MoT.prefill_video_cache 当前帧只计算一次,缓存30层K/V
动作去噪 FastWAM.infer_action 从动作噪声开始迭代生成动作块
Joint变体 fastwam_joint.py::FastWAMJoint 联合去噪视频和动作
IDM变体 fastwam_idm.py::FastWAMIDM 先处理未来视频,再条件化动作
Flow调度 scheduler_continuous.py 加噪、速度目标、推理时间表和Euler更新

5.3、Attention Mask的源码实现

python 复制代码
mask[:video_seq_len, :video_seq_len] = video_self_mask
mask[video_seq_len:, video_seq_len:] = True
mask[video_seq_len:, :first_frame_tokens] = True

第一行建立视频分支内部注意力;第二行允许动作 token 双向交互;第三行只允许动作读取第一帧视频 token。代码没有打开 action → future video,因此未来帧不会泄漏到动作分支。

5.4、联合训练损失的源码实现

python 复制代码
latents = video_scheduler.add_noise(input_latents, noise_video, t_video)
noisy_action = action_scheduler.add_noise(action, noise_action, t_action)

target_video = video_scheduler.training_target(input_latents, noise_video, t_video)
target_action = action_scheduler.training_target(action, noise_action, t_action)

loss_total = lambda_video * loss_video + lambda_action * loss_action

视频和动作分别采样噪声与时间,随后由 MoT 输出 pred_videopred_action。源码还对 padding token 做掩码,并根据噪声时间使用 training_weight 加权,不是所有时间点完全等权。

5.5、KV Cache与动作推理

python 复制代码
video_kv_cache = mot.prefill_video_cache(video_tokens, ...)

for t, delta in action_schedule:
    pred_action = predict_action_with_cache(action, video_kv_cache, ...)
    action = scheduler.step(pred_action, delta, action)

prefill_video_cache 保存 Video DiT 每层的 K/V。动作去噪时重新计算动作 Q/K/V,再与缓存的视频 K/V 拼接。这样 10 个动作去噪步都不需要重复执行 Video DiT,也不需要创建未来视频 latent。

5.6、数据与动作配置

配置 LIBERO RoboTwin 2.0
相机数量 2路 3路
拼接后尺寸 224 × 448 224\times448 224×448 配置输出 384 × 320 384\times320 384×320
动作维度 7 14
本体状态维度 8 14
归一化方式 min/max z-score
原始时间帧 33 33
动作块长度 32 32
VAE潜视频帧 9 9

原始序列包含 33 帧,动作块对应 32 个相邻控制步;视频 VAE 时间压缩 4 倍后得到 9 个 latent frame。9 个视频 latent 不等于 9 步动作。

5.7、最小环境与官方入口

bash 复制代码
conda create -n fastwam python=3.10 -y
conda activate fastwam
pip install torch==2.7.1+cu128 torchvision==0.22.1+cu128 \
  --extra-index-url https://download.pytorch.org/whl/cu128
pip install -e .

bash scripts/train_zero1.sh 8 task=libero_uncond_2cam224_1e-4

python experiments/libero/run_libero_manager.py \
  task=libero_uncond_2cam224_1e-4 \
  ckpt=./checkpoints/fastwam_release/libero_uncond_2cam224.pt

正式运行前还要准备 Wan2.2、Action DiT 初始化权重、T5 embedding cache、数据集和统计文件。README 建议 LIBERO 使用单机 8 GPU,RoboTwin 使用 64 GPU 加速训练,因此这里只做源码静态解析,不声称已完成大规模复现。

6、模型效果

6.1、RoboTwin实验

RoboTwin 2.0 包含 50 多个双臂任务。训练数据由 2,500 条 clean 场景演示和 25,000 条强随机化场景演示组成,每个任务在 clean 和 randomized 设置下各测试 100 次。

方法 具身预训练 Clean Rand. 平均成功率
π 0 .5 \pi_0.5 π0.5 82.74 76.76 79.8
Motus 88.66 87.02 87.8
LingBot-VA 92.90 91.50 92.2
Fast-WAM 91.88 91.78 91.8
Fast-WAM-Joint 90.84 90.32 90.6
Fast-WAM-IDM 91.16 91.34 91.3
Fast-WAM w.o. video co-train 82.76 84.80 83.8

Fast-WAM、Joint 和 IDM 的平均成功率分别为 91.8%、90.6% 和 91.3%,差距不超过 1.2 个百分点;删除视频共训练后下降到 83.8%,降低 8.0 个百分点。

这一结果说明,在当前实验中,视频训练目标造成的性能差异明显大于测试时是否生成未来视频。

6.2、LIBERO实验

LIBERO 包含 Spatial、Object、Goal 和 Long 四个 suite,共 40 个任务、2,000 次测试。Fast-WAM 平均成功率为 97.6%,Joint 为 98.5%,IDM 为 98.0%,删除视频共训练后为 93.5%。

Fast-WAM 并不是所有变体中分数最高的,因此论文更准确的结论是"性能接近显式未来生成,但推理更快",而不是"Fast-WAM全面超过所有WAM"。

此外,"无具身预训练"不等于"从零训练"。Fast-WAM 使用了 Wan2.2 视频预训练模型、T5 和 Video VAE,只是没有在大规模机器人数据上做额外 embodied pretraining。

6.3、真机毛巾折叠

如下图所示,论文在 Galaxea R1 Lite 上测试长时序毛巾折叠任务,并收集了 60 小时遥操作演示。

真机结果同时统计成功率、平均完成时间和推理延迟:

  • 预训练 π 0 .5 \pi_0.5 π0.5 成功率为 100%,平均完成时间约 120 s,延迟 180 ms。
  • Fast-WAM 成功率约 75%,平均完成时间约 150 s,延迟 190 ms。
  • Fast-WAM-Joint 成功率约 70%,延迟 580 ms。
  • Fast-WAM-IDM 成功率约 90%,延迟 810 ms。
  • 删除视频共训练后,成功率降到 10%,平均完成时间约 240 s。

论文所说的"4× 更快"主要对应 190 ms 与 Fast-WAM-IDM 的 810 ms 相比,约为 4.26×;与 Joint 的 580 ms 相比约为 3.05×。所有延迟均在单张 NVIDIA RTX 5090D V2 32GB 上测量,不包含机器人完成整个动作块的物理执行时间。

7、论文与开源实现差异

  1. 噪声时间分布不同。 论文写的是 logit-normal 分布;当前 WanContinuousFlowMatchScheduler 实际采样 u ∼ U ( 0 , 1 ) u\sim U(0,1) u∼U(0,1),再做 shift 映射,默认 shift 为 5。
  2. 视频损失权重未在论文中明确。 源码默认 lambda_video=1.0lambda_action=1.0
  3. 真机代码尚未公开。 当前仓库提供 LIBERO 和 RoboTwin 训练评测,未提供毛巾折叠数据、配置、脚本与 checkpoint。
  4. 官方权重只覆盖Fast-WAM主模型。 已发布 LIBERO 和 RoboTwin 两个 checkpoint,Joint 与 IDM 变体权重未列出。
  5. 推理步数存在配置与函数默认值差异。 论文和评测配置使用 10 步,但 infer_action 函数签名默认是 20 步;复现论文延迟需要使用 release 配置。

8、总结

Fast-WAM 的核心结论可以概括为:模型需要在训练时学会预测未来,但不一定要在推理时把未来视频真正生成出来。

在 RoboTwin、LIBERO 和真机毛巾折叠中,删除视频共训练带来的性能下降,明显大于删除测试时未来想象造成的差异;同时,跳过未来视频生成把延迟从 810 ms 降到 190 ms。

但论文并没有证明未来想象普遍无用。Fast-WAM-IDM 在真机上的成功率高于 Fast-WAM,只是在线成本更高;长时规划、失败恢复、多候选轨迹评估以及显式 action-conditioned dynamics 是否仍需要测试时想象,也没有被当前实验完全回答。

因此,更稳妥的判断是:在当前 Wan2.2 骨架、数据规模和评测范围内,视频共训练是主要收益来源,显式未来生成的边际收益较小,而实时计算代价较高。

相关推荐
能年玲奈喝榴莲牛奶2 小时前
资产和漏洞管理系统(AI)
人工智能·安全·web安全
lifallen2 小时前
Orca 与 Emdash:同样管理多个 Agent,差别在谁来调度
人工智能·学习·ai·软件构建·开源软件·ai编程
m0_547486662 小时前
《人工智能通识基础与AIGC应用》全套PPT课件2026
人工智能·aigc
AI刀刀2 小时前
腾讯元宝粘贴到 word 格式混乱,AI 导出鸭一键规整排版
人工智能·c#·word·ai导出鸭
测开小菜鸟2 小时前
AI Agent 智能体:当大模型长出“手”和“记忆”
大数据·人工智能·数据挖掘
测开小菜鸟2 小时前
从AI概念到LLM评估:全面解析大型语言模型的能力与评价
人工智能·语言模型·自然语言处理
实在智能RPA2 小时前
3天变30分钟、40小时归零:跨境大卖用智能体在做什么?
大数据·人工智能·搜索引擎·实在智能·实在agent
RobinDevNotes3 小时前
K8s+Ray+vLLM打穿大模型全生命周期(有实践步骤)
人工智能·云原生·容器·kubernetes·生活·vllm
达子6663 小时前
AI训练师图解_02_能力培养_成为一名合格的AI训练师
人工智能