面向AI的Cisco UCS X-Series设计-2:Cisco UCS AI规格选型

📑课程信息

  • 领域:IT基础设施 / 企业技术培训
📖知识精讲

Cisco UCS AI and ML Sizer工具的实操让我们解了工具的定位与功能,演示了从项目创建到配置对比、价格估算的完整使用流程,总结了工具的应用价值。

Cisco UCS AI ML Sizer工具概述

  • 工具定位与核心作用:AI基础设施设计中最困难的任务是根据AI工作负载(如大语言模型、输入输出序列长度、并发用户数)估算所需GPU与算力容量。本工具是面向架构师和工程师的在线工具,可基于Cisco UCS平台,将工作负载要求(训练/推理、数据集规模、GPU/CPU需求)转换为推荐硬件配置,保证AI项目的算力、内存、存储、网络的平衡匹配,连接业务需求与合适的硬件方案。
  • 访问权限说明:🚩重点:工具访问权限仅对Cisco合作伙伴开放,不支持普通用户登录使用。

工具主页功能说明

  • 现有项目管理 :主页可查看所有已有项目(工具中称为configurations),支持对项目进行以下操作:

    • 编辑、删除:操作逻辑直观无需额外说明

    • 构建:触发工具根据输入需求计算最优硬件配置

    • 复制:复制现有项目生成新项目

    • 分享:将项目分享给其他Cisco工作人员

  • 全局功能入口:主页还支持访问帮助菜单、通过「联系我们」按钮给工具开发团队发消息、通过右上角按钮管理个人账户。

新建项目操作流程

  • 基础信息填写 :点击「Create Configuration」链接新建项目,在弹出窗口填写必要信息:配置名称、客户联系人电话、客户单位名称、项目描述,填写完成后点击下一步即可进入项目主配置页。

  • Step 1:配置AI工作负载需求:🚩重点------此步骤为整个配置流程的核心基础,决定最终硬件方案的匹配结果,需要填写的参数如下:

    参数项 说明与本次演示配置
    运行类型 目前仅支持推理(inferencing),暂不支持训练
    模型选择 从支持列表中选择模型,本演示选择Llama 3.1 8B:属于中等规模大语言模型,模型越大能力越强,GPU消耗也越高
    目标精度 精度越高准确率越高,但占用更多GPU显存,精度选择取决于业务场景;本次演示选择FP16/Bfloat16,适配需求
    输入序列长度 即用户提示词的长度,以token为单位,通用换算规则:100 token≈75单词;本演示配置为8196 token,约合6000单词
    输出序列长度 即模型生成内容的长度,同样以token为单位,本演示需要生成长代码,因此也配置为8196 token
    并发用户/批次大小 模型需要同时处理的最大并发请求数,本演示配置为25
  • Step 2:选择偏好硬件配置:工具提供两个配置方案,支持不同硬件的能力与性价比对比:

    1. 方案1:Intel架构UCS X200 10c M8刀片服务器,搭配NVIDIA L40S GPU,每服务器最大配置2块GPU;

    2. 方案2:AMD架构UCS C225 M8机架服务器,搭配NVIDIA L4 GPU,每服务器最大配置3块GPU;

    🚩重点:工具会自动校验硬件兼容性,无法选择不支持的硬件组合,避免配置错误。

  • Step 3:自定义高级参数:可自定义功率配置、温室气体排放、成本参数,本次演示保留默认值即可。

配置结果分析与输出

  • 自动计算结果展示:完成配置后工具会自动在页面右侧计算并展示结果:

    • 上方区域:服务器配置与能力汇总,展示算力、GPU等信息;本次演示的结果为:方案1需要2台UCS X系列服务器,共4块GPU;方案2需要5台UCS C系列服务器,共13块GPU------符合GPU性能差异:L4性能弱于L40S,因此需要更多显卡与服务器;

    • 下方区域:性能指标(指标按单GPU展示),核心指标为延迟(响应时间)和吞吐量(token/秒),本次演示中方案2性能明显低于方案1,符合L4单卡性能仅为L40S的1/3的特性。

  • 🚩重点:GPU利用率越高越好,说明GPU资源被高效利用,本案例两个方案的GPU显存利用率都处于高位,属于合理配置。

  • 生成详细报告:勾选两个方案后点击「Build Config」按钮,再点击「Generate Report」即可生成完整的硬件规格文档(含功率要求、排放信息),可输出为专业演示格式的报告。

  • 价格与扩展能力对比:回到AI ML方案主页,勾选两个方案后点击「Check Price」即可获取价格,本次演示结果为:方案1比方案2贵约25%,但方案1包含X系列刀片机箱与交换矩阵,未来扩展更简单低成本,因此如果预算允许,方案1是更优选择。

  • 功耗对比:排除方案1额外的交换矩阵功耗后,两个方案的整体功耗基本接近。

🖍️ 重点速览

🚩 考点重点
  • 工具访问权限:仅对Cisco合作伙伴开放,不支持普通用户使用;

  • 核心配置步骤:Step1工作负载需求定义是整个流程的基础,直接影响最终硬件匹配结果;

  • 工具特性:自动校验硬件兼容性,避免不支持的配置错误;

  • 核心性能指标:评估方案的核心指标是延迟(响应时间)和吞吐量(token每秒);

  • GPU利用率判定:GPU利用率越高越好,说明资源被高效利用。

💡 核心概念
  • Cisco UCS AI ML Sizer:面向架构师的在线AI基础设施规划工具,可将AI工作负载需求转换为匹配的Cisco UCS硬件推荐配置。

  • Token换算规则:100 tokens ≈ 75 单词,用于估算输入输出序列长度对应的文本量。

✨ 课堂金句
  • 更大的模型能力更强,但也会消耗更多GPU资源。

  • GPU内存利用率高,是好事,因为你希望高效使用GPU。

  • 工具帮你在性能、可扩展性和成本效率之间找到平衡。

📝运维实操演示

🎯 课程总结

🔍 AI/ML基础概念与分类
  • 人工智能(AI) :模拟人类认知功能(视觉感知、语音识别等)的机器智能,核心特征是从数据中学习并随时间优化性能,区别于传统基于固定规则的软件系统。

  • 复杂度谱系:从低到高依次为垃圾邮件过滤器→客户推荐系统→聊天机器人→Adobe Photoshop生成填充→大型语言模型(LLMs)。

  • 核心分支关系

    复制代码
    graph TD
      AI[人工智能] --> ML[机器学习]
      ML --> DL[深度学习]
      DL --> GenAI[生成式AI]
      GenAI --> SLMs[小型语言模型]
      GenAI --> LLMs[大型语言模型]
📊 机器学习(ML)vs 深度学习(DL)
维度 机器学习 深度学习
技术核心 统计方法+人工特征工程 多层神经网络自动特征提取
数据依赖 适用于小数据集 需海量标注数据
计算需求 可在CPU运行 依赖GPU/TPU并行计算
代表应用 预测分析、异常检测、信用评分 图像识别、语音识别、自然语言处理、自动驾驶
典型案例 垃圾邮件过滤器(基于已知模式分类) 图像中识别猫(自动发现特征如耳朵、胡须)
✨ 生成式AI与语言模型
  • 生成式AI(GenAI):通过学习数据模式生成新内容(文本、图像、音乐等),核心技术为神经网络与机器学习,例如ChatGPT(文本生成)、Photoshop生成填充(图像编辑)。

  • 语言模型分类

    • 小型语言模型(SLMs):参数少(数百万级)、轻量高效,适用于特定任务(如客服聊天机器人),通过知识蒸馏、剪枝等技术从LLM压缩而来;

    • 大型语言模型(LLMs):参数数十亿级(如GPT-3.5有1750亿参数),需海量数据训练,支持复杂任务(内容生成、翻译、多步推理),依赖高算力环境。

⚙️ AI/ML工作负载与资源需求
  • 生命周期阶段

    1. 训练:最耗资源,以GPU为主(并行矩阵运算),CPU辅助数据预处理,需高吞吐量存储与网络;

    2. 微调:与训练资源类型相同,但数据量更小,计算强度更低;

    3. 推理:低延迟敏感,可在GPU或带AI扩展的CPU运行,批量推理时需关注吞吐量。

  • 网络需求:分布式训练需高带宽低延迟网络,支持GPU间数据同步(如All-to-All通信模式),推理阶段需负载均衡以处理并发请求。

  • 硬件选择:GPU适合并行计算密集型任务(训练/微调),CPU适合轻量级推理或传统ML算法(如决策树)。

相关推荐
禁默1 小时前
从一行需求到压测波峰:我用 Seed-2.1-pro-0915 从 0 交付了一套分布式任务看板
人工智能·ai·seed-2.1-pro
55873 生态系统1 小时前
技术第4篇,【架构实战】55873 双层安全风控架构:Rust 底层硬拦截 + AI 语义研判双保险设计全解
人工智能·55873全域文明生态体系·55873操作系统·全域文明生态系统·55873技术底座
天远Date Lab1 小时前
零信任架构实战:基于天远手机在网状态V即时版构建自动化通信网关
人工智能·ai·工具分享
元岳数字人小元1 小时前
无惧网络受限:数字人私有化部署打造离线全域服务能力
运维·人工智能·开源·人机交互·交互
kaixin_啊啊1 小时前
Micam 多容器太吃资源?用 Go2RTC + EasyNVR 给小米摄像头换一套轻量本地录像方案
图像处理·人工智能·摄像头
具身AGI1 小时前
具身ICL走热,物理AI 自主学习能力 多一条轴
人工智能
雾屿_Mistisle1 小时前
本地 AI 工作台的 Agent 化改造:从聊天转发到 22 个工具
人工智能
水如烟1 小时前
孤能子视角:蓝星文明篇·异——正当性叙事的裂缝:负续指的聚合与相变
人工智能
美狐美颜SDK开放平台2 小时前
直播APP源码与视频美颜sdk如何配合?一套完整开发思路
android·人工智能·计算机视觉·音视频·直播美颜sdk