马斯克开源大模型Grok-1,手把手教你如何使用

马斯克一直在指责OpenAI没有开源,终于开源自家的大模型Grok-1,也把压力给到了OpenAI

GitHub链接:github.com/xai-org/gro...

居然短短一天就有29k的star

Grok-1的模型参数:

•Parameters: 314B

•Architecture: Mixture of 8 Experts (MoE)

•Experts Utilization: 2 experts used per token

•Layers: 64

•Attention Heads: 48 for queries, 8 for keys/values

•Embedding Size: 6,144

•Tokenization: SentencePiece tokenizer with 131,072 tokens

•Additional Features: Rotary embeddings (RoPE)

•Supports activation sharding and 8-bit quantization

•Maximum Sequence Length (context): 8,192 tokens

第一步:下载模型权重

用户需要确保先下载 checkpoint,并将 ckpt-0 目录放置在 checkpoint 中。

模型权重约为 296.38 GB,如下图,要注意自己磁盘的容量

有下面两种下载方法

1.可以使用 torrent 客户端和此磁力链接下载权重

perl 复制代码
magnet:?xt=urn:btih:5f96d43576e3d386c9ba65b883210a393b68210e&tr=https%3A%2F%2Facademictorrents.com%2Fannounce.php&tr=udp%3A%2F%2Ftracker.coppersurfer.tk%3A6969&tr=udp%3A%2F%2Ftracker.opentrackr.org%3A1337%2Fannounce
  1. 直接使用HuggingFace

链接 huggingface.co/xai-org/gro...

HuggingFace上面有很多预训练模型(如GPT,BERT),也有很多数据集,十分强大 ,推荐大家使用

执行下面的代码

bash 复制代码
git clone https://github.com/xai-org/grok-1.git && cd grok-1pip install huggingface_hub[hf_transfer]huggingface-cli download xai-org/grok-1 --repo-type model --include ckpt-0/* --local-dir checkpoints --local-dir-use-symlinks False

第二步:运行大模型

安装依赖环境,执行代码

复制代码
pip install -r requirements.txt

requirements.txt的文件内容:

ini 复制代码
dm_haiku==0.0.12
jax[cuda12_pip]==0.4.25 -f https://storage.googleapis.com/jax-releases/jax_cuda_releases.html
numpy==1.26.4
sentencepiece==0.2.0

然后执行代码

arduino 复制代码
python run.py

注意:硬件要求多大呢?

由于模型规模较大(314B参数),需要有足够GPU、内存的机器才能使用示例代码测试模型。

那具体需要多大呢?

这个也是提的比较多的问题,有人给出了回复,但暂时未确认

由于由于the mesh shape assertion(1, 8),因此需要 8 个 GPU。要以本机大小运行,您可能需要 8x80GB GPU (A100 80GB / H100GB)。

详见issue:github.com/xai-org/gro...

容易出现的问题

大家遇到比较多的是下载问题,比如种子无法下载

还有硬件资源的问题,毕竟需要的gpu和内存太高了,对于个人来说成本太高了,个人没法玩了啊

相关推荐
沛沛老爹7 分钟前
Web转AI架构篇 Agent Skills vs MCP:工具箱与标准接口的本质区别
java·开发语言·前端·人工智能·架构·企业开发
ZKNOW甄知科技18 分钟前
IT自动分派单据:让企业服务流程更智能、更高效的关键技术
大数据·运维·数据库·人工智能·低代码·自动化
OpenCSG20 分钟前
如何通过 AgenticOps x CSGHub 重塑企业 AI 生产力
人工智能
Nautiluss29 分钟前
一起调试XVF3800麦克风阵列(十四)
linux·人工智能·音频·语音识别·dsp开发
地瓜伯伯31 分钟前
elasticsearch性能调优方法原理与实战
人工智能·elasticsearch·语言模型·数据分析
ZCXZ12385296a34 分钟前
YOLO13改进模型C3k2-SFHF实现:阻尼器类型识别与分类系统详解
人工智能·分类·数据挖掘
黑客思维者36 分钟前
2025年AI垃圾(AI Slop)现象综合研究报告:规模、影响与治理路径
人工智能·搜索引擎·百度
Aspect of twilight1 小时前
QwenVL 模型输入细节
人工智能·qwen
悟纤1 小时前
Suno 电子舞曲创作指南:102 个实用 Prompt 精选 | Suno高级篇 | 第20篇
人工智能·prompt·suno·suno ai·suno api·ai music
北京耐用通信1 小时前
石油化工车间的“通讯救星”:耐达讯自动化Profibus总线光纤中继器有多实用?
人工智能·科技·物联网·自动化·信息与通信