Machine Learning Engineering Open Book 机器学习工程开放书

文章目录


一、关于 Machine Learning Engineering Open Book

这是一个开放的方法、工具和分步说明集合,有助于成功训练和微调大型语言模型和多模态模型及其推理。

这是一份适合LLM/VLM培训工程师和操作员的技术材料。这里的内容包含大量脚本和n-粘贴命令,使您能够快速满足您的需求。

这个存储库是我训练大型语言模型(LLM)(和VLM)的经验的持续大脑转储;我在2022年训练开源BLOOM-176B模型和2023年训练IDEFICS-80B多模态模型以及2024年训练RAG模型时获得的许多专业知识。Contextual.AI

我一直在为自己编译这些信息,这样我就可以快速找到我过去已经研究过并且有效的解决方案,但是像往常一样,我很乐意与更广泛的机器学习社区分享这些笔记。


二、书籍目录

第1部分 见解

  1. 人工智能战场工程------你需要知道什么才能成功。
  2. 如何选择云提供商-这些问题将使您获得成功的计算云体验。

第2部分 硬件

  1. 计算-加速器,CPU,CPU内存。
  2. 存储-本地、分布式和共享文件系统。
  3. 网络-节点内和节点间网络。

第3部分 编排

  1. 编排系统-管理容器和资源
  2. SLURM-资源管理的简单Linux工具

第4部分 训练

  1. 训练- 模型培训相关指南

第5部分 推理

  1. 推理- 模型推理洞察

第6部分 开发

  1. 调试和故障排除-如何调试简单和困难的问题
  2. 还有更多的调试
  3. 测试------让测试写作变得愉快的众多技巧和工具

第7部分 杂项

  1. 资源-LLM/VLM编年史

三、关键对照表

高端加速器:

网络:


四、快捷方式

你可能需要快速经常找到的东西。

工具:

指南:


2025-01-27(一)

相关推荐
组合缺一21 小时前
搭建基于 Solon AI 的 Streamable MCP 服务并部署至阿里云百炼
java·人工智能·solon·mcp
qinyia21 小时前
Wisdom SSH 是一款集成了强大 AI 助手功能的 SSH 工具,助你高效管理服务器。
服务器·人工智能·ssh
IT_陈寒21 小时前
SpringBoot 3.x实战:5种高并发场景下的性能优化秘籍,让你的应用快如闪电!
前端·人工智能·后端
Clownseven21 小时前
云市场周报 (2025.09.05):解读腾讯云AI安全、阿里数据湖与KubeVela
人工智能·安全·腾讯云
野豹商业评论21 小时前
AI 浪潮下阿里云“高光”乍现,但离终局胜利尚远
人工智能·阿里云·云计算
z千鑫21 小时前
【模型比对】Gemini 2.5 Pro 与 Claude Sonnet 4 结构化数据对比报告 + API KEY的使用教程
人工智能·gpt·ai·语言模型·aigc
gptplusplus21 小时前
超越自动化:为什么说供应链的终局是“AI + 人类专家”的混合智能?
大数据·人工智能
耐达讯通信技术21 小时前
耐达讯自动化RS485与Profinet双向奔赴,伺服驱动器连接“稳稳拿捏”
运维·人工智能·物联网·网络协议·自动化·信息与通信
hqyjzsb21 小时前
2025职场进阶:B端产品经理必备的计算机专业技能精要
大数据·开发语言·人工智能·产品经理·编程语言·caie
耐达讯通信技术21 小时前
嘎嘎厉害!耐达讯自动化RS485转Profinet网关就是食品温控的“天选之子”
运维·服务器·网络·人工智能·网络协议·自动化·信息与通信