【LLM】从零预训练一个tiny-llama

文章目录

  • 从零预训练一个tiny-llama
    • [1. 数据集](#1. 数据集)
    • [2. 数据预处理](#2. 数据预处理)
    • [3. 训练模型](#3. 训练模型)
    • [4. 项目结构介绍](#4. 项目结构介绍)
    • [5. 运行项目示例](#5. 运行项目示例)
    • 学习总结

从零预训练一个tiny-llama

参考项目:https://github.com/KMnO4-zx/tiny-llm

数据集:https://www.modelscope.cn/datasets/AI-ModelScope/TinyStories

1. 数据集

2. 数据预处理

3. 训练模型

4. 项目结构介绍

5. 运行项目示例

学习总结

本次掌握了数据集的预处理,并对预处理后的数据进行训练。了解模型如何基于已有的上下文生成后续 token 的机制。

相关推荐
grey_csdn3 天前
1928_llama.cpp部署Qwen 3.6-35B-A3B扩充识图功能
llama
码云骑士4 天前
78-LLaMA-Factory微调实战-零代码训练-LoRA参数配置-训练曲线解读
python·llama
寒水馨4 天前
Linux下载、安装llama.cpp-b10068(附安装包llama-b10068-bin-ubuntu-vulkan-x64.tar.gz)
linux·ubuntu·llm·llama·本地部署·llama.cpp·推理引擎
千天夜5 天前
让大模型“先想再答”:Chain-of-Thought Prompting 论文精读——CoT 为什么能激发多步推理?
人工智能·深度学习·llm·gpt-3·llama
网络工程小王5 天前
【HCIE-AI】10.pytorch模型迁移分析
人工智能·学习·华为·llama
寒水馨8 天前
Windows下载、安装ollama-v0.32.1(附安装包OllamaSetup.exe)
windows·llm·大语言模型·llama·本地部署·ollama·模型运行
老刘说AI8 天前
AI服务核心: 高并发原理与性能监控调优
人工智能·神经网络·langchain·llama·持续部署
头茬韭菜9 天前
Kronos 模型推理性能基准测试报告
llama
亮亮在江湖10 天前
# 手写原生Transformers SFT脚本 vs LLaMA Factory 训练 核心完整对比
llama
染指111010 天前
61.RAG-RAG存在的问题
人工智能·llama·rag·llama_index·llamaindex