【星海出品】大模型微调-Part-One

LoRA (Low-Rank Adaptation of Large Language Model)

大规模语言模型的低秩适应

低秩: 指矩阵的秩远小于其行数和列数,意味着数据中存在大量冗余信息 。

NLA - 自然语言自编码器(Natural Language Autoencoder(s))

DeepSeek-Flash(即DeepSeek-V4-Flash)的总参数量为2840亿(284B),但在实际推理时,只会激活约130亿(13B)的参数

LLaMA-Factory

Unsloth Pro + LoRA-XT + QLoRA

HuggingFace生态: https://huggingface.co/

阿里巴巴达摩院提出的魔塔社区: https://modelscope.cn

行业有人称其为中国版的HuggingFace

LLaMA-Factory: https://github.com/hiyouga/LLaMA-Factory

Unsloth: https://github.com/unslothai/unsloth

适用 RTX 5080

使用的5080 16G显存 甜点级 大模型

文本生成模型:8B-13B级别(如Llama 3 8B/13B、Qwen2.5 14B)全精度模型

对比ollama提供的cloud 模型速度比,本地速度快出一小截

可能涉及到本地调整的参数与云上不同,以及云传的网络过滤延迟等。

相关推荐
番茄不是西红柿kk3 分钟前
AtomGit CodingPlan限时免费、限量 500 人/天
人工智能
深圳市益普科技有限公司8 分钟前
SMT 产线 MES 怎么管“钢网、刮刀、feeder”这些易耗辅料:防错与寿命追踪
人工智能
科研小牛马13 分钟前
北航何静:DeepSeek Harness,部署操作教程
人工智能
朝阳资本论15 分钟前
机器人的智能短板,大晓世界模型补齐
人工智能
YFJ_mily16 分钟前
9.24早鸟通道即将关闭|IMRA2026智能制造机器人自动化IEEE会议|往届EI稳定检索,设有学生专属投稿权益
人工智能·机器学习·机器人·自动化·智能制造·rdlink研发家·马鞍山会议
陌シ未央ゞ23 分钟前
基于BM25算法和RRF实现的混合索引(java版)
人工智能·spring boot·后端·算法
jsl_jsl_jsl24 分钟前
《Skill 与定时任务:让 Agent 在没人说话时也能干活》
人工智能
事界见闻25 分钟前
网页版AI 3D工具通常能完成哪些基础工作?生成、处理与导出流程对比
人工智能·3d
renhongxia127 分钟前
数字孪生不止在工厂:能源、医疗与农业
人工智能·深度学习·算法·机器学习·数字孪生
济南凡维36 分钟前
CODESOFT中如何将标签保存为PDF文件
网络·人工智能·打印机·codesoft