llama

老刘说AI2 小时前
人工智能·神经网络·langchain·llama·持续部署
AI服务核心: 高并发原理与性能监控调优KV Cache 在 Transformer 的自回归生成过程中,为避免重复计算,将每一层的 Key(K)和 Value(V)张量缓存起来。
亮亮在江湖1 天前
llama
# 手写原生Transformers SFT脚本 vs LLaMA Factory 训练 核心完整对比完全基于 HuggingFace 原生库(transformers/peft/accelerate/bitsandbytes)从零编码实现训练全链路:数据集加载、对话模板拼接、DataCollator、LoRA/QLoRA 逻辑、梯度累积、分布式、训练循环、保存逻辑全部自己手写维护,无上层封装。
头茬韭菜1 天前
llama
Kronos 模型推理性能基准测试报告生成时间: 2026-07-19 00:20 CST 本机显卡: NVIDIA GeForce RTX 4070 Laptop GPU (8GB) 驱动版本: 566.26 当前状态: ⚠️ PyTorch为CPU版本(2.12.0),需升级以启用GPU加速
染指11101 天前
人工智能·llama·rag·llama_index·llamaindex
61.RAG-RAG存在的问题内容参考于:图灵AI大模型全栈RAG它实际上存在一些问题,需要考虑这些问题该怎样解决RAG的流程1.加载文件
CClaris6 天前
人工智能·pytorch·python·深度学习·llama
大模型量化从0到1(九):用 llama.cpp 把模型转成 GGUF 并跑本地推理上一篇把 GGUF 这个"打包盒子"从里到外解剖清楚了。这一篇动手,把盒子从制作到使用完整走一遍:用 llama.cpp 把一个 HuggingFace 模型转成 GGUF、量化成你要的档位、然后在本地(CPU 或 GPU)真正跑起来。
染指11106 天前
人工智能·llama·rag·llama_index·llamaindex
56.llama_index-查询引擎内容参考于:图灵AI大模型全栈查询引擎Query Engine(查询引擎)它在llamaindex中是最常用的一个抽象接口,用来接收问题,自动完成检索相关文档片段(Node)然后调用llm大模型生成最终答案,只需要一行代码就可以实现
_codemonster6 天前
人工智能·gpt·大模型·llama
从零手搓大模型(七)GPT 转 Llama:从教学版 GPT 走向现代 LLM 架构这个模块教你把 GPT 骨架逐步改造成 Llama:RMSNorm、RoPE、SwiGLU、GQA、现代 tokenizer、权重加载。
liming4957 天前
llama
Ubuntu + Docker + NVIDIA 显卡 上部署 Ollama如果是在 Ubuntu + Docker + NVIDIA 显卡 上部署 Ollama,推荐直接使用官方 Docker 镜像并开启 GPU 支持。
SLD_Allen7 天前
安全·开源·llama
Purple Llama:Meta开源的LLM安全“紫队”工具箱大语言模型的快速普及,带来了一场关于“安全”的深刻讨论——模型越强大,被滥用的风险也越高。从提示词注入攻击到越狱指令,从生成不安全代码到协助网络攻击,LLM的安全威胁已经不再是理论推演,而是每天都在发生的现实挑战。
俊俊谢7 天前
langchain·llama
从零搭建:本地LangChain Agent调用远程LLaMA-Factory模型服务本文记录了从Linux服务器部署LLaMA-Factory + HuggingFace模型,到本地Windows环境使用LangChain进行远程调用的完整过程。适合需要将大模型服务化、并接入Agent应用的开发者参考。
heroboyluck8 天前
人工智能·python·深度学习·llama
AI工程师第四课 - 深度学习入门学习代码记录仓库使用Jupyter lab测试执行代码验证。PyTorch 是最流行的深度学习框架之一,由 Meta(Facebook)开发。它用张量(Tensor)处理数据,支持 GPU 加速,提供自动求导和构建神经网络的工具。
Token炼金师11 天前
人工智能·llm·llama·vllm·tensorrt-llm·sglang
引擎四强:vLLM、SGLang、TensorRT-LLM 与 llama.cpp —— 推理引擎选型对决推理引擎是大模型落地的核心基础设施。本文从 vLLM、SGLang、TensorRT-LLM、llama.cpp 四大主流引擎的架构原理、核心优化、性能对比、选型决策四个切口,给出源码级实现与企业级推理服务决策框架。
尼米棕熊12 天前
学习·llama
大模型学习8上-推理部署框架llama.cpp与Ollama使用指北见LLM推理框架近年来,随着LLM的持续发展,推理部署框架在模型落地中的作用日益重要。作为连接模型能力与实际应用场景的关键基础设施,其设计与性能直接影响部署效率与最终效果。目前,业界已涌现出多种具有代表性的推理框架,常见的包括以下几类:
Day(AKA Elin)12 天前
python·深度学习·学习·llama
【Day】MTP(Multi Token Prediction)技术学习在MTP出现之前,LLM的推理流程的复杂程度是: InputToken×TFBlockLength×NIter InputToken \times TFBlock Length \times NIter InputToken×TFBlockLength×NIter 因此你会发现:真正会影响LLM图例速度的点在于Transformer Block在LLM模型中的深度,即使当我们仅仅输入了一个Token,如果Transformer Block足够深,那么它也会计算很长时间。更何况现实是我们与LLM聊天时,并不
染指111012 天前
llama·rag·llamaindex
50.llama_index-文档分割器(文本)内容参考于:图灵AI大模型全栈分割(分割也叫分片)器的作用1.限制LLM上下文窗口的数据,问题内容和大模型输出的内容被看作为一次上下文大小,现在的模型都有上下文的限制,没办法传递给大模型一个很大的文档
Scabbards_14 天前
gpt·语言模型·llama
经典大语言模型框架整理(gpt/llama/chatglm/qwen/deepseek)简介:发布了其最新的大型语言模型 DeepSeek-V3,这款模型在性能和效率方面都取得了显著的进步,成为当前最强大的开源基础模型之一。DeepSeek-V3 是一款拥有 671B参数的大型混合专家 (MoE) 模型,其中每个 token 会有 37 B参数被激活。
sunywz18 天前
人工智能·llama
【AI】基于LLaMA-Factory大模型微调本文系统介绍大模型微调的核心概念、方法论与实践操作,涵盖从理论基础到工具链应用的完整流程。大语言模型本质上是一种基于海量文本训练得到的文本生成模型,可以看作是一个规模非常庞大、包含了非常多参数的函数。
染指111016 天前
llama·rag·llamaindex
46.llama_index-提示词模板(富提示词模板、jinja2静态和动态模板)内容参考于:图灵AI大模型全栈LLamaIndex提供了三个提示词模板PromptTemplate:普通提示词模板,出现的最早,纯字符串,可以用来做文本补齐,但真正的场景都是要跟聊天一样,这种纯字符串的不会用,现代最基本的AI就要支持聊天,这个只需要做了解就可以
AI小百科18 天前
人工智能·开源·llama
基于 llama.cpp 的 AI 编程相关开源项目llama.cpp 作为纯 C/C++ 实现的 LLM 推理引擎,已成为整个本地 LLM 推理生态的基石。Ollama、LM Studio、GPT4All、Jan、LMDeploy 等数十个项目都在底层使用了 llama.cpp 或其 GGML 张量库。下面从 AI 编程视角梳理几类最相关的开源项目。
染指111017 天前
llama·llamaindex
45.llama_index-全局配置(Settings)内容参考于:图灵AI大模型全栈llamaIndex中有一个全局配置,当我们没有指定模型的时候它会使用全局配置中设置的模型