llama

维核科技3 天前
ai·私有化部署·llama·大模型部署·私有化大模型部署
Llama 3.3 vs Qwen2.5 vs DeepSeek-R1开源大模型选型实战对比一、选型背景:开源大模型格局剧变2024至2026年,开源大语言模型(LLM)生态经历了前所未有的洗牌。Meta的Llama系列、阿里云的Qwen系列以及深度求索(DeepSeek)旗下的R1/V3系列,共同构成了当前中文开发者圈最具影响力的三大开源阵营。三者在模型架构、训练范式、能力侧重与商业授权上各具特色,也让技术选型变得前所未有地复杂。
AI78406 天前
人工智能·开源·llama
开源模型改写AI格局:Llama、通义千问、Mistral如何挑战闭源巨头过去两年,AI行业长期维持“闭源领跑、开源跟随”的固定格局。早期开源模型普遍落后GPT、Claude等闭源产品半年以上,仅能作为轻量化试用工具,无法参与商用竞争。如今行业拐点彻底到来,Llama、通义千问、Mistral等主流开源模型快速迭代,在垂直推理、端侧部署、轻量化任务、自主本地化微调等场景,性能已经追平甚至局部超越通用闭源模型。
leoZ2316 天前
java·人工智能·spring·生成对抗网络·语言模型·自然语言处理·llama
本地跑大模型实战(七):llama.cpp 性能调优,让推理更快更省本文是《本地大模型搭应用实战》系列第 7 篇。前面六篇解决了"能不能用"——部署、量化、API、tool call、RAG、agent。本篇解决"用得爽不爽"。同一台机器同一个模型,配置不同,token/s 能差好几倍。
leoZ2317 天前
java·人工智能·python·深度学习·自然语言处理·github·llama
实战复盘:用 Claude Code 从零搭一个 GitHub PR 统计工具本文是《Claude Code 实战》系列第 7 篇。前六篇分别讲了工作流、Plan、MCP、子 Agent、记忆管理——这篇把它们串起来,做一次完整的从零到一。
不喝水的鱼儿8 天前
ide·vscode·语言模型·copilot·llama
本地部署 260K 上下文 Qwen-3.6-35B-A3B 与 Ornith-1.0-35B 模型及 VSCode Copilot 参数调优记录在本地构建编程 AI Agent 的过程中,算力约束始终是核心瓶颈。本文记录在 RTX 5060 Ti 16G 显存条件下,如何本地部署高上下文(260K)MoE(Mixture of Experts)模型并将其接入 VSCode Copilot 的工作流。
yagami_gagami7 天前
linux·服务器·网络·mysql·安全·docker·llama
第四届黄河流域公安院校电子物证个人赛服务器取证💡 报告元数据可以看到此llama.cpp的docker容器启动是没有传递–ctx-size参数,所以llama.cpp会根据宿主机的内存大小来决定上下文长度,一般仿真软件默认的设置是4G,做出来的答案就是117760,所以仿真时给予不同的内存会做出不同的答案。 8G内存就开满了qwen的262k上下文
(轻舟已过万重山)9 天前
人工智能·开源·llama
第16章 主流开源模型选型:Qwen/LLaMA/GLM/Mistral 怎么选一句话点题: 2024年开源大模型已经能打闭源了,别只盯着GPT——选对模型,省下的不只是钱,还有数据安全和自主可控。
染指11109 天前
python·sql·mysql·llama·llamaindex·高级rag
72.高级RAG-sql检索器内容参考于:图灵AI大模型全栈sql检索器它没办法做到跟向量检索一样进行语意匹配,它只能做到把自然语言转成sql语法
孪生质数-11 天前
linux·运维·服务器·人工智能·深度学习·语言模型·llama
AI 应用实践篇——让大模型真正开始工作很多人第一次接触大模型时,往往把它当作一个“更聪明的搜索引擎”或“聊天机器人”。这没错,但远远不够。本章将带你完成从“随便聊聊”到“完成任务”的关键转身。我们将通过最轻量的网页端体验,拆解 Prompt 的本质,并手把手带你跑通第一个真实的 AI 工作流。
刹那芳华199211 天前
docker·容器·llama
基于 Docker 的 LLaMA-Factory 全流程部署指南
grey_csdn15 天前
llama
1928_llama.cpp部署Qwen 3.6-35B-A3B扩充识图功能前面我已经把千问 3.6-35B-A3B 的模型量化版本在我的电脑上跑起来了,而且已经把它给融入到了我日常工作以及学习的工作流程之中,目前正在尝试打磨。我知道这一个模型是一个多模态的模型,能够识别图像等信息。但是我发现我自己在模型这方面的能力一直欠缺。但是由于我自己工作流程之中处理的主要还是文本或者是代码,因此这一方面我就没有着急尝试去扩展。但是总觉得这一个多模态的功能如果是扩充起来,那么给这个模型的可用性就留下了更多的想象空间。因此在我自己个人的计划里面,除了尝试对我当前自己本地大模型的功能以及性能进行
码云骑士16 天前
python·llama
78-LLaMA-Factory微调实战-零代码训练-LoRA参数配置-训练曲线解读📖 文章简介: 本文手把手教你用LLaMA-Factory完成第一次模型微调——这是目前最流行的零代码微调框架,支持100+开源模型,自带WebUI。文章覆盖完整链路:环境搭建(conda+CUDA避坑)、数据集放置与注册(dataset_info.json的正确写法)、LoRA关键参数配置(学习率/rank/epoch的推荐起点)、WebUI可视化训练操作,以及训练曲线解读(什么样的loss曲线算健康、什么情况说明过拟合)。配以Mermaid流程图展示从数据到模型的完整训练链路,适合刚准备好数据集、想
寒水馨16 天前
linux·ubuntu·llm·llama·本地部署·llama.cpp·推理引擎
Linux下载、安装llama.cpp-b10068(附安装包llama-b10068-bin-ubuntu-vulkan-x64.tar.gz)llama.cpp 是由保加利亚软件工程师 Georgi Gerganov 于 2023 年 3 月创建的开源 LLM(Large Language Model,大语言模型)推理引擎。最初是 Gerganov 在一个周末为了让 Meta 的 LLaMA 模型在 MacBook 上运行而发起的项目,如今已发展成为本地 AI 推理领域的事实标准。截至 2026 年中,该项目在 GitHub 上已获得约 12 万颗星(Stars)、超过 1600 位贡献者,增长速度超过 PyTorch 和 TensorFlow
千天夜18 天前
人工智能·深度学习·llm·gpt-3·llama
让大模型“先想再答”:Chain-of-Thought Prompting 论文精读——CoT 为什么能激发多步推理?论文:Chain-of-Thought Prompting Elicits Reasoning in Large Language Models 作者:Jason Wei、Xuezhi Wang、Dale Schuurmans 等 会议:NeurIPS 2022 博文作者:千天夜
网络工程小王18 天前
人工智能·学习·华为·llama
【HCIE-AI】10.pytorch模型迁移分析概述: 迁移分析不是直接从GPU代码跳到NPU代码,而是需要先在第三方平台(GPU)上建立"基线",再在昇腾平台上进行对标验证。没有基线,后续所有分析都缺少参照系。
寒水馨20 天前
windows·llm·大语言模型·llama·本地部署·ollama·模型运行
Windows下载、安装ollama-v0.32.1(附安装包OllamaSetup.exe)Ollama 是目前最流行的本地大语言模型(LLM)运行工具,在 GitHub 上已获得超过 130,000 颗星标(Stars),是 AI 开发者社区中最受关注的开源项目之一。
老刘说AI21 天前
人工智能·神经网络·langchain·llama·持续部署
AI服务核心: 高并发原理与性能监控调优KV Cache 在 Transformer 的自回归生成过程中,为避免重复计算,将每一层的 Key(K)和 Value(V)张量缓存起来。
亮亮在江湖22 天前
llama
# 手写原生Transformers SFT脚本 vs LLaMA Factory 训练 核心完整对比完全基于 HuggingFace 原生库(transformers/peft/accelerate/bitsandbytes)从零编码实现训练全链路:数据集加载、对话模板拼接、DataCollator、LoRA/QLoRA 逻辑、梯度累积、分布式、训练循环、保存逻辑全部自己手写维护,无上层封装。
头茬韭菜22 天前
llama
Kronos 模型推理性能基准测试报告生成时间: 2026-07-19 00:20 CST 本机显卡: NVIDIA GeForce RTX 4070 Laptop GPU (8GB) 驱动版本: 566.26 当前状态: ⚠️ PyTorch为CPU版本(2.12.0),需升级以启用GPU加速
染指111022 天前
人工智能·llama·rag·llama_index·llamaindex
61.RAG-RAG存在的问题内容参考于:图灵AI大模型全栈RAG它实际上存在一些问题,需要考虑这些问题该怎样解决RAG的流程1.加载文件