llama

qyyyyy5704 天前
数据库·pdf·json·erlang·llama
PDF 转 JSON 怎么做?从表格和元数据提取到 LLM 结构化处理摘要: PDF 适合阅读,却不天然等于结构化数据。本文从页面文本、坐标与表格的差异出发,给出“翻译辅助理解—PDF 转 JSON—Schema 设计—清洗校验—接入 LLM 或知识库”的完整流程,并说明复杂表格、公式、扫描件和跨页结构为什么仍需人工抽检。
薛定e的猫咪4 天前
人工智能·深度学习·算法·llama
【大模型量化】使用 llama.cpp 完成量化、本地推理与服务化部署大模型时代,我们总在追求更大的参数规模、更强的算力硬件,但落到真实的工业场景里,成本与投入产出比永远是绕不开的命题。
CODER03044 天前
开发语言·python·llama
win11系统编译安装cuda版llama-cpp-python(踩完所有的坑)①下载地址:https://aka.ms/vs/17/release/vs_Community.exe ②安装界面选择工作负载:在“工作负载”选项卡中,必须勾选“使用 C++ 的桌面开发”。 ③勾选单个组件(重要):切换到“单个组件”选项卡,搜索并勾选 C++ CMake tools for Windows。这是确保 CMake 能正常找到 Visual Studio 编译器的重要组件。
今天吃饺子5 天前
大语言模型·llama·故障诊断
超高创新模型!TF-SAX-Llama 轴承故障诊断近年来,大语言模型火得一塌糊涂,写文案、敲代码、做图样样都行。于是很多人开始琢磨:能不能把大模型用在工业故障诊断上?
明月千里赴迢遥6 天前
llama
Node搭建代理清洗API请求下面是一份从零开始的完整教程,基于 Ubuntu 环境,手把手带你用 Node 写一个本地代理,把 Claude Code 发出的请求体清洗成 DeepSeek 兼容端点能识别的格式,解决 400 报错。核心清洗逻辑来自 的“白名单 + block 级规范化 + system 归位 + 去 beta 头”四板斧。
Rei22486 天前
linux·运维·llama
使用llama.cpp的Qwen3.6-27B-Q8本地部署详解【Linux GPU】0. 检查cmake,cuda的安装情况及版本 cmake更新,参考:https://askubuntu.com/questions/829310/how-to-upgrade-cmake-in-ubuntu cmake --version无结果,ln一下(注意cmake版本):
蛋先生DX6 天前
llm·llama·ollama
大模型本地部署神器的瘦身进阶原理,就这两招?温馨提示:另有配套视频版,附带图解演示,观感不同,欢迎到各大视频平台搜索同名标题或【蛋先生说识】丹尼尔:蛋兄,本地跑大模型,有啥好工具推荐不?
爱学习的小白柏7 天前
java·网络·人工智能·windows·sql·架构·llama
【AI问数技术】多Agent协同架构:查询规划/SQL生成/洞察分析/报告生成一个真实场景:用户问"帮我分析一下上个月经营情况,和去年同期对比,找出主要问题,给出改善建议"。这个问题需要:①理解"经营情况"包含哪些指标;②生成多条SQL(收入/成本/利润/客户/产品);③执行查询并对比同比数据;④分析差异、归因;⑤生成结构化报告+可视化+建议。
qy2016skq8 天前
langchain·prompt·aigc·embedding·ai编程·llama·agi
OpenClaw 源码解读——入门与破局9 双插件协同:Quota Guard 负责“停“,Model Router 负责“绕“前两篇我们分别把 Quota Guard(熔断)和 Model Router(切换)挂进了 Worker 执行链路。 这一篇讲它们同时在 Worker 里工作时怎么分工、怎么配合,以及 Manager 侧如何消费 插件状态做任务编排——把"基础设施故障"变成"任务自动降级 + 人工精准介入"的完整闭环。
CHPCWWHSU8 天前
llama
llama.cpp + DeepSeek-Harness 构建本地大模型推理与Agent智能体系统llama.cpp 是本地大模型推理的高效后端引擎,而 LM Studio 则通过图形化界面与 API 服务,对 llama.cpp 的 GGUF 模型格式提供了深度集成与封装,显著降低了本地模型的部署与调用门槛。DeepSeek-Harness 是 DeepSeek AI 推出的开源 Agent 智能体框架,其核心理念为“一切皆插件”——模型、工具、界面及智能体行为均可按需添加、移除或替换。该插件式架构由 Cordis 驱动,使开发者能够精细掌控 Agent 的执行逻辑,而非受限于固定工作流。本章将围绕
weipt9 天前
linux·服务器·llama
从ollama到llama.cpp如果你用过ollama,那你不妨再来玩玩llama.cpp,这个更强悍,为了继续使用原来在ollama下载的模型,只需要运行以下bat文件即可
wulitoud10 天前
人工智能·llama·claude·本地模型
把 Claude、Codex、Gemini 的引擎换成本地模型:免费、离线、数据不出本机之前写过两篇 RunJam 的文章(github上的开源项目),一篇讲一个窗口跑 Claude Code、Codex、Gemini,一篇讲让 Claude 接 DeepSeek API 省钱。这篇说另一个玩法:把这三个 agent 全接到本地模型上,完全不花钱,代码也不出本机。
goodlook012311 天前
llama
LLaMa factory 大模型高效微调(三)train_config.jsonds_config.jsondataset_info.json 注册数据集配置
zyl8372113 天前
llama
LLaMA‑Factory 使用条件 + 学习手册LLaMA‑Factory:一站式大模型微调框架,支持 SFT、DPO、ORPO、KTO、PPO、预训练,支持百种大模型,提供 WebUI 可视化,支持 LoRA / QLoRA 高效微调。 项目仓库:https://github.com/hiyouga/LLaMA‑Factory 官方中文文档:https://llamafactory.readthedocs.io/zh‑cn/latest/
福大大架构师每日一题13 天前
android·java·llama
ollama v0.32.14正式发布:WebP 自动转码、Qwen 系统消息兼容升级与 llama.cpp、MLX 更新全解析2026 年 8 月 17 日,ollama 发布 v0.32.14。此次版本更新共包含 5 次提交,涉及 10 个文件,整体变更为 341 行新增、530 行删除。
微软技术分享14 天前
windows·llama
Windows 环境下 llama.cpp 编译运行指南在大模型落地场景中,本地轻量化部署因低延迟、高隐私性、无需依赖云端算力等优势,成为开发者与 AI 爱好者的热门需求。本文聚焦 Windows 环境,详细拆解 llama.cpp 工具的编译流程,并指导如何通过 modelscope 下载 GGUF 格式的模型,最终实现模型本地启动与 API 服务搭建。
刻BITTER13 天前
人工智能·llama·openvino
让 Intel NPU 跑AI 大模型?一次 llama.cpp OpenVINO 后端的完整实测机器:Intel Core Ultra 9 275HX + RTX 5070 Ti Laptop我们的离线 PDF 转 Markdown 项目用 llama.cpp 加载 OvisOCR2(0.8B 视觉文档解析模型), CUDA 后端 + RTX 5070 Ti 已经跑得飞快(单页约 2 秒)。某天听到一个说法:llama.cpp 可以用 Intel CPU 内置的 NPU 当推理后端,底层是 OpenVINO。核显之外的免费算力,听着 很诱人——于是有了这次探索。结论先放前面:最终没跑成,但把整条链路
zhy2956314 天前
人工智能·dnn·llama
【DNN】Llama 3.2 1B模型LORA微调与QAIRT部署由于是为了演示LORA的训练流程,这里选择1000个数据集。即使用一下命令`python convert_dataset.py --input alpaca_gpt4_data_zh.csv --output-dir . --max-samples 1000
Flynt14 天前
开源·llm·llama
花一下午把Qwen3.8-27B跑在本地,最坑的不是显存8月14号周四下午刷到Qwen3.8-27B开源的消息,没太当回事——又是个"27B打Claude"的标题党对吧。 结果到了晚上,量子位、机器之心全在推,Hugging Face趋势榜直接冲到第一。翻了翻官方的benchmark数据,SWE-bench Pro 61.7分,比Claude Opus 4.6 Max的53.4高了8分多。QwenSWEBench更离谱,79.0对63.8,领先15分。 这就不是一句"营销跑分"能解释的了。 行吧,反正周末没事,下载跑一下看看。
uncle_ll15 天前
llm·nlp·llama·ollama·大模型微调
Llama 3 私有化落地全栈实战:从 Ollama 极速部署到 LLaMA Factory LoRA 定制微调在前沿生成式 AI 的落地应用中,开发者常面临两大工程痛点:本文将围绕开源大模型基座 Llama 3,提供一条“推理部署 + 轻量微调”的完整闭环方案:采用Ollama构建零门槛本地 API 服务,结合LLaMA Factory框架完成低算力消耗的 LoRA 参数高效微调(PEFT)。