llm

uncle_ll2 小时前
llm·nlp·llama·ollama·大模型微调
Llama 3 私有化落地全栈实战:从 Ollama 极速部署到 LLaMA Factory LoRA 定制微调在前沿生成式 AI 的落地应用中,开发者常面临两大工程痛点:本文将围绕开源大模型基座 Llama 3,提供一条“推理部署 + 轻量微调”的完整闭环方案:采用Ollama构建零门槛本地 API 服务,结合LLaMA Factory框架完成低算力消耗的 LoRA 参数高效微调(PEFT)。
Smoothcloud_润云3 小时前
llm·agent·gpu
从“模型服务”到“Agent 调度”:AI 推理基础设施为什么正在重构?2026 年,AI 应用正在从“问一句、答一句”,快速进入 Agent 时代。过去,大模型推理服务的目标很明确:
武子康4 小时前
人工智能·llm·agent
GPT-Live 分析研究:从回合式语音到连续交互循环一个语音 Agent 可以做到 300 毫秒出声,仍然可能很难用。用户只是停下来想了半秒,它抢着回答;用户说“等等”,它要到整段 TTS 播完才停;搜索需要十几秒,会话就像断线;后台结果回来时,用户已经换了问题,它却继续念旧答案。这些体验并不主要由音色或单段模型延迟决定,而是因为系统仍把对话理解成一串整齐的回合:先听完,再理解,再回答。
ShallWeL2 天前
人工智能·机器学习·大模型·llm·本地部署
【机器学习】(39)—— 部署测试摘要:模型文件导出成功,并不等于可以安全替换线上版本。部署测试需要覆盖输入数据、特征工程、新模型质量、服务基础设施,以及流水线组件之间的集成。本文说明可复现训练、接口快速校验、端到端集成、突然退化与缓慢退化门禁,以及模型与服务环境的兼容性检查,并结合汽车油耗与工单分类给出发布核对清单。适合读完特征变换与训练—服务偏差、准备发版的读者。
CoderJia程序员甲4 小时前
ai·大模型·llm·github
GitHub 热榜项目 - 周榜(2026-08-16)生成于:2026-08-16共发现热门项目: 16 个Token赞助:siliconflow前些天发现了一个巨牛的人工智能学习网站,通俗易懂,风趣幽默,忍不住分享一下给大家。点击跳转到网站。
武子康5 小时前
人工智能·llm·agent
给 Pi 增加能力时,应该写 Prompt、Skill、Tool 还是 Extension?团队想统一发布流程,于是有人提议“写一个插件”:它要提醒检查清单、读取团队规范、 执行发布命令、拦截危险参数,还要让每个人一键安装。听起来只是一个需求,实际上混合了 五种职责。如果全部塞进一个高权限插件,改一句提示词也要重发代码;如果全部写进 Markdown,真正危险的命令又只能依赖模型“记得不要做”。
tachibana25 小时前
大数据·人工智能·ai·大模型·llm·prompt
怎么让大模型同时给意图节点打分摘要:在智能客服、任务型对话系统(Task-Oriented Dialogue)、智能体工作流(Agent Routing)以及复杂问答路由场景中,用户输入往往具有多意图混合、表述模糊、隐含诉求等特点。传统的单分类模型或串行单一意图匹配,不仅难以应对意图重叠,还会带来巨大的延迟与 Token 开销。
XLYcmy6 小时前
llm·sft·强化学习·多模态·损失函数·visual r1·奖励机制
小红书 算法一面 三# Visual R1 原理与 MLLM RL 方案设计全解析## 一、Visual R1 核心实现原理
罗高20 小时前
llm·agent
AI Agent 可观测性完全指南:遥测、追踪、指标与评估译注: 本文翻译自 groundcover 技术博客。原文链接:AI Agent Observability: Key Concepts, Challenges & Best Practices。译文在保留原文核心观点的基础上进行了意译润色,并保留了所有原始配图。
罗高21 小时前
llm·agent
评估 AI Agent 技能:用 Langfuse 让技能质量变得可衡量译注: 本文翻译自 Langfuse 技术博客,原作者 Lotte Verheyden。原文链接:Evaluating AI Agent Skills。译文在保留原文核心观点的基础上进行了意译润色,并保留了所有原始配图。
罗高21 小时前
llm
评估 AI Agent 技能的框架:如何量化技能对代理性能的真实影响译注: 本文翻译自 Tessl 技术博客,原作者 Maksim Shaposhnikov。原文链接:A Proposed Framework For Evaluating Skills。译文在保留原文核心观点的基础上进行了意译润色,并保留了所有原始配图。
小林ixn21 小时前
react.js·llm·浏览器
在浏览器里跑 DeepSeek-R1:WebGPU + Transformers.js 实战最近在折腾一个有意思的项目:让 DeepSeek-R1 推理模型直接在浏览器里运行,不需要服务器,数据不出本机,甚至断网后还能用。听起来很酷对吧?经过一番踩坑,我终于把 HuggingFace 官方示例 完整跑通,并梳理出了其中的关键技术和实现细节。
XLYcmy21 小时前
llm·sft·memory·多模态·位置编码·grpo·视觉数据
小红书 算法一面 二### 二、视觉数据Memory设计核心解析视觉数据的核心特征是**空间结构化(图像是2D网格)、时序动态性(视频是3D时空)、高维度(像素/patch特征维度高)**,这和NLP的一维序列数据有本质区别。因此视觉memory的设计核心是:**在保留时空结构的前提下,高效存储、检索和复用多粒度视觉特征,平衡存储容量、检索效率和任务效果**。
CodeBlog-star1 天前
人工智能·python·开源·llm
LLM能力与边界:多模态、幻觉、上下文窗口及开源模型对比摘要:当前大语言模型(LLM)能力突飞猛进,多模态、长上下文、工具调用等功能令人眼花缭乱,但幻觉、上下文窗口有限等问题依然困扰开发者。本文系统梳理LLM的核心能力与典型边界,并通过表格对比国内外主流开源模型(Llama 3.1/3.2、Qwen2.5、DeepSeek-V3、ChatGLM3、Gemma 2等)的上下文窗口、模态支持与开源协议,帮助开发者理性选型。建议收藏,选型避坑必读。
冬奇Lab1 天前
人工智能·llm·agent
Code Agent 解剖(02):agent 是怎么一轮一轮思考和行动的?最简单的 LLM 调用是这样的:这能完成简单问答,但不能完成"帮我重构这个函数并跑一遍测试"这类任务——因为它涉及多个步骤:读文件、改代码、执行命令、根据结果决定下一步。每一步的输入依赖上一步的输出,而模型不能一次性预知所有步骤。
武子康1 天前
人工智能·llm·agent
Pi 怎样决定模型看见什么:AGENTS.md、SYSTEM.md 与 Skills 的加载边界你在仓库根目录告诉 Agent:“修改后运行单测。”进入 services/payment/ 后,它又遵循 “禁止运行全量测试”;调用数据库迁移 Skill 时,第三份说明要求先连接生产库做探测。 三条规则都真实存在,问题却不是“Prompt 写得够不够好”,而是:本轮到底加载了哪些 资源、以什么顺序加载、它们是否可信,以及冲突发生时谁负责停止执行。
Revolution611 天前
llm·github·deepseek
DeepSeek Harness 最近上线:Everything is a Plugin 有什么特别之处最近 DeepSeek 公开了 DeepSeek Harness(dsh) 的 Developer Preview,并开放了源码。官方给它的定位是 Agent Harness,也就是模型之外负责组织工具、Session、执行环境、权限和运行流程的一层基础设施。项目目前仍处于快速迭代阶段,官方明确提醒后续会存在兼容性变更。(GitHub)
武子康1 天前
人工智能·llm·agent
从 DeepSeek Harness 看:Tool 注册成功,为什么还不等于安全可用一个工具出现在模型的 Tool 列表里,只能证明一件事:模型可能知道它叫什么、接收什么参数。它不能证明 Provider 已经装载,不能证明参数经过审批,不能证明 Sandbox 覆盖网络和进程,更不能证明工具执行到一半失败时,外部文件、数据库或云资源已经回滚。
海天一色y3 天前
人工智能·llm·sglang
Sglang本地部署Qwen3.5-9B模型随着大语言模型(LLM)的快速发展,模型规模不断增大,对推理部署的要求也越来越高。如何在本地高效地部署和运行大模型,已成为许多开发者和AI从业者面临的核心挑战之一。本文将详细介绍如何使用 SGLang 推理框架在本地部署 Qwen3.5-9B 大模型,从环境准备到服务调用的完整流程。
XLYcmy2 天前
rnn·神经网络·llm·微调·transformer·训练·对齐
京东 算法实习一面 上八股:Transformer完全基于注意力机制,摒弃了循环和卷积操作。Transformer出来之前,主流的序列转换模型都基于复杂的循环神经网络(RNN),包含编码器和解码器两部分。当时表现最好的模型还通过注意力机制将编码器和解码器连接起来。