技术栈
llm
uncle_ll
2 小时前
llm
·
nlp
·
llama
·
ollama
·
大模型微调
Llama 3 私有化落地全栈实战:从 Ollama 极速部署到 LLaMA Factory LoRA 定制微调
在前沿生成式 AI 的落地应用中,开发者常面临两大工程痛点:本文将围绕开源大模型基座 Llama 3,提供一条“推理部署 + 轻量微调”的完整闭环方案:采用Ollama构建零门槛本地 API 服务,结合LLaMA Factory框架完成低算力消耗的 LoRA 参数高效微调(PEFT)。
Smoothcloud_润云
3 小时前
llm
·
agent
·
gpu
从“模型服务”到“Agent 调度”:AI 推理基础设施为什么正在重构?
2026 年,AI 应用正在从“问一句、答一句”,快速进入 Agent 时代。过去,大模型推理服务的目标很明确:
武子康
4 小时前
人工智能
·
llm
·
agent
GPT-Live 分析研究:从回合式语音到连续交互循环
一个语音 Agent 可以做到 300 毫秒出声,仍然可能很难用。用户只是停下来想了半秒,它抢着回答;用户说“等等”,它要到整段 TTS 播完才停;搜索需要十几秒,会话就像断线;后台结果回来时,用户已经换了问题,它却继续念旧答案。这些体验并不主要由音色或单段模型延迟决定,而是因为系统仍把对话理解成一串整齐的回合:先听完,再理解,再回答。
ShallWeL
2 天前
人工智能
·
机器学习
·
大模型
·
llm
·
本地部署
【机器学习】(39)—— 部署测试
摘要:模型文件导出成功,并不等于可以安全替换线上版本。部署测试需要覆盖输入数据、特征工程、新模型质量、服务基础设施,以及流水线组件之间的集成。本文说明可复现训练、接口快速校验、端到端集成、突然退化与缓慢退化门禁,以及模型与服务环境的兼容性检查,并结合汽车油耗与工单分类给出发布核对清单。适合读完特征变换与训练—服务偏差、准备发版的读者。
CoderJia程序员甲
4 小时前
ai
·
大模型
·
llm
·
github
GitHub 热榜项目 - 周榜(2026-08-16)
生成于:2026-08-16共发现热门项目: 16 个Token赞助:siliconflow前些天发现了一个巨牛的人工智能学习网站,通俗易懂,风趣幽默,忍不住分享一下给大家。点击跳转到网站。
武子康
5 小时前
人工智能
·
llm
·
agent
给 Pi 增加能力时,应该写 Prompt、Skill、Tool 还是 Extension?
团队想统一发布流程,于是有人提议“写一个插件”:它要提醒检查清单、读取团队规范、 执行发布命令、拦截危险参数,还要让每个人一键安装。听起来只是一个需求,实际上混合了 五种职责。如果全部塞进一个高权限插件,改一句提示词也要重发代码;如果全部写进 Markdown,真正危险的命令又只能依赖模型“记得不要做”。
tachibana2
5 小时前
大数据
·
人工智能
·
ai
·
大模型
·
llm
·
prompt
怎么让大模型同时给意图节点打分
摘要:在智能客服、任务型对话系统(Task-Oriented Dialogue)、智能体工作流(Agent Routing)以及复杂问答路由场景中,用户输入往往具有多意图混合、表述模糊、隐含诉求等特点。传统的单分类模型或串行单一意图匹配,不仅难以应对意图重叠,还会带来巨大的延迟与 Token 开销。
XLYcmy
6 小时前
llm
·
sft
·
强化学习
·
多模态
·
损失函数
·
visual r1
·
奖励机制
小红书 算法一面 三
# Visual R1 原理与 MLLM RL 方案设计全解析## 一、Visual R1 核心实现原理
罗高
20 小时前
llm
·
agent
AI Agent 可观测性完全指南:遥测、追踪、指标与评估
译注: 本文翻译自 groundcover 技术博客。原文链接:AI Agent Observability: Key Concepts, Challenges & Best Practices。译文在保留原文核心观点的基础上进行了意译润色,并保留了所有原始配图。
罗高
21 小时前
llm
·
agent
评估 AI Agent 技能:用 Langfuse 让技能质量变得可衡量
译注: 本文翻译自 Langfuse 技术博客,原作者 Lotte Verheyden。原文链接:Evaluating AI Agent Skills。译文在保留原文核心观点的基础上进行了意译润色,并保留了所有原始配图。
罗高
21 小时前
llm
评估 AI Agent 技能的框架:如何量化技能对代理性能的真实影响
译注: 本文翻译自 Tessl 技术博客,原作者 Maksim Shaposhnikov。原文链接:A Proposed Framework For Evaluating Skills。译文在保留原文核心观点的基础上进行了意译润色,并保留了所有原始配图。
小林ixn
21 小时前
react.js
·
llm
·
浏览器
在浏览器里跑 DeepSeek-R1:WebGPU + Transformers.js 实战
最近在折腾一个有意思的项目:让 DeepSeek-R1 推理模型直接在浏览器里运行,不需要服务器,数据不出本机,甚至断网后还能用。听起来很酷对吧?经过一番踩坑,我终于把 HuggingFace 官方示例 完整跑通,并梳理出了其中的关键技术和实现细节。
XLYcmy
21 小时前
llm
·
sft
·
memory
·
多模态
·
位置编码
·
grpo
·
视觉数据
小红书 算法一面 二
### 二、视觉数据Memory设计核心解析视觉数据的核心特征是**空间结构化(图像是2D网格)、时序动态性(视频是3D时空)、高维度(像素/patch特征维度高)**,这和NLP的一维序列数据有本质区别。因此视觉memory的设计核心是:**在保留时空结构的前提下,高效存储、检索和复用多粒度视觉特征,平衡存储容量、检索效率和任务效果**。
CodeBlog-star
1 天前
人工智能
·
python
·
开源
·
llm
LLM能力与边界:多模态、幻觉、上下文窗口及开源模型对比
摘要:当前大语言模型(LLM)能力突飞猛进,多模态、长上下文、工具调用等功能令人眼花缭乱,但幻觉、上下文窗口有限等问题依然困扰开发者。本文系统梳理LLM的核心能力与典型边界,并通过表格对比国内外主流开源模型(Llama 3.1/3.2、Qwen2.5、DeepSeek-V3、ChatGLM3、Gemma 2等)的上下文窗口、模态支持与开源协议,帮助开发者理性选型。建议收藏,选型避坑必读。
冬奇Lab
1 天前
人工智能
·
llm
·
agent
Code Agent 解剖(02):agent 是怎么一轮一轮思考和行动的?
最简单的 LLM 调用是这样的:这能完成简单问答,但不能完成"帮我重构这个函数并跑一遍测试"这类任务——因为它涉及多个步骤:读文件、改代码、执行命令、根据结果决定下一步。每一步的输入依赖上一步的输出,而模型不能一次性预知所有步骤。
武子康
1 天前
人工智能
·
llm
·
agent
Pi 怎样决定模型看见什么:AGENTS.md、SYSTEM.md 与 Skills 的加载边界
你在仓库根目录告诉 Agent:“修改后运行单测。”进入 services/payment/ 后,它又遵循 “禁止运行全量测试”;调用数据库迁移 Skill 时,第三份说明要求先连接生产库做探测。 三条规则都真实存在,问题却不是“Prompt 写得够不够好”,而是:本轮到底加载了哪些 资源、以什么顺序加载、它们是否可信,以及冲突发生时谁负责停止执行。
Revolution61
1 天前
llm
·
github
·
deepseek
DeepSeek Harness 最近上线:Everything is a Plugin 有什么特别之处
最近 DeepSeek 公开了 DeepSeek Harness(dsh) 的 Developer Preview,并开放了源码。官方给它的定位是 Agent Harness,也就是模型之外负责组织工具、Session、执行环境、权限和运行流程的一层基础设施。项目目前仍处于快速迭代阶段,官方明确提醒后续会存在兼容性变更。(GitHub)
武子康
1 天前
人工智能
·
llm
·
agent
从 DeepSeek Harness 看:Tool 注册成功,为什么还不等于安全可用
一个工具出现在模型的 Tool 列表里,只能证明一件事:模型可能知道它叫什么、接收什么参数。它不能证明 Provider 已经装载,不能证明参数经过审批,不能证明 Sandbox 覆盖网络和进程,更不能证明工具执行到一半失败时,外部文件、数据库或云资源已经回滚。
海天一色y
3 天前
人工智能
·
llm
·
sglang
Sglang本地部署Qwen3.5-9B模型
随着大语言模型(LLM)的快速发展,模型规模不断增大,对推理部署的要求也越来越高。如何在本地高效地部署和运行大模型,已成为许多开发者和AI从业者面临的核心挑战之一。本文将详细介绍如何使用 SGLang 推理框架在本地部署 Qwen3.5-9B 大模型,从环境准备到服务调用的完整流程。
XLYcmy
2 天前
rnn
·
神经网络
·
llm
·
微调
·
transformer
·
训练
·
对齐
京东 算法实习一面 上
八股:Transformer完全基于注意力机制,摒弃了循环和卷积操作。Transformer出来之前,主流的序列转换模型都基于复杂的循环神经网络(RNN),包含编码器和解码器两部分。当时表现最好的模型还通过注意力机制将编码器和解码器连接起来。