llm

武子康1 小时前
人工智能·llm·agent
Pi 怎样决定模型看见什么:AGENTS.md、SYSTEM.md 与 Skills 的加载边界你在仓库根目录告诉 Agent:“修改后运行单测。”进入 services/payment/ 后,它又遵循 “禁止运行全量测试”;调用数据库迁移 Skill 时,第三份说明要求先连接生产库做探测。 三条规则都真实存在,问题却不是“Prompt 写得够不够好”,而是:本轮到底加载了哪些 资源、以什么顺序加载、它们是否可信,以及冲突发生时谁负责停止执行。
Revolution611 小时前
llm·github·deepseek
DeepSeek Harness 最近上线:Everything is a Plugin 有什么特别之处最近 DeepSeek 公开了 DeepSeek Harness(dsh) 的 Developer Preview,并开放了源码。官方给它的定位是 Agent Harness,也就是模型之外负责组织工具、Session、执行环境、权限和运行流程的一层基础设施。项目目前仍处于快速迭代阶段,官方明确提醒后续会存在兼容性变更。(GitHub)
武子康2 小时前
人工智能·llm·agent
从 DeepSeek Harness 看:Tool 注册成功,为什么还不等于安全可用一个工具出现在模型的 Tool 列表里,只能证明一件事:模型可能知道它叫什么、接收什么参数。它不能证明 Provider 已经装载,不能证明参数经过审批,不能证明 Sandbox 覆盖网络和进程,更不能证明工具执行到一半失败时,外部文件、数据库或云资源已经回滚。
海天一色y2 天前
人工智能·llm·sglang
Sglang本地部署Qwen3.5-9B模型随着大语言模型(LLM)的快速发展,模型规模不断增大,对推理部署的要求也越来越高。如何在本地高效地部署和运行大模型,已成为许多开发者和AI从业者面临的核心挑战之一。本文将详细介绍如何使用 SGLang 推理框架在本地部署 Qwen3.5-9B 大模型,从环境准备到服务调用的完整流程。
XLYcmy16 小时前
rnn·神经网络·llm·微调·transformer·训练·对齐
京东 算法实习一面 上八股:Transformer完全基于注意力机制,摒弃了循环和卷积操作。Transformer出来之前,主流的序列转换模型都基于复杂的循环神经网络(RNN),包含编码器和解码器两部分。当时表现最好的模型还通过注意力机制将编码器和解码器连接起来。
武子康21 小时前
人工智能·llm·agent
DeepSeek 把 Agent Core 也插件化了:Harness 的真正赌注假设同一个团队要做两个 Agent 产品。一个通过 Web 界面工作,会话存进 SQLite,允许使用 Bash 和文件工具;另一个只跑一次性任务, 会话写入 JSONL,禁止本地 Shell,通过 Python SDK 调用。再过一段时间,第二个产品甚至想换掉默认 Agent Loop。
liulilittle1 天前
c++·ai·llm·内存·memory·core·kernel
LLM 推理引擎与内核系统工程原理摘要:本文从计算机系统的基础理论出发,系统阐述大语言模型推理引擎与内核工程的原理体系。核心论点是:decode 的性能由内存带宽决定而非算力决定,帧时间等于活跃权重字节数除以有效带宽;由此推出全部工程手段的分类——量化削减字节、批处理摊薄字节、预取提高有效带宽、卸载改变带宽档位、投机解码减少搬运次数、分页管理 KV 容量。全文以一次推理请求的生命周期为线索:硬件存储层次(第二章)→ 带宽瓶颈的推导与实测(第三章)→ 计算分解(第四章)→ 调度与批处理(第五章)→ KV cache 与分页显存(第六章)→
orangerot1 天前
llm
Prompt Engineering六大核心原则全文约6000字,预计需要25-30分钟阅读。核心定义: Prompt Engineering(提示词工程)是一种设计输入的实践,目的是从大语言模型中获得可靠、高质量的输出。
张彦峰ZYF2 天前
人工智能·llm·agent·react·langgroup
LangGraph 深入理解 ReAct:让 AI Agent 真正学会「边想边做」目录一、LLM 给出的答案,究竟是“查到的”还是“写出来的”?二、为什么需要 ReAct:模型的两个天然短板
想要成为糕糕手2 天前
react.js·typescript·llm
🚀 在浏览器里跑 DeepSeek-R1?WebGPU 端侧推理实战(六)—— 完结篇:消息渲染与流式收尾📌 上篇回顾:我们打通了推理全链路——中断控制、KV 缓存加速、双回调流式输出、思考标签识别,Worker 侧已经把文字推到了主线程门口。 🎯 本篇目标:把文字变成真正的聊天气泡——消息渲染、思考折叠、流式填充、自适应输入框、粘性滚动、TS 类型化,以及一路踩过的坑。 📌 系列完结:六篇文章,从项目骨架到完整聊天应用,一篇不多,一篇不少。本篇是终点。
AndrewHZ2 天前
人工智能·深度学习·算法·llm·检索增强·生成式模型·rag
【LLM技术全景】RAG 从原理到实战——检索增强生成完整指南本篇是「应用实战篇」第 3 篇。前两篇我们分别解决了"如何让模型听指令"(第21篇 Prompt Engineering)和"如何让模型调工具"(第22篇 Function Calling)。但还有一个更普遍的需求:让模型回答它没学过、或知识已过时的问题。这正是 RAG(Retrieval-Augmented Generation,检索增强生成)的主场——先检索、再生成。
liulilittle2 天前
前端·javascript·人工智能·windows·llm·deepseek·harness
DeepSeek Harness 自定义模型提供商配置适用版本:deepseek-harness 0.1.0-rc.5(源码部署) 本文所有事实均来自仓库源码与实测验证,关键出处以 文件:行号 标注。
tachibana22 天前
人工智能·ai·大模型·llm·prompt
文件上传分布式限流如何做?在微服务与云原生架构中,文件上传是典型的网络密集型(Network-Intensive)与 IO 密集型(IO-Intensive)业务。传统的 API 限流手段通常基于请求频次(QPS)进行控制,这在普通 JSON/Form 接口场景下效果显著。然而在文件上传场景中,仅仅限制 QPS 存在致命盲区:一个 1KB 的元数据查询请求与一个 2GB 的高清视频上传请求,对系统网卡带宽、内存缓冲区、磁盘 IOPS 以及后端对象存储造成的压力相差数百万倍。
浮生望2 天前
llm
Harness 工程:用 Best of N Sampling + LLM as Judge 构建自动化代码生成流水线将LLM生成、评测、择优三阶段解耦为流水线,通过Best of N Sampling并行生成候选、LLM as Judge自动评分,实现prompt到最优代码的闭环筛选,解决LLM输出不稳定问题。
To_OC2 天前
人工智能·llm·agent
别死磕 Prompt 了!我用 Harness 流水线,让大模型自动产出高质量代码前阵子用大模型批量写工具函数,踩了个巨恶心的坑。就拿最简单的数组去重来说,同一句提示词丢进去,三次生成的结果里总有一两个藏着暗坑 —— 要么没处理 NaN,要么对象引用去重逻辑写错,更气人的是有时候表面能跑,边界情况直接拉胯。我得挨个复制出来跑测试、改 bug,一下午净干重复活了。
qpsj3 天前
python·llm
让 LLM 控制 AutoCAD/ZWCAD:COM 自动化 + MCP 封装上一篇定了调:让 LLM 操作 CAD,AutoCAD 的 COM 是 ROI 最高的一条——半天能打通,ZWCAD 白捡。这篇把它拆开,从"坐标传不进去"这个坑讲起,把 API 挨个过一遍,最后讲怎么把这些能力封装成 LLM 能调的 MCP 工具。所有代码都是实测跑通的,不是文档抄的。
demo007x3 天前
程序员·llm·agent
CoT(Chain-of-Thought)大语言模型(LLM)中广泛研究和应用的一种方法,用于增强模型的推理能力和解决复杂问题的能力。与直接生成答案的方式相比,思维链能够帮助模型以类人逻辑的方式逐步拆解问题,逐步推导最终答案。
qpsj3 天前
人工智能·llm
让 LLM 操作 CAD:四条技术路线的取舍给 agent 接 CAD 能力这件事,我一开始把重心放错了。我以为难点在"让 LLM 听懂'画一个 300×200 的钢板'这种话",于是花了很多时间调 prompt、设计 JSON schema。两周跑下来发现,语义理解是整条链路上最不值一提的一环——真正的坑全在 CAD 那一侧:坐标为什么非得是 VARIANT、插件为什么必须放安装目录、三维建模为什么只能在主线程、几十万张 DWG 凭什么这么难读。这些脏活,跟 LLM 一点关系都没有。