llm

温暖的苹果2 小时前
ai·llm·agent·vibecoding·opencode
opencode 配置完全指南:配置文件、目录与字段详解一份面向 opencode 用户的配置指南:讲清楚配置写在哪里、每个字段是干什么的、provider / skill / plugin / command / 自定义工具各自从哪些目录被自动发现,以及合并优先级。文末附一章内部实现原理,供想深挖的读者参考。
七点半.7 小时前
人工智能·llm
LLM 工程能力LLM内部是怎么工作的? 人工智能与LLM基础理论接下来开始:作为开发者,我怎么控制LLM?先建立一个非常重要的认知: Prompt不是:
修远客9 小时前
llm·agent
对话式修改:Agent的人机协作模式 — Chat as Interface,对话不是聊天,是最高效的人机协作方式生成一篇文章只需要一次 LLM 调用,但改好一篇文章往往需要多轮对话。很多人做内容生成 Agent,生成完就结束了 — 用户不满意只能"重新生成",结果每次都是一篇全新的文章,之前的风格、结构、措辞全丢了。这不是协作,是抽奖。
武子康9 小时前
人工智能·llm·agent
机器人接入 AI 连续语音后,端云架构要改什么?摘要:连续语音进入机器人后,声音停止不等于播放、任务或物理动作同时停止。本文把系统拆成媒体、交互控制、物理动作三个平面,用五类身份、播放进度代理、动作准入和渐进迁移步骤重新建立端云一致性,并明确 IMPLEMENTED、VERIFIED 与 UNKNOWN 的证据边界。
tachibana29 小时前
数据库·人工智能·语言模型·自然语言处理·大模型·llm
大语言模型基础从概率论与统计学视角来看,语言模型(Language Model, LM)的目标是建立一个计算自然语言序列概率分布的数学模型。
阿里云云原生1 天前
llm
云原生 AI 基础设施演进:利用 Envoy Wasm 构建去中心化的 LLM 内容安全网关作者:王建伟(正己)生成式 AI 正在跨越“能不能用”的门槛,走向“如何规模化地安全使用”。Higress 项目现已以 Wasm 插件形式接入 Qwen3Guard-Gen。三句话说明它做了什么:
Novlan11 天前
llm
Transformer基于论文《Attention Is All You Need》(Vaswani et al., 2017)
逸Y 仙X1 天前
python·大模型·llm·ai编程·mcp
MCP(模型控制协议)完全指南:从核心概念到实战开发摘要:本文全面介绍了MCP(模型控制协议)的核心概念、架构设计与实战应用。MCP是由Anthropic提出的标准化协议,旨在解决AI应用与外部工具集成时的碎片化问题。文章首先阐述了MCP的背景、设计渊源和核心价值,然后详细解析了其基于JSON-RPC的通信架构、三大核心能力(Tools、Resources、Prompts),以及streamableHTTP和stdio两种通信方式。最后通过Python代码示例展示了如何开发MCP服务器,包括工具定义、资源管理和提示词模板的实现,为开发者提供了从理论到实践的
DigitalOcean1 天前
llm
DigitalOcean 推理路由器新增缓存感知能力:为什么最便宜的模型不一定最省钱Coinbase CEO Brian Armstrong 最近提出了一个问题,也是所有正在扩大 AI 使用规模的企业都在面对的问题:当 Token 用量呈指数增长时,怎样才能让 AI 支出保持基本不变?
众人皆醒我独醉1 天前
面试·llm·gpu
调和循环:kubectl apply 之后发生了什么KServe 源码拆解系列 · 第 3 篇第 2 篇里,predictor、transformer、explainer 安静地躺在一个 YAML 里。可你 kubectl apply 一按回车,这几百行配置就要在几秒内变成 Deployment、Service、VirtualService——谁在动手?顺序是什么?中途失败怎么办?本篇跟一次完整的调和循环:起点是 pkg/controller/v1beta1/inferenceservice/controller.go 的 Reconcile(),spec
KAIWEILIUCC1 天前
分布式·llm
Ray:高性能、易扩展的Python分布式计算框架在机器学习、数据科学和高性能计算领域,我们经常需要处理大规模的计算任务。传统的单机计算往往无法满足需求,而构建分布式系统又充满挑战。Ray作为一个现代化的分布式计算框架,以其简洁的API、强大的性能和丰富的生态系统,正在改变我们处理大规模计算任务的方式。本文将深入探讨Ray的核心概念、应用场景和最佳实践。
众人皆醒我独醉1 天前
面试·llm·gpu
从 Spec 到资源:Predictor/Transformer/Explainer 如何变成 DeploymentKServe 源码拆解系列 · 第 4 篇第 3 篇走完了调和循环主流程:事件进来,控制器按 spec 组装 reconciler 链,逐个组件调和。但"调和一个组件"这一步里发生了什么?你的 YAML 只有几行 predictor:、transformer:,集群里却长出了 Deployment、Service、探针、资源配额。意图声明(Spec)和集群现实(资源)之间的这段距离,就是本篇要拆的:组件构建器。结尾留下线头——模型怎么进 Pod——交给第 5 篇。
tachibana21 天前
数据库·人工智能·算法·机器学习·架构·大模型·llm
RAGAS 指标解读摘要:在检索增强生成(RAG)系统的研发过程中,“如何客观评估系统质量”是阻碍技术从 Demo 迈向生产级的最大难关。依赖工程师肉眼抽检(Eyeballing)不仅耗时费力,而且无法形成量化的 CI/CD 迭代基准。
a187927218311 天前
ai·大模型·llm·transformer·layernorm·deepseek·层归一化
从一条直线到大模型输出一个token(五):Transformer Block 全景与层归一化建议先看:从一条直线到大模型输出一个token(四):位置编码 RoPE上一篇末尾留了个悬念:「苹果」在"我吃了一个苹果"里是水果,在"苹果发布新手机"里是公司——同一个 token,含义要靠旁边的词决定。从这一篇开始,我们正式走进 Transformer 大厦,看词和词怎么"发生关系"。
谢白羽1 天前
llm·agent·tts·vllm·大模型部署
vLLM-Omni 部署 IndexTTS 2.51.第一阶段:autoregressive talker(自回归 Talker 模块) 输入文本,不直接生成音频,输出语义编码(semantic codes)。 语义编码是中间抽象表示:包含说话内容、韵律、停顿、音色信息,是离散 token 序列。
Komorebi_99991 天前
llm·rag
RAG23-RAG28所有文档加载器最终返回 Document 实例表格所有加载器都具备这两个方法。专门用来读取 csv 文件,每一行 csv 生成一个Document对象。
武子康1 天前
人工智能·llm·agent
单卡 A6000 跑 27B FP8:我把“能跑”拆成了五组证据我在一张 RTX A6000 48GB 上测了一套 27B FP8 的 vLLM 服务。跑分表第一眼很好看:长输出约 23.5 token/s,80 个 JSON Schema 样本全部通过,短时 soak 也是 100/100。
网络工程小王1 天前
人工智能·深度学习·机器学习·llm·qlora
【LLM开发实验】 QLoRA实现原理及实战虽然标准LoRA大幅减少了可训练参数 (parameter)的数量,但微调 (fine-tuning)大型语言模型仍构成主要的内存难题。主要瓶颈通常不是适配器权重 (weight)本身,而是加载庞大基础模型并进行计算所需的内存。即使模型被冻结,基础模型的权重(通常为FP16或BF16等16比特格式)也会占用大量GPU内存。
苹果二1 天前
llm·知识图谱·aiagent·能源领域
【案例说明】融合知识图谱、大语言模型和 AI Agent 完成能源领域知识工程工作今天以“海上风电场智能运维项目”为例,说明知识图谱、大语言模型和 AI Agent 如何共同完成知识工程工作。三者的分工可以概括为:
liulilittle1 天前
c++·人工智能·ai·llm·注意力·qkv
长上下文的成本结构与「甜点区间」——从推理引擎的物理约束看 200K/256K/400K摘要:1M 上下文是当前大模型最具营销力、也最容易被误读的指标。本文不讨论「能不能支持 1M」,而是讨论一个更实质的问题:在真实推理成本与能力衰减的双重约束下,什么长度是高效工作的甜点区间。 文中全部数值来自笔者从零实现的纯 CPU 推理引擎 llmx(目标模型 Qwen3.6-35B-A3B,40 层、词表 248320、GGUF Q4_K_XL 量化),以及公开的注意力复杂度结论。核心论点是:解码器的成本由「每 token 必须搬运的字节数」决定,而这个字节数在权重项上是常数、在上下文项上是线性的;当