llm

Novlan129 分钟前
llm
Transformer基于论文《Attention Is All You Need》(Vaswani et al., 2017)
逸Y 仙X1 小时前
python·大模型·llm·ai编程·mcp
MCP(模型控制协议)完全指南:从核心概念到实战开发摘要:本文全面介绍了MCP(模型控制协议)的核心概念、架构设计与实战应用。MCP是由Anthropic提出的标准化协议,旨在解决AI应用与外部工具集成时的碎片化问题。文章首先阐述了MCP的背景、设计渊源和核心价值,然后详细解析了其基于JSON-RPC的通信架构、三大核心能力(Tools、Resources、Prompts),以及streamableHTTP和stdio两种通信方式。最后通过Python代码示例展示了如何开发MCP服务器,包括工具定义、资源管理和提示词模板的实现,为开发者提供了从理论到实践的
DigitalOcean1 小时前
llm
DigitalOcean 推理路由器新增缓存感知能力:为什么最便宜的模型不一定最省钱Coinbase CEO Brian Armstrong 最近提出了一个问题,也是所有正在扩大 AI 使用规模的企业都在面对的问题:当 Token 用量呈指数增长时,怎样才能让 AI 支出保持基本不变?
众人皆醒我独醉2 小时前
面试·llm·gpu
调和循环:kubectl apply 之后发生了什么KServe 源码拆解系列 · 第 3 篇第 2 篇里,predictor、transformer、explainer 安静地躺在一个 YAML 里。可你 kubectl apply 一按回车,这几百行配置就要在几秒内变成 Deployment、Service、VirtualService——谁在动手?顺序是什么?中途失败怎么办?本篇跟一次完整的调和循环:起点是 pkg/controller/v1beta1/inferenceservice/controller.go 的 Reconcile(),spec
KAIWEILIUCC2 小时前
分布式·llm
Ray:高性能、易扩展的Python分布式计算框架在机器学习、数据科学和高性能计算领域,我们经常需要处理大规模的计算任务。传统的单机计算往往无法满足需求,而构建分布式系统又充满挑战。Ray作为一个现代化的分布式计算框架,以其简洁的API、强大的性能和丰富的生态系统,正在改变我们处理大规模计算任务的方式。本文将深入探讨Ray的核心概念、应用场景和最佳实践。
众人皆醒我独醉2 小时前
面试·llm·gpu
从 Spec 到资源:Predictor/Transformer/Explainer 如何变成 DeploymentKServe 源码拆解系列 · 第 4 篇第 3 篇走完了调和循环主流程:事件进来,控制器按 spec 组装 reconciler 链,逐个组件调和。但"调和一个组件"这一步里发生了什么?你的 YAML 只有几行 predictor:、transformer:,集群里却长出了 Deployment、Service、探针、资源配额。意图声明(Spec)和集群现实(资源)之间的这段距离,就是本篇要拆的:组件构建器。结尾留下线头——模型怎么进 Pod——交给第 5 篇。
tachibana23 小时前
数据库·人工智能·算法·机器学习·架构·大模型·llm
RAGAS 指标解读摘要:在检索增强生成(RAG)系统的研发过程中,“如何客观评估系统质量”是阻碍技术从 Demo 迈向生产级的最大难关。依赖工程师肉眼抽检(Eyeballing)不仅耗时费力,而且无法形成量化的 CI/CD 迭代基准。
a187927218313 小时前
ai·大模型·llm·transformer·layernorm·deepseek·层归一化
从一条直线到大模型输出一个token(五):Transformer Block 全景与层归一化建议先看:从一条直线到大模型输出一个token(四):位置编码 RoPE上一篇末尾留了个悬念:「苹果」在"我吃了一个苹果"里是水果,在"苹果发布新手机"里是公司——同一个 token,含义要靠旁边的词决定。从这一篇开始,我们正式走进 Transformer 大厦,看词和词怎么"发生关系"。
谢白羽3 小时前
llm·agent·tts·vllm·大模型部署
vLLM-Omni 部署 IndexTTS 2.51.第一阶段:autoregressive talker(自回归 Talker 模块) 输入文本,不直接生成音频,输出语义编码(semantic codes)。 语义编码是中间抽象表示:包含说话内容、韵律、停顿、音色信息,是离散 token 序列。
Komorebi_99993 小时前
llm·rag
RAG23-RAG28所有文档加载器最终返回 Document 实例表格所有加载器都具备这两个方法。专门用来读取 csv 文件,每一行 csv 生成一个Document对象。
武子康3 小时前
人工智能·llm·agent
单卡 A6000 跑 27B FP8:我把“能跑”拆成了五组证据我在一张 RTX A6000 48GB 上测了一套 27B FP8 的 vLLM 服务。跑分表第一眼很好看:长输出约 23.5 token/s,80 个 JSON Schema 样本全部通过,短时 soak 也是 100/100。
网络工程小王4 小时前
人工智能·深度学习·机器学习·llm·qlora
【LLM开发实验】 QLoRA实现原理及实战虽然标准LoRA大幅减少了可训练参数 (parameter)的数量,但微调 (fine-tuning)大型语言模型仍构成主要的内存难题。主要瓶颈通常不是适配器权重 (weight)本身,而是加载庞大基础模型并进行计算所需的内存。即使模型被冻结,基础模型的权重(通常为FP16或BF16等16比特格式)也会占用大量GPU内存。
苹果二5 小时前
llm·知识图谱·aiagent·能源领域
【案例说明】融合知识图谱、大语言模型和 AI Agent 完成能源领域知识工程工作今天以“海上风电场智能运维项目”为例,说明知识图谱、大语言模型和 AI Agent 如何共同完成知识工程工作。三者的分工可以概括为:
liulilittle5 小时前
c++·人工智能·ai·llm·注意力·qkv
长上下文的成本结构与「甜点区间」——从推理引擎的物理约束看 200K/256K/400K摘要:1M 上下文是当前大模型最具营销力、也最容易被误读的指标。本文不讨论「能不能支持 1M」,而是讨论一个更实质的问题:在真实推理成本与能力衰减的双重约束下,什么长度是高效工作的甜点区间。 文中全部数值来自笔者从零实现的纯 CPU 推理引擎 llmx(目标模型 Qwen3.6-35B-A3B,40 层、词表 248320、GGUF Q4_K_XL 量化),以及公开的注意力复杂度结论。核心论点是:解码器的成本由「每 token 必须搬运的字节数」决定,而这个字节数在权重项上是常数、在上下文项上是线性的;当
Geek-Chow5 小时前
人工智能·llm·大语言模型
12 开源 vs 闭源:同一份权重,两种交付训练管线跑完,产出一个几十 GB 的文件。接下来只剩一个决策:这个文件公开吗?就这一个二选一,分叉出了两个平行生态、两套成本模型、两种隐私边界、两类风险。而分叉之后,两边跑的推理原理一模一样——同样的 prefill/decode、同样的 KV Cache、同样的采样参数。
Roadinforest7 小时前
ai·架构·llm·agent·anthropic·claudecode
Claude Code 架构深度解析:从 Agent Loop 到 Tool、MCP 与 Context本文基于本地仓库 claude-code/claude-code-main 的 TypeScript 源码快照整理。该仓库 README 将其描述为 2026 年 3 月 31 日公开暴露的研究快照,并非 Anthropic 官方仓库。因此,本文讨论的是这个快照体现的设计,而不是对所有历史版本或未来版本的承诺。
卷无止境7 小时前
llm
寻找不花钱的AI算力,看这一篇就够了现如今,调用各种主流大语言模型(LLM)的API早已成为开发者、科研人员乃至AI爱好者的刚需。不过,对于预算有限的个人开发者或者需要快速验证想法的团队来说,频繁按 Token 计费的小账本积少成多,也是一笔不小的开销。
tachibana27 小时前
数据库·人工智能·ai·架构·大模型·llm·rag
把RAGAS跑起来摘要:在检索增强生成(RAG)系统的落地过程中,“如何科学、量化地评估系统好坏”始终是决定项目能否上线的核心命题。RAGAS(Retrieval Augmented Generation Assessment) 是当前大模型领域事实上的 RAG 自动化评估标准。然而,RAGAS 原生基于 Python 生态开发,许多统计学背景深厚、精通 R 语言数据分析与制图的数据科学家和统计学家在评估大模型系统时面临工具链断层的困扰。
武子康8 小时前
人工智能·llm·agent
DeepSeek Harness 为什么不用 messages 数组保存一切很多 Agent 最初只有一个 messages[]:用户消息追加进去,模型回答追加进去,工具结果也追加进去。上下文太长时,删掉前几条或塞入一段摘要。
lucas_AI8 小时前
人工智能·算法·llm
35 种开源文档抽取配置,只有 4 个跨过 F1 0.5💡 一句话总结:在真实公共部门成绩单上,开源零样本结构化抽取远未到可自动化水平;决定成败的不只是模型大小,OCR 是否保留行分组和表格结构同样关键。