llm

众人皆醒我独醉6 小时前
面试·kubernetes·llm
自动扩缩容:KPA/HPA/KEDA 三条路径KServe 源码拆解系列 · 第 7 篇第 6 篇你追着请求走完了整条路:VirtualService → ksvc → 推理 Pod。但有个问题一直悬着:Pod 的数量是谁定的?流量翻倍时谁来加 Pod?夜里没人调用时谁来把 GPU 腾出来?——这篇拆自动扩缩容的控制面:YAML 里的几个字段,怎么变成 HPA、KEDA ScaledObject 和 Knative 的注解。
武子康11 小时前
人工智能·llm·agent
262K 跑过,128K 却被脚本拦下:A6000 跑分里的三种“失败”不能混为一谈同一个单卡 A6000 服务,较早的超长上下文探针跑到了目标 262K;几个阶段之后,一次目标 128K 的测试却留下了这行日志:
修远客11 小时前
llm·agent
质检系统:Agent的自我审查 — 不自检的Agent就像没有编辑的报社LLM 能写出流畅的文章,但不代表文章没问题 — 夸大宣传、敏感词、AI味书面语、内容重复,这些坑 LLM 自己看不见。
sg_knight13 小时前
linux·windows·macos·llm·agent·ai编程·opencode
openCode 安装与初始化配置(Windows / macOS / Linux)前五篇把 openCode 是什么、和 Cursor 怎么选、核心概念全讲清楚了。这篇直接装机——macOS、Linux 原生安装 + Windows WSL2 全流程,从零到能用的完整路径。
Shawn_Shawn13 小时前
后端·llm·领域驱动设计
本体论的基本核心概念本体不是某一张表,而是整个组织共享的语义模型:它定义了企业里有哪些实体类型、实体有哪些属性、实体之间如何关联、可以对实体执行哪些操作。
XLYcmy4 天前
llm·负载均衡·强化学习·多模态·ppo·dpo·grpo
小红书 算法一面 十二在 **MoE(混合专家模型)** 场景中,**负载均衡** 是指**门控网络将输入 token 均匀分配给各个专家子网络**,使得每个专家接收的计算任务量(token 数量、计算开销)保持相对均衡,避免出现“热门专家过载、冷门专家闲置”的现象。
uncle_ll1 天前
架构·llm·agent·rag·llamaindex
LlamaIndex 全栈实战指南:架构解构、RAG 核心原理与私有知识库工程化落地方案大语言模型(LLM)面临知识时效性滞后、私有数据盲区与事实幻觉三大工程瓶颈。检索增强生成(RAG, Retrieval-Augmented Generation) 是解决私有数据问答成本最低、准确率最高的工程路径。
蛋先生DX1 天前
llm·llama·ollama
大模型本地部署神器的瘦身进阶原理,就这两招?温馨提示:另有配套视频版,附带图解演示,观感不同,欢迎到各大视频平台搜索同名标题或【蛋先生说识】丹尼尔:蛋兄,本地跑大模型,有啥好工具推荐不?
众人皆醒我独醉1 天前
面试·kubernetes·llm
流量路由:Istio 与 Knative 的集成KServe 源码拆解系列 · 第 6 篇第 5 篇结束时,模型已经躺进 Pod 的 /mnt/models:storage-initializer 下载完,推理容器就绪。但集群外面一条 curl,凭什么能精确命中这个 Pod?中间隔着一整套指路系统:网关、VirtualService、Knative Route。本篇拆这套系统,也把概述文一笔带过的 canaryTrafficPercent 拆到源码层:百分比如何变成路由权重。而流量怎么分,直接连着下一篇的主角——自动扩缩容。
温暖的苹果1 天前
ai·llm·agent·vibecoding·opencode
opencode 配置完全指南:配置文件、目录与字段详解一份面向 opencode 用户的配置指南:讲清楚配置写在哪里、每个字段是干什么的、provider / skill / plugin / command / 自定义工具各自从哪些目录被自动发现,以及合并优先级。文末附一章内部实现原理,供想深挖的读者参考。
七点半.1 天前
人工智能·llm
LLM 工程能力LLM内部是怎么工作的? 人工智能与LLM基础理论接下来开始:作为开发者,我怎么控制LLM?先建立一个非常重要的认知: Prompt不是:
修远客1 天前
llm·agent
对话式修改:Agent的人机协作模式 — Chat as Interface,对话不是聊天,是最高效的人机协作方式生成一篇文章只需要一次 LLM 调用,但改好一篇文章往往需要多轮对话。很多人做内容生成 Agent,生成完就结束了 — 用户不满意只能"重新生成",结果每次都是一篇全新的文章,之前的风格、结构、措辞全丢了。这不是协作,是抽奖。
武子康1 天前
人工智能·llm·agent
机器人接入 AI 连续语音后,端云架构要改什么?摘要:连续语音进入机器人后,声音停止不等于播放、任务或物理动作同时停止。本文把系统拆成媒体、交互控制、物理动作三个平面,用五类身份、播放进度代理、动作准入和渐进迁移步骤重新建立端云一致性,并明确 IMPLEMENTED、VERIFIED 与 UNKNOWN 的证据边界。
tachibana21 天前
数据库·人工智能·语言模型·自然语言处理·大模型·llm
大语言模型基础从概率论与统计学视角来看,语言模型(Language Model, LM)的目标是建立一个计算自然语言序列概率分布的数学模型。
阿里云云原生2 天前
llm
云原生 AI 基础设施演进:利用 Envoy Wasm 构建去中心化的 LLM 内容安全网关作者:王建伟(正己)生成式 AI 正在跨越“能不能用”的门槛,走向“如何规模化地安全使用”。Higress 项目现已以 Wasm 插件形式接入 Qwen3Guard-Gen。三句话说明它做了什么:
Novlan12 天前
llm
Transformer基于论文《Attention Is All You Need》(Vaswani et al., 2017)
逸Y 仙X2 天前
python·大模型·llm·ai编程·mcp
MCP(模型控制协议)完全指南:从核心概念到实战开发摘要:本文全面介绍了MCP(模型控制协议)的核心概念、架构设计与实战应用。MCP是由Anthropic提出的标准化协议,旨在解决AI应用与外部工具集成时的碎片化问题。文章首先阐述了MCP的背景、设计渊源和核心价值,然后详细解析了其基于JSON-RPC的通信架构、三大核心能力(Tools、Resources、Prompts),以及streamableHTTP和stdio两种通信方式。最后通过Python代码示例展示了如何开发MCP服务器,包括工具定义、资源管理和提示词模板的实现,为开发者提供了从理论到实践的
DigitalOcean2 天前
llm
DigitalOcean 推理路由器新增缓存感知能力:为什么最便宜的模型不一定最省钱Coinbase CEO Brian Armstrong 最近提出了一个问题,也是所有正在扩大 AI 使用规模的企业都在面对的问题:当 Token 用量呈指数增长时,怎样才能让 AI 支出保持基本不变?
众人皆醒我独醉2 天前
面试·llm·gpu
调和循环:kubectl apply 之后发生了什么KServe 源码拆解系列 · 第 3 篇第 2 篇里,predictor、transformer、explainer 安静地躺在一个 YAML 里。可你 kubectl apply 一按回车,这几百行配置就要在几秒内变成 Deployment、Service、VirtualService——谁在动手?顺序是什么?中途失败怎么办?本篇跟一次完整的调和循环:起点是 pkg/controller/v1beta1/inferenceservice/controller.go 的 Reconcile(),spec
KAIWEILIUCC2 天前
分布式·llm
Ray:高性能、易扩展的Python分布式计算框架在机器学习、数据科学和高性能计算领域,我们经常需要处理大规模的计算任务。传统的单机计算往往无法满足需求,而构建分布式系统又充满挑战。Ray作为一个现代化的分布式计算框架,以其简洁的API、强大的性能和丰富的生态系统,正在改变我们处理大规模计算任务的方式。本文将深入探讨Ray的核心概念、应用场景和最佳实践。