技术栈
llm
leeyi
8 小时前
llm
·
aigc
·
agent
流式传输引擎:Eino StreamReader 源码拆解(第61篇-E47)
系列「企业级 AI Agent 实现拆解」E47 篇,Part 10 生产工程篇第五章。上一篇 讲了 RAG 流水线。这篇往下看底层:LLM 的流式输出在 Eino 内部是怎么流动的——StreamReader 如何实现 fan-out、fan-in、类型转换,以及 Graph 层如何包装它。
寒水馨
8 小时前
windows
·
llm
·
大语言模型
·
llama
·
本地部署
·
ollama
·
模型运行
Windows下载、安装ollama-v0.32.1(附安装包OllamaSetup.exe)
Ollama 是目前最流行的本地大语言模型(LLM)运行工具,在 GitHub 上已获得超过 130,000 颗星标(Stars),是 AI 开发者社区中最受关注的开源项目之一。
AINative软件工程
10 小时前
后端
·
llm
·
ai编程
LLM 应用的熔断降级工程实践:Circuit Breaker 不只是重试的升级版
你以为给 LLM 调用加个重试就够了?直到某天凌晨,某国产大模型 API 挂了 3 小时,你的 retry storm 把下游打垮了,你才意识到熔断和降级是两回事。
wangruofeng
20 小时前
llm
·
github
·
openai
opencodex 解锁 Codex 任意模型,一个本地代理打通 Claude/Kimi/GLM/DeepSeek
大家好,我是若风。你大概有过这种憋屈,打开 OpenAI 的 Codex CLI 或者 Claude Code,界面很顺手,Agent 跑任务也很流畅,但你就是想换个脑子试试。手里明明有 Claude 的 Max 订阅、有 Gemini 的 API、本地还跑着一个 DeepSeek,可 Codex 就是认死了它自己的后端,你 codex -m deepseek-chat 它理都不理你。
wangruofeng
20 小时前
llm
·
aigc
姚顺雨长谈:在 Anthropic 和 Gemini 训练模型,英雄主义已经过时
本文整理自 YouTube 访谈视频 Yao Shunyu: Let Me Go a Little Crazy! Training Models at Anthropic & Gemini, Heroism Is Over,主持人小君,嘉宾姚顺雨(Google DeepMind 研究员,前 Anthropic)。
赵康
1 天前
ai
·
llm
·
skill
AI 写代码之后,Code Review 会议怎么开
写完 /weekly-report[1][2] 之后发现同一套思路还能再用一次:代码 review 会前,也得把这段时间的提交整理成一份能讲的东西。会上被问"这里为什么这么改",自己都未必答得上来,毕竟现在很多代码本身是 AI 写的,没细看过的代码讲不出个所以然。
莫逸风
1 天前
java
·
llm
·
agent
·
agentscope
【AgentScope 2.0】 0. 学习指南
版本基准:本文档基于 AgentScope 2.0 GA(v2.0.0)编写。具体版本号以 Release Notes 为准。
谢白羽
1 天前
笔记
·
分布式
·
llm
·
论文
·
vllm
vllm源码剖析14-vLLM 分布式推理-专家并行EP
大模型的算力与显存瓶颈,随着大模型规模越来越大,参数量动辄上百亿,但我们的显存和算力却跟不上。尤其是在 Transformer 的 Decoder 层中,除了 Attention 之外,参数量最多、计算最重的部分就是 MLP(多层感知机)层
Token炼金师
1 天前
人工智能
·
深度学习
·
llm
框架的擂台:LangChain、LlamaIndex、Dify、AutoGen 与 LangGraph —— 应用框架选型五局
应用框架屏蔽底层复杂度,加速大模型应用开发。本文从 LangChain 编排生态、LlamaIndex 知识增强、Dify 低代码平台、AutoGen 多 Agent 对话、LangGraph 状态图编排、框架选型决策六个切口,给出源码级对比与企业级选型框架。
wenb1n
1 天前
llm
【 LLM】Agent Planning 完全指南:8 种纯 LLM 范式 + 8 种混合规划模式详解(一)
💡 核心摘要 :Planning 是 Agent 面对任务时,决定“怎么做”“先做什么后做什么”“用什么工具做”的核心过程。本文系统梳理 8 种纯 LLM 规划范式与 8 种混合规划模式,每种均配有直观流程图、适用场景与工程实现要点,助你根据实际需求选择最合适的方案。
bonechips
1 天前
langchain
·
llm
LLM 的"严谨"与"胡说":temperature、Top K + LangChain 工作流
摘要:LLM是概率引擎,每个词都是从概率分布中抽出来的。temperature控制发散度,TopK限制候选池,两者配合决定输出是严谨还是创意。本文用LangChain搭双链条同一主题两套参数,直观对比真实效果。
带刺的坐椅
1 天前
java
·
ai
·
llm
·
agent
·
solon
Solon AI:Tool 与 Talent 怎么选?从函数到领域专家
多数 Agent 教程停在工具层:给模型一个函数 Schema,指望它会正确调用。这对 get_time、hash_string 够用;一旦模型跳过知识库检索就直接开工单,或把几十上百个 API 全塞进上下文,就会崩。
AINative软件工程
1 天前
llm
·
ai编程
LLM 账单来了,却不知道哪个功能在烧钱:Cost Attribution 工程实践
每个月 LLM 账单 6 万块,CFO 来问你"AI 写作功能花了多少钱",你答不上来。这不是成本控制问题,是工程问题。
不好听613
1 天前
llm
LLM 是怎么"随机"说话的 —— Temperature、Top-K、Top-P 详解
你有没有想过一个问题:大模型每次生成文本,为什么能给出不同的回答?同一个 Prompt 问三遍,回答可能每次都不一样。这种"随机性"不是 bug,而是刻意设计的结果——而控制它的核心,就是三个参数:Temperature、Top-K、Top-P。
一起努力啊~
1 天前
笔记
·
学习
·
llm
DataWhale组队学习笔记--llm-algo-leetcode(五)
在大语言模型(LLM)的部署和推理优化中,vLLM 提出的 PagedAttention(分页注意力机制) 是一个里程碑式的突破。它直接解决了大模型在生成长文本时,显存(GPU Memory)被严重浪费的核心痛点。
To_OC
2 天前
人工智能
·
llm
·
agent
大模型蒸馏是啥?说白了就是大厨带徒弟的学问
前阵子刷到 OpenAI 和 DeepSeek 的争议新闻,我当时啃着瓜就下了结论:不就是拿大模型的输出训自己的小模型吗,说白了就是抄答案走捷径。直到这周专门去捋知识蒸馏的原理,才发现我之前的理解,连核心都没摸到 —— 这玩意儿根本不是背答案那么简单。
陳陈陳
2 天前
langchain
·
llm
从“胡说八道”到“妙笔生花”:我用LangChain手搓了一个可控AI写作流(Temperature+TopK调参指南)
揭秘LLM文本生成中的“可控随机性”,从概率分布到采样策略,再到LangChain工作流实战你有没有遇到过这种情况:同样的Prompt问AI两次,得到的答案却截然不同?一次惊艳得像文学大师,一次又平庸得像小学生作文。这种“随机性”到底是大模型的“精神分裂”,还是背后有一套精密的控制逻辑?
冬奇Lab
2 天前
人工智能
·
llm
AI 评测系列(03):LLM-as-Judge——让 LLM 评价 LLM 的正确姿势
LLM-as-Judge 把一个 LLM 的输出质量评估任务,交给另一个(或同一个)LLM 来完成。基本形态有两种: