llm

用户458562068232 小时前
llm
DeepSeek-Harness部署踩坑DeepSeek-Harness(简称dsh)是DeepSeek推出的本地网页调试工具,方便对各类大模型API进行对比调试。
leeyi3 小时前
llm·aigc·agent
Langfuse 接入:给 Agent 加“行车记录仪“(第88篇-E74)上一篇把 Eino 的切面机制拆完了:一个 16 行的高阶函数包装,加一个挂在 ctx 里的注册表。机制有了,这篇把它用起来——接 Langfuse,给 Agent 装一台"行车记录仪":每次 LLM 调用的输入、输出、token 数、耗时、报错,全部录下来,出事故了倒回去看。
今日无bug4 小时前
node.js·llm·agent
Tool Use 工具调用 —— 让LLM缸中大脑突破物理限制的3个阶段你用豆包让它自动搜网页、用 Claude 让它分析 Excel、用 AI Agent 操作电脑…… 你以为 AI 真的有自我意识?
众人皆醒我独醉4 小时前
面试·llm·gpu
MLOps 流水线:从训练到推理的 CI/CDAI 加速器系列 · 第 8 篇软件部署错了回滚一个二进制就行。模型部署错了——精度下降 3%,错误率翻倍——你不知道问题出在数据、训练代码、还是模型本身。MLOps 管的不是一个 artifact,是三个。
shepherd1114 小时前
人工智能·llm·ai编程
国产模型越来越强了:DeepSeek V4、Kimi K3 与 GLM 最新进展这是《ALL IN AI》专栏的第三篇文章,想和大家聊聊近期国产模型的最新进展。坦白说,我原本没打算写这种偏资讯盘点的文章。单纯追踪模型更新,对个人能力提升的帮助其实比较有限。不过,最近两个月国产模型发展得很快,有些小伙伴可能因为工作忙,或者平时没有关注这个领域,错过了不少重要变化。更主要的原因是,下一篇我准备介绍 Claude Code 和 Codex 如何接入国产模型。在开始具体操作之前,有必要先把 DeepSeek、Kimi 和 GLM 最近发生了什么梳理清楚,也算是为后面的实操教程做个铺垫
武子康4 小时前
人工智能·llm·agent
Project Trust 不是 Sandbox:Pi Agent 的安全边界怎样补齐你克隆了一个陌生仓库,Pi 启动时询问是否信任项目。选择“不信任”,是不是就可以放心让 Agent 读代码、跑测试?选择“信任”以后,是不是意味着项目已经通过安全检查?
武子康5 小时前
人工智能·llm·agent
DeepSeek Harness:Subagent、Job、Goal 都叫任务,为什么不能混成一个对象“让另一个 Agent 查资料”“把命令放到后台跑”“继续做,直到目标完成”,在人看来都像是在创建任务。
AINative软件工程6 小时前
后端·llm·ai编程
LLM 应用的 Warm-Up 工程实践:冷启动延迟从 12 秒砍到 800ms 的 5 个工程手段TL;DR:LLM 应用第一次请求总是慢得离谱——连接池没预热、tokenizer 懒加载、CUDA kernel 第一次编译……这些"冷启动税"叠在一起,生产环境首请求可以轻松超过 10 秒。本文记录我们在一个月内把服务冷启动 P95 从 12.3s 砍到 780ms 的 5 个工程手段,每一个都附实测数据和可落地的代码。
漂流瓶jz18 小时前
人工智能·llm·openai
【AI】一文读懂大模型生态:分类/参数/结构/训练/GPU/评测/排行/社区大模型指参数规模巨大、基于深度神经网络构建的人工智能模型。主要有语言模型,图像视频模型,语音模型,多模态模型(可以同时处理文本图像语音等)。本文主要描述大语言模型,即LLM(Large Language Model)。LLM大语言模型主要使用Transformer架构,在海量文本数据上进行训练,可以理解和生成自然语言。
蛋先生DX18 小时前
深度学习·算法·llm
你瘦不下来但大模型可以:量化原理了解一下温馨提示:另有配套视频版,附带图解演示,观感不同,欢迎到各大视频平台搜索同名标题或【蛋先生说识】丹尼尔:蛋兄,最近在折腾大模型本地部署,经常遇到 "量化" 这个词,一直没搞懂到底是什么
DigitalOcean1 天前
llm
Qwen3.8-2.4T-A95B 部署与性能解析:DigitalOcean 无服务器推理实测Qwen3.8-2.4T-A95B 现已上线 DigitalOcean 推理引擎。它是从阿里巴巴 Qwen3.8-Max 旗舰模型衍生而来的开放权重纯文本版本:采用混合专家(MoE)架构,总参数量达到 2.4 万亿,每个 Token 大约激活 950 亿参数,主要面向编程、工具调用以及长周期 Agent 任务。根据阿里云公布的 Benchmark,Qwen3.8-Max 旗舰版在 PaperBench(93.0)和 IFBench(82.8)上排名领先,在 Terminal-Bench 2.1 上取得 8
XLYcmy1 天前
深度学习·llm·sft·强化学习·多模态·grpo·奖励函数
小红书 算法一面 四SFT训练中**训练loss正常下降但测试集表现差**,核心原因是**模型泛化能力不足**——模型学到了训练集的特征(甚至噪声),但无法迁移到分布不同的测试集。结合SFT的任务特性(大模型微调、文本/多模态生成),具体原因可分为四大类,每类对应明确的排查和解决方法:
Together_CZ2 天前
语言模型·llm·transformer·scaling laws·parcae·用于稳定循环语言模型的扩展定律·stable looped
Parcae: Scaling Laws For Stable Looped Language Models——用于稳定循环语言模型的扩展定律论文由加州大学圣迭戈分校和Together AI的研究者共同完成,聚焦于如何稳定地训练循环(Looped)架构的大语言模型,并将其发展为一种独立于模型参数和数据量的、可预测的扩展计算规模的新维度。核心贡献是提出了新型循环架构 Parcae,通过动态系统理论和工程化改进,解决了该类模型长期存在的训练不稳定问题,并首次系统性地推导了其在训练和推理阶段的扩展定律。
漂流瓶jz1 天前
人工智能·大模型·llm·openai·nvidia·deepseek·anthropic
一文读懂大模型生态:分类/参数/结构/训练/GPU/评测/排行/社区大模型指参数规模巨大、基于深度神经网络构建的人工智能模型。主要有语言模型,图像视频模型,语音模型,多模态模型(可以同时处理文本图像语音等)。本文主要描述大语言模型,即LLM(Large Language Model)。LLM大语言模型主要使用Transformer架构,在海量文本数据上进行训练,可以理解和生成自然语言。
幻灵尔依1 天前
llm·agent·ai编程
LLM 推理核心链路&缓存命中讲解可以。你现在问到的是 LLM 推理最核心的一条链路。我先不讲复杂数学,而是把每个名词拆开,再把它们串成一条完整的“模型到底干了什么”。
武子康1 天前
人工智能·llm·agent
DeepSeek Harness:Cordis 如何让插件可卸载、可依赖、可重组把一个工具塞进注册表并不难。真正麻烦的是它离开以后发生什么。假设一个 Workspace 插件注册了文件服务、监听器、Prompt 片段和一个定时任务。用户切换项目时,插件被卸载:监听器有没有解除?Prompt 片段会不会重复?依赖文件服务的工具应该立即消失,还是继续拿着已经失效的引用?如果配置热更新再次装载同一个插件,系统里会不会留下两份副作用?
武子康1 天前
人工智能·llm·agent
从 Pi 学习设计自己的 Agent Harness:一条可验证的垂直生产线一个内容团队把研究、写稿、审核、配图和发布串成自动流程。开始几天很顺:模型能写文件,脚本能跑, 图片能上传。后来编辑改了两段正文,旧审核结论仍显示通过;上传图片只改了 Markdown 链接,却又触发 一次全文和逐图复审;换成便宜模型后,格式看起来正确,引用、论证和视觉闭环却同时退化。
徐且行1 天前
深度学习·自然语言处理·llm·agents·deepseek·harness
DeepSeek Harness初体验:入门、安装与自定义插件本文讲两件事:怎么装 DeepSeek Harness(dsh),以及怎么写一个自定义插件(从极简到可用)。案例代码在 tmp/cordis-tutorial/,三个案例全程无需 API key。
拾年2751 天前
langchain·llm
让 AI 自己卷自己:50 行代码实现「LLM 当评委 + 多选一」的 Harness 工程你是否遇到过这种情况:让大模型写一段代码,第一次跑出来的结果有 bug,第二次换个说法又好了,第三次……它居然开始胡言乱语了?
AINative软件工程1 天前
后端·llm·ai编程
LLM 请求合并工程实践:用 Single-Flight 把并发重复调用从 N 次砍成 1 次你的推荐系统在高峰期同时有 80 个请求问同一个问题,却打出了 80 次 LLM 调用。语义缓存没命中,去重逻辑没覆盖,账单翻了 8 倍。这篇文章讲的就是:在请求真正落到 LLM 之前,把那 80 次压成 1 次。