llm

漂流瓶jz4 小时前
人工智能·大模型·llm·openai·nvidia·deepseek·anthropic
一文读懂大模型生态:分类/参数/结构/训练/GPU/评测/排行/社区大模型指参数规模巨大、基于深度神经网络构建的人工智能模型。主要有语言模型,图像视频模型,语音模型,多模态模型(可以同时处理文本图像语音等)。本文主要描述大语言模型,即LLM(Large Language Model)。LLM大语言模型主要使用Transformer架构,在海量文本数据上进行训练,可以理解和生成自然语言。
幻灵尔依2 小时前
llm·agent·ai编程
LLM 推理核心链路&缓存命中讲解可以。你现在问到的是 LLM 推理最核心的一条链路。我先不讲复杂数学,而是把每个名词拆开,再把它们串成一条完整的“模型到底干了什么”。
武子康4 小时前
人工智能·llm·agent
DeepSeek Harness:Cordis 如何让插件可卸载、可依赖、可重组把一个工具塞进注册表并不难。真正麻烦的是它离开以后发生什么。假设一个 Workspace 插件注册了文件服务、监听器、Prompt 片段和一个定时任务。用户切换项目时,插件被卸载:监听器有没有解除?Prompt 片段会不会重复?依赖文件服务的工具应该立即消失,还是继续拿着已经失效的引用?如果配置热更新再次装载同一个插件,系统里会不会留下两份副作用?
武子康4 小时前
人工智能·llm·agent
从 Pi 学习设计自己的 Agent Harness:一条可验证的垂直生产线一个内容团队把研究、写稿、审核、配图和发布串成自动流程。开始几天很顺:模型能写文件,脚本能跑, 图片能上传。后来编辑改了两段正文,旧审核结论仍显示通过;上传图片只改了 Markdown 链接,却又触发 一次全文和逐图复审;换成便宜模型后,格式看起来正确,引用、论证和视觉闭环却同时退化。
徐且行4 小时前
深度学习·自然语言处理·llm·agents·deepseek·harness
DeepSeek Harness初体验:入门、安装与自定义插件本文讲两件事:怎么装 DeepSeek Harness(dsh),以及怎么写一个自定义插件(从极简到可用)。案例代码在 tmp/cordis-tutorial/,三个案例全程无需 API key。
拾年2754 小时前
langchain·llm
让 AI 自己卷自己:50 行代码实现「LLM 当评委 + 多选一」的 Harness 工程你是否遇到过这种情况:让大模型写一段代码,第一次跑出来的结果有 bug,第二次换个说法又好了,第三次……它居然开始胡言乱语了?
AINative软件工程6 小时前
后端·llm·ai编程
LLM 请求合并工程实践:用 Single-Flight 把并发重复调用从 N 次砍成 1 次你的推荐系统在高峰期同时有 80 个请求问同一个问题,却打出了 80 次 LLM 调用。语义缓存没命中,去重逻辑没覆盖,账单翻了 8 倍。这篇文章讲的就是:在请求真正落到 LLM 之前,把那 80 次压成 1 次。
Flynt15 小时前
开源·llm·llama
花一下午把Qwen3.8-27B跑在本地,最坑的不是显存8月14号周四下午刷到Qwen3.8-27B开源的消息,没太当回事——又是个"27B打Claude"的标题党对吧。 结果到了晚上,量子位、机器之心全在推,Hugging Face趋势榜直接冲到第一。翻了翻官方的benchmark数据,SWE-bench Pro 61.7分,比Claude Opus 4.6 Max的53.4高了8分多。QwenSWEBench更离谱,79.0对63.8,领先15分。 这就不是一句"营销跑分"能解释的了。 行吧,反正周末没事,下载跑一下看看。
XLYcmy16 小时前
c++·python·llm·概率论·数据处理·训练·codebert
京东 算法实习一面 下+手撕数据清洗-数据评估(二次筛选)-训练时增强模型鲁棒性(数据增强、对抗训练)参考:一、核心定义与问题边界
众人皆醒我独醉1 天前
面试·llm·gpu
AI 工作负载可观测性:DCGM + Prometheus + GrafanaAI 加速器系列 · 第 7 篇GPU 利用率 100%!一切看起来很好。直到你发现 Tensor Core 使用率只有 15%,80% 的时间 GPU 在等 CPU 喂数据和 AllReduce 通信。"GPU 利用率"是 AI 基础设施里最大的谎言。
qpsj1 天前
人工智能·llm
DeepSeek 缓存命中涨价 12 倍:4 个改动,账单回到涨价前8 月 17 日 0 点,DeepSeek 新定价生效。最刺眼的一档:V4-Pro 高峰时段缓存命中从 0.025 涨到 0.30 元/百万 tokens,翻了 12 倍。我手里跑着两个常驻 API 项目,其中一个就是靠缓存命中省钱的高频 RAG 场景,算完账差点没坐住。这篇记录我当天做的 4 个改动,以及改动前后账单的真实对比。所有数字来自官方定价表,今天零点已生效。
uncle_ll1 天前
llm·nlp·llama·ollama·大模型微调
Llama 3 私有化落地全栈实战:从 Ollama 极速部署到 LLaMA Factory LoRA 定制微调在前沿生成式 AI 的落地应用中,开发者常面临两大工程痛点:本文将围绕开源大模型基座 Llama 3,提供一条“推理部署 + 轻量微调”的完整闭环方案:采用Ollama构建零门槛本地 API 服务,结合LLaMA Factory框架完成低算力消耗的 LoRA 参数高效微调(PEFT)。
Smoothcloud_润云1 天前
llm·agent·gpu
从“模型服务”到“Agent 调度”:AI 推理基础设施为什么正在重构?2026 年,AI 应用正在从“问一句、答一句”,快速进入 Agent 时代。过去,大模型推理服务的目标很明确:
武子康1 天前
人工智能·llm·agent
GPT-Live 分析研究:从回合式语音到连续交互循环一个语音 Agent 可以做到 300 毫秒出声,仍然可能很难用。用户只是停下来想了半秒,它抢着回答;用户说“等等”,它要到整段 TTS 播完才停;搜索需要十几秒,会话就像断线;后台结果回来时,用户已经换了问题,它却继续念旧答案。这些体验并不主要由音色或单段模型延迟决定,而是因为系统仍把对话理解成一串整齐的回合:先听完,再理解,再回答。
ShallWeL3 天前
人工智能·机器学习·大模型·llm·本地部署
【机器学习】(39)—— 部署测试摘要:模型文件导出成功,并不等于可以安全替换线上版本。部署测试需要覆盖输入数据、特征工程、新模型质量、服务基础设施,以及流水线组件之间的集成。本文说明可复现训练、接口快速校验、端到端集成、突然退化与缓慢退化门禁,以及模型与服务环境的兼容性检查,并结合汽车油耗与工单分类给出发布核对清单。适合读完特征变换与训练—服务偏差、准备发版的读者。
CoderJia程序员甲1 天前
ai·大模型·llm·github
GitHub 热榜项目 - 周榜(2026-08-16)生成于:2026-08-16共发现热门项目: 16 个Token赞助:siliconflow前些天发现了一个巨牛的人工智能学习网站,通俗易懂,风趣幽默,忍不住分享一下给大家。点击跳转到网站。
武子康1 天前
人工智能·llm·agent
给 Pi 增加能力时,应该写 Prompt、Skill、Tool 还是 Extension?团队想统一发布流程,于是有人提议“写一个插件”:它要提醒检查清单、读取团队规范、 执行发布命令、拦截危险参数,还要让每个人一键安装。听起来只是一个需求,实际上混合了 五种职责。如果全部塞进一个高权限插件,改一句提示词也要重发代码;如果全部写进 Markdown,真正危险的命令又只能依赖模型“记得不要做”。
tachibana21 天前
大数据·人工智能·ai·大模型·llm·prompt
怎么让大模型同时给意图节点打分摘要:在智能客服、任务型对话系统(Task-Oriented Dialogue)、智能体工作流(Agent Routing)以及复杂问答路由场景中,用户输入往往具有多意图混合、表述模糊、隐含诉求等特点。传统的单分类模型或串行单一意图匹配,不仅难以应对意图重叠,还会带来巨大的延迟与 Token 开销。
XLYcmy1 天前
llm·sft·强化学习·多模态·损失函数·visual r1·奖励机制
小红书 算法一面 三# Visual R1 原理与 MLLM RL 方案设计全解析## 一、Visual R1 核心实现原理
罗高2 天前
llm·agent
AI Agent 可观测性完全指南:遥测、追踪、指标与评估译注: 本文翻译自 groundcover 技术博客。原文链接:AI Agent Observability: Key Concepts, Challenges & Best Practices。译文在保留原文核心观点的基础上进行了意译润色,并保留了所有原始配图。