llm

我想问问天2 分钟前
人工智能·llm·aigc
Jev 是做什么的?聊聊它能帮 LLM 分担哪些工作假设我们要做一个客服系统,用户发来一句:“我的信用卡被扣了两次,请尽快处理。”系统得先知道这件事归哪个部门管、急不急、要不要转人工。后面可能还要查订单、查账单,最后给用户一段回复。光是回复之前,就已经有好几个判断要做了。
谢白羽1 小时前
llm·vllm·大模型部署·sglang
对比DP8+EP与TP8在DS MoE部署性能MoE的Transformer层执行路径如下: 上图是以DP8+EP部署模型的执行流程。一个token进入本地Attention层(完整att)计算后通过路由发送给激活专家所在卡(注意,未必在本地了)做GEMM,最后专家模块返回结果合并输出进入下一层。
XLYcmy2 小时前
ai·llm·agent·模型·mom·harness·工业系统
AI 时代,MOM(制造运营管理系统)该如何演进? 上AI 时代,MOM(制造运营管理系统)该如何演进?——从零设计一套适配多品类产线的通用 MOM 架构智能制造 / 工业软件 / MOM 架构
凉凉的知识库4 小时前
开源·llm·agent
Agent 如何拥有长期记忆:六个主流项目的设计思路对比想象一下,你连续几天都在和同一个 AI 助手讨论旅行计划。第一天,你告诉它自己不坐红眼航班;第二天,你补充说更喜欢靠过道的位置;到了第三天,它却像第一次见到你一样,又从头询问所有偏好。
桃西西呀4 小时前
人工智能·llm·ai编程
Laya 源码级原理拆解之二:序列打包与决策头我在之一里把 Laya 的整体架构和运行入口拆完了,当时留了一个最关键的疑问没有展开:它号称一次前向就把判断吐出来,输出 token 还是免费的,这件事在代码层面到底是怎么发生的。这一篇我直接进 common.py 和 agent.py,把序列打包 build_sequence 和决策头 DecisionModel 的源码逐行走查一遍,再把温度缩放和那套容易踩错的双置信度说清楚。最后看一下 fast.py 和 tl_kernels.py 怎么把同样的决策换一组融合核跑在 GPU 上。
桃西西呀6 小时前
人工智能·llm·ai编程
Laya 源码级原理拆解之一:整体架构与运行入口我第一次翻 Laya 的源码时,最意外的不是它的模型结构,而是它的包长什么样。一个开源的 System 1 决策模型,号称能在一次前向里把判断吐出来,但 import laya 这一下,居然不碰 torch,也不碰 numpy。我当时以为自己看错了,反复确认之后才明白:这是它被设计成能在推理服务的入口处被轻量加载的关键。
桃西西呀8 小时前
人工智能·llm·ai编程
你的 Agent 每判一次都要为大模型吐的字买单?-Laya模型帮你做判断前几天我看到一个开源项目叫 Laya,说是专门给 Agent 做"判断"用的。我第一反应是:判断?这不就是让大模型自己说一句"该派给 billing 部门"吗,有什么特别的。
AINative软件工程9 小时前
后端·llm·ai编程
LLM 输出 Guardrail 工程实践:5 层防护栏让 AI 生成的内容不会炸掉生产你的 LLM 应用上线了,模型 99% 的时候输出正常——但那 1% 的异常输出,足以让一个客户投诉毁掉整个产品的信任。Guardrail 不是可选的"安全网",它是生产级 LLM 应用的标配基础设施。
武子康14 小时前
人工智能·llm·agent
Agent 能接进 IDE,为什么还不能随意互换?假设你正在给团队的开发工作台加一个审查入口:开发者选中一批改动,点“审查”,结果统一显示在侧栏。第一版接 Codex,第二版想再接一个审查 Agent。界面没有变化,看上去只要换掉调用目标。
武子康15 小时前
人工智能·llm·agent
ESP32-S3 Mini 和 C3 Mini 怎么买?从 PSRAM、USB 到一张可核对的采购单给一台桌面语音终端买开发板:接麦克风和扬声器,用 Wi-Fi 收发音频,再接一块 320×240 彩屏。商品页同时出现“C3 SuperMini”“S3 Mini 8 MB”“S3 N4R2”,都带 USB 接口,似乎只是性能和价格不同。
10年前端老司机15 小时前
人工智能·llm·aigc
RAG 检索效果量化测评落地:完整流程、指标实现与踩坑总结在知识库问答(RAG)系统迭代过程中,最大的痛点往往不是检索功能不可用,而是无法量化检索效果好坏。调切片大小、改向量/关键词权重、换 Embedding 模型后,我们基本只能“肉眼看结果”,非常主观,无法回答这些关键问题:
武子康15 小时前
人工智能·llm·agent
权重装进了 24 GiB,四路 32K 上下文还装得下吗?模型权重已经加载,短问题也能回答,于是把服务目标改成四路长上下文。接下来遇到的却是缓存不足、请求等待,或者在某个峰值阶段显存不够。第一反应往往是:“权重才占一部分,剩下的显存为什么不够?”
Python私教15 小时前
人工智能·llm·deepseek
DeepSeek本地部署Ollama+知识库,附3个报错解决最近帮不少朋友在Windows电脑上部署DeepSeek,需求基本一致:模型跑在本地、数据不出电脑、还能读自己的文档回答问题。本文把完整流程整理出来:Ollama负责运行模型,Open WebUI负责聊天界面和知识库,最后附上最常见的3个报错及解决方法。按步骤操作即可跑通。
闪学it15 小时前
llm
闪学it-Linux云计+AIOps大模型Linux 不是一门需要“学完”的课,而是一种需要养成的手感。真正要刻进肌肉记忆的,只有四件事:把这四件事摸透,后面所有云原生工具都只是它们的组合与抽象。
武子康15 小时前
人工智能·llm·agent
Codex 只读审查的权限边界:任务文件是谁写的?一次 Codex 审查没有修改仓库代码,却留下了新的任务 JSON。看到这种现象,先别把它判成“只读沙箱失效”。更值得追问的是:文件由哪个进程写入,read-only 又设置在哪一层?
柒和远方15 小时前
elasticsearch·langchain·llm
混合检索 RAG 全链路:查询增强、双路召回与重排——向量库和搜索引擎联手补齐召回上一篇把 Agentic RAG 的"决策层"画完了:路由、评估、多跳、联网兜底。这一篇回到检索层做最后一个升级——把向量检索和关键词检索真正接进同一张图:查询先用 LLM 改写成多条检索句,ES(BM25)和 Milvus(向量)两路并行召回,合并去重后交给重排模型精读打分,取 top 3 再喂给大模型。整套流水线在 LangGraph 里一次性跑通,实测案例见文末复盘。
货拉拉技术15 小时前
llm·agent
货拉拉 DataAgent 实践:策略复盘的智能化探索本文以货拉拉内部策略复盘场景为例,分享如何借助 Dynamic Workflows,将复杂的 DID 因果分析 SOP 转化为可执行、可追踪、可复核的多 Agent 工作流。文章内容涵盖方案选型、Dynamic Workflows 实践、真实踩坑等经验。
犀利豆15 小时前
人工智能·llm·aigc
AI 老板五分钟挂出招聘启事,四个月后开除了第一个人旧金山联合街 2102 号有家店,卖衣服、家居用品和艺术品。店里没有收银台,也没有扫码枪。想结账的顾客要拿起柜台上一部老式有线电话,跟那头的经理报一遍自己拿了什么。经理再在旁边一台 iPad 上把这笔账记上。
桃西西呀15 小时前
人工智能·计算机视觉·llm
从手写数字到ImageNet冠军:CNN架构20年,为什么越深越难训?手机相册能自动把猫和狗分开,门禁能认出你是谁,医学影像里的结节也能被算法标出来。这些应用看起来各不相同,背后其实共用同一套基础结构:卷积神经网络,也就是 CNN。
桃西西呀15 小时前
人工智能·llm·ai编程
给告警加了道 AI 初筛,我终于半夜不用爬起来了看无用告警了凌晨 03:14,我手机被监控叫醒。node-07 这台机器,CPU 持续 97%,磁盘 IO 等待飙升,而且同一时刻三个探针一起报了红。