llm

1点东西6 小时前
llm·agent·ai编程
做了近两年的Agent开发,其实真正要学的就是这五件事这两年一直致力于公司的Agent开发。总结了一些思考和解决方案,今天给大家分享下,也是给自己的一个复盘。
程序猿编码8 小时前
c++·大模型·llm·推理引擎
告别改源码适配模型:纯 C++ 可配置 LLM 推理引擎,全格式全结构兼容这是一套纯C++实现的高效、高度可配置大语言模型推理引擎,采用配置驱动的设计理念:接入新模型无需修改源码、重新编译,仅通过编辑模型规格配置文件即可完成适配。
小林ixn11 小时前
langchain·llm·agent
从 LangChain 到 LangGraph:用「网状工作流」解锁多 Agent 协作的正确姿势单 Agent 是"一个人扛所有活",多 Agent 是"一个团队各司其职"。当你发现 Prompt 越写越长、工具越堆越多、模型越来越迷糊时,就是时候上 LangGraph 了。
武子康11 小时前
人工智能·llm·agent
自己做一个 Mini Reviewer:让 AI 审到本次准备提交的代码你改完代码,执行了一次 AI Review,读完它给出的意见,准备提交。此时有一个比“模型够不够强”更早的问题:它看到的,是你准备提交的那份修改吗?
武子康12 小时前
人工智能·llm·agent
GPU Pod 已经 Running,为什么扩容还没变成推理容量?流量升高,模型服务开始排队。扩容已经触发,新建的两个 GPU Worker Pod 也显示 Running,但请求的首 token 等待仍在增长。
BlackStar_L13 小时前
大模型·llm·agent
第二章 上下文工程上下文:Agent的“眼睛”,AI实际看得到的信息。上下文内容:上下文工程:上下文的设计与管理与harness的关系:
Together_CZ1 天前
缓存·llm·compression·kv cache·deepseek·v4.1-flash·推动 kv 缓存压缩的极限
DeepSeek-V4.1-Flash:Pushing the Limits of KV Cache Compression——推动 KV 缓存压缩的极限长时程智能体(long-horizon agents)的广泛应用,使模型工作负载越来越“输入密集”。虽然稀疏注意力等先前工作已经大幅降低了长上下文计算成本,但真正的瓶颈转移到了:
桃西西呀1 天前
人工智能·llm·图像识别
你拍的一堆硬币,手机怎么一眼数出有几枚?聊聊边缘、轮廓和模板匹配前两天整理零钱,我把桌上一把硬币拍了张照片,想数清楚到底有几枚。手点着屏幕数到一半就乱了,硬币叠着、反光晃眼,眼睛和手指对不上号。后来我用一个硬币清点小程序扫了一下,它立刻报出“7 枚”。我没联网、也没等它“思考”半天,就是扫一下。
slacker-kian1 天前
ai·llm·sap·agent·abap·adt·opencode
[实践]-让 SAP 工程 Skill 脱离 opencode跑在自定义Agent 上如何把一套 SAP ABAP 工程 Skill 从 opencode 运行时中「萃取」出来,让它独立运行在自开发的Agent上?本次实践来复刻 opencode 的 Skill 调用机制(发现 → 路由 → 注入 → 工具循环)。最终目标:用自然语言对话即可让 Agent 读写 ABAP 源码、执行代码审查、做传输门控评估,最终可直接集成进企业 Chatbot中。
武子康1 天前
人工智能·llm·agent
CLAUDE.md 越写越长,哪些规则该放到子目录?一个前后端放在同一仓库的团队,最初只在 CLAUDE.md 里写了测试入口和提交要求。几个月后,文件里又出现接口错误码、组件样式、数据库迁移、版本发布、事故恢复。维护者让 Claude Code 改一个按钮的文案,它却同时拿到了后端事务说明和发版步骤。
武子康1 天前
人工智能·llm·agent
两台机器跑 vLLM,什么时候才值得引入 Ray?一套 vLLM 服务从一台机器搬到两台机器,部署方案里往往会顺手加上 Ray。理由也很直接:multiprocessing 管本机,Ray 管多机。
桃西西呀1 天前
人工智能·llm·agent
Agent说做完了,其实什么都没改:静默失败原因拆解你让编码 Agent 把一个旧的鉴权函数改个名字。十分钟后它回你:全部 12 处调用点已更新,测试通过,done。三天后生产环境开始报 500,你翻代码,发现那个函数还有 4 个调用点压根没动过,它们恰好在 Agent 从没 grep 过的目录里。这种事在我自己接 Agent 进 CI 之后发生过不止一次,所以这篇带你深入复盘这个问题。
犀利豆2 天前
人工智能·llm·aigc
为什么全世界的 AI 都画不好一只骑自行车的鹈鹕2024 年 10 月 25 日,英国程序员 Simon Willison 在博客上发了篇很短的文章。他给手头能用的 16 个大模型丢了同一句话:
武子康2 天前
人工智能·llm·agent
Codex 后台任务结束了,为什么还不能直接接着用?假设你在 Claude Code 里把一个调查交给 Codex,随后继续修改同一仓库。过了一会儿,你输入 /codex:result,拿到一份输出,准备按里面的建议接着改。
stereohomology2 天前
llm·薅羊毛·反被·羊毛薅
智谱的工程师是如何笃定认为这个不会被发现?最近,关于智谱旗下 AI 编程工具 zcode 是否存在静默上传用户数据的讨论,在开发者社区掀起了不小的波澜。无论最终的技术鉴定结果如何,这件事本身折射出的问题远比单一产品更深层:开发者的"实现思维"和安全研究者的"逆向思维"之间,存在一道几乎不可逾越的认知鸿沟。
liulilittle2 天前
ai·自动化·llm·mock·测试·tools
mock 规范总纲第0条(基线)本目录一切数字以 20260918 磁盘实测为准;旧数引用禁止。产品源码与文档冲突时以源码为准并即时修正文档。
音视频牛哥2 天前
人工智能·llm·机器人视觉·slam·vla·多模态感知·机器人音视频
从 LLM、VLA、LLA、SLIM 到实时音视频感知底座:具身智能真正需要的不只是大模型过去十几年,音视频行业解决的问题,大多可以归结为一个核心目标:怎样把声音和画面更稳定、更清晰、更低延迟地送到另一个人面前。摄像头采集、H.264/H.265 编码、RTSP/RTMP 推流、播放器解码、GB28181 接入、录像与转发,这些技术最终服务的主要对象仍然是“人”。
我是小邵2 天前
人工智能·ai·llm·长期记忆·中间迷失·上下文收口
长对话先收口:用“工作记忆 vs 长期记忆“管理 AI 上下文发布日期: 2026年09月19日 阅读时间: 约 12-15 分钟 分类:技术杂谈 专栏:主流AI工具指南 关键词:上下文工程 收口 中间迷失 LLM 长期记忆 AI
liulilittle2 天前
ai·自动化·llm·mock·lua·测试
麻将结算全链路语义(SETTLE_SEMANTICS)第0条(基线)本文件语义以产品源码为权威源;引用只允许以文件与符号(函数、字段、协议名)给出;行号引用前必须复核现码。文件简称:PS=玩法服,GS=游戏服,CC=客户端核心,SC=场景服,MC=匹配中心,DF=麻将定义。进程链路:PS 到 MC 到 SC 到 GC 到 GS 到 CC。
武子康2 天前
人工智能·llm·agent
vLLM 的 token 预算还有余量,为什么请求仍被抢占?一批语音 Agent 正在持续输出,旁边又来了几个携带长检索材料的请求。服务没有报 OOM,GPU 也还在工作,但用户听到的停顿变长了。此时把 max_num_batched_tokens 调大,看起来能让长输入更快处理完;问题是,如果真正先耗尽的是 KV Cache,可调度的 token 更多,并不意味着请求就能继续执行。