llm

Ticnix9 小时前
python·llm·agent
我删了 200 行 if-else,把决策逻辑全写进了 System Prompt「AI Agent 工程化实战」系列 · 06项目背景:广州气象大数据 + AI 智能体出行推荐系统(FastAPI + LangGraph + MCP + pgvector)
谢白羽9 小时前
笔记·python·llm·llama·sglang
在4×B300用SGLang部署DeepSeek-V4.1 Flash优化实录本文提到的 DeepSeek-V4.1 的 Day 0 适配和 kernel 优化由 SGLang 团队共同完成。最终在 4×B300、TP4 / EP4 配置下,配合 DSpark 达到
DigitalOcean10 小时前
llm
DeepSeek V4.1 Flash 现已上线 DigitalOcean:更强 Agent,更低推理成本DeepSeek 最新发布的 DeepSeek-V4.1-Flash 现已上线 DigitalOcean AI 推理平台,开发者可以直接通过 DigitalOcean 无服务器推理(Serverless Inference)调用,无需自己部署和维护 GPU 推理集群。
liulilittle10 小时前
ai·spark·llm·agent·tools·opencode·muse
OpenCode 中解禁 Muse-Spark 1.3 - max 档OpenCode UI 最高给到 xhigh。Muse-Spark 1.3 的 API 接受 max。默认配置下,max 可能在客户端被校验丢弃,或静默降级成 xhigh。解禁就是让请求真正带 reasoning_effort=max。
桃西西呀11 小时前
人工智能·深度学习·llm
限速 30 和限速 80 只差一个数字,卷积网络怎么分得清?上个月我把行车记录仪里的视频导出来重看了一遍。同一条路,白天路过拍到一块「限速 80」的牌子,傍晚逆光再路过,同一块牌子在画面里几乎看不出轮廓,只有中间那个数字还算清楚。
武子康14 小时前
人工智能·llm·agent
小智首批设备怎样放量?从接入名单到故障后的恢复决定平台版本:小智服务端 xinnan-tech/xiaozhi-esp32-server commit 6afc54a17def47578a4b3efc4680873689d3168b;小智客户端 78/xiaozhi-esp32 commit cf2024ff36b3af1d651a68ee582cbb91986ec4d4;ESP-IDF v6.0.1。资料检查日期 2026-09-16。本文未启动服务器、未调用模型、未烧录固件、未做真实断网测试。
桃西西呀14 小时前
人工智能·llm·agent
邮件自动分类 Agent:分类即建模,动作即风险邮件自动分类看着是 AI Agent 里最成熟的一类:输入是文本,动作只是挪个文件夹。但凡是真用在跑的,几乎都踩过同一类坑——把老板的发票判成垃圾、把含身份证的邮件落库明文、一个 expunge 永久删信、连接断了还以为自己成功。
武子康15 小时前
人工智能·llm·agent
Data Parallel 深入解析:把请求分给真正有余量的副本两份模型副本都显示"等待请求:4",轮询路由看起来很公平。可 A 排着四条短问句,B 排着四份长文档。如果按相同 Tokenizer 计数,A 的每条输入是 128 Token,B 是 8192 Token,而且都没有可复用前缀,那么等待处理的输入分别是 512 和 32768 Token,相差 64 倍。
Java后端的Ai之路16 小时前
开发语言·人工智能·python·llm·评估
大模型LLM评估完全指南你花了三个月微调的模型,Demo演示时惊艳全场,一上线就被用户骂到回滚? 你说模型效果好,老板问"好多少",你支支吾吾说不出一个数字? 竞品都在卷MMLU分数,你却连自己的模型在真实业务场景下会不会胡说八道都不知道?
牛油果子哥q1 天前
ai·llm
LLM安全与内容风控全栈落地: Prompt注入、越狱攻击、幻觉风控、敏感词过滤、C++风控网关、多级审核体系、线上攻防实战前面我们搞定了LLM服务架构、网关治理、性能压测、SLA稳定性。服务能跑、能抗并发、性能达标,但是距离「可以商用上线」还差最后一道、也是最致命的一关:AI安全与内容风控。
武子康1 天前
人工智能·llm·agent
小智服务端怎样组织 ASR、LLM、TTS?先追本次连接实际使用的对象你给小智服务端改了模型配置,设备仍能连接,日志也有识别文本,但回答不像预期模型,或者文字已经出来,扬声器还没开始说话。此时"ASR→LLM→TTS"只能说明大方向:它没有告诉你,这个设备到底拿到了哪份配置、哪个实例,又在哪个交接点等待。
掰头战士1 天前
前端·llm·agent
Prompt Cache,如果agent全靠LLM方做隐式缓存实在不够用。系统提示的内容一个字没改,只把其中一行挪了个位置,二十轮的账单差了 7 倍设想这样一个场景。你的 Agent 上线第一周,账单很稳定。第二周开始不对劲——同样的任务量,费用翻了一倍。
Code_Artist1 天前
人工智能·llm·ai编程
☢︎自然语言 → 机器码:这到底是 AI 编程的终极形态,还是一个伪命题?如果 AI 已经能够理解自然语言、生成代码、编译代码,那么“编程语言”这层抽象是否最终会消失?自然语言 → 机器码,会不会成为 AI 编程的终极形态?
前端双越老师1 天前
llm·agent·芯片
张三的 10 亿元 AI 梦:从“造神”到“活下去”大家好,我是双越。wangEditor 作者,前百度 滴滴 资深前端工程师,慕课网精英讲师,PMP,前端面试派 作者。
桃西西呀1 天前
人工智能·深度学习·llm
机器眼里没有脸,怎么识别人脸?手写 CNN 拆开卷积层与 BatchNorm早上七点四十,地铁口,我掏出手机扫了一下脸,锁开了,半秒不到。同一件事的另一面是,过去一年 AI 生成的脸也多了起来。2025 年 9 月 1 日《人工智能生成合成内容标识办法》施行,要求 AI 生成合成的内容打上标识,到今年 9 月刚好跑满一年。
bestcxx1 天前
ai·llm
DeepSeek 的“快”与“全”:一次关于搜索、爬虫与信息时效性的讨论最近和Deepseek 聊到 DeepSeek自己,** 聊着聊着,话题就滑向了更底层的好奇——它为什么能爬那么多信息而不被拦截?搜索为什么那么快?它是不是把整个互联网都缓存了?那还能搜到最新消息吗?
谢白羽1 天前
笔记·llm·论文·大模型部署·sglang
MiniMax-H3 : 4卡 H20-3e一套权重部署实践/8卡H200部署优化实测H3-Base 将各模态编码后组织为统一序列,由同一个 Omni Transformer 联合预测视频与音频的潜在表示,再交给各自的 VAE 解码。文字和视觉条件会经过 H3-Encoder,视觉内容还通过 Visual VAE 表示,音频则由 Audio VAE 编码。这使参考素材的类型和长度都可能改变工作量;只验证文本生成,不能覆盖有声视频或混合参考的编码路径。
气象复杂2 天前
llm
手写 ReAct 跑了 30 个任务:模型 0 格式失败,丢的 10 步全是我写的解析器接上一篇。第二个项目(LangGraph 多智能体岗位匹配)做到一半,我干了件框架时代的"逆行"事:不用 create_react_agent,不用任何框架,手写了一遍 ReAct 循环,然后在 30 个任务上跑了批量实验,同一输入连跑两轮。
桃西西呀2 天前
人工智能·llm·agent
文件监控 Agent 为什么总在关键时刻掉链子你大概率写过或想写过这样一个东西:盯着一个文件夹,新文件进来自动分类、重复文件丢进回收站、某个目录一变更就告警。十几行 watchdog 就能跑起来,看起来是 AI Agent 里最简单的一类。
夫子3962 天前
llm·agent
【第三部分:第一个 Agent 应用】13. 为 Agent 增加记忆能力:不是记住一切,而是在需要时想起正确的信息上一篇我们使用 State Machine 解决了一个重要问题:当前这一次任务执行到哪里。但状态机并不会让 Agent 真正“认识”用户。假设用户连续几周都在使用同一个需求分析 Agent,并多次说明: