llm

武子康4 小时前
人工智能·llm·agent
小智断网后还能做什么?沿一次唤醒看清设备与服务端的分工把一台小智放在桌上,说出唤醒词,屏幕发生变化,随后听见回答。对使用者来说,这是一件事;对系统来说,识别唤醒词、接通会话、理解问题、生成语音和驱动扬声器,可能发生在不同位置。
米小虾6 小时前
人工智能·llm
加了 20 条示例反而变差:你的 few-shot 提升,可能只是 prompt 变长的功劳有一句被写进无数 Prompt 工程教程的常识:给模型几个示例(few-shot demonstrations),它会更懂你要什么;示例放多了反而会伤害效果,因为示例"扭曲"了模型的内部表征。前半句有人查过,后半句基本没人认真查过。
程序猿编码9 小时前
大模型·llm·rk3588·qwen·推理·vlm
不用 GPU!RK3588 跑视觉大模型,Qwen3.5-2B VLM 端侧落地这是一套面向瑞芯微RK3588 NPU硬件加速的Qwen3.5-2B视觉语言模型推理实现,完全基于原生C++构建,配套专用大模型运行时与神经网络加速引擎,完整支持单图像理解与视频序列分析两种模式。
刘马想放假10 小时前
人工智能·开源·llm
RK3588 使用 rk-llama.cpp + RKNPU2 部署 Qwen3.5:从零开始的 NPU 本地大模型实战图 1:本文以 RK3588 上的文本推理为目标。板卡为概念示意,CPU 与三核 NPU 均属于 RK3588 SoC。
殷紫川10 小时前
llm·aigc
ZCode 把整个 Git 仓库加密上传到了阿里云 OSS:一次客户端逆向的完整复盘事情的开头特别不起眼。有开发者清理磁盘时顺手看了一眼家目录,发现 ~/.zcode 占了七百多兆。这目录平时没人会去看,它只是智谱官方 AI 编程桌面应用 ZCode 的数据根目录。往下翻,cli/ 占 257MB,是会话数据库和执行日志;computer-use/ 占 130MB,是打包进去的运行时依赖;真正占大头的是 v2/checkpoints/,约 303MB。
一颗无畏豆儿11 小时前
ai·大模型·llm·ai工具
关于常用AI工具和大模型的总结
武子康11 小时前
人工智能·llm·agent
Expert Parallel 深入解析:专家分得均匀,负载为什么仍不均平台版本:vLLM docs.vllm.ai/en/stable 页眉 v0.28.0;DeepEP github.com/deepseek-ai/DeepEP README V2 节。资料检查日期 2026-09-08。所有任务计数(600/500/200…、1100/400/300/200、700/600/350/350)与"3.3.3 万人已读"等下游结论均为作者假设,未执行部署、性能或质量实验。
烈风逍遥12 小时前
llm
LLM 流式调用工具类 LlmSseHelper解析项目地址前端:github.com/seapack-hub…后端:github.com/seapack-hub…
桃西西呀12 小时前
人工智能·llm·agent
本地 RAG 问答 Agent:切片即建模,幻觉即责任本地搭一个 RAG 问答 Agent,看着比训练模型省事多了:丢一堆文档进去,接个 embedding,再套个大模型,问答不就出来了?但凡是真把内部知识库接上、让人天天问的,几乎都栽过同一类事——问「七天无理由退款怎么操作」答成「不支持退款」、问「怎么开发票」却编出一段「发票在设置页自助开具」、向量库重启后整个检索崩掉还以为自己正常。
梅梅绵绵冰16 小时前
langchain·llm·longchain4j
RAG知识库RAG(检索增强生成)主要解决大模型的两大痛点:核心思想:不把全部文档一次性塞给大模型,而是在用户提问时,先从私有知识库中检索出相关片段,再将检索到的片段与用户问题一并交给大模型,让模型参考检索到的真实资料进行回答。
DylanlZhao16 小时前
llm·grafana
我想看看本地 LLM 给我省了多少钱,于是我监控了它最近大量用本地模型,我想知道我每天到底省了多少钱。所以我就必须要知道我每天用了多少 tokens。于是我就问 AI,怎么才能监听本地大模型的用量?
gravity_w17 小时前
人工智能·深度学习·语言模型·llm·nlp·flops·cs336
【CS336】Lecture 2 PyTorch 与资源核算(Resource Accounting)我们的核心目标是在给定有限资源(算力、内存、数据)的情况下训练出最好的模型,数据在本课程中不是真正的瓶颈,目标是最大化训练的计算效率。在优化计算效率之前,我们需要理解某一个具体计算的效率,因此,需要理解其计算特性和内存特性。 问题 1:在 1024 张 H100 上训练一个 700 亿参数、1.5 万亿 token 的模型需要多长时间?
XLYcmy17 小时前
网络安全·llm·prompt·agent·cot·漏洞检测·harness
Prompt 设计相关问题2. Prompt 设计相关问题问题 2.1:为什么要设计那么长的 Prompt?会不会导致模型的处理效率降低?
Ticnix1 天前
python·llm·agent
我删了 200 行 if-else,把决策逻辑全写进了 System Prompt「AI Agent 工程化实战」系列 · 06项目背景:广州气象大数据 + AI 智能体出行推荐系统(FastAPI + LangGraph + MCP + pgvector)
谢白羽1 天前
笔记·python·llm·llama·sglang
在4×B300用SGLang部署DeepSeek-V4.1 Flash优化实录本文提到的 DeepSeek-V4.1 的 Day 0 适配和 kernel 优化由 SGLang 团队共同完成。最终在 4×B300、TP4 / EP4 配置下,配合 DSpark 达到
DigitalOcean2 天前
llm
DeepSeek V4.1 Flash 现已上线 DigitalOcean:更强 Agent,更低推理成本DeepSeek 最新发布的 DeepSeek-V4.1-Flash 现已上线 DigitalOcean AI 推理平台,开发者可以直接通过 DigitalOcean 无服务器推理(Serverless Inference)调用,无需自己部署和维护 GPU 推理集群。
liulilittle2 天前
ai·spark·llm·agent·tools·opencode·muse
OpenCode 中解禁 Muse-Spark 1.3 - max 档OpenCode UI 最高给到 xhigh。Muse-Spark 1.3 的 API 接受 max。默认配置下,max 可能在客户端被校验丢弃,或静默降级成 xhigh。解禁就是让请求真正带 reasoning_effort=max。
桃西西呀2 天前
人工智能·深度学习·llm
限速 30 和限速 80 只差一个数字,卷积网络怎么分得清?上个月我把行车记录仪里的视频导出来重看了一遍。同一条路,白天路过拍到一块「限速 80」的牌子,傍晚逆光再路过,同一块牌子在画面里几乎看不出轮廓,只有中间那个数字还算清楚。
武子康2 天前
人工智能·llm·agent
小智首批设备怎样放量?从接入名单到故障后的恢复决定平台版本:小智服务端 xinnan-tech/xiaozhi-esp32-server commit 6afc54a17def47578a4b3efc4680873689d3168b;小智客户端 78/xiaozhi-esp32 commit cf2024ff36b3af1d651a68ee582cbb91986ec4d4;ESP-IDF v6.0.1。资料检查日期 2026-09-16。本文未启动服务器、未调用模型、未烧录固件、未做真实断网测试。
桃西西呀2 天前
人工智能·llm·agent
邮件自动分类 Agent:分类即建模,动作即风险邮件自动分类看着是 AI Agent 里最成熟的一类:输入是文本,动作只是挪个文件夹。但凡是真用在跑的,几乎都踩过同一类坑——把老板的发票判成垃圾、把含身份证的邮件落库明文、一个 expunge 永久删信、连接断了还以为自己成功。