token

小七-七牛开发者12 小时前
ai·大模型·claude·token·工作流·skill·claudecode·ai coding
拆解 dsh 系列:从源码和版本变化看 DeepSeek Harness 的设计取舍DeepSeek Harness 发布才两周,但翻看它的 Git 历史,会发现它在第一个公开 rc 出现之前,其实就在内部打磨了两个月。
XLYcmy14 小时前
pdf·llm·json·agent·token·csv·dify
PDF论文处理器 - 完整使用指南PDF论文处理器是一个专门为网安科研论文设计的PDF文本分割工具,旨在将英文论文PDF文件转化为Dify知识库可直接使用的高质量数据块。
guwentian20 小时前
大模型·token·gguf
不用显卡也能跑大模型?GGUF 量化与 llama.cpp 本地推理实战📖 摘要:云端 API 有隐私、成本、限流三道坎,本地推理正成为 2026 年开源最热方向之一。本文用量化直觉讲清"4-bit 为什么质量不崩",并用纯 Python 跑通三件套:最小对话、GPU 卸载 + 流式输出、OpenAI 兼容 Server。附 VRAM 选型表与 4 条生产避坑,帮你半小时内把第一个本地模型用起来。
小七-七牛开发者2 天前
ai·大模型·agent·token·工作流·claudecode·ai coding
Agent 小知识 | Skill 的设计与生命周期:从工具接口到能力模块上一期我们聊了 Agent 的环境,承载文件、网页、进程和数据库等真实对象,工具则构成 Agent 的观察空间与行动空间。
yuyuyui2 天前
jwt·.net core·token·主动登出·会话撤销
DOTNET 鉴权系列- JWT 会话撤销与主动登出写这篇的主要原因是记录一下jwt无状态特点下的主动撤销和登出的解决方案,因为之前负责做过类似的用户相关的系统,对于这一块的方案和实现比较粗糙的,登录成功后,计算完整 JWT 字符串的 Hash,将tokenHash + userId存入Redis,每次鉴权时计算请求 Token 的 Hash,去存储中比对是否存在,这套方案虽然实现了登出撤销,但把所有有效 Token 全部落地存储,JWT 只剩下签名验签的能力,几乎退化成传统 Session 模式,丢失了 JWT 无状态的设计初衷。
a187927218313 天前
深度学习·ai·transformer·token·注意力机制·deepseek·多层堆叠
从一条直线到大模型输出一个token(九):输出矩阵与多层堆叠建议先看:从一条直线到大模型输出一个token(八):残差连接与前馈网络上一篇走完了单个 Block 的六步。这一篇把 Block 复制 32 份串起来——不同层的 Block 各学什么,2024-2025 各家大模型到底堆了多少层,然后用 6 个 token 实地观察"浅→中→深"到底改了什么——这是理解"下一个 token 如何诞生"的关键一环。
小七-七牛开发者3 天前
ai·大模型·agent·token·工作流·claudecode·ai coding
拆解 DeepSeek Harness:Profile 与 Bundle 如何装配运行时前一篇讨论 Cordis 插件架构「解读 Cordis:dsh 一切皆插件背后的运行时设计」时,我们看到 dsh 把工具、模型适配器、会话、Agent Loop 等运行时能力拆成了插件。这样一来,运行时中的各个组件可以独立地完成注册、替换和退出。
小七-七牛开发者4 天前
ai·大模型·agent·token·工作流·claudecode·ai coding
61 亿次请求背后:LLM Serving 的 Cache 与调度难题随着 LLM 进入真实业务环境,LLM Serving 面临的问题正从单纯的单次推理加速,扩展到集群层面的资源调度与运行效率。一次请求的计算成本不仅取决于模型参数量,还受到输入输出 Token 长度、用户交互方式、上下文复用以及请求路由策略影响。
xiaokcehui5 天前
token
deepseek harness安装和使用入门1、安装 Node.js官网下载node-v24.19.0-x64.msi,并安装2、打开windows 的cmd命令窗口,输入
XLYcmy7 天前
google·meta·llm·负载均衡·token·moe·glam
小红书 算法一面 十一# 基于MoE的模型架构全景解析MoE(混合专家模型)核心思想是**将模型总参数量与单次推理计算量解耦**,通过稀疏激活专家子网络实现高效扩展。以下按时间线与创新维度,系统介绍主流MoE架构的设计特点、核心突破与适用场景。
小七-七牛开发者8 天前
ai·大模型·agent·claude·token·工作流·skill·claudecode·ai coding
dsh 拆解系列 Vol.01:没有特权内核的 Agent 运行时本文基于 @deepseek-ai/dsh 0.1.0-rc.7(npm latest 标签),文中的包名与依赖数据都可以用文末命令复现。dsh 目前处于 developer preview,官方明确预告后续会有破坏性变更,因此这个系列更关注具体 API 背后的工程设计。读到本文时,如果版本继续往前走,请以文首标注的版本为准。
孙启超8 天前
人工智能·lora·llm·微调·sft·token·rlhf
【大模型应用开发】LLM 到底是什么,以及它是怎么训练的你有没有想过一个问题:为什么 ChatGPT 能跟你对话?它不是"搜答案"。如果你问它"1+1 等于几",它不是去百度查,而是"算"出来的。更准确地说,是"生成"出来的——它基于你输入的文字,一个 token 一个 token 地预测下一个字该是什么。
小七-七牛开发者9 天前
ai·大模型·agent·claude·token·工作流·skill·claudecode·ai coding
Agent 小知识|Agent 环境工程:部分可观测性、状态转移与执行隔离上一期我们聊了 Agent 的三种编排方式:ReAct、Plan-and-Execute 与 Workflow Graph。编排解决的是任务接下来往哪里走,工具负责把模型提出的行动交给真实系统执行。
番茄不是西红柿kk10 天前
人工智能·ai·chatgpt·agent·token·codex·deepseek
什么是Token?如果你用过任何一款大语言模型产品,你一定见过“Token”这个词。它出现在计费账单里、API文档里、技术评测里——无处不在,但很少有人真正说清楚它到底是什么。
赵大仁10 天前
ai·大模型·prompt·token·成本优化
Prompt 缓存与上下文压缩:把 Token 账单砍一刀的实操清单独立专题 · 成本优化加餐 相关阅读:drafts/llm-07-cost.md(全链路成本治理)Agent 上线第三周后,账单往往不是因为「答得更长」,而是 同一套 system、工具 Schema、规章前缀,每轮对话又被完整计费一遍。Prompt 缓存和上下文压缩,是少数能在 不砍模型档位 的前提下,立刻压低输入 token 的两把刀。
SoStraw12 天前
tcp/ip·webrtc·frp·token·faq·webrpc·无公网ip
webrpc 常见问题 FAQ:无公网 IP、Token、传文件,以及和 frp / WebRTC 的差别独立开发者笔记,非官方文档。内容以 webrpc 官网 公开说明与实际接入体验为准。接入 webrpc 一段时间后,私信和评论里反复出现同一批问题:它到底是什么、没公网行不行、和 frp 比谁合适、Token 怎么用、文件怎么传、握手失败怎么办。这篇把我答过多次的内容收成一份 FAQ,方便对照自查。
小当家.10516 天前
java·spring·缓存·token·上下文
Token成本控制实战:语义缓存、上下文压缩与工具缓存LLM 按 Token 计费,一个中等规模的 AI 应用每天可能产生数百万 Token 消耗。以 GPT-4o 为例,input $2.50/1M tokens、output $10.00/1M tokens,一次包含 30 轮对话的练习会话可能消耗 15K+ tokens,月活 1000 用户的场景下月成本轻松过万。
小七-七牛开发者17 天前
ai·大模型·agent·claude·token·工作流·claudecode·ai coding
Codex 实践系列 Vol.04:用 Goal 和 Plan 管住一个长任务在先前的 Codex 实践中,我们已经跑过 CLI、读过开源项目,也用 /status、/diff、/review、/plan 等 Slash Command 管理过一次完整的开发过程。