llm

夫子3964 小时前
llm·agent·ai编程
【第三部分:第一个 Agent 应用】10. 不使用框架,手写一个最小 Agent前面的文章,我们已经分别介绍了 Context Engineering、Function Calling、Structured Output 和 RAG。这些能力单独看并不复杂,但真正进入 Agent 开发后,还需要回答一个问题:
武子康5 小时前
人工智能·llm·agent
模型分数涨了,它真的学会了吗?LittleLearner 拆开了三种可能给模型加几万条 SFT 数据,再跑一轮 GRPO,数学分数从 30 分涨到 50 分。这个结果通常会 被概括成一句话:模型学会了更多数学。
柒和远方5 小时前
llm·agent
V073:SDD 规范驱动开发:文档即代码,两次创造与 proposal/design/task 三份规范Vibe Coding(氛围编程)很上头:打开 AI Coding Agent 的交互面板,不停地给 AI 下任务——"帮我做一个用户认证系统",AI 疯狂生成代码,第一天效率翻倍,第二周开始返工(AI 在猜),第一个月陷入自我怀疑。第六十二天的笔记指出:问题不在 AI 能力,而在我们给大模型的上下文不够。解法是一种新的 AI 协作范式——SDD(Spec-Driven Development,规范驱动开发):先撰写文档、设计好项目,再让 AI 按规范写代码。这篇文章把这套范式拆开讲清楚,并用一个 Chr
要有锋芒_不要疯忙5 小时前
llm
Transformer 是什么?--LLM知识(一)一句话回答:Transformer 是一种让模型在处理一句话、一个段落或一张被切分后的图片时,能同时查看所有相关部分,并据此更新每个部分含义的神经网络架构。
武子康5 小时前
人工智能·llm·agent
DeepSeek Harness:一次 Prompt 如何变成 Turn、Step 与工具事件用户输入一句“检查这个项目并修复测试”,系统什么时候算接收,什么时候算开始,什么时候算完成?如果把一次 Prompt 直接等同于一次模型请求,工具一出现,边界马上崩掉:模型先请求读文件,工具返回以后还要再调用模型;中途可能插入 steering,也可能取消;一个请求失败后,策略还可能决定重试。最后 SDK 看见 Agent 回到 idle,却不一定能把这次 idle 唯一归因给最早那条消息。
AINative软件工程6 小时前
llm
LLM 请求重试耗尽之后:Dead Letter Queue 工程实践你的 LLM 应用加了重试。但重试耗尽之后,那条请求去哪了?凌晨两点,我们的报告生成任务静静地失败了。
孙启超15 小时前
人工智能·lora·llm·微调·sft·token·rlhf
【大模型应用开发】LLM 到底是什么,以及它是怎么训练的你有没有想过一个问题:为什么 ChatGPT 能跟你对话?它不是"搜答案"。如果你问它"1+1 等于几",它不是去百度查,而是"算"出来的。更准确地说,是"生成"出来的——它基于你输入的文字,一个 token 一个 token 地预测下一个字该是什么。
DigitalOcean21 小时前
llm
2026 LLM 成本计算指南:Token 价格、推理费用与降本方法根据 2026 年 State of FinOps Report 的调查数据,去年接近四分之三的企业都出现了 AI 成本超出预算的情况。造成这一差距的一个重要原因,就是很多团队在工作负载进入生产环境之前,没有先做好准确的 LLM 成本测算。
武子康1 天前
人工智能·llm·agent
DeepSeek Harness、Codex、Claude Code、LangGraph 应该怎么选:先判断你缺的是产品、底盘还是工作流“DeepSeek Harness 和 Codex、Claude Code、LangGraph 谁更强?”
阿弱1 天前
后端·llm·agent
pi 扩展机制:加载、执行与能力pi 的扩展系统解决一个问题:把 agent 内部流程以事件形式暴露出来,让外部代码能观察、拦截、修改它的行为。Claude Code 这类 agent 默认是黑盒——你不知道它中途改了哪些文件、跑了哪些命令、每一轮花了多少 token、有没有切模型。pi 的做法是给一套扩展机制,把内部流程白盒化,挂回调就能拿到这些信息。
vivo互联网技术1 天前
深度学习·计算机视觉·llm
Octopus:基于无历史数据的梯度正交化的学习框架|CVPR 2026作者: vivo BlueImage Lab 本文入选 CVPR 2026 CVPR(IEEE Conference on Computer Vision and Pattern Recognition)IEEE国际计算机视觉与模式识别会议,主要内容是计算机视觉与模式识别技术。CVPR 2026约160920篇投稿,接收率约25.42%。
leeyi1 天前
llm·aigc·agent
Langfuse 集成源码:batch 协议、media 上传与 mock 测试(第89篇-E75)上一篇站在使用者视角把行车记录仪装上了:handler 翻译切面、队列攒批、四道工序。这篇下到桥接层最底下——libs/acl/langfuse 这个不含任何 Eino 概念的纯 HTTP 客户端库,回答三个出门前才需要想的问题:
修远客1 天前
llm·agent
风格进化:让Agent越来越懂你 — 从"工具"到"助手"的关键跃迁没有风格进化的 Agent,用 100 次和用 1 次没区别 — 每次都是"第一次见面"。风格进化让 Agent 从"一次性工具"变成"越用越懂你的助手"。 这是 Agent 最有"Agent 味"的能力 — 不是开发者写死的规则,是 Agent 从用户行为中自己学到的偏好。
武子康1 天前
人工智能·llm·agent
Pi Extension 写完不等于可用:从类型检查到真实 Runtime 的证据阶梯本文用一个 Context Audit Extension 展示 Pi Tool、Command、Event 与 UI Status 的职责, 并给出来源契约、官方类型检查、注册与 Mock、真实 Runtime、TUI/模型路径、生产安全六层 证据阶梯。文中真实验证到 Pi v0.82.1 RPC 加载、/audit 发现与执行、 context_audit 进入活动工具面;未把 TUI、模型自主调用或生产安全写成已通过。
一只积极向上的小咸鱼1 天前
算法·llm
分词器tokenizer笔记12将原始文本转化为模型理解的数字序列 LLM负责“理解和生成”,而tokenizer负责“把语言变成模型能理解、可复用的格式” 分词器会影响模型能力:token划分得太“碎片化”或太“笼统”,都会影响表达效率; 所以:
AINative软件工程1 天前
后端·llm·ai编程
LLM Token Budget 工程实践:给每个请求设上限,让成本和质量都在掌控中我们的 AI 总结功能上线第三天,成本告警炸了。复盘之后发现:有几条用户上传的长文档,每次请求的输出 token 数超过 4000,而我们并没有设置任何 max_tokens 限制。模型默认往长了生成,单次请求成本是预期的 6 倍。更糟的是,有个 Agent loop 在某个工具返回异常数据后开始反复重试,三分钟消耗了我们一天的 token 配额。
XLYcmy2 天前
深度学习·llm·sgd·adam·deepseek·mla·adamw
小红书 算法一面 八# DeepSeek R1的MLA:KV缓存的低秩压缩革命MLA(Multi-Head Latent Attention,多头潜在注意力)是DeepSeek R1前3层采用的核心创新机制,其**通过低秩联合压缩技术将KV缓存大小降低90%以上**,同时保持与标准多头注意力(MHA)相当的性能,为长上下文推理与高吞吐量部署提供了关键支撑。
魔术师Grace2 天前
llm·agent
大模型到底怎么分类?从“聊天模型”走到 Agent 模型选型我有个前同事做 Java 开发的,最近被迫转行做 Agent 开发,他们公司要求不转型就拜拜,所以也只能硬着头皮上了,每天晚上都跟打了鸡血一样要找我聊五块钱的~
XLYcmy2 天前
llm·transformer·encoder·decoder·自注意力·deepseek·深度思考
小红书 算法一面 七Transformer 编码器(Encoder)的**多头自注意力(Multi-Head Self-Attention)**与解码器(Decoder)的**掩码多头自注意力(Masked Multi-Head Self-Attention)**,核心差异源于两者的任务目标不同:**Encoder 负责“理解输入序列的全局语义”,需双向关注所有 token;Decoder 负责“生成连贯的输出序列”,需单向关注已生成的 token,防止泄露未来信息**。
京东云开发者2 天前
llm·agent
让AI真正参与工作!JoyDesk已上线京东云大模型正加速走向产业应用,AI也正在从“回答问题”迈向“完成任务”。越来越多企业开始将AI应用到研发、办公、营销、运营等业务场景。然而,工具分散、知识难沉淀、业务系统割裂,以及安全治理不足等问题,成为AI价值落地的瓶颈。企业需要的不只是一个AI工具,而是一个能够真正参与工作的AI平台。