技术栈
llm
用户719697593358
9 小时前
llm
Llama 3 精读|附 FP8 量化与长上下文实测
Llama 3 是 Meta 的第三代开放权重模型(论文里的结果都是 7 月发布的 Llama 3.1):8B、70B、405B 三个稠密 Transformer,最大的 405B 在 15.6T token 上训练,用了 3.8×10253.8 \times 10^{25} 3.8×1025 FLOPs,约为 Llama 2 70B 的 50 倍,上下文分 6 个阶段从 8K 扩到 128K。结构几乎没变(所有规模都用 GQA,词表扩到 128K,RoPE 基频提高到 500,000),提升主要来自更多
架构师那点事儿
9 小时前
人工智能
·
架构
·
llm
大模型如何私有化部署到生产环境
先架构设计为主+,部分已实现工程为辅。以翻译模型为例,打通「下载开源模型 → 私有化部署 → 对外提供 API」全流程
浮生望
9 小时前
llm
·
agent
给 Agent 加记忆:截断、总结与向量检索三种方案怎么取舍
我做多轮对话时最早的“记忆”实现,就是把所有消息放进数组,每次请求都完整传给模型。对话少时没有问题;轮次一多,token 开销持续上涨,旧内容开始挤占上下文窗口,真正相关的信息反而被淹没。
浮链序
10 小时前
人工智能
·
python
·
llm
用 Claude Haiku 5.5 做子智能体路由,把 Agent 成本砍掉六成
做 Agent 系统最容易被账单教做人。我带过一个内部客服 agent,一开始所有请求都丢给旗舰模型,月底一看费用,老板脸都绿了。后来我们做了一层「路由」:轻活给小模型,重活给大模型,整体开销直接腰斩。但腰斩不是白来的。路由写错了比不路由还惨——把本该重推理的请求误判成轻活丢给小模型,用户那边直接看到胡说八道,投诉比省钱更贵。所以路由的核心不是「省」,是「分得对」。我们当时是先离线跑了一周流量做意图标注,确认分布后才上路由,不是拍脑袋切,这一步省不得。
Soofjan
10 小时前
llm
·
agent
Agent基础(3):提示工程、采样参数与 Token
和大模型交互,本质上是在做两件事:一是用提示词告诉模型“该怎么理解任务”,二是理解模型实际读到的并不是文字本身,而是一串 Token。前者决定输出方向,后者决定成本、上下文长度和一些看似奇怪的错误。
Soofjan
10 小时前
llm
·
agent
Agent基础(1):组成、运行机制与幻觉处理
一个可用的 Agent,通常不是“一个会聊天的模型”,而是四块能力拼在一起:理解 AI Agent,可以先抓住一个核心差异:普通 AI 更像“回答问题的助手”,而智能体更像“能围绕目标持续行动的执行者”。
万联WANFLOW
11 小时前
llm
·
agent
·
mcp
从Agent到Agentic Collaboration:企业AI工作流背后的技术架构
10月7日,Cisco在WebexOne 2026期间公布了一系列围绕Agentic Collaboration的更新,涉及Webex、Claude Managed Agents、Model Context Protocol(MCP),以及客户服务、智能办公和企业IT管理等场景。
孟健
11 小时前
人工智能
·
llm
·
ai编程
200 美元订阅实测:从 Agent 吞吐与缓存机制,算清 Claude 与 OpenAI 的算力账
大家好,我是孟健。上周我把团队自动化编程 Agent 矩阵的主力调用通道重新梳理了一遍,并复盘了全月的算力账单。
草上飞9527
13 小时前
人工智能
·
深度学习
·
llm
把前沿能力装进便宜产物,本身是多数模型还不会的能力
原文链接:arxiv.org/abs/2610.08…这篇论文问的是一个很朴素的工程问题:一个大模型能逐条回答某个窄任务,但要对几百万条同类实例逐条调用,账单会大到不可接受;那么能不能让模型以智能体的身份,自己动手把这份能力做成一个便宜的、可反复使用的产物——训一个小模型、写一段规则程序,或者两者混用——再拿这个产物去跑完整个工作量?作者把这种能力叫作 bottling(装瓶),并搭了一个叫 BOTTLED 的基准来测它。
山顶夕景
13 小时前
llm
·
蒸馏
·
rlvr
·
opd
【OPD】Rethinking On-Policy Distillation: Phenomenology, Mechanism, and Recipe
Rethinking On-Policy Distillation of Large Language Models: Phenomenology, Mechanism, and Recipe 清华大学等,2026-04-15 | 代码:github.com/thunlp/OPD
goehou
13 小时前
ai
·
llm
·
json
·
agent
·
教程
·
结构化输出
LLM 结构化输出全解:从 Prompt 约束到 Schema 硬保证,三层实现怎么选
LLM 系列又一篇。Function Calling 篇讲过「模型输出结构化请求」的协议细节——但那个循环里有个前提没展开:模型输出本来就是不可靠的散文,怎么让它变成代码能直接用的数据? 这篇讲透结构化输出。
AI技术新视界
15 小时前
人工智能
·
llm
微软确认 GPT‑6 使用 Looped Transformers
GPT‑6 系列确实采用了 Looped Transformers:一种重复执行同一层以提升推理深度的架构。它带来更强性能,但显著降低可解释性与安全性,因此引发社区对 OpenAI 的强烈争议。
桃西西呀
17 小时前
人工智能
·
spring
·
llm
Spring AI Alibaba 之二:Spring AI 底座与原子抽象一笔带过,看清 SAA 在之上加了什么编排
我翻开 SAA 源码的第一反应是:五个最重的能力,import 的全是 org.springframework.ai。这篇不展开讲 Spring AI 怎么用,那够写好几篇;我只把 SAA 用到的五个原子抽象点一遍,每个标好源码落点,让你一眼分清:哪些是 Spring AI 现成的,哪层才是 SAA 自己加的编排。很多人读不懂 SAA,往往不是因为它难,而是绕过了它脚下的 Spring AI。所以这篇的读法,是把它当一张地图:左边写 Spring AI,右边写 SAA,只看箭头从哪指向哪。
桃西西呀
19 小时前
人工智能
·
spring
·
llm
Spring AI Alibaba 之一:整体概览与分层架构,看清它在 Spring AI 之上到底加了什么
我写这个系列,是因为 Spring AI Alibaba(简称 SAA)在中文社区里被讲得很多,但多数文章停在注解和示例层面,很少有人把它的核心增量从源码里拆出来看。SAA 是什么,一句话说清楚:它是基于 Spring AI 构建的 Java 智能体应用开发框架,真正区别于 Spring AI 原生的部分,是两层东西,一层叫 graph-core 的图编排引擎,另一层叫 agent-framework 的多智能体框架。底层和模型对话、记忆、工具这些原子能力,仍然来自 Spring AI 和 Spring
做cv的小昊
19 小时前
人工智能
·
笔记
·
算法
·
自然语言处理
·
大模型
·
llm
【大模型算法自学笔记01】NLP基础知识(1.1 自注意力)
self-attention是一种将单个序列的不同位置关联起来以计算同一序列的表示的注意机制。可以把self-attention理解为感受野可以自学习的CNN,CNN是self-attention的特例。self-attention在数据量大时表现优于CNN。
Together_CZ
20 小时前
大模型
·
llm
·
gui agent
·
智能体系统
·
agentos
·
ufo²
·
桌面代理操作系统
UFO²: The Desktop AgentOS——桌面代理操作系统
这篇论文介绍了 UFO2,一个面向 Windows 桌面的 多智能体 AgentOS(桌面代理操作系统),旨在解决现有计算机使用代理(CUA)在真实桌面自动化中面临的系统级瓶颈。以下是对其研究内容的全面总结。
Alice-YUE
20 小时前
人工智能
·
大模型
·
llm
·
prompt
·
prompt工程
·
提示词
·
ai应用
从「能用」到「可控」:Prompt 工程与日常写 Prompt 的本质区别
**同样是"写 Prompt",为什么有人月薪数万做"Prompt 工程师",有人只是把 AI 当高级补全工具?**差别不在天赋,而在认知——你是在"调用 API",还是在"设计 DSL"。本文从底层逻辑、核心区别、实战写法三个维度拆透。
互联网叫兽
2 天前
ai
·
llm
·
rag
RAG 知识库-基于元数据的细粒度权限控制
在企业级 RAG(检索增强生成)应用中,知识库权限控制是一个绕不开的话题。传统的权限模型通常停留在知识库级别——一个用户要么能访问整个知识库,要么完全不能访问。
智码看视界
2 天前
gpt
·
自然语言处理
·
大模型
·
llm
·
rlhf
·
提示工程
·
思维链
第7篇:GPT 系列大模型架构演进与提示工程入门
BERT 和 GPT 都源自 Transformer,但取了不同的"半边":为什么生成式偏好 Decoder? 因为生成是自回归的:第 $t$ 个词只能依赖已生成的 1…$t-1$ 个词,因果掩码恰好强制了这一约束。而 Encoder 的双向注意力会"泄露未来",不适合逐词生成。
XLYcmy
2 天前
python
·
pdf
·
llm
·
agent
·
dify
·
rag
·
harness
PDF 论文处理器 — 改进方向与建议文档
文档性质:局限性诊断 + 可落地优化方案 + 重构路线图requirements.txt 声明 pandas==2.2.0,但全项目无任何 import pandas(pdf_extractor.py 用 fitz、output_manager.py 用标准库 csv/json)。