大模型

Tom·Ge2 小时前
人工智能·大模型·ai前沿
【AI前沿】2026.08.17 SpaceX 600亿收购Cursor正式完成·DeepSeek V4 Pro万亿开源·人形机器人生态全面爆发title: 【AI前沿】2026.08.17 SpaceX 600亿收购Cursor正式完成·DeepSeek V4 Pro万亿开源·人形机器人生态全面爆发 description: 2026年8月17日AI前沿综述:SpaceX完成600亿美元收购Cursor、火箭帝国全栈布局AI编程;DeepSeek V4 Pro正式版1.6万亿MoE开源+API峰谷计价+Harness框架45小时破10万星;智谱GLM-5.3后训练撬动编程安全双跃迁;谷歌Gemini半价/OpenAI 14倍速/Anthropi
程序员-Benothing10 小时前
人工智能·开源·大模型
OpenAI断供Cursor:当AI巨头开始“清理门户“,开源生态的中立性还能撑多久?8月29日,OpenAI正式宣布终止向AI代码编辑器Cursor提供模型服务,并计划于11月12日彻底关闭其API访问权限。消息一出,开发者社区炸锅——这不仅是两家公司的商业纠纷,更是AI行业走向"阵营化"的标志性事件。当马斯克旗下的SpaceX以600亿美元收购Cursor母公司Anysphere后,OpenAI选择用"断供"回应,背后折射出的,是技术中立性在资本博弈面前的脆弱。
thesky12345612 小时前
大模型·rlhf·奖励模型·ppo·dpo·grpo·强化学习对齐
27届大模型面试准备(七十三):大模型强化学习对齐工程实战——RLHF、PPO 与 GRPO 的训练流水线引言前面把后训练(A16)、对齐税(A48)、多模态训练(A40)、工具调用训练(A42)都铺开了。本篇把"对齐"里最硬核、也是面试官最爱追问的一段单独拎出来讲透:基于强化学习的对齐训练。它和上一篇高频八股(A52)、指令遵循(A48)是一条线,但更偏工程实现——奖励模型怎么训、PPO 为什么要有 critic、GRPO 怎么把 critic 省掉、DPO 又怎么绕过奖励模型直接做偏好。
tachibana213 小时前
人工智能·ai·大模型·llm·agent
微调和 RAG 各自的优劣势是什么?要厘清 RAG 与微调的分水岭,首先必须理解大语言模型(LLM)内部两种截然不同的记忆载体微调(Fine-Tuning):本质是在修改模型的参数化记忆。试图通过梯度下降,将海量的行业专业知识直接“烧写”到模型的神经元权重中。
thesky12345616 小时前
大模型·sse·长连接·背压·流式推理·首包优化·ttft
27届大模型面试准备(七十二):大模型流式推理服务与长连接工程——SSE、背压与首包优化引言前面几篇把"怎么把请求调度到卡上、怎么把卡喂满"讲透了。本篇聊用户真正感知到的那一端:流式输出(打字机效果)。用户问一个问题,前端要能在 200ms 内看到第一个字,然后稳定地一个 token 一个 token 蹦出来,断网还能续上。这背后是 SSE/WebSocket 长连接、服务端背压、首包(TTFT)优化、断点续传一整套工程。也是华为云大模型 API 岗、对话产品后端岗必问。
deepseek2318 小时前
大模型·ai agent·moe
Kimi K3 开放日拆解:2.8T MoE 的 896 专家稀疏路由、KDA 混合注意力与 Infra 三件套开放日当天,月之暗面把 Kimi K3 的模型权重、技术报告和三个基础设施仓库同时放了出来。我第一时间把权重拉下来,顺手把报告和仓库也一起克隆了,现场拆解会人坐得挺满,周围几位开发者没太关注台上讲了什么,都在低头翻刚公开的模型卡和配置文件。官方公布时间是 2026 年 7 月 27 日,选择这个日子相当于把整个训练家底一次性摊开。
xcLeigh18 小时前
人工智能·大模型·prompt·提示词
提示词模板库:建立你的专属Prompt兵器库💡 读完这篇文章,你将掌握:📝 这篇文章适合:所有希望将AI写作从"每次都从零开始"升级为"系统化高效作战"的创作者。如果你厌倦了每次写提示词都像"重新发明轮子",这套方法论会让你效率倍增。
猫先生Mr.Mao19 小时前
深度学习·大模型·transformer·注意力机制·论文解读
大模型之Attention Is All You Need详解:Transformer如何用注意力重写序列建模【从零走向AGI】旨在深入了解通用人工智能(AGI)的发展路径,从最基础的概念起,逐步构建完整的知识体系。 项目地址🔗:https://github.com/AI-mzq/From-Zero-to-AGI.git
thesky12345619 小时前
大模型·服务化·chunked prefill·长上下文推理·kv卸载·ring attention·序列并行
27届大模型面试准备(七十四):大模型长上下文推理与服务化工程——分块 Prefill、KV 卸载与 Ring Attention引言A13 讲了长上下文的"原理与位置编码",A29 讲了高效注意力,A69 讲了 PD 分离。本篇把这三块在工程服务化层面串起来:当用户输入 32K、128K 甚至百万 token 时,推理服务怎么不爆显存、不卡首包、还能扛住吞吐。这是长文档问答、代码仓库级理解、4MRAG 长多跳推理的必过工程关。
寻道码路20 小时前
大模型·agent·rag·json schema·ai工程化·llmops`
大模型工程化实战(七):JSON Schema 强约束——模型吐的 json 不合规?schema 校验不通过,重试、兜底、降级一条龙客服 AI 念身份证的事过去一周,脱敏闸挂上了,泄露是不泄露了。可上线第四周,数据组来拍桌子:模型把“金额”吐成字符串 “¥1,234”(schema 要的是 number),“是否退款”整个字段丢了,还自作主张加了个 schema 里根本没有的“运费”。下游 json.loads 直接崩,pandas 读出来一片 NaN。
KeepSeek20 小时前
大模型
大模型推理优化面试题1、vllm推理vLLM 的推理分为 Prefill 和 Decode 两个阶段。Prefill 会并行处理整个 Prompt,完成 Transformer 前向计算,并为每层生成 KV Cache。最后根据 Prompt 最后一个位置的 logits 采样出第一个输出 token。这个阶段包含大量 GEMM,计算密度较高,所以通常是 compute-bound,主要看 GPU 的 Tensor Core 算力。对于超长上下文,Attention 的二次复杂度也会成为瓶颈。
deepseek2321 小时前
大模型·claude·ai agent
Claude Fable 5.1 深度拆解:推理强度、缓存降价,Agent 工作流成本如何省 45%九月一日晚间,Anthropic 在 Fable 5 发布不到三个月后,突然端出了 Fable 5.1 与 Mythos 5.1。名义上这是小版本迭代,但官方公布的基准测试数据显示,这次升级的幅度远超常规小版本应有的范围。Terminal-Bench-Science 从两成四点七跳到五成二点六,翻了一倍还多。在竞争白热化的大模型市场,这显然不是一次常规迭代。
七夜zippoe21 小时前
人工智能·ai·大模型·qwen3.8-max·build with qwen
我用 Qwen3.8-Max 搭了一个 AI 作业辅导助手,拍照讲题 + 错题本诊断一次搞定目录一、背景二、最终效果三、搭建过程3.1 技术选型3.2 核心 Prompt / Agent 编排3.3 踩坑记录
腾视科技-AI21 小时前
大数据·人工智能·科技·大模型·ai大模型·腾视科技·ai算力盒
腾视科技AI大模型应用:提效、破局与落地,重塑智能新生态当AI大模型技术从实验室走向产业落地,企业却普遍面临 “成效难显、成本高企、复用性差” 的三重困境。腾视科技深耕大模型应用领域,以 “顶层设计 + 敏捷迭代” 的方法论,结合全栈式技术产品矩阵,推出AI大模型应用解决方案,为千行百业提供从技术落地到效率革命的完整路径,让智能价值看得见、摸得着。
dozenyaoyida1 天前
人工智能·ai·大模型·新闻
AI与大模型新闻日报 | 2026-09-01共 14 条新闻来源: IT 之家时间: 2026-08-31 23:55摘要: IT之家 9 月 1 日消息,Anthropic 刚刚发布长文,披露了其针对 7 月 30 日和 8 月 4 日两起 Claude 模型未经授权访问真实计算机系统、在真实互联网环境采取未授权行动事件的调查进展,并公布了过去一个月来针对模型安全、评测环境和训练环境采取的多项措施。Anthropic 表示,7 月 30 日曾报告 3 起类似事件。当时 Claude 模型为了评测目的被刻意关闭网络安全防护,但由于第三方评测环境配置
ReleaseU1 天前
人工智能·大模型
Harness + MCP:打通企业工具链的最后一步上周我在 Harness 里跑了一个多 Agent 工作流,任务拆得漂漂亮亮的,Agent 们各司其职,结果到最后一步卡住了——它需要把产出的报告自动提交到公司的 Jira 工单上,我折腾了整整一个下午。你猜怎么着?Harness 本身没有直接对接 Jira 的能力。当时我差点就放弃了,心想"这玩意儿好看是好用,但进不了生产环境啊"。
tachibana22 天前
网络·人工智能·ai·大模型·llm·agent
如何设计多 Agent 的协作与动态切换机制?摘要:随着大语言模型(LLM)从单任务处理走向复杂跨领域业务求解,单一 Agent(单体智能体)由于 Prompt 膨胀、工具过多导致的召回稀释(Tool Dilution)、上下文污染(Context Pollution)以及规划深度不足,正迅速触碰到性能天花板。
程序员三明治2 天前
java·人工智能·后端·大模型·llm·deepseek·dsh
【体验毛坯房】Deep Harness 入门教程我也来安装使用下。安装前,先来搞懂DeepSeek Harness到底是什么?我们都知道下面这个公式:
江厌012 天前
人工智能·深度学习·大模型·私有化部署·gpu·信创·ai服务器
金融大模型私有化:信创合规下,算力该按哪个口径配金融行业做大模型,第一步不是选模型,是先认怂——把那几条硬约束摆上桌。客户数据、交易数据不能出域;系统要过等保、要能审计留痕;风控场景对延迟极敏感,慢两秒可能就是一笔坏账;再到信创国产化的要求越来越具体。这几条凑在一起,注定金融和互联网是两条路:互联网喜欢租公有云、弹性扩容、偶尔慢个几秒也没事;金融往往得把模型、数据、算力都锁在本地,甚至直接放进信创环境。
梦想的颜色2 天前
react.js·大模型·app·agent·reactnative·expo·ai 应用开发
【AI实战】React‑Native + AI 移动端 APP 完整实战全流程|云端 / 本地大模型、Agent 集成、安装配置、避坑指南2026 移动端 AI 开发分为两条路线:云端 API 调用、设备端本地离线推理。React‑Native(Expo)是跨平台移动端首选,一套代码同时输出 Android、iOS。很多同学踩坑:把 web 端 AI 逻辑直接搬到 RN,出现流式乱码、原生模块兼容、内存爆炸、模型体积过大等一系列问题。