技术栈
大语言模型
墨心@
1 天前
人工智能
·
语言模型
·
大语言模型
·
agent
·
codex
·
harness
阶段 4:事件总线
对应代码:stage04_events.py理解"事件既是给消费者的消息,也是驱动派生状态的输入",并实现 terminal_error 的单写多读模式。
白拾
3 天前
大语言模型
·
高效推理
·
mla
·
deepseek-v2 论文分享
·
moe 稀疏架构
·
arxiv 2024
【arXiv 2024】DeepSeek-V2 论文解读:经济训练与高效推理的 MoE 大语言模型|从稀疏架构降本增效视角
本文解读 arXiv 2024 论文《DeepSeek-V2: A Strong, Economical, and Efficient Mixture-of-Experts Language Model》。该论文提出DeepSeek-V2 大语言模型,通过融合MLA(多头潜在注意力)、DeepSeekMoE(细粒度专家稀疏)与GRPO 两阶段对齐,在 236B 总参数、每 token 仅激活 21B 的条件下支持 128K 上下文,其特别之处在于用低秩 KV 联合压缩把推理显存瓶颈转化为一次可被矩阵吸收的
夏文强
4 天前
人工智能
·
大语言模型
·
多模态
·
前沿技术
·
ai agent
多模态 AI Agent 前沿全景:2026 年从「能回答」到「能干活」的跃迁
标签: 多模态, AI Agent, 大语言模型, 人工智能, 前沿技术如果说 2023–2024 年的大模型关键词是「会聊天」,那么 2026 年的关键词毫无疑问是「能干活」。AI Agent(智能体)正在从「回答一个问题」进化到「端到端交付一个任务」,而多模态能力则是让它真正看懂世界、动手操作的关键一跃。
夏文强
4 天前
人工智能
·
深度学习
·
机器学习
·
大语言模型
·
技术架构
AI 技术全景架构科普:从算法到应用的一整套技术栈
标签: 人工智能, 深度学习, 大语言模型, 机器学习, 技术架构人工智能(Artificial Intelligence,AI)已经渗透到我们生活的方方面面:从手机里的语音助手、人脸识别,到生成文本的 ChatGPT、生成图片的 Midjourney。但对很多人来说,AI 仍然像是一个「黑箱」——知道它很厉害,却不清楚它内部到底是怎么运转的。
美人胖八分
4 天前
lora
·
大语言模型
·
deepspeed
·
qlora
大模型常见微调框架对比
微调框架的价值不只在于启动训练,还要正确处理聊天模板、损失掩码、4-bit 基座加载、LoRA 注入、分布式检查点与权重导出。选型前应分清层级:Transformers 提供模型、Tokenizer 和通用 Trainer;PEFT 实现 LoRA 等参数高效方法;Accelerate 统一设备和任务启动;DeepSpeed ZeRO、PyTorch FSDP 负责切分参数、梯度与优化器状态;Megatron-Core 则提供张量、流水线、上下文和专家并行。LLaMA-Factory、Axolotl 和
艺杯羹
6 天前
网络
·
安全
·
网络安全
·
ai
·
llm
·
大语言模型
·
ai安全
LLM越狱与安全护栏攻防大演进:从奶奶漏洞到输入输出双重检测模型
目录1. 角色扮演攻防战:从“奶奶漏洞”到强化学习安全对齐1.1. 角色扮演攻击的底层机制1.2. 静态拦截与强化学习对齐(RLHF/SFT)
还是奇怪
7 天前
人工智能
·
web安全
·
大语言模型
·
anthropic
Agent 安全事件成为本周核心风险信号,从三起越界评测到 Hugging Face 入侵
导语:2026 年 7 月底,Anthropic、OpenAI 与 Hugging Face 接连披露真实系统被 AI Agent 越界访问的事件。它们不是“模型突然产生恶意”的证据,却足以推翻一种危险的安全假设:只要在系统提示词里写明边界,Agent 就会被约束在边界内。
prog_6103
13 天前
笔记
·
llm
·
大语言模型
·
agent
【笔记】用cursor手搓cursor(八)
最近有点魔怔,因为思路完全卡住了。现在的claude code、codex、hermes就是LLM的wrapper而已,而且LLM为了在RL里刷分,幻觉会提高不少。它见过的东西确实写得很不错,它没见过的真的是胡扯。
科研小刘带你玩学术
14 天前
人工智能
·
大语言模型
·
未来趋势
·
智能体
·
智能系统
AI Agent正在改变人工智能应用模式:从工具助手走向自主智能系统
过去几年,人工智能的发展主要围绕大语言模型展开。ChatGPT、Claude、Gemini等模型让AI具备了强大的语言理解和内容生成能力。
带娃的IT创业者
16 天前
人工智能
·
开源
·
大语言模型
·
多模态
·
moe
·
开源模型
·
inkling
Inkling:当开源模型开始思考“如何思考”
👋 大家好,我是 带娃的IT创业者,CSDN 人工智能领域新星创作者,一边带娃一边创业的全栈工程师。专注 AI 大模型应用落地、Python 实战进阶与 AI 开发工具链(Python / FastAPI / 大模型 / AI 编程)。
钱多多_qdd
22 天前
ai
·
大语言模型
Mac本地部署大模型,Ollama+Qwen3.5
很多新手第一次折腾本地模型,刚起步就翻车——核心原因就一个:选了个自己Mac跑不动的模型!要么内存不够直接报错,要么跑起来卡到怀疑人生,白忙活一场。
寒水馨
1 个月前
windows
·
llm
·
大语言模型
·
llama
·
本地部署
·
ollama
·
模型运行
Windows下载、安装ollama-v0.32.1(附安装包OllamaSetup.exe)
Ollama 是目前最流行的本地大语言模型(LLM)运行工具,在 GitHub 上已获得超过 130,000 颗星标(Stars),是 AI 开发者社区中最受关注的开源项目之一。
战族狼魂
1 个月前
人工智能
·
算法
·
大模型
·
大语言模型
高频面试题精选:分治与AI Agent架构
基于过去一周CSDN、51CTO、掘金等技术社区的热议内容,筛选出10道高频面试题,涵盖算法、系统设计、数据库、网络四大核心领域。
猫先生Mr.Mao
1 个月前
大语言模型
·
论文解读
·
moe
·
模型推理
·
开源权重
从“更大”到“更会做事”:Kimi K3 的开放前沿智能路线
【从零走向AGI】旨在深入了解通用人工智能(AGI)的发展路径,从最基础的概念起,逐步构建完整的知识体系。 项目地址🔗:https://github.com/AI-mzq/From-Zero-to-AGI.git
带娃的IT创业者
1 个月前
人工智能
·
移动开发
·
大语言模型
·
apple
·
端侧ai
深度解析 Apple Foundation Models:端侧 AI 的真正革命
在移动开发领域,我们正站在一个关键的转折点上。过去两年,大语言模型(LLM)的应用主要集中在云端——开发者通过 API 调用远程服务器,实现文本生成、图像处理等功能。这种模式虽然强大,但始终存在延迟、隐私和离线可用性这三大痛点。
战族狼魂
1 个月前
人工智能
·
算法
·
大模型
·
大语言模型
广东备案大模型超百款
检索时间范围:近24小时(2026年7月14日-7月15日) 聚焦领域:AI智能、机器人、芯片、大模型与应用 资讯数量:10条精选
deephub
1 个月前
人工智能
·
大语言模型
·
sklearn
用 Scikit-LLM 和 Groq 搭建情感分析 pipeline
传统的机器学习(Machine Learning)pipeline 在处理文本分类等预测任务时,通常依赖从原始文本中提取结构化的数值特征——例如 TF-IDF 频率或 token embedding——再输入逻辑回归、集成方法或支持向量机等经典模型。