语言模型

顾城猿3 小时前
语言模型
联邦学习(Federated Learning, FL)联邦学习是一种分布式机器学习框架,核心原则是「数据不出本地,模型协同训练」:多个数据持有方(客户端)在不共享原始训练数据的前提下,共同训练一个全局模型;训练过程中仅在客户端与中央服务器之间传输模型更新(参数、梯度或适配器),由服务器完成聚合迭代,最终所有客户端共享一个统一的全局模型。
Zzj_tju5 小时前
人工智能·深度学习·语言模型·自然语言处理
CLIP 图文对齐:先核对正样本,再相信检索分数开源 AI 论文复现实验与代码解读 · 第五轮 / 071 面向研究生、科研新人和工程型研究者;检索与实验日期:2026-09-12。
Zzj_tju7 小时前
人工智能·深度学习·机器学习·语言模型
VLM 读图评测:先审计评分器,再判断读错还是算错开源 AI 论文复现实验与代码解读 · 第五轮 / 072 面向研究生、科研新人和工程型研究者;检索与实验日期:2026-09-13。
夜瞬15 小时前
人工智能·深度学习·语言模型
Merge、Ensemble 与 Cooperate:一文读懂大语言模型协同本文是对论文《Merge, Ensemble, and Cooperate! A Survey on Collaborative Strategies in the Era of Large Language Models》的中文解读。 论文:Jinliang Lu、Ziliang Pang、Min Xiao、Yaochen Zhu、Rui Xia、Jiajun Zhang,arXiv:2407.06089v1,2024 年 7 月。 原文链接:arXiv:2407.06089
一技安身1 天前
docker·ai·语言模型
【大模型】Win11 部署 DeepSeek+ RAGFlow0.27.2 (Ollama方案,断网可用)最终版脚本下载: https://download.csdn.net/download/cnxzzcn/93430748
顾城猿1 天前
语言模型
LoRA基础它最初由Hu等人在2021年提出,原本用于解决大模型全参数微调算力成本高、易灾难性遗忘、多任务切换困难的问题,现在已经成为联邦大模型微调、端侧微调、轻量化定制的核心技术底座。
余槐i1 天前
人工智能·语言模型·自然语言处理·大模型·api
使用Ollama本地部署和测试Kimi、GLM等多款大语言模型实战本文摘要:你是否想在本地快速部署和对比不同的大语言模型?本文将介绍如何利用 Ollama 这一开源工具,通过统一的命令行接口,高效地在本地部署和测试多款主流大模型。 开发者在进行模型选型或应用原型开发时,常需要在本地环境中部署和测试多个模型(如 Qwen、DeepSeek)。传统方式下,每个模型都有其独立的仓库、下载链接和运行脚本,导致环境管理复杂。 Ollama 解决了这一问题。
AI 思录1 天前
人工智能·语言模型·prompt·ai写作·用户体验·ai合规
AI生造词、乱用术语怎么治?一份防“词汇污染“的Prompt约束模板长期跟大模型打交道,最近踩到一个典型坑。让 AI 协助处理一道"多轮连环交互"的试题时,它为了省事直接删掉核心交互环节,改成静态简答题。更离谱的是它解释改动时用了两个词:“扁平化简化"和"压平流程”。
喵喵爱自由1 天前
docker·ai·语言模型
Deepseek Harness镜像离线部署本文记录通过容器镜像方式,本地部署 Deepseek Harness(DSH)的完整流程。作者已将 DSH 运行所需的全部环境打包成镜像,省去了部署时构建环境的繁琐准备,只需下载、导入并运行容器,即可快速完成本地部署。
一技安身1 天前
服务器·docker·语言模型
【信创】Ollama 手动提取 deepseek-r1:1.5b模型迁移到内网机器Ollama没有原生一键导出tar命令,有3种方案,按推荐顺序:我这里主用第一种手动方案Ollama模型由两部分组成:
Dawson Zhu2 天前
人工智能·语言模型·架构·aigc·agi
从“会回答“到“能执行“:AI Agent 的系统构成、运行机制与工程实践本文拆解 AI Agent(智能体)的核心公式、ReAct 循环、上下文工程、支撑框架(Harness)、工作流与自主智能体的选型边界,以及生产级落地的安全与可靠性设计。适合希望从概念走向工程实现的开发者阅读。
硅谷秋水2 天前
人工智能·深度学习·机器学习·语言模型·自动驾驶
Qwen-Drive-1.0:迈向自动驾驶视觉-语言基础模型的第一步26年8月来自阿里千问团队和华中科技的论文“Qwen-Drive-1.0: An Initial Step towards a Vision-Language Foundation Model for Autonomous Driving”。
吴佳浩 Alben2 天前
人工智能·深度学习·神经网络·语言模型·架构·自动化·ai编程
走向 Memory OS:企业私有化 Agent 设计与实现作 者:吴佳浩(Alben) 微某信公某众号:全栈架构师笔记 系列专栏:《打造下一代智能体:企业级 Coding / DevOps Agent》· 第 03 篇
吴佳浩 Alben2 天前
人工智能·安全·语言模型·架构·ai编程
Agent 安全红线:越狱防御、间接注入与数据防泄漏实战作 者:吴佳浩(Alben) 微某信公众某号:全栈架构师笔记 系列专栏:《企业级 Agent 质量保障体系:Evaluation 与安全防线》· 第 03 篇
星辰AI2 天前
人工智能·ai·语言模型
前端性能优化实战:从首屏加载到交互响应的全链路调优Google 的研究数据表明,页面加载时间从 1 秒增加到 3 秒,跳出率上升 32%。在国内移动网络环境下,这个数字只会更糟。一个典型的 Vue3/React SPA 应用,未优化前首屏加载体积动辄 2MB+,FCP(First Contentful Paint)超过 3 秒是常态。
Behaviour2 天前
人工智能·语言模型·开源·aigc·ai编程
DeepSeek V4.1 Flash 发布开源,Harness v0.1.5同日适配2026 年 9 月 10 日,DeepSeek 一次性放出了三样东西:V4.1 Flash 的模型权重(MIT 协议)、Agent 框架 DeepSeek Harness 的 v0.1.5、以及一个此前没被预告过的 xPU 内核 JIT 编译库 DeepJIT。模型、推理栈、Agent 框架三层同时开源,再加上一份保留峰谷机制的降价通知,这套组合拳的分量比单看参数表要大得多。
Dawson Zhu2 天前
人工智能·语言模型·架构·aigc·agi
GraphRAG 原理、适用场景与工程落地:从关系建模视角做一次客观拆解Retrieval-Augmented Generation(RAG)的基本流程大家都熟:文档切片 → 向量化 → 语义检索 → 拼进 Prompt 生成。它本质是一种 基于文本相似度的"片段召回"。
李昊哲小课2 天前
spring boot·语言模型·大模型·openai·webclient·restclient·anthropic
LLM API 协议代理 —— 从零到一全栈教程项目名称:llm-protocol-proxy 技术栈:Spring Boot 4.1.1 + Java 25 + RestClient(非流式) + WebClient(Reactor Netty, 流式) + 前端原生 JS 核心功能:原生透传 OpenAI Chat Completions / OpenAI Responses / Anthropic Messages 三种 LLM 协议,实现非流式(RestClient 同步)与流式(WebClient SSE)双模式对话 学习路线设计:零跳跃——
蓝速科技3 天前
运维·人工智能·科技·语言模型·自然语言处理·语音识别
涉外酒店前台双屏翻译机落地应用指南在涉外酒店的前台,每天上演的是一场场跨越语言的“微外交”。当一位拖着行李箱的外宾站在柜台前,前台员工手忙脚乱地掏出手持翻译机,对着麦克风说一句,再递过去等对方回答,这种“乒乓球式”的沟通不仅拉长了办理入住的时间,更让原本应该温馨专业的接待场景显得局促且缺乏科技感。对于追求服务品质的高端酒店而言,沟通效率的低下往往直接转化为客人体验的折扣,甚至在嘈杂的大堂环境中,因听不清、译不准而引发的误解更是屡见不鲜。而蓝速科技(larxu)推出的双屏翻译设备,正是针对这一系列痛点设计的专业解决方案。
TAN-90°-3 天前
人工智能·深度学习·神经网络·算法·机器学习·计算机视觉·语言模型
Deep Learning for Computer Vision——Large Scale Distributed TrainingGPU (Graphics Processing Unit):最初为图形设计,现已成为通用的并行处理器(General Parallel Processor)。