多模态

智码看视界2 天前
开源·apache·多模态·图像生成·ai生图·sensenova·商汤大模型
SenseNova U1.5 Lite 部署实测:8B 单卡跑通 4K 生图,Apache 2.0 免费商用SenseNova U1.5 Lite 是商汤「SenseNova-U1」统一多模态家族的 8B 轻量版本,2026-08-21 正式开源,Apache 2.0 协议,个人/学术/商业均可免费使用、微调与二次分发。它最大的特点是「一个模型干三件事」:图像理解(看图问答、OCR、图表解析、多图对比推理)、文本生成图像、图像编辑(局部修改、元素替换、多参考图合成)全部由同一套权重完成,没有传统扩散模型里独立的 VAE 与视觉编码器。
weixin_471383032 天前
多模态
28 多模态(Multimodal)传统 LLM 只能处理文本,多模态模型(Multimodal / Vision Language Model,VLM)能同时理解多种输入类型:
Geek-Chow3 天前
人工智能·大语言模型·多模态
02 多模态 LLM 是什么:定义、边界与生态位置上一篇讲清了纯文本 LLM 撞上的四堵墙,以及 CLIP 造出了眼睛却没接大脑。这一篇把"接起来之后的那个东西"正式定义出来。
XLYcmy6 天前
llm·负载均衡·强化学习·多模态·ppo·dpo·grpo
小红书 算法一面 十二在 **MoE(混合专家模型)** 场景中,**负载均衡** 是指**门控网络将输入 token 均匀分配给各个专家子网络**,使得每个专家接收的计算任务量(token 数量、计算开销)保持相对均衡,避免出现“热门专家过载、冷门专家闲置”的现象。
山顶夕景5 天前
agent·强化学习·多模态·rl·agentic
【MLLM Agent】多模态理解Agent研究进展(1)框架类(可直接搭建多模态 Agent 基座) DeepSeek‑Harness(DeepSeek 2026) 定位:Agent 运行时框架,近期新增 Vision 支持,对接 V4‑Flash‑Vision‑Exp,实现图片输入 + 原生 function call 闭环,可插拔 Agent 循环、工具、记忆、上下文管理 仓库:https://github.com/deepseek‑ai/harness
uncle_ll5 天前
llm·文生图·文生视频·多模态·ollama
多模态大模型视听生成本地实战从纯文本交互到跨模态感知,多模态大模型(MLLM)正成为 AI 从语言对话走向全场景智能的关键枢纽。本文从核心分类、对齐机制、任务矩阵到本地部署,系统拆解多模态技术的工程化落地全流程。
xiezhr7 天前
ai·多模态·ai agent·deepseek·视觉模型·deepseek harness
期待了很久的DeepSeek多模态视觉模型终于上线了大家好,我是晓凡。等了这么久,DeepSeek 终于有视觉模型了。8 月 21 日,DeepSeek 悄悄上线了多模态视觉理解模型 DeepSeek-V4-Flash-Vision-Exp,DeepSeek 终于自己能看图了。
XLYcmy10 天前
深度学习·llm·sft·强化学习·多模态·grpo·奖励函数
小红书 算法一面 四SFT训练中**训练loss正常下降但测试集表现差**,核心原因是**模型泛化能力不足**——模型学到了训练集的特征(甚至噪声),但无法迁移到分布不同的测试集。结合SFT的任务特性(大模型微调、文本/多模态生成),具体原因可分为四大类,每类对应明确的排查和解决方法:
虎鲸不是鱼11 天前
大模型·多模态·qwen·lm studio·千问
【RTX Pro 4500】Qwen3.8 27B NVFP4在LM Studio挂载多模态模型【RTX Pro 4500】Qwen3.8 27B NVFP4在LM Studio挂载多模态模型之前已经部署了模型: https://lizhiyong.blog.csdn.net/article/details/163834176
XLYcmy12 天前
llm·sft·强化学习·多模态·损失函数·visual r1·奖励机制
小红书 算法一面 三# Visual R1 原理与 MLLM RL 方案设计全解析## 一、Visual R1 核心实现原理
XLYcmy12 天前
llm·sft·memory·多模态·位置编码·grpo·视觉数据
小红书 算法一面 二### 二、视觉数据Memory设计核心解析视觉数据的核心特征是**空间结构化(图像是2D网格)、时序动态性(视频是3D时空)、高维度(像素/patch特征维度高)**,这和NLP的一维序列数据有本质区别。因此视觉memory的设计核心是:**在保留时空结构的前提下,高效存储、检索和复用多粒度视觉特征,平衡存储容量、检索效率和任务效果**。
夏文强15 天前
人工智能·大语言模型·多模态·前沿技术·ai agent
多模态 AI Agent 前沿全景:2026 年从「能回答」到「能干活」的跃迁标签: 多模态, AI Agent, 大语言模型, 人工智能, 前沿技术如果说 2023–2024 年的大模型关键词是「会聊天」,那么 2026 年的关键词毫无疑问是「能干活」。AI Agent(智能体)正在从「回答一个问题」进化到「端到端交付一个任务」,而多模态能力则是让它真正看懂世界、动手操作的关键一跃。
NutShell Wang17 天前
人工智能·语言模型·开源·大模型·音视频·多模态·vibe coding
国产全模态开源潮:从语言模型到视频模型,中国开源生态再升级过去72小时,国内AI圈出现了一种值得记录的现象:密集发布的不只是新模型,而是开源权重正在从语言模型一路延伸到视频、全双工音视频等更复杂的模态。对开发者与企业来说,这意味着「自选、自部署、自定制」的选项以前所未有的速度变多;对从业者来说,理清这条主线,比追单条快讯更有价值。
深圳市快瞳科技有限公司20 天前
人工智能·算法·计算机视觉·大模型·多模态·宠物·宠物ai识别
个体识别、行为解读、健康管理:多模态宠物AI大模型的场景化落地快瞳科技多模态宠物AI大模型,融合了面部、鼻纹、肢体、排泄物等多个维度生物特征的AI视觉识别,构建了一套从宠物身份识别、行为解读、情绪分析到健康管理的全方位感知体系,为宠物饲养、智能设备、犬类管理、宠物保险、宠物医疗等场景提供智能化解决方案。
山顶夕景21 天前
音视频·多模态·视频理解·长视频
【VQA】VideoChat3长视频理解模型arXiv链接:https://arxiv.org/abs/2607.14935 这篇论文是 VideoChat3: Fully Open Video MLLM for Efficient and Generalist Video Understanding(2026年7月arXiv),由南京大学、上海人工智能实验室、南洋理工大学等机构联合提出。
猫先生Mr.Mao23 天前
多模态·论文解读·3dgs·世界模型
世界模型之HY-World 2.0详解:生成完还能走进去——如何把文本、照片和视频变成可探索的 3D 世界【从零走向AGI】旨在深入了解通用人工智能(AGI)的发展路径,从最基础的概念起,逐步构建完整的知识体系。 项目地址🔗:https://github.com/AI-mzq/From-Zero-to-AGI.git
GoAI23 天前
人工智能·大模型·llm·多模态
# AI Agent 记忆框架横向对比报告总结覆盖框架:Claude Code、DeerFlow 2.0、Hermes Agent、Mem0、OpenClaw、claude-mem、MemGPT/Letta、LangMem、Zep、Cognee
deepseek231 个月前
人工智能·多模态·视频生成
MiniMax H3 全模态模型拆解:2K 视频成本被腰斩背后,H3-VAE 和 In-context Regeneration 做了什么7 月 31 日,MiniMax 发布了全模态生成模型 H3,随后宣布将在几天内开放模型权重。消息传开后,资本市场先动了:MiniMax 股价盘中一度拉升 15%。但比起股价,我更想先算一笔账。
带娃的IT创业者1 个月前
人工智能·开源·大语言模型·多模态·moe·开源模型·inkling
Inkling:当开源模型开始思考“如何思考”👋 大家好,我是 带娃的IT创业者,CSDN 人工智能领域新星创作者,一边带娃一边创业的全栈工程师。专注 AI 大模型应用落地、Python 实战进阶与 AI 开发工具链(Python / FastAPI / 大模型 / AI 编程)。