技术栈
多模态
智码看视界
2 天前
开源
·
apache
·
多模态
·
图像生成
·
ai生图
·
sensenova
·
商汤大模型
SenseNova U1.5 Lite 部署实测:8B 单卡跑通 4K 生图,Apache 2.0 免费商用
SenseNova U1.5 Lite 是商汤「SenseNova-U1」统一多模态家族的 8B 轻量版本,2026-08-21 正式开源,Apache 2.0 协议,个人/学术/商业均可免费使用、微调与二次分发。它最大的特点是「一个模型干三件事」:图像理解(看图问答、OCR、图表解析、多图对比推理)、文本生成图像、图像编辑(局部修改、元素替换、多参考图合成)全部由同一套权重完成,没有传统扩散模型里独立的 VAE 与视觉编码器。
weixin_47138303
2 天前
多模态
28 多模态(Multimodal)
传统 LLM 只能处理文本,多模态模型(Multimodal / Vision Language Model,VLM)能同时理解多种输入类型:
Geek-Chow
3 天前
人工智能
·
大语言模型
·
多模态
02 多模态 LLM 是什么:定义、边界与生态位置
上一篇讲清了纯文本 LLM 撞上的四堵墙,以及 CLIP 造出了眼睛却没接大脑。这一篇把"接起来之后的那个东西"正式定义出来。
XLYcmy
6 天前
llm
·
负载均衡
·
强化学习
·
多模态
·
ppo
·
dpo
·
grpo
小红书 算法一面 十二
在 **MoE(混合专家模型)** 场景中,**负载均衡** 是指**门控网络将输入 token 均匀分配给各个专家子网络**,使得每个专家接收的计算任务量(token 数量、计算开销)保持相对均衡,避免出现“热门专家过载、冷门专家闲置”的现象。
山顶夕景
5 天前
agent
·
强化学习
·
多模态
·
rl
·
agentic
【MLLM Agent】多模态理解Agent研究进展
(1)框架类(可直接搭建多模态 Agent 基座) DeepSeek‑Harness(DeepSeek 2026) 定位:Agent 运行时框架,近期新增 Vision 支持,对接 V4‑Flash‑Vision‑Exp,实现图片输入 + 原生 function call 闭环,可插拔 Agent 循环、工具、记忆、上下文管理 仓库:https://github.com/deepseek‑ai/harness
uncle_ll
5 天前
llm
·
文生图
·
文生视频
·
多模态
·
ollama
多模态大模型视听生成本地实战
从纯文本交互到跨模态感知,多模态大模型(MLLM)正成为 AI 从语言对话走向全场景智能的关键枢纽。本文从核心分类、对齐机制、任务矩阵到本地部署,系统拆解多模态技术的工程化落地全流程。
xiezhr
7 天前
ai
·
多模态
·
ai agent
·
deepseek
·
视觉模型
·
deepseek harness
期待了很久的DeepSeek多模态视觉模型终于上线了
大家好,我是晓凡。等了这么久,DeepSeek 终于有视觉模型了。8 月 21 日,DeepSeek 悄悄上线了多模态视觉理解模型 DeepSeek-V4-Flash-Vision-Exp,DeepSeek 终于自己能看图了。
XLYcmy
10 天前
深度学习
·
llm
·
sft
·
强化学习
·
多模态
·
grpo
·
奖励函数
小红书 算法一面 四
SFT训练中**训练loss正常下降但测试集表现差**,核心原因是**模型泛化能力不足**——模型学到了训练集的特征(甚至噪声),但无法迁移到分布不同的测试集。结合SFT的任务特性(大模型微调、文本/多模态生成),具体原因可分为四大类,每类对应明确的排查和解决方法:
虎鲸不是鱼
11 天前
大模型
·
多模态
·
qwen
·
lm studio
·
千问
【RTX Pro 4500】Qwen3.8 27B NVFP4在LM Studio挂载多模态模型
【RTX Pro 4500】Qwen3.8 27B NVFP4在LM Studio挂载多模态模型之前已经部署了模型: https://lizhiyong.blog.csdn.net/article/details/163834176
XLYcmy
12 天前
llm
·
sft
·
强化学习
·
多模态
·
损失函数
·
visual r1
·
奖励机制
小红书 算法一面 三
# Visual R1 原理与 MLLM RL 方案设计全解析## 一、Visual R1 核心实现原理
XLYcmy
12 天前
llm
·
sft
·
memory
·
多模态
·
位置编码
·
grpo
·
视觉数据
小红书 算法一面 二
### 二、视觉数据Memory设计核心解析视觉数据的核心特征是**空间结构化(图像是2D网格)、时序动态性(视频是3D时空)、高维度(像素/patch特征维度高)**,这和NLP的一维序列数据有本质区别。因此视觉memory的设计核心是:**在保留时空结构的前提下,高效存储、检索和复用多粒度视觉特征,平衡存储容量、检索效率和任务效果**。
夏文强
15 天前
人工智能
·
大语言模型
·
多模态
·
前沿技术
·
ai agent
多模态 AI Agent 前沿全景:2026 年从「能回答」到「能干活」的跃迁
标签: 多模态, AI Agent, 大语言模型, 人工智能, 前沿技术如果说 2023–2024 年的大模型关键词是「会聊天」,那么 2026 年的关键词毫无疑问是「能干活」。AI Agent(智能体)正在从「回答一个问题」进化到「端到端交付一个任务」,而多模态能力则是让它真正看懂世界、动手操作的关键一跃。
NutShell Wang
17 天前
人工智能
·
语言模型
·
开源
·
大模型
·
音视频
·
多模态
·
vibe coding
国产全模态开源潮:从语言模型到视频模型,中国开源生态再升级
过去72小时,国内AI圈出现了一种值得记录的现象:密集发布的不只是新模型,而是开源权重正在从语言模型一路延伸到视频、全双工音视频等更复杂的模态。对开发者与企业来说,这意味着「自选、自部署、自定制」的选项以前所未有的速度变多;对从业者来说,理清这条主线,比追单条快讯更有价值。
深圳市快瞳科技有限公司
20 天前
人工智能
·
算法
·
计算机视觉
·
大模型
·
多模态
·
宠物
·
宠物ai识别
个体识别、行为解读、健康管理:多模态宠物AI大模型的场景化落地
快瞳科技多模态宠物AI大模型,融合了面部、鼻纹、肢体、排泄物等多个维度生物特征的AI视觉识别,构建了一套从宠物身份识别、行为解读、情绪分析到健康管理的全方位感知体系,为宠物饲养、智能设备、犬类管理、宠物保险、宠物医疗等场景提供智能化解决方案。
山顶夕景
21 天前
音视频
·
多模态
·
视频理解
·
长视频
【VQA】VideoChat3长视频理解模型
arXiv链接:https://arxiv.org/abs/2607.14935 这篇论文是 VideoChat3: Fully Open Video MLLM for Efficient and Generalist Video Understanding(2026年7月arXiv),由南京大学、上海人工智能实验室、南洋理工大学等机构联合提出。
猫先生Mr.Mao
23 天前
多模态
·
论文解读
·
3dgs
·
世界模型
世界模型之HY-World 2.0详解:生成完还能走进去——如何把文本、照片和视频变成可探索的 3D 世界
【从零走向AGI】旨在深入了解通用人工智能(AGI)的发展路径,从最基础的概念起,逐步构建完整的知识体系。 项目地址🔗:https://github.com/AI-mzq/From-Zero-to-AGI.git
GoAI
23 天前
人工智能
·
大模型
·
llm
·
多模态
# AI Agent 记忆框架横向对比报告总结
覆盖框架:Claude Code、DeerFlow 2.0、Hermes Agent、Mem0、OpenClaw、claude-mem、MemGPT/Letta、LangMem、Zep、Cognee
deepseek23
1 个月前
人工智能
·
多模态
·
视频生成
MiniMax H3 全模态模型拆解:2K 视频成本被腰斩背后,H3-VAE 和 In-context Regeneration 做了什么
7 月 31 日,MiniMax 发布了全模态生成模型 H3,随后宣布将在几天内开放模型权重。消息传开后,资本市场先动了:MiniMax 股价盘中一度拉升 15%。但比起股价,我更想先算一笔账。
带娃的IT创业者
1 个月前
人工智能
·
开源
·
大语言模型
·
多模态
·
moe
·
开源模型
·
inkling
Inkling:当开源模型开始思考“如何思考”
👋 大家好,我是 带娃的IT创业者,CSDN 人工智能领域新星创作者,一边带娃一边创业的全栈工程师。专注 AI 大模型应用落地、Python 实战进阶与 AI 开发工具链(Python / FastAPI / 大模型 / AI 编程)。