多模态大模型

小草cys5 天前
大模型·图像生成·多模态大模型·视频生成·minimax·wan
MiniMax H3 和 Wan2.2的对比MiniMax H3 和 Wan2.2 都是当前顶尖的开源/可本地化视频生成模型,但它们的底层定位、优势赛道以及生成逻辑完全不同。
拉你进_教堂12 天前
人工智能·计算机视觉·多模态大模型·openclaw小龙虾技能
小龙虾技能之【Intelligent Public Smoking Detection Skill | 公共场所吸烟行为智能检测技能】简介智能分析中枢 · 图片/视频智能分析 · 结构化报告 · 历史报告云端查询Based on advanced computer vision and deep learning algorithms, this feature provides 24/7, high-precision automated monitoring of smoking behaviors within target areas. The system supports multi-source detection via r
拉你进_教堂17 天前
人工智能·计算机视觉·多模态大模型·openclaw小龙虾技能
小龙虾技能之【Parkinson‘s & Epileptic Behavior Recognition Skill | 帕金森癫痫行为识别技能】简介智能分析中枢 · 图片/视频智能分析 · 结构化报告 · 历史报告云端查询Based on advanced computer vision technology, this feature conducts 24/7 intelligent scanning of designated surveillance areas such as community stations, residential entrances, and office building lobbies. The system
论文复现现场18 天前
cuda·多模态大模型·显存优化·rtx3090·minicpm-o
MiniCPM-o 4.5 需要多少显存?RTX 3090 24GB 的 BF16、AWQ、GGUF 部署边界与验收方法先给结论:RTX 3090 的 24GB 显存不能按官方口径稳定承载 MiniCPM-o 4.5 完整 PyTorch 全双工 Web Demo;它更适合 AWQ、GGUF,或关闭部分模态后的单轮验证。若目标是原精度、完整音视频全双工服务,应按官方“至少 28GB 显存”要求选卡。
HyperAI超神经1 个月前
人工智能·深度学习·图像生成·多模态大模型·视觉推理
SenseNova-U1.5-8B-MoT 统一生成与理解,解锁原生多模态创作;DeepSeek-V4-Flash-Vision-Exp 拓展视觉理解新能力SenseNova-U1.5-8B-MoT 是商汤科技 SenseNova 团队于 2026 年发布的原生统一多模态生成模型,采用 NEO-unify 架构设计,可在单一模型内完成图像生成、图像编辑与多模态理解等任务。模型公开约 18B 参数的 BF16 精度版本,在图像质量、文字渲染、4K 图像生成和复杂指令遵循等方面全面升级,能够实现更精准的画面控制、更稳定的主体保持以及更丰富的视觉创作能力,为海报设计、图像编辑和多模态内容生产提供更加高效的 AI 解决方案。
OpenBayes1 个月前
人工智能·深度学习·计算机视觉·自然语言处理·语音识别·多模态大模型
Qwen3.8-27B-FP8 降低大模型部署门槛,开启高效多模态智能体验;MiniMax H3-1K 发布千段视频测试数据集,全面评估 AI 视频生成能力公共资源速递6 个公共数据集:* RSNA Knee MRI 膝关节 3D 异常数据集* MiniMax H3-1K 模型图像视频测试数据集
HyperAI超神经1 个月前
人工智能·文生视频·多模态大模型·图生视频·ai视频生成
在线教程丨最高2K+原生双声道,MiniMax H3统一音视频生成从一句创意描述到一段完整视频,MiniMax H3 正在推动 AI 视频生成从「内容生成」迈向「智能创作」新阶段。
deepseek232 个月前
开源·多模态大模型·ai agent
商汤开源SenseNova U1.5 Lite拆解:8B装下原生统一多模态,NEO-Unify架构与4K图像生成的三笔工程账商汤科技在2026年8月21日把SenseNova U1.5 Lite正式推向开源,权重落在HuggingFace的sensenova/SenseNova-U1.5-8B-MoT-Preview,ModelScope镜像与GitHub仓库OpenSenseNova/SenseNova-U1当天同步可用,协议选了限制最少的Apache 2.0。发布节奏干脆利落,没有邀请码也没有排队申请,工程师当天就能把权重拉到本地。轻量级的定位直接写在名字里,Lite后缀对应的正是8B这一档体量。对一个原生统一的多模态模型
deepseek232 个月前
多模态大模型·推理优化·token 压缩
紫东太初 GMC 核心集剪枝拆解:少 80% Token 还满血,多模态视觉 Token 冗余有了新解法多模态大模型这几年越跑越快,但有一笔账始终绕不开:图像进入模型的那一刻,就被拆成了成百上千个视觉 Token。一张高分辨率图片经过视觉编码器,往往要吐出上千个离散表示,这些表示要和文字一起进入解码器参与每一层注意力计算。Token 越多,前向计算越重,显存占用越高,推理时延越长。视觉 Token 的冗余,已经成为多模态模型规模化落地最扎眼的瓶颈之一。
生命涌现2 个月前
人工智能·计算机视觉·agent·多模态大模型·openclaw小龙虾技能
【生命涌现植物健康分析】在火山云Agent平台的使用教程深耕电商、本地生活、小游戏与红果短剧四大黄金赛道。 海量即插即用、高转化的商业级 Skill,助你快人一步抢占 AI 增长红利。
白拾2 个月前
人工智能·多模态大模型·视频理解·cvpr 2026·cof 论文分享·链式推理·帧感知推理
【CVPR 2026】CoF:Chain-of-Frames,让视频大模型按帧推理|从多模态视频推理范式视角本文解读 CVPR 2026 论文《Chain-of-Frames: Advancing Video Understanding in Multimodal LLMs via Frame-Aware Reasoning》。该论文提出 Chain-of-Frames(CoF,帧感知推理链),通过融合单阶段链式推理、显式帧引用与真实+合成双通道数据生成,让视频多模态大模型在回答前先输出一段明确引用关键帧的推理过程,其特别之处在于把"关键帧检索"内化为纯文本推理轨迹中的帧编号引用,无需任何辅助模型。实验表明 C
Michaelliu_dev2 个月前
人工智能·llm·多模态大模型·vit·llava·rope·mllm
多模态大模型推理流程解析本文想从数据流的方式走一遍多模态大模型推理流程,但不包含vit和llm具体的计算流程,因为里面基本是常见的attention计算方式。attention的计算方式可以参考《Attention Is All You Need》算法详解
Michaelliu_dev2 个月前
人工智能·llm·位置编码·多模态大模型·rope·旋转位置编码·mllm
RoPE通俗讲解现有的attention结构如下图所示,输入的N长度的features之间在计算attention的时候是没有位置关系的。但是在不管是文本、图片还是视频两个feature之前是有先后、远近关系的。为了让模型能够学到这种关系,现在有大量的文章提出位置编码相关的内容。其中RoPE是比较常用的一种位置编码,包括后续一系列改进的位置编码都是在RoPE基础上做的,例如Qwen用于多模态的MD-RoPE可外推的Yarn。
生命涌现2 个月前
人工智能·目标检测·计算机视觉·多模态大模型·openclaw小龙虾技能
生命涌现的小龙虾技能之【Human Pose Recognition Skill | 人体姿态识别技能】简介智能分析中枢 · 图片/视频智能分析 · 结构化报告 · 历史报告云端查询This capability supports the recognition of various human postures, including standing, sitting, lying down, bending, raising hands, running, and falling, while featuring abnormal limb posture identification and fall w
SimpleLearingAI3 个月前
音视频·多模态大模型
生成图像/视频质量评估评估生成图像和视频的质量是生成模型(GAN、VAE、DDPM、Stable Diffusion 等)研发中的关键环节。评估指标分为主观评估和客观评估两大类。
CV-deeplearning4 个月前
多模态大模型·阿里·视频理解·mllm·mplug-owl
阿里 mPLUG-Owl 三代进化史:从模块化多模态到长视频理解,CVPR Highlight + ICLR 收录,7B 模型吊打 12B 竞品💡 7B 参数的多模态大模型能干啥?阿里达摩院的 mPLUG-Owl 说:分类超越 LLaVA-1.5、文本能力超越 LLaMA-2-Chat、长视频理解登顶 LVBench!三代进化,从模块化设计(Owl)到模态协作(Owl2,CVPR 2024 Highlight)到长图像序列理解(Owl3,ICLR 2025),每一步都是多模态大模型的关键突破。Apache 2.0 开源,HuggingFace/ModelScope 双平台可用。
SimpleLearingAI4 个月前
人工智能·算法·多模态大模型
PyTorch & Numpy 实现线性回归详解线性回归是机器学习入门最经典的算法,核心是拟合出一条最优直线(高维场景为超平面),让模型预测值与真实值误差最小。本文分别使用 Numpy(手动梯度) 和 PyTorch(自动求导) 实现梯度下降版线性回归,对比两种实现思路与差异。
EDPJ4 个月前
计算机视觉·cot·多模态大模型·思维链·mllm
(2025|ICML|普林斯顿 & NYU,MLLM,思维链/ CoT)思维链会降低需要思考才能完成的任务的完成效率,这在人类身上表现得尤为明显论文地址:https://arxiv.org/abs/2410.21333项目页面:https://github.com/JiayiGeng/CoT_overthinking
百度智能云技术站5 个月前
负载均衡·dp·多模态大模型
多模态模型训练加速,LoongForge 的 DP 负载均衡优化方案详解官方网页地址:https://baidu-baige.github.io/LoongForge/GitHub 地址:https://github.com/baidu-baige/LoongForge
SimpleLearingAI5 个月前
多模态大模型
大模型数值格式总结大模型常用的数值格式主要分为两大类:浮点格式(遵循IEEE标准,由符号位+指数位+尾数位组成,原生存储小数)和整数量化格式(无指数位,通过将小数映射为固定区间整数来实现压缩)。