多模态

山顶夕景1 天前
音视频·多模态·视频理解·长视频
【VQA】VideoChat3长视频理解模型arXiv链接:https://arxiv.org/abs/2607.14935 这篇论文是 VideoChat3: Fully Open Video MLLM for Efficient and Generalist Video Understanding(2026年7月arXiv),由南京大学、上海人工智能实验室、南洋理工大学等机构联合提出。
猫先生Mr.Mao3 天前
多模态·论文解读·3dgs·世界模型
世界模型之HY-World 2.0详解:生成完还能走进去——如何把文本、照片和视频变成可探索的 3D 世界【从零走向AGI】旨在深入了解通用人工智能(AGI)的发展路径,从最基础的概念起,逐步构建完整的知识体系。 项目地址🔗:https://github.com/AI-mzq/From-Zero-to-AGI.git
GoAI3 天前
人工智能·大模型·llm·多模态
# AI Agent 记忆框架横向对比报告总结覆盖框架:Claude Code、DeerFlow 2.0、Hermes Agent、Mem0、OpenClaw、claude-mem、MemGPT/Letta、LangMem、Zep、Cognee
deepseek236 天前
人工智能·多模态·视频生成
MiniMax H3 全模态模型拆解:2K 视频成本被腰斩背后,H3-VAE 和 In-context Regeneration 做了什么7 月 31 日,MiniMax 发布了全模态生成模型 H3,随后宣布将在几天内开放模型权重。消息传开后,资本市场先动了:MiniMax 股价盘中一度拉升 15%。但比起股价,我更想先算一笔账。
带娃的IT创业者6 天前
人工智能·开源·大语言模型·多模态·moe·开源模型·inkling
Inkling:当开源模型开始思考“如何思考”👋 大家好,我是 带娃的IT创业者,CSDN 人工智能领域新星创作者,一边带娃一边创业的全栈工程师。专注 AI 大模型应用落地、Python 实战进阶与 AI 开发工具链(Python / FastAPI / 大模型 / AI 编程)。
余俊晖6 天前
人工智能·深度学习·算法·多模态·opd
多模态大模型细粒度视觉理解:Vision-OPD在线策略自蒸馏技术方案概述MLLM在细粒度视觉理解上仍然吃力:答案往往依赖图中只占极小比例的"决定性细节",而在整图推理时,这些细节被海量视觉 token 淹没。
余俊晖6 天前
人工智能·ocr·多模态
再看多模态OCR视觉token裁剪思路-LayoutLite基于token的隐式布局分析前面介绍了一篇关于《多模态文档理解视觉token剪枝思路》的方案,今天又看到一篇类似的方案-LayoutLite,其核心背景也是OCR场景中图片上有很多冗余背景token【大量token对应空白边距、纯色背景等无文本信息的冗余区域;这些冗余token会全程参与后续解码器计算,直接推高预填充(prefill)阶段延迟、整体计算量(FLOPs)以及KV缓存的内存占用,成为端到端OCR落地的核心性能短板。】,需要剔除以提升VLM-OCR的效率。LayoutLite 的应用场景是在 token 层面做隐式布局分析
HyperAI超神经7 天前
人工智能·深度学习·机器人·多模态·图像生成·具身智能·智能体
15亿参数挑战机器人控制,MiniCPM-RobotManip正式开源;覆盖文本/图/视频/动作序列,英伟达发布全模态模型Cosmos3-Edge在具身智能领域,让机器人具备感知、理解与行动能力,是推动智能体进入真实世界的关键。MiniCPM 推出的 MiniCPM-Robot 系列模型,围绕机器人操作与目标跟踪两大核心任务展开探索。其中,MiniCPM-RobotManip 是一个仅 15 亿参数的视觉语言动作模型,基于 MiniCPM-V 4.6 视觉语言骨干,并结合扩散动作头,实现从视觉观察和语言指令到机器人动作的端到端映射;MiniCPM-RobotTrack 则聚焦实体目标跟踪,以 0.9B 参数实现端侧实时视觉跟踪能力。通过轻量化架构、
不爱记笔记7 天前
人工智能·自然语言处理·nlp·音视频·多模态
多模态AI如何理解视频内容?从视觉、语音到语义的三层技术拆解过去两年,音视频内容的生产速度远超文本。一个B站UP主每月产出几十个小时的视频,一门培训课程动辄上百节录播。面对海量视频,靠人力逐帧观看、手动做笔记已经不现实。多模态AI的出现,让机器理解视频内容从概念变成了可落地的技术方案。
AndrewHZ10 天前
人工智能·gpt·深度学习·语言模型·自然语言处理·llm·多模态
【LLM技术全景】多模态大模型:当语言模型学会“看“和“听“摘要回顾本系列前 17 篇,我们一直在和文本 Token打交道:Tokenization、Embedding、Self-Attention、预训练、对齐……所有机制都建立在"一串离散文本符号"之上。
山顶夕景20 天前
大模型·音视频·多模态·audio·检索·全模态
【Audio】Audio encoder相关BenchmarkHEAR 的目标就是评估“什么 audio embedding 能泛化到多种下游音频任务”,覆盖 speech、environmental sound、music,并且是 NeurIPS 2021 shared challenge 发展出来的 benchmark。
山顶夕景19 天前
音视频·ssl·多模态·自监督·mae
【MAE】音频自监督训练Masked Autoencoders that Listen《Masked Autoencoders that Listen》(Audio-MAE, NeurIPS 2022)
山顶夕景20 天前
vr·多模态·图片·clip·视频检索
【VR】 A CLIP-Hitchhiker’s Guide to Long Video RetrievalA CLIP-Hitchhiker’s Guide to Long Video Retrieval 2022
在水一缸20 天前
gpt·llm·交互·多模态·端到端·实时语音交互·gpt-live
深度解析 GPT-Live:实时语音交互的技术变革与实践指南在大型语言模型(LLM)的发展历程中,我们见证了从简单的文本补全到多模态理解的飞跃。然而,直到最近,人机交互依然存在着一道隐形的屏障——“延迟”。传统的语音交互往往依赖于级联式架构,即“语音转文字(ASR)→ 大模型处理(LLM)→ 文字转语音(TTS)”的三段式流程。这种架构带来的数秒延迟,使得对话失去了自然交流的韵律感。
春波petal21 天前
人工智能·自然语言处理·chatgpt·大模型·多模态·语音大模型
大模型底层逻辑:优势局限与天生短板👨‍💻 了解博主:波仔椿 📖 人生箴言:技术落地,方为 AI 正道。 🧰 我的专栏:普通人可落地的 AI 提效实战
我是小杰啊22 天前
人工智能·计算机视觉·多模态·ai应用·视频搜索
幻视是什么?一款用自然语言搜索图片与视频的 AI 视觉问答工具**一句话回答:**幻视是一款面向个人媒体资产的 AI 视觉搜索与问答 Web 应用。用户上传图片或视频后,可以像聊天一样提问,让系统查找人物、物体、动作、场景和关键画面,而不必手动拖动进度条逐段观看。
新知图书23 天前
人工智能·agent·多模态·ai agent·智能体
多模态响应解析与后处理多模态AIAgent开发实践 邓立国、周驰岷、邓淇等 清华大学出版社【行情 报价 价格 评测】-京东《多模态AI Agent开发实践》1~6章试读-CSDN博客
新知图书24 天前
人工智能·agent·多模态·ai agent·智能体
主流多模态模型(GPT-4V/CLIP/BLIP/Qwen-VL)多模态AIAgent开发实践 邓立国、周驰岷、邓淇等 清华大学出版社【行情 报价 价格 评测】-京东《多模态AI Agent开发实践》1~6章试读-CSDN博客