多模态

星云_byto18 小时前
chatgpt·agent·多模态·codex·deepseek·大模型测评·opus-4.8
大模型测评:从最新出的DeepSeekV4.1模型看这19项指标一张成绩单上 19 门"考试",全看懂没必要。这篇文章把它们分成三类、三层,告诉你哪 5 个必须懂、哪 6 个要学会读、剩下 7 个按需看——以及比记指标更重要的两条"读数心法"。读完你会发现:19 项指标,其实只需要记住 5 个,再加两个心眼。
东姬AI2 天前
多模态·ai数字人·世界模型·ai视频生成·音画同步
当世界模型学会“开口说话“:从EchoWM开源,看AI生成内容的音画合流过去两年,AI视频生成的进步几乎都发生在"画面"上:分辨率从480P卷到1080P,时长从几秒卷到几十秒,物理规律和运镜质感也在肉眼可见地逼近实拍。但有一个维度长期被搁置在次要位置——声音。绝大多数视频生成模型产出的内容是"默片",配音、音效、环境声要靠后期另外补。9月初的京东全球科技探索者大会(JDD)上,京东探索研究院开源的交互视听世界模型EchoWM,把这个问题重新推到了台前:它生成的不是"带画面的视频",而是画面、环境音、音乐和语音原生同步的视听内容,并且允许用户像玩游戏一样走进去持续探索。
XLYcmy3 天前
llm·sft·强化学习·多模态·苹果·rag·检索
DeepMMSearch-R1: Empowering Multimodal LLMs in Multimodal Web Search论文分享今天分享的论文是《DeepMMSearch-R1: Empowering Multimodal LLMs in Multimodal Web Search》
william_yangshun9 天前
人工智能·多模态
【AI Agent 实战】agent-vision-toolkit 中文版:给纯文本模型(DeepSeek)装上视觉能力1180 stars · MIT · Python · 支持 Codex / Claude Code / Pi / OpenCode
CV山月10 天前
人工智能·python·大模型·强化学习·多模态·研究生
大模型强化学习对齐:从 RLHF 框架到 PPO 算法原理前面几期内容,我们主要介绍强化学习中更新模型的手段,比如 GRPO、GSPO 等,那么这一期我们想把顺序理清楚,向大家完善强化学习的框架,并从原理角度介绍 PPO 算法;如果前几期内容没有了解的,可以直接点击下方的链接:
deepseek2311 天前
python·多模态·ai agent·gemini·视频理解
Google Gemini Agentic Video 上线:88% 少 token 的主动取样如何改写长视频理解那天晚上我对着一段45分钟的项目复盘录像,想找出所有提到数据库迁移的片段。按固定帧率处理,默认每秒取一帧,整段录像会先被拆成2700个画面,再把这些画面送进模型。问题不只在账单,画面变化很小的白板讨论也可能刚好落在两帧之间,模型看见了会议,却没看见真正有用的那几秒。
山顶夕景12 天前
agent·多模态·vlm·omni·全模态
【Omni】OmniGAIA: Towards Native Omni-Modal AI Agents项目链接:https://github.com/RUC-NLPIR/OmniGAIA当前多模态大模型(MLLM)存在三个明显的断层:
s1ckrain12 天前
论文阅读·人工智能·多模态·具身智能
【论文阅读】A Survey on Vision–Language–Action Models for Embodied AIUnimodel to Multimodal:机器人领域的变化:传统机器人 RL policy 通常是:
这张生成的图像能检测吗14 天前
大模型·文生图·多模态·扩散模型·图像生成
(论文速读)Scaling Rectified Flow Transformers:Rectified Flow + MM-DiT 的高分辨率文生图路线论文题目: Scaling Rectified Flow Transformers for High-Resolution Image Synthesis 中文翻译: 用于高分辨率图像合成的可扩展 Rectified Flow Transformer 会议: ICML 2024
新知图书15 天前
人工智能·多模态·智能体
10.4 交互优化与用户体验提升邓立国多模态Agent开发必读书《多模态AI Agent开发实践》全文试读~持续更新-CSDN博客目录
山顶夕景18 天前
大模型·llm·agent·多模态·moe
【LLM】GLM-5.3-Flash模型MVBench 和 MMVU:我们使用的参数设置为温度=1.0,top_p=0.95,最大上下文长度为 256K 个令牌。对于那些原生支持视频输入的模型,比如 Gemini 3.7 Flash,我们可以直接将原始视频作为输入进行评估。而对于那些不支持视频输入的模型,我们会采用默认的 1 帧每秒的提取策略。如果提取出的帧数超过 API 的最大限制,我们会在整个视频范围内进行均匀采样,直到达到这个最大帧数限制为止。
梦想的颜色18 天前
人工智能·深度学习·计算机视觉·多模态·aiagent·#vlm·ai工程实战
【AI科普】什么是计算机视觉:硬核科普,它和大 AI 大模型到底是什么关系很多初学者容易混淆概念:AI 就是大语言模型?计算机视觉 = AI 画图?VLM 多模态大模型 = 计算机视觉?
HyperAI超神经20 天前
人工智能·深度学习·学习·音视频·多模态·视频生成·推理模型
MiniMax H3 突破视频生成边界,音画内容一体生成;Ornith-1.5-35B-A3B 探索推理模型自进化训练新模式MiniMax H3 是 MiniMax 推出的通用全模态生成模型,让模型从「理解内容」进一步走向「统一生成」。它能够同时处理文本、图片、视频和音频等复杂输入,并根据多模态上下文直接生成视频,最高支持 2K 分辨率、24 FPS 和 15 秒时长。与传统视频生成模型侧重单一任务不同,H3 将文生视频、图生视频、参考生视频和视频编辑等能力统一在同一模型中,并采用音画联合生成机制,一次性生成画面、语音、音效与音乐。在实际应用中,模型还强化了复杂指令遵循、画面文字与品牌 Logo 渲染、视频运动迁移等能力,为广
智码看视界22 天前
开源·apache·多模态·图像生成·ai生图·sensenova·商汤大模型
SenseNova U1.5 Lite 部署实测:8B 单卡跑通 4K 生图,Apache 2.0 免费商用SenseNova U1.5 Lite 是商汤「SenseNova-U1」统一多模态家族的 8B 轻量版本,2026-08-21 正式开源,Apache 2.0 协议,个人/学术/商业均可免费使用、微调与二次分发。它最大的特点是「一个模型干三件事」:图像理解(看图问答、OCR、图表解析、多图对比推理)、文本生成图像、图像编辑(局部修改、元素替换、多参考图合成)全部由同一套权重完成,没有传统扩散模型里独立的 VAE 与视觉编码器。
weixin_4713830323 天前
多模态
28 多模态(Multimodal)传统 LLM 只能处理文本,多模态模型(Multimodal / Vision Language Model,VLM)能同时理解多种输入类型:
Geek-Chow23 天前
人工智能·大语言模型·多模态
02 多模态 LLM 是什么:定义、边界与生态位置上一篇讲清了纯文本 LLM 撞上的四堵墙,以及 CLIP 造出了眼睛却没接大脑。这一篇把"接起来之后的那个东西"正式定义出来。
XLYcmy1 个月前
llm·负载均衡·强化学习·多模态·ppo·dpo·grpo
小红书 算法一面 十二在 **MoE(混合专家模型)** 场景中,**负载均衡** 是指**门控网络将输入 token 均匀分配给各个专家子网络**,使得每个专家接收的计算任务量(token 数量、计算开销)保持相对均衡,避免出现“热门专家过载、冷门专家闲置”的现象。
山顶夕景25 天前
agent·强化学习·多模态·rl·agentic
【MLLM Agent】多模态理解Agent研究进展(1)框架类(可直接搭建多模态 Agent 基座) DeepSeek‑Harness(DeepSeek 2026) 定位:Agent 运行时框架,近期新增 Vision 支持,对接 V4‑Flash‑Vision‑Exp,实现图片输入 + 原生 function call 闭环,可插拔 Agent 循环、工具、记忆、上下文管理 仓库:https://github.com/deepseek‑ai/harness
uncle_ll25 天前
llm·文生图·文生视频·多模态·ollama
多模态大模型视听生成本地实战从纯文本交互到跨模态感知,多模态大模型(MLLM)正成为 AI 从语言对话走向全场景智能的关键枢纽。本文从核心分类、对齐机制、任务矩阵到本地部署,系统拆解多模态技术的工程化落地全流程。