多模态

这张生成的图像能检测吗2 天前
人工智能·机器学习·计算机视觉·大模型·多模态·异常检测
(论文速读)LogSAD:无需训练的结构异常与逻辑异常统一检测论文题目:Towards Training-free Anomaly Detection with Vision and Language Foundation Models(迈向基于视觉与语言基础模型的免训练异常检测)
山顶夕景2 天前
机器人·多模态·扩散模型·具身智能·vla·dit·vlm
【VLA】Qwen-VLA:VLM+DiT统一多模态理解与连续机器人动作生成Qwen-VLA 的做法,不是声称"把所有机器人统一成一种动作",而是用 Qwen3.5-4B 视觉—语言骨干 + 约 1.15B 参数的 DiT 流匹配动作专家 + 一套 H×K 张量/前缀掩码/具身提示的接口,把操作、导航、人本动作、轨迹预测接进同一个条件生成框架。
Web3&Basketball4 天前
python·大模型·agent·强化学习·多模态·推理
用 SGLang 决策端点做毫秒级 Agent 路由本文结论先行:把「分类 / 路由 / 判定」这类任务从生成模型里拆出来,交给专门的决策模型(decision model),能把单次延迟从几百毫秒压到 sub-100ms,成本降到原来的几十分之一。SGLang 已在 nightly 加入 /v1/decisions 与 /v1/systemone 端点,AWS 也开源了 Strands Decider 2B,这个方向已经从概念变成可落地的工程选项。
EW Frontier6 天前
多模态·usrp·realsense·相控阵·isac(通感一体化)
【多模态 ISAC】USRP + 28 GHz 相控阵 + RealSense:这套毫米波通感一体原型把 UE 定位做到了 0.30 米【文末附代码链接】环境:MATLAB R2022b+(新增以免影响 readmatrix、深度深学习 YOLO 相关工具箱按需)+ Python 3.x(numpy / scipy / torch / matplotlib / openpyxl / Pillow) 数据集:Zenodo DOI 10.5281/zenodo.22896456(约数百 MB,仓库内不含数据) 论文:Multi-Modal Radio-Vision SLAM for ISAC: Prototype Design, Experimental Va
audyxiao0018 天前
人工智能·语言模型·多模态·时间序列
让大语言模型先读懂外部事件:一种文本增强与正则扩散对齐的多模态时序预测框架本文分享一篇2026年人工智能领域国际期刊Knowledge-Based Systems发表的论文《TRDA-TS: Text reinforcement and regularized diffusion alignment for LLM-empowered multimodal time series forecasting》。该论文针对大语言模型用于多模态时间序列预测时,外部事件文本利用不足以及文本与数值时序之间存在跨模态错配等问题,提出了TRDA-TS预测框架。该模型首先在数值分支中提取多尺度和
做cv的小昊9 天前
人工智能·算法·机器学习·大模型·多模态·vla·世界模型
【World Model】π0.5:a Vision-Language-Action Model with Open-World Generalization图1: π 0.5 \pi_{0.5} π0.5 模型从多种异质数据源中迁移知识,包括其他机器人、高层子任务预测、口头指令和网络数据,从而实现跨环境和物体的广泛泛化。 π 0.5 \pi_{0.5} π0.5 能够控制移动操作机器人,在训练数据未覆盖的新家庭中清洁厨房和卧室,并执行持续10至15分钟的复杂多阶段行为。
七夜zippoe10 天前
ai·agent·多模态·看懂·听懂·生成内容
多模态 Agent 入门:让 Agent 看懂图片、听懂语音、生成内容AI Agent 工程化落地实战系列 第 18 篇(核心技能篇)本文是 AI Agent 工程化落地实战系列第 18 篇,聚焦多模态 Agent 的设计与实现。我们从实际应用场景出发,系统讲解如何让 Agent 具备视觉理解(图片描述、OCR、图表解析)、语音交互(ASR + TTS)以及多模态融合处理能力。文章涵盖多模态工具设计模式、融合架构方案,并提供一个完整的多模态 Agent 实现代码。通过本文,你将掌握构建能"看"、能"听"、能"说"的智能 Agent 的核心方法论。
东姬AI18 天前
ai·数字人·多模态·视频生成·语音大模型
语音抢着实时,视频也抢着实时:两条赛道同时冲刺,交汇点却还差一步过去24小时,AI行业上演了一场少见的"实时竞赛"。9月15日凌晨,谷歌发布Gemini 3.8 Live与Gemini 3.8 Live Extended Thinking两款实时对话模型,官方称这是其迄今最先进的对话式AI,能够在对话不中断的情况下调用工具、处理视觉信息、执行复杂任务;同一天,国内的阶跃星辰一口气放出StepAudio 3系列五款语音模型,其中Realtime版本在Artificial Analysis对话动态榜单以98.9%的综合得分排名全球第一;还是同一天,生数科技发布实时视频模型
医嘉研-Meta|生信|一对一指导18 天前
多模态·医学·论文辅导收费·多少钱·公开行情大致·人工润色千元
医嘉研:单细胞CNV异质性锁定膀胱癌恶性亚型:多模态AI病理模型与RTN3/JAK2/STAT3/糖酵解轴的耐药机制解析医学 SCI 论文辅导收费多少钱?公开行情大致:人工润色千元级/篇,单环节支持数百到数千元,Meta 分析、数据库挖掘等项目制全程辅导约 0.8 万-2 万元。医嘉研可分阶段付费,避免为用不上的环节买单。
码哥字节20 天前
vision·多模态·deepseek·agent skills
DeepSeek 视觉 API 刚上线:单张图 0.001 元,Agent 终于能看图你昨天还在给 Agent 接 OCR 服务,今天 DeepSeek 直接把眼睛递到你手里了。2026 年 8 月 21 日,DeepSeek 在 API 平台上线了实验性多模态视觉模型 deepseek-v4-flash-vision-exp。一句话讲清楚,开发者第一次能用自己的 API Key,把图片塞进 DeepSeek 的上下文,让模型看、再让 Agent 接着干活。
oscar99920 天前
多模态·opik
用 Opik 记录多模态追踪:图像、视频、音频附件的完整指南如果你正在开发 LLM 应用,可能已经习惯了记录文本输入输出。但现实世界中的 AI 应用远不止文字。用户可能会上传一张图片让模型分析,或者你的 agent 会生成一份图表报告,又或者语音助手的对话需要保存音频。这些多模态数据如果不能被追踪,调试和评估就会留下巨大的盲区。Opik 支持多模态追踪,让你不仅能记录文本,还能记录图像、视频、音频以及任何其他媒体文件。这篇文章会详细介绍如何在 Opik 中记录和管理这些附件,包括大小限制、代码示例、最佳实践和程序化管理。
星云_byto21 天前
chatgpt·agent·多模态·codex·deepseek·大模型测评·opus-4.8
大模型测评:从最新出的DeepSeekV4.1模型看这19项指标一张成绩单上 19 门"考试",全看懂没必要。这篇文章把它们分成三类、三层,告诉你哪 5 个必须懂、哪 6 个要学会读、剩下 7 个按需看——以及比记指标更重要的两条"读数心法"。读完你会发现:19 项指标,其实只需要记住 5 个,再加两个心眼。
东姬AI22 天前
多模态·ai数字人·世界模型·ai视频生成·音画同步
当世界模型学会“开口说话“:从EchoWM开源,看AI生成内容的音画合流过去两年,AI视频生成的进步几乎都发生在"画面"上:分辨率从480P卷到1080P,时长从几秒卷到几十秒,物理规律和运镜质感也在肉眼可见地逼近实拍。但有一个维度长期被搁置在次要位置——声音。绝大多数视频生成模型产出的内容是"默片",配音、音效、环境声要靠后期另外补。9月初的京东全球科技探索者大会(JDD)上,京东探索研究院开源的交互视听世界模型EchoWM,把这个问题重新推到了台前:它生成的不是"带画面的视频",而是画面、环境音、音乐和语音原生同步的视听内容,并且允许用户像玩游戏一样走进去持续探索。
XLYcmy23 天前
llm·sft·强化学习·多模态·苹果·rag·检索
DeepMMSearch-R1: Empowering Multimodal LLMs in Multimodal Web Search论文分享今天分享的论文是《DeepMMSearch-R1: Empowering Multimodal LLMs in Multimodal Web Search》
william_yangshun1 个月前
人工智能·多模态
【AI Agent 实战】agent-vision-toolkit 中文版:给纯文本模型(DeepSeek)装上视觉能力1180 stars · MIT · Python · 支持 Codex / Claude Code / Pi / OpenCode
CV山月1 个月前
人工智能·python·大模型·强化学习·多模态·研究生
大模型强化学习对齐:从 RLHF 框架到 PPO 算法原理前面几期内容,我们主要介绍强化学习中更新模型的手段,比如 GRPO、GSPO 等,那么这一期我们想把顺序理清楚,向大家完善强化学习的框架,并从原理角度介绍 PPO 算法;如果前几期内容没有了解的,可以直接点击下方的链接:
deepseek231 个月前
python·多模态·ai agent·gemini·视频理解
Google Gemini Agentic Video 上线:88% 少 token 的主动取样如何改写长视频理解那天晚上我对着一段45分钟的项目复盘录像,想找出所有提到数据库迁移的片段。按固定帧率处理,默认每秒取一帧,整段录像会先被拆成2700个画面,再把这些画面送进模型。问题不只在账单,画面变化很小的白板讨论也可能刚好落在两帧之间,模型看见了会议,却没看见真正有用的那几秒。
山顶夕景1 个月前
agent·多模态·vlm·omni·全模态
【Omni】OmniGAIA: Towards Native Omni-Modal AI Agents项目链接:https://github.com/RUC-NLPIR/OmniGAIA当前多模态大模型(MLLM)存在三个明显的断层: