全模态

山顶夕景6 天前
音视频·vlm·视频理解·agentic·全模态
【VLM】Qwen3.8-Omni-Flash长音视频理解Agentic模型1、向 Qwen3.8-Omni-Flash 提出了一项任务:在 12 小时内提升 Qwen2.5-Omni-3B 的四川话识别能力,并交付可用模型。它自主选定 WenetSpeech-Chuan 评测集、固定评测标准并完成基线测试,随后直接听取语音样本,结合识别结果诊断问题,构建针对性的训练数据。在连续 4 轮实验中,Agent 累计构建了 3,413 条训练数据,并根据评测反馈调整方案、保留有效改进、回退无效尝试。最终,Qwen2.5-Omni-3B 在同一评测集上的字符错误率从 25.79% 降至
山顶夕景19 天前
agent·多模态·vlm·omni·全模态
【Omni】OmniGAIA: Towards Native Omni-Modal AI Agents项目链接:https://github.com/RUC-NLPIR/OmniGAIA当前多模态大模型(MLLM)存在三个明显的断层:
山顶夕景2 个月前
大模型·音视频·多模态·audio·检索·全模态
【Audio】Audio encoder相关BenchmarkHEAR 的目标就是评估“什么 audio embedding 能泛化到多种下游音频任务”,覆盖 speech、environmental sound、music,并且是 NeurIPS 2021 shared challenge 发展出来的 benchmark。
武子康10 个月前
人工智能·深度学习·机器学习·ai·大模型·qwen·全模态
AI研究-129 Qwen2.5-Omni-7B 要点:显存、上下文、并发与成本Qwen2.5-Omni目前开源提供的是7亿参数(7B)版本。相对于GPT-4等数千亿参数的闭源模型,7B的规模非常小巧,这带来了低资源占用和易部署的优势。在FP16精度下模型权重约需14GB显存,使用INT4量化后可压缩到<4GB,使普通PC甚至高端手机都有能力运行。
示申○言舌1 年前
数字人·实时问答·全模态·口型驱动
实时问答数字人现在数字人挺火的,这两天研究了一阵子,先将所得记录和总结一下,如果这篇文章能够帮到你,那就更好了。 目前数字人大概分为两种,第一种是非实时的,本质上就是视频生成,有文生视频、图生视频还有参考视频生视频,这种比较适合直播,还有做视频的UP主,这种在我看来不太符合我的研究方向,懒得研究它。 另一种,就是实时性的了,本文重点研究这种类型的。
我是有底线的