长视频

山顶夕景5 天前
音视频·多模态·视频理解·长视频
【VQA】VideoChat3长视频理解模型arXiv链接:https://arxiv.org/abs/2607.14935 这篇论文是 VideoChat3: Fully Open Video MLLM for Efficient and Generalist Video Understanding(2026年7月arXiv),由南京大学、上海人工智能实验室、南洋理工大学等机构联合提出。
山顶夕景1 个月前
vlm·rope·视频理解·多模态理解·长视频·token压缩
【VLM】视频理解LLaVA-OneVision-2(Codec-stream)链接:https://github.com/EvolvingLMMs-Lab/LLaVA-OneVision-2
AI生成未来8 个月前
aigc·扩散模型·视频生成·长视频
南洋理工&腾讯最新Rolling Forcing解决流视频生成长期误差累积,连贯如一且长达数分钟!论文链接:https://arxiv.org/pdf/2509.25161 项目链接:https://kunhao-liu.github.io/Rolling_Forcing_Webpage/
AI生成未来10 个月前
视频生成·自回归·长视频
4分15秒!高质量超长视频生成取得颠覆突破!字节Self-Forcing++超基线50倍,效果炸裂!论文链接:https://arxiv.org/pdf/2510.02283 项目链接:https://self-forcing-plus-plus.github.io/
大数据AI人工智能培训专家培训讲师叶梓1 年前
人工智能·ai·大模型·音视频·视频·视频生成·长视频
FramePack:让视频生成更高效、更实用想要掌握如何将大模型的力量发挥到极致吗?叶梓老师带您深入了解 Llama Factory —— 一款革命性的大模型微调工具(限时免费)。
我是有底线的