1929_使用本地 AI 大模型处理会议录屏长视频

我做了一个小小的尝试,想看一看我电脑上的这个 A3B 模型能不能完成长时间的会议纪要的整理。输入内容是会议的录屏,输出内容需要输出会议的相关讨论文本以及投屏显示的信息。

我用的这个千问的模型是一个多模态的模型,它本身是具备分析图像以及视频能力的。但是我的机器配置能力有限,加上这个模型本身上下文的支持也不是特别高,因此它能够处理的视频是十分有限的。

我尝试过把一个非常短的视频直接扔给它,虽然只有几分钟,但是显卡的显存什么的还是爆掉了,最后处理不掉。然后我的 AI 大模型服务直接就卡崩掉了。

它原生支持的上下文是 260 多 K,而我现在的电脑配置顶多能够支持 128K,而且还是在单用户的模式之下。为了能够更好的利用这个 128K,我就指挥 AI 给我写了一个 Python 的脚本。脚本的处理过程是我自己定义好的。使用的工具和方法也都是我自己考虑好的,他只需要给我实现这样的一个处理流程就好了。结果脚本写的非常快,一步到位就实现了。

脚本的具体功能:把当前的视频进行拆分分割,全都分割成 30 秒一个。这个 30 秒钟的视频几乎就是我的这个本地模型所能够处理的最长长度了。如果是以后处理发现信息密度有可能更大,那我就会把这个拆成更小,比如说 10 秒钟一个。之后我就向我的服务器发起服务请求,让它去分析这 30 秒钟的视频。给相应的音频分析内容打上时间戳,也给相应的屏幕分析内容打上时间戳,两者的时间戳是一样的。每 30 秒钟的视频,生成一个 Markdown 的文档,汇总这 30 秒钟的需求。当处理完一个视频之后,我直接截断这一次会话,重新发起新的服务请求。这样的话上下文就开始从头开始重新记。不断的循环,把一个视频以 30 秒钟一格的拆分进行独立分析,最后再把拆分出来的子文件汇总成一个大的 Markdown 文件。由于我对每一个视频中的信息都进行了时间戳印记,后面再根据文件的编号加上一个偏移量,就可以在汇总的大的 Markdown 文件之中得到原本的发言时间戳信息。这样汇总出来的 Markdown 文件信息非常丰富,是一个大视频总的信息量。但是这个大的视频总的信息量其实也不是很多,128K 的上下文想要处理这样的会议纪要,那是非常轻松的。于是在合并完了之后,进行简单的检查,然后就发起最后的一次服务请求,对汇总的这个大文件进行分析、归纳、总结。

目前测试了一批之前自己买的 AI 教程视频录屏,感觉这个效果还是可以的。理论分析,只要是这个录屏的信息在文本上不至于过于庞大,那么想要进行一个相关的会议纪要数据分析,还是足够容易的。

一个简单的尝试,让我对当前的这个 AI 本地大模型又有了更多的期待。

相关推荐
俊哥V8 分钟前
每日 AI 研究简报 · 2026-08-30
人工智能·ai
番茄不是西红柿kk11 分钟前
GLM-5.3-Flash 20分钟复刻《我的世界》实录
人工智能·ai·aigc·agent·我的世界
认真就输DBA1 小时前
一个DBA,把用了16年的两款软件换了
数据库·ai·dba·tabby·笔记软件·obsidian
张忠琳1 小时前
【deepseek-harness】Cordis 时空可组合性编程范式 — 三段式精读笔记(五)
ai·agent·deepseek·harness·cordis·dsh
kaixin_啊啊2 小时前
系统开发实践指南:构建高效可靠的软件系统
ai
sukioe3 小时前
一张图、两把锁:AI 物流履约平台的确定性边界设计
人工智能·python·ai·langchain
JaydenAI3 小时前
[DeepSeek Harness插件内核-06]Context全面解析[自由扩展篇]
ai·agent·deepseek·harness·cordis
TechEdu2026064 小时前
[人工智能]Gemini(Google DeepMind):多模态模型、智能体与工程实践
人工智能·ai
FIT2CLOUD飞致云4 小时前
1Panel AI一体机(GB10版)推出MiniMax H3本地视频生成方案
运维·ai·开源·1panel·ai视频·运维面板
tachibana24 小时前
AI Agent 的记忆机制
人工智能·ai·大模型·llm·agent