1929_使用本地 AI 大模型处理会议录屏长视频

我做了一个小小的尝试,想看一看我电脑上的这个 A3B 模型能不能完成长时间的会议纪要的整理。输入内容是会议的录屏,输出内容需要输出会议的相关讨论文本以及投屏显示的信息。

我用的这个千问的模型是一个多模态的模型,它本身是具备分析图像以及视频能力的。但是我的机器配置能力有限,加上这个模型本身上下文的支持也不是特别高,因此它能够处理的视频是十分有限的。

我尝试过把一个非常短的视频直接扔给它,虽然只有几分钟,但是显卡的显存什么的还是爆掉了,最后处理不掉。然后我的 AI 大模型服务直接就卡崩掉了。

它原生支持的上下文是 260 多 K,而我现在的电脑配置顶多能够支持 128K,而且还是在单用户的模式之下。为了能够更好的利用这个 128K,我就指挥 AI 给我写了一个 Python 的脚本。脚本的处理过程是我自己定义好的。使用的工具和方法也都是我自己考虑好的,他只需要给我实现这样的一个处理流程就好了。结果脚本写的非常快,一步到位就实现了。

脚本的具体功能:把当前的视频进行拆分分割,全都分割成 30 秒一个。这个 30 秒钟的视频几乎就是我的这个本地模型所能够处理的最长长度了。如果是以后处理发现信息密度有可能更大,那我就会把这个拆成更小,比如说 10 秒钟一个。之后我就向我的服务器发起服务请求,让它去分析这 30 秒钟的视频。给相应的音频分析内容打上时间戳,也给相应的屏幕分析内容打上时间戳,两者的时间戳是一样的。每 30 秒钟的视频,生成一个 Markdown 的文档,汇总这 30 秒钟的需求。当处理完一个视频之后,我直接截断这一次会话,重新发起新的服务请求。这样的话上下文就开始从头开始重新记。不断的循环,把一个视频以 30 秒钟一格的拆分进行独立分析,最后再把拆分出来的子文件汇总成一个大的 Markdown 文件。由于我对每一个视频中的信息都进行了时间戳印记,后面再根据文件的编号加上一个偏移量,就可以在汇总的大的 Markdown 文件之中得到原本的发言时间戳信息。这样汇总出来的 Markdown 文件信息非常丰富,是一个大视频总的信息量。但是这个大的视频总的信息量其实也不是很多,128K 的上下文想要处理这样的会议纪要,那是非常轻松的。于是在合并完了之后,进行简单的检查,然后就发起最后的一次服务请求,对汇总的这个大文件进行分析、归纳、总结。

目前测试了一批之前自己买的 AI 教程视频录屏,感觉这个效果还是可以的。理论分析,只要是这个录屏的信息在文本上不至于过于庞大,那么想要进行一个相关的会议纪要数据分析,还是足够容易的。

一个简单的尝试,让我对当前的这个 AI 本地大模型又有了更多的期待。

相关推荐
wu85877345713 小时前
从 Prompt 到 Loop:拆解 AI 工程化四范式的演进逻辑与落地边界
人工智能·ai·prompt·aigc·ai编程
老猿AI洞察14 小时前
三万Token的底牌:Claude Opus 5提示词泄露,揭开AI“灵魂“的每一道锁
人工智能·ai
俊哥V14 小时前
每日 AI 研究简报 · 2026-07-26
人工智能·ai
Summer-Bright14 小时前
AI 芯片简报 07.21-07.24:NVIDIA Vera 亮剑、AMD 2nm GPU、Google 叛逃 CoWoS
大数据·人工智能·ai·自然语言处理·芯片·agi
yiwanbin14 小时前
从 vibe coding 到 spec coding:Trellis 的实践总结
ai
猫先生Mr.Mao15 小时前
视频生成之LongLive-2.0详解:如何把 5B 长视频生成推到 45.7 FPS
ai·论文解读·视频生成·ai视频·longlive-2.0
腾视科技AIoT15 小时前
腾视科技重磅发布全场景无人叉车及智能调度系统解决方案,开启工业物流智能新时代
人工智能·科技·ai·无人车·ai算力·无人叉车·低速无人车
神奇霸王龙15 小时前
GPT-Image-2 角色一致性屠榜:2026 五款图生图模型 IP 漫剧实测
人工智能·gpt·tcp/ip·ai·ai作画·prompt·音视频