我做了一个小小的尝试,想看一看我电脑上的这个 A3B 模型能不能完成长时间的会议纪要的整理。输入内容是会议的录屏,输出内容需要输出会议的相关讨论文本以及投屏显示的信息。
我用的这个千问的模型是一个多模态的模型,它本身是具备分析图像以及视频能力的。但是我的机器配置能力有限,加上这个模型本身上下文的支持也不是特别高,因此它能够处理的视频是十分有限的。
我尝试过把一个非常短的视频直接扔给它,虽然只有几分钟,但是显卡的显存什么的还是爆掉了,最后处理不掉。然后我的 AI 大模型服务直接就卡崩掉了。
它原生支持的上下文是 260 多 K,而我现在的电脑配置顶多能够支持 128K,而且还是在单用户的模式之下。为了能够更好的利用这个 128K,我就指挥 AI 给我写了一个 Python 的脚本。脚本的处理过程是我自己定义好的。使用的工具和方法也都是我自己考虑好的,他只需要给我实现这样的一个处理流程就好了。结果脚本写的非常快,一步到位就实现了。
脚本的具体功能:把当前的视频进行拆分分割,全都分割成 30 秒一个。这个 30 秒钟的视频几乎就是我的这个本地模型所能够处理的最长长度了。如果是以后处理发现信息密度有可能更大,那我就会把这个拆成更小,比如说 10 秒钟一个。之后我就向我的服务器发起服务请求,让它去分析这 30 秒钟的视频。给相应的音频分析内容打上时间戳,也给相应的屏幕分析内容打上时间戳,两者的时间戳是一样的。每 30 秒钟的视频,生成一个 Markdown 的文档,汇总这 30 秒钟的需求。当处理完一个视频之后,我直接截断这一次会话,重新发起新的服务请求。这样的话上下文就开始从头开始重新记。不断的循环,把一个视频以 30 秒钟一格的拆分进行独立分析,最后再把拆分出来的子文件汇总成一个大的 Markdown 文件。由于我对每一个视频中的信息都进行了时间戳印记,后面再根据文件的编号加上一个偏移量,就可以在汇总的大的 Markdown 文件之中得到原本的发言时间戳信息。这样汇总出来的 Markdown 文件信息非常丰富,是一个大视频总的信息量。但是这个大的视频总的信息量其实也不是很多,128K 的上下文想要处理这样的会议纪要,那是非常轻松的。于是在合并完了之后,进行简单的检查,然后就发起最后的一次服务请求,对汇总的这个大文件进行分析、归纳、总结。
目前测试了一批之前自己买的 AI 教程视频录屏,感觉这个效果还是可以的。理论分析,只要是这个录屏的信息在文本上不至于过于庞大,那么想要进行一个相关的会议纪要数据分析,还是足够容易的。
一个简单的尝试,让我对当前的这个 AI 本地大模型又有了更多的期待。