前面尝试使用千问的 3.6-35B-A3B 大模型本地部署的版本进行视频的解析,发现它能够解析出来一些内容。但是当我综合看汇总的分析结果之后,发现分析的内容不太对头。后来对照着原来的视频分析看了一下,发现其实它分析的主要还是视频页面。它的逻辑应该是把视频进行截屏,然后从里面提取相应的信息。归根结底,使用的这个技技能还是图像的识别能力。
但是不管是会议的录屏,还是别人的讲座,当我们想要去了解里面的内容的时候,音频里面的信息还是占了很大的主导作用。因此这样的一个视频的解析方式并不是很实用,甚至说是有一些鸡肋。我借助于网络上的信息以及 DeepSeek 等免费的 AI 聊天界面进行查询,发现其实我用的这个 A3B 的模型本身不支持视频流的解析。如果想要进行视频流的解析,得去尝试其他的大模型。或者是使用 A3B 的模型,再加上其他的工具作为辅助来实现。
我感觉使用其他的工具辅助也算是一个很好的尝试方案,只要是辅助的工具足够精简、专用。于是我尝试寻找了相应的解决方案,但是发现部署起来还是有一些困难,尤其是想让这些工作全都在 Server 端一次性搞定,而我们接入的设备只需要发起请求就可以。这种想法实现起来不是那么容易,尤其是我们使用 Windows 操作系统,而电脑的配置又不是那么强大的时候。
做了一些尝试,最终也没有取得很好的效果。于是我就尝试去寻找能够进行音视频解析的大模型。结果一搜索发现谷歌开源的 gemma 4 不管是 12B 还是 26B-A4B 都支持这样的功能。而我现在的机器配置,想要跑一个 26B 的量化版本,还是可以尝试一下的。于是赶紧从模大社区找到了相应的量化模型版本,做了尝试。最初的尝试,我没有尝试像之前一样,直接写一个脚本让它跑着,等待它分析完一个比较大的视频。这一次我是直接切割了一个 30 秒的视频,又切割了一个 5 秒钟的视频,之后让它分析独立的视频段。我发现这个模型的确确是能够完成这样的任务的。但是这样任务的完成也有一定的代价,那就是时间巨长无比,哪怕是几秒钟的视频。
通过上面的几个尝试,我就感觉想要尝试在本地大模型进行音视频的解读,似乎是一个断头路。如果继续走下去的话,这方面投入的时间与收回的效益并不会成正比,还不如就此搁置,再也不去做尝试了。除非以后能够看得到开箱即用的更好的方案。
尝试部署了谷歌 gemma 4 26B-A4B 的模型,进行对话测试的时候,我意外的发现它的推理速度出奇的快。我也尝试用它写了一下代码,发现写代码的速度如同机关枪一样。有种瞬间爆发,迅速火力笼罩的那种感觉。只是,虽然我的上下文一直是中文,但是它的注释信息全都是英文。我倒觉得这还挺好,顺便让我们学习一下英文,而且很多编码规范并不允许使用中文。经过测试发现它的代码生成质量也是可以的,最起码我要的一些功能基本上都实现了,没有太大的偏差。这也算是一个意外的收获,后续我倒是可以尝试使用这样的模型作为我的 coding 的主要模型,用一段时间。
通过这么多的折腾,最终感觉有一个初步的小结论。本地的大模型部署,充其量也就是能够成为我的 coding agent 背后的一个引擎。而这一部分的 token 消耗本来就不是一个特别大的数目。如果从实用性以及经济性的角度来考虑,还不如直接去买 DeepSeek API 来使用云端的 token 来的实在。不过有个小老弟跟我聊天的时候,说了一句话,倒是多少让我有点觉醒了。其实我们折腾本地大模型的部署,最终的收获并不在于省了多少投产的费用。在这个折腾的过程之中,我们收获的经验可能是我们收获的最宝贵的财富。