技术栈

multimodal

代码不会写
11 天前
multimodal·daft
Daft 快速入门:从 DataFrame 到 Swordfish、Flotilla 与 RayDaft 是面向 AI 与多模态工作负载的高性能数据处理引擎。它提供 Python DataFrame 和 SQL 接口,让图片、音频、视频、文本、Embedding 与普通结构化数据进入同一条声明式流水线;底层由 Rust 执行引擎负责向量化、流式执行和内存控制,并能从单机扩展到分布式集群。
泡泡茶壶_ovo
8 个月前
人工智能·深度学习·计算机视觉·imagecaptioning·multimodal
Zero-Shot Image Captioning with Multi-type Entity Representations(AAAI 2025)研究方向:Image Captioning传统方法通常需要大量的图像-文本对数据进行训练,这在数据获取方面提出了挑战;
泡泡茶壶_ovo
9 个月前
llms·multimodal
RETHINKING VISUAL INFORMATION PROCESSING IN MULTIMODAL LLMS研究方向:Image Captioning本文提出了LLaViT,一种扩展的视觉Transformer,它通过三个关键修改使LLM能够同时充当视觉编码器:
我是有底线的