Surgical Video Understanding LLM

__如果2025-11-21 15:52

SurgLLM: A Versatile Large Multimodal Model with Spatial Focus and Temporal Awareness for Surgical Video Understanding

（1）优先对含手术器械的区域进行掩码，不同时间长度（2、4、8、16 帧）的mask，让AE重建mask的部分，练一下encoder

（2）对比学习：视频 - 文本对比学习（VTC）、视频 - 文本匹配（VTM）和掩码语言建模（MLM）三个互补目标

（3）对切片的手术片段打上 "这是一个从 i×t 秒到 (i+1)×t 秒的视频片段"的时间描述S，与对应视觉特征H交错排列

，q是查询的问题

（4）Surgical Task Dynamic Ensemble：先对输入查询进行任务类型判定，用多任务Q-Former把视觉映射到不同任务空间，并激活不同任务对应的Lora参数

其中，Q-Former中，每个任务对应一组可学习向量，激活到具体任务时，用可学习向量和video encoder的向量做交叉注意力

SurgVidLM: Towards Multi-grained Surgical Video Understanding with Large Language Model

（1）构建数据集是拿ResNet50过滤非手术片段，有全局QA和局部QA

（2）训练：第一阶段低频采样（1fps）全局视频，Lora微调

第二阶段输入时间码，对时间码对应的片段高频采样（2fps），将第一阶段的低频特征作为kv，采样出的特征作为q，做注意力融合

（3）推理：第一阶段生成全局理解结果（如 "该视频为腹腔镜直肠癌根治术，包含探查、游离、吻合等 5 个关键阶段"）

第二阶段模型先定位问题对应的视频片段（通过时间码），再推理

Procedure-Aware Surgical Video-language Pretraining with Hierarchical Knowledge Augmentation

想解决的问题是外科领域文本质量低、专业知识缺失的痛点，而不是练一个手术视频理解模型

多层对比学习，红色是手术流程中不同阶段的核心操作描述，绿色是对整个手术视频的摘要文本（病例总结）

（a）根据病例扩充可能发生的结构化的手术步骤描述

（b）红色部分对应 Video-Level Pairing，根据临床症状描述Context，生成视频级摘要

橙色部分对应Phase-Level Pairing，根据手术视频的片段，生成阶段级关键步骤描述

蓝色部分，将手术过程中碎片化的语音转录文本，将转录文本与流程 (a) 构建的结构化手术步骤描述进行语义匹配，生成标准化的片段级叙事文本

EndoChat: Grounded Multimodal Large Language Model for Endoscopic Surgery

上一篇：DDL实战指南：如何定义和管理动态表

热门推荐

01GitHub 镜像站点 02今天 Cloudflare 全球事故，连 GPT 和你的网站都一起“掉线”了 03Google Antigravity：无法登录？早期错误、登录修复和用户反馈指南 04UV安装并设置国内源 05【保姆级教程】免费使用Gemini3的5种方法！免翻墙/国内直连 06安娜的档案(Anna’s Archive) 镜像网站/国内最新可访问入口（持续更新）07BongoCat - 跨平台键盘猫动画工具 08Linux下V2Ray安装配置指南 09全球最强模型Grok4，国内已可免费使用！（附教程）1046个Nano-banana 精选提示词，持续更新中