引言

X-AnyLabeling 是一款 AI 原生的轻量、高效、统一跨平台桌面应用,面向个人开发者及中小团队,为文本、文档、图像、视频及多模态数据提供开箱即用的智能辅助标注能力,打通数据标注、模型推理、算法训练的一站式闭环。
提供多边形、矩形、长方体、旋转框、四边形、圆形、线段、折线、点、掩码等丰富的标注对象类型,并在应用内集成 YOLO、SAM、DINO 等行业内数百款最顶尖的深度学习模型,支持多后端推理引擎及灵活的多格式数据导入与导出,覆盖从分类、检测、分割、计数、估计、跟踪、文档解析、视频描述到多模态理解等数十种视觉基础任务类型。
此外,平台内置自动化标注工作流与丰富的功能组件,将批量预标注、人工审核和数据统计融入统一流程;推理既可在本地完成,也能按需接入远程算力,并通过开放的组件、模型与数据流扩展机制适配不同业务。个人和小团队无需投入重型基础设施,也能建立高效、可控的数据生产流程。
这些能力并非一蹴而就。过去一年多,X-AnyLabeling 持续围绕真实数据生产需求迭代,并在社区开发者与用户的共同参与下逐步走向成熟,并取得一些成绩:GitHub 开源仓库突破一万 Star,全渠道累计下载量达到数百万次,官方网站正式上线,应用范围也从个人开发实践延伸至全球高校、科研机构和企事业单位,服务于科研攻关、工业生产与教育教学等场景。
如今正式发布的 X-AnyLabeling v4,不只是一次简单的版本升级,更是对既有能力的系统化整合:基础组件负责统一表达与高效编辑数据,任务体系承接不同视觉和多模态问题,专用工作流重组复杂数据生产过程,开放扩展能力则进一步连接自定义交互、模型、数据流与远程算力。下面将沿着这四个层次,逐一拆解产品能力与设计逻辑。
基础组件
文件
X-AnyLabeling 既支持单张图片,也支持批量图片、多级目录数据集以及视频文件的直接导入。
除常见图像格式外,还兼容 HEIC、HEIF 和 16 位灰度图;视频则支持 MP4、AVI、MOV、MKV、WMV 等常见格式,并可直接抽帧后进入统一的标注、审核与导出流程。
导入后,文件会按照自然顺序排列,并自动处理 EXIF 方向信息,减少手机拍摄、工业相机采集或视频抽帧数据在标注前的额外整理工作。
X-AnyLabeling 支持标签自动保存,也可以将 JSON 标注结果统一输出到独立目录,使原始数据与标注文件分开管理。
在文件安全方面,删除图片时,原图会被移动到当前任务目录下的备份目录,方便误删后恢复;删除标签文件则属于不可恢复操作。这样的设计既降低了原始数据误删的风险,也让标注结果的管理更加明确。
对象

在 X-AnyLabeling 中,每一个最小标注单元称为一个对象 (shape)。
为满足不同任务对几何表达的需求,平台目前提供以下九种对象类型:
| 对象名称 | 对象类型 | 几何特征与绘制方式 | 典型任务与场景 |
|---|---|---|---|
| 矩形框 | rectangle |
单击两个对角点,创建与图像坐标轴平行的外接矩形 | 通用目标检测、多目标跟踪、感兴趣区域定位,以及规则目标的快速框选 |
| 多边形 | polygon |
沿目标边缘依次添加顶点,至少需要 3 个点;也可通过画笔(Ctrl+N)或魔术棒(Shift+W)快速生成轮廓 |
实例分割、语义分割、显著目标检测,以及医学、遥感和工业缺陷等精细轮廓标注 |
| 旋转框 | rotation |
先按矩形方式创建,再通过拖动旋转控制点或 Z、X、C、V 精调方向与角度 |
遥感航拍、场景文字、船舶、车辆、包装件等带有明显方向角的目标检测 |
| 四边形 | quadrilateral |
依次指定 4 个顶点,可表达透视形变,不要求边与坐标轴平行 | OCR 文本检测、票据与文档区域、车牌、屏幕等倾斜或透视目标标注 |
| 点 | point |
单击放置单个坐标点,可通过标签与 group_id 组织多个关联点 |
人体姿态、面部关键点、医学标志点(Landmark)、目标中心点及其他稀疏点位标注 |
| 线段 | line |
依次指定起点和终点;绘制时按住 Shift 可吸附为水平或竖直方向 |
短边缘、方向基准、测量端点、局部裂缝及其他直线型目标标注 |
| 折线 | linestrip |
连续添加多个顶点形成开放折线,双击结束;按住 Shift 可约束当前线段方向 |
车道线、道路边界、长裂缝、河流、轨迹及其他连续线状目标标注 |
| 圆形 | circle |
先确定圆心,再通过第二个点确定半径 | 细胞、孔洞、表盘、圆形零件、果实等近圆形目标的检测与定位 |
| 长方体 | cuboid |
先绘制正面矩形,系统根据深度方向自动生成背面;编辑时可调整宽、高和透视深度 | 单张图像中的 2.5D 目标框标注,适用于车辆、纸箱、货架及机器人空间感知等场景 |
(1)对象创建
针对多边形对象的标注,在原有逐点绘制的模式外,X-AnyLabeling 内额外支持了两种新的绘制模式。
第一种是画笔模式。用户可以单击确定起点后,沿对象边缘移动鼠标即可自动添加顶点,移动回起点附近时会自动闭合轮廓,全程无需点击鼠标,一气呵成。

第二种是魔法棒模式。用户只需在目标上按住鼠标左键,预览会显示与起始像素连通且颜色相近的区域;保持按下并向任意方向拖动,直到满意后单击右键,即可完成对象创建。全程无需加载模型或消耗算力,适用于背景纯色、边缘清晰的简单目标,比如色块、纯色物体轮廓这类不需要模型介入就能快速圈出的场景。

(2)对象属性
每个标注对象都带有一套完整属性:类别标签、置信度得分、顶点坐标、组 ID、描述、难例标记、对象类型、标志位、自定义属性、KIE 连接关系,以及 cuboid3d 专属的立体元数据。
组 ID 能把检测框、关键点、多个部件或同一目标轨迹关联起来;难例标记方便把遮挡、模糊、边界不清的样本单独留出来复核;KIE 连接关系可以直接表达文档字段之间的对应关系。需要保护已确认的轮廓时,也可以只锁住几何位置,标签和属性依旧能改。
(3)对象编辑
对象操作分为绘制模式和编辑模式:前者专注快速创建,后者支持移动、缩放、旋转、复制粘贴、删除、撤销、锁定等操作,两种模式随时切换,标注和精修两不误。
针对不同对象类型还做了细粒度适配:矩形框支持角点缩放、批量合并、滚轮调整边界;多边形支持顶点增删、橡皮擦和编辑笔刷,可直接对轮廓局部扩展或擦除;旋转框可通过控制点调方向,配合快捷键做精细角度修正;长方体提供多个几何控制点,在保持结构约束的前提下调整位置、形状与深度。
面对复杂场景,还支持对象锁定、群组选择整体移动、多对象复制粘贴、坐标快速复制,配合对象遍历、双击编辑标签、绘制中临时平移画布等交互,大幅减少了来回切换工具的成本。
除了对象级标注,X-AnyLabeling 同样覆盖图像级任务:图像分类、图像描述、图像标签、图像检索、视觉问答等,一应俱全。
(4)对象搜索
X-AnyLabeling 同样提供了强大的对象搜索功能。右侧搜索框支持按序号、正则表达式以及各类标注属性快速筛选:
| 搜索方式 | 输入示例 | 能找到什么 |
|---|---|---|
| 文件名文本 | test |
文件名中包含 test 的图片 |
| 序号定位 | #10 |
当前列表中的第 10 张图片 |
| 正则表达式 | <\.png$> |
所有 PNG 图片 |
| 困难对象 | difficult::true |
至少包含一个困难标注的图片 |
| 群组编号 | gid::0 |
包含群组 0 的图片 |
| 是否已有对象 | shape::true |
至少包含一个标注对象的图片 |
| 标签 | label::person |
包含 person 标签的图片 |
| 对象类型 | type::cuboid |
包含指定对象类型的图片,九种基础对象均可检索 |
| 分数区间 | score::[0,0.5] |
包含低置信度对象的图片,支持开区间与半开区间 |
| 描述 | description::true |
包含非空描述的图片 |
| 检查状态 | checked::false |
尚未检查的图片,未生成标签文件的图片也会纳入 |
(5)对象审核
审核大批量图片时,光靠肉眼很容易漏掉哪些看过、哪些没看过。X-AnyLabeling 为此加入了检查状态标记:文件列表里绿色圆点代表已检查、灰色代表待检查,一目了然,还支持一键跳转到下一张未检查的图片,不用在列表里来回翻找,审核效率高了不止一星半点。
最后,右侧对象列表支持按标签或群组编号过滤,左侧的"眼睛"图标则能一键隐藏或恢复所有对象,快速聚焦当前画布。
标签
任务完成后,标签数据既可以保留为 X-AnyLabeling 原生 JSON 格式继续编辑与审核,也可以在多种主流标注格式之间进行导入、导出与转换:
| 格式 | 支持任务 |
|---|---|
| YOLO | 目标检测、旋转框、实例分割、姿态估计 |
| Pascal VOC | 目标检测、语义分割 |
| COCO | 目标检测、实例分割、关键点 |
| DOTA | 旋转目标检测 |
| Mask | 语义分割 |
| MOT | 多目标跟踪 |
| MOTS | 多目标分割跟踪 |
| PPOCR | OCR、关键信息抽取 |
| ODVG | 开放词汇检测 |
| MM-Grounding-DINO | 开放词汇检测 |
| VLM-R1-OVD | 多模态 Grounding |
界面
对于长时间进行标注作业的用户,界面舒适度会直接影响其专注力。X-AnyLabeling 现提供三种不同的主题模式,可跟随系统,也能固定为浅色或深色。

此外,界面现已支持中文、英文、日文和韩文四种语言,满足不同地区用户的使用需求,后续还将陆续扩展更多语种。

不仅如此,我们还将大量常用功能和参数集中整合到统一的设置面板中。用户只需点击 GUI 主窗口右侧面板的齿轮图标,即可随时打开设置面板并即时调整,无需修改配置文件或重启应用:
| 设置区域 | 调整范围 | 适用场景 |
|---|---|---|
| 通用 | 自动保存、标签排序与校验、自动使用上一标签、创建后是否切回编辑模式、悬浮高亮 | 连续同类标注、严格标签规范、审核流程 |
| 画布 | 选择灵敏度、双击编辑、双击闭合、撤销深度、滚轮步长、交叉线、矩形滚轮编辑 | 小目标、密集目标、精细轮廓 |
| 对象 | 线条、填充、顶点、点大小、标签与属性颜色 | 深浅底图切换、多类别区分 |
| 工具 | 调整旋转角度步长、画笔采样、魔术棒容差、长方体深度、掩码显示 | 旋转目标、分割与透视物体 |
| 系统 | 语言、主题、字体、更改模型下载源、日志和图像内存策略 | 不同系统环境与团队偏好 |

视图
视图功能对于一款图像标注工具也说同样重要。X-AnyLabeling 将常用的显示与浏览能力放在画布周围,让观察、定位和复核能够自然衔接起来。
最先用到的是画布左下角可折叠的 Canvas Display 面板,其包含三个主要功能。
(1)Opacity:用于实时调整对象与掩码的透明度,标签文字仍会保持清晰。

(2)Brightness:用于实时调整画布亮度,只改变底图的显示效果,不会修改原始图像。面对曝光不足或整体偏暗的图片时,可以适当提亮画面,让目标细节更容易辨认。

(3)Contrast:用于实时调整画布对比度,同样不会修改原始图像。当目标与背景较为接近、边缘不够清晰时,可以通过增强对比度帮助区分。

把局部看清之后,下一步是快速找到它。在上方菜单栏视图下拉框或直接按下 F9 即可打开导航器:缩略图中的红框代表主画布当前可见区域,单击目标位置或拖动红框,就能在高分辨率图像中快速跳转。

进入复核阶段后,Loop 与 Zoom 可以省去反复寻找下一个目标的动作。
(1)Loop:按下 Ctrl+Shift+C,程序会按照对象顺序逐个选中,适合连续修改标签、属性或群组,而不必在对象列表与画布之间反复寻找。

(2)Zoom:按下 Ctrl+Shift+N,程序会依次放大并居中显示每个对象,同时提示当前进度,更适合检查小目标、边界贴合与类别是否正确。如果只想临时查看某一处细节,也可以按住 Ctrl 滚动鼠标滚轮进行局部缩放。

最后,如果检查需要一张参考图,对比视图 可以把另一目录中的同名图像与当前画面放在一起,通过可拖动的分割线查看差异。右上角菜单栏文件下拉框或直接按 Ctrl+Alt+C 选择对比目录后,即可用于红外与可见光对照、原图与掩码核验,或图像增强前后的效果比较。

从调整显示、定位区域,到逐个复核和前后对照,这些视图能力没有增加额外的标注步骤,却能让许多原本反复进行的观察动作更顺手。看清数据之后,接下来就可以借助统计、裁剪等效率工具,把检查结果进一步整理出来。
性能
除了功能扩展,X-AnyLabeling 还持续从数据加载、启动流程、推理链路和画布交互等底层环节进行优化,尽量让高频操作保持流畅:
(1)大批量数据集加载与切图:针对大文件和大规模数据集优化图片切换流程;目录导入时将 EXIF 检测放入异步任务,并在读取图片尺寸时避免不必要的完整像素解码,同时减少重复图像转换与内存拷贝,降低切图等待和界面卡顿。
(2)应用启动速度:延迟 GUI 模块导入、按需解析配置与数据路径;更新检查等非必要任务采用延后或异步方式执行,让主窗口优先完成初始化,缩短首次启动等待时间。
(3)服务端推理与 GPU 利用率:支持通过 X-AnyLabeling-Server 将推理从桌面端分离,结合批量处理、队列与并发管理,减少界面交互对模型执行的影响;在合理配置批量大小和并发数的情况下,可进一步提高推理吞吐与 GPU 利用效率。
(4)画布绘制与批量更新:以浅拷贝替代绘制路径中不必要的深拷贝,并对对象可见性等批量操作减少重复刷新,降低大量对象编辑时的重绘成本。
(5)后台任务与资源管理:将模型下载、模型刷新和批量推理等耗时任务放入工作线程,同时完善线程结束、任务取消与显存释放流程,减少界面冻结、线程残留以及 CUDA 推理过程中的显存泄漏问题。
(6)画布对象选中算法:优化重叠与嵌套对象的选择逻辑,通过优先判断更接近的顶点和可编辑边缘,帮助用户在多层对象相互覆盖时快速选中目标,无需反复隐藏或移动其他对象。

更多优化详情请参考官方更新日志。
工具
前面的功能主要解决"如何把对象标出来",而工具栏解决的是标注之后更容易被忽略的另一半问题:如何检查数据、沉淀局部样本、批量修改结果,以及把当前画布变成可复核的交付物。它们共同的特点是把原本需要逐张图片、逐个对象重复完成的操作,提升到当前任务或指定文件范围这一层来执行。
(1)统计总览
当数据集规模从几十张扩展到几千张甚至上万量级时,只看当前画布其实很难判断类别是否完整、不同对象类型的数量是否平衡,也不容易定位困难样本。
此时可以在顶部菜单栏选择 工具 -> 数据总览 ,或直接按下 Ctrl+G 打开统计窗口。
统计窗口并不是简单地显示一个对象总数,而是从当前任务的标注 JSON 中重新读取对象信息,并提供两种观察粒度。
默认的标签统计表以标签为行、对象类型为列,最后给出每个标签的总数和整个任务的总计:

切换到对象明细后,则可以逐条查看文件名、标签、对象类型、KIE 连接关系、群组编号、困难标记、描述、附加标志和顶点坐标:

其中,困难对象会使用醒目的颜色标识,明细表中的一行还可以双击跳回对应图片,形成"统计发现问题---回到原图复核"的闭环。
统计支持按照当前文件列表指定范围进行筛选,视频帧或大批量图片都可以只查看目标区间,从而更快定位某一段数据中的类别分布和异常对象。
最后,同样支持一键打包导出,压缩包中包含标签数量统计、逐对象明细以及完整类别列表,既方便进一步分析,也便于衔接后续的数据整理与格式转换。
(2)子图裁剪
标注结果除了服务于训练,也可以进一步沉淀为分类样本、难例集或人工复核素材。保存子图正是为这个环节准备的:它把一批图片中的标注对象批量提取出来,并按标签组织为独立的局部图像,让原本分散在标注文件里的目标区域变成可以再次利用的数据资产。
当前支持矩形、多边形和旋转框。需要注意的是,这里的裁剪以对象的轴对齐外接矩形为基础,并不等价于按照多边形轮廓进行像素级抠图。因此,它更适合快速构造局部样本和检查集合;如果任务要求保留精确轮廓或透明背景,则应使用掩码相关的导出能力。工具还提供最小尺寸过滤,用于剔除过小、信息量有限的对象。
(3)群组编号管理器
group_id 用于将检测框、关键点或同一实例的多个部件关联起来。工具 -> 群组编号管理器 (Alt+G)支持扫描当前任务中的群组编号,并在指定范围内批量修改或删除对应对象,适用于关键点、KIE 和多目标跟踪等关系型标注。

(4)对象转换器
不同标注任务对几何对象的要求并不相同。同一批数据可能需要先用矩形框或圆形快速标定,再转换成旋转框或多边形用于训练。
为此,X-AnyLabeling 提供了统一的批量转换入口:

需要注意的是,转换器做的是几何近似,而不是无损格式改写。
(5)对象管理器
视频标注中,一个对象往往会在连续帧中保持相同位置或相同语义。逐帧复制、删除和修正不仅耗时,也容易把不同帧的结果做得不一致。
X-AnyLabeling 面向视频帧序列提供批量操作,支持以下四种操作互斥,同时也支持指定范围生效:
- 删除所有标注:删除指定范围内的标签文件,图像保留,文件列表中的勾选状态同步取消。
- 删除所有图像及标注 :同时移除图像和对应标签,图像会先移动到当前任务的
_delete_目录,便于误操作后手动恢复。 - 移除选定对象:先在当前画布选中一个或多个对象,程序会在目标帧中按标签、对象类型和坐标逐一匹配。
- 添加选定对象:将当前选中对象复制到指定帧。
注意,此处匹配不是基于跟踪模型重新推理,而是对当前选定对象做几何一致性比较,因此它特别适合固定机位、目标位置变化较小的帧序列。
因此,如果目标发生明显位移或形变,应先使用跟踪或自动标注,再用管理器做局部批改。
(6)标签管理器
类别体系一旦发生变化,逐个文件改标签很容易漏改。
标签管理器会汇总当前任务中的标签,支持在指定文件范围内批量重命名或删除标签对象,控制类别显隐并调整标签配色:

其中显示设置只作用于当前窗口,不会改变标注中的几何数据,标签变更则会写回标签文件,已锁定对象不会参与删除。
对于密集标注场景,还可以批量切换某一类别的可见性,在不改动数据的情况下快速聚焦目标类别。
(7)可视化导出
画布上的标注信息适合编辑,但不适合展示。
保存可视化图像 和保存可视化视频会调用同一套画布渲染逻辑,把对象几何和选定的辅助信息烘焙到新的媒体文件中,原始图片和标签文件不会被改写。
这项功能的价值不只是"截图"。它把可见性、标签、分数和群组关系固化为一个独立的复核工件:图片适合抽查单帧和归档,视频适合连续目标、跟踪结果以及团队协作时的快速浏览。
(8)数字快捷键管理器
连续标注时,真正消耗时间的往往不是鼠标移动,而是反复切换绘制模式和重复输入标签。
数字快捷键管理器 允许把 0--9 十个数字键分别绑定到绘制模式与默认标签,配置后用户只需按下已配置的数字键,程序会切换到对应的创建模式,并把预设标签带入下一次对象创建流程。

从统计、裁剪和可视化,到几何转换与四类批量管理器,这些工具覆盖了标注数据从检查、加工到交付的完整后处理链路。
任务

一个标注平台的任务覆盖度,不能只看它能画几种几何图形。真正决定一项任务能否落地的,是预测结果能否被表达、修正、组织并最终交付:分类需要图像级或对象级的语义标记,检测需要几何位置,姿态估计需要关键点之间的归属关系,文档理解则还需要文本、阅读顺序与字段连接。
X-AnyLabeling 的处理方式,是把这些任务映射到同一套数据原语上:图像级语义由 flags 和描述承载,空间位置由矩形、多边形、旋转框、点等对象承载,对象属性保存细粒度语义,group_id 和 KIE 连接则负责表达实例与关系。因此,不同模型的输出可以回到同一个可编辑画布中,人工标注、AI 首轮预标注、复核与导出也不再是几套割裂的流程。
以下是 X-AnyLabeling 中所支持的模型列表:
| 任务类别 | 支持模型 |
|---|---|
| 🖼️ 图像分类 | YOLOv5-Cls, YOLOv8-Cls, YOLO11-Cls, InternImage, PULC |
| 🎯 目标检测 | YOLOv5/6/7/8/9/10, YOLO11/12/26, YOLOX, YOLO-NAS, D-FINE, DAMO-YOLO, Gold_YOLO, RT-DETR, RF-DETR, DEIMv2 |
| 🗺️ 语义分割 | U-Net |
| 🫧 实例分割 | YOLOv5-Seg, YOLOv8-Seg, YOLO11-Seg, YOLO26-Seg, Hyper-YOLO-Seg, RF-DETR-Seg, D-FINE-seg |
| 🏃 姿态估计 | YOLOv8-Pose, YOLO11-Pose, YOLO26-Pose, DWPose, RTMO |
| 😀 人脸估计 | SCRFD, YOLOv6Lite-Face |
| 👣 目标跟踪 | TrackTrack, Bot-SORT, ByteTrack, SAM2/3-Video |
| 🔄 旋转目标检测 | YOLOv5-Obb, YOLOv8-Obb, YOLO11-Obb, YOLO26-Obb, RT-DETRv2-OBB |
| 📏 深度估计 | Depth Anything |
| 🧩 分割一切 | SAM 1/2/3, SAM-HQ, SAM-Med2D, EdgeSAM, EfficientViT-SAM, MobileSAM |
| ✂️ 图像抠图 | RMBG 1.4/2.0 |
| 💡 候选框提取 | UPN |
| 🏷️ 图像标记 | RAM, RAM++ |
| 📄 光学字符识别 | PP-OCRv4, PP-OCRv5, PP-OCRv6 |
| 🧾 综合版面分析 | PP-DocLayoutV3 |
| 📑 文档解析 | PaddleOCR-VL, PaddleOCR-VL-1.6 |
| 🗣️ 视觉基础模型 | Rex-Omni, Florence2 |
| 👁️ 视觉语言模型 | Qwen3-VL, Gemini, ChatGPT, GLM |
| 🛣️ 车道线检测 | CLRNet |
| 🔢 目标计数 | CountGD, GeCO, GeCo2 |
| 📍 视觉定位 | Grounding DINO, YOLO-World, YOLOE, SAM 3, LocateAnything |
这些模型共同支撑了 X-AnyLabeling 从传统视觉任务到多模态任务的完整能力覆盖。
分类
分类任务解决的是"这张图或这个对象属于什么"。它不一定产生新的几何边界,而是将离散语义附着在整张图像或已有对象上。
X-AnyLabeling 同时支持图像级和对象级的多标签。前者适合场景属性、内容审核与数据检索,后者则适合为已定位的人、车或商品补充多个语义标记。标注系统在这里承担的不只是"多选框",而是确保标签粒度与其作用对象不被混淆。
(1)图像分类
最原始的图像分类任务是为每张图像选择一个互斥类别,例如将产品图片判定为合格或不合格,将遥感切片归入不同地貌,或为医学影像设置病例类别。此时标签属于整张图像,并不需要额外绘制对象。
X-AnyLabeling 将这类标签作为图像级状态保存,并提供独立的图像分类工作区,详情可见后续工作流。

另一方面,多标签分类允许同一个样本同时命中多个非互斥标签。譬如一张街景图既可以包含"夜间"和"雨天",也可以同时出现"行人"、"车辆"与"交通灯"。

(2)对象分类
当一个对象同时有多个彼此独立的属性时,问题就不再是从一张扁平的类别表中选答案。例如,车辆可以同时标注车身颜色和车型,行人可以同时标注是否佩戴眼镜、口罩以及服饰颜色。每个属性都是一个子任务,它们共享同一个对象,却拥有各自的取值空间。

多任务分类保留了"属性属于哪个对象"这层关系,比把所有答案展平成一组普通标签更适合细粒度视觉任务。
检测
目标检测(Object Detection)是同时完成目标定位与类别判别的视觉任务,通常为图像中的每个目标实例输出类别、置信度及边界框。根据边界框形式与类别空间设定,可进一步分为水平目标检测、旋转目标检测和开放词汇目标检测。
(1)水平目标检测
水平框目标检测(Horizontal Object Detection)使用与图像坐标轴对齐的矩形框对目标进行定位,是最常见的目标检测形式之一,适用于行人、车辆、动物、工业零件等大多数常规目标。
X-AnyLabeling 支持水平框的创建、编辑、复制、合并与批量管理,并可结合 YOLO、RT-DETR、RF-DETR、D-FINE 等系列模型进行自动预标注,覆盖从人工标注、模型辅助标注到结果复核与导出的完整流程。

针对超高分辨率与密集小目标场景,平台还可以通过切片推理 *(
SAHI)保留局部细节,再把分块结果映射回原图进行统一复核。
(2)旋转目标检测
对于具有明显方向性的目标,水平框往往难以准确描述其空间范围,并可能引入较多无关背景。旋转目标检测(Oriented Object Detection)通过旋转框对目标的位置、尺度与方向进行联合描述,尤其适用于遥感影像中的舰船、飞机,场景文字以及密集排列的工业目标等。
X-AnyLabeling 支持通过鼠标快速调整旋转框,同时也支持通过快捷键精调旋转角度,并一键导出到 YOLO_OBB 或 DOTA 等格式。

(3)开放词汇检测
传统目标检测模型通常受限于预先定义的类别集合,而开放词汇检测(Open-Vocabulary Detection)允许用户在推理阶段动态指定目标,从而将检测能力扩展到训练类别之外。目标既可以通过类别名称或自然语言描述进行定义,也可以通过图像中的参考目标进行视觉提示。
X-AnyLabeling 将文本提示、视觉提示以及无提示检测统一集成到自动标注流程中,并支持 YOLOE、SAM 3、LocateAnything 等开放视觉模型。用户可以根据任务特点灵活选择交互方式:文本提示适合快速检索具有明确语义的目标,视觉提示则更适合难以准确命名、但具有相似外观特征的对象。
对于需要反复调整文本提示的场景,部分模型还支持复用图像特征,无需在每次查询时重新执行完整的视觉编码,从而提升连续交互与批量标注的效率。
分割
与目标检测使用边界框定位目标不同,图像分割进一步将识别粒度细化到像素级,用于精确描述目标的区域与边界。根据是否区分同一类别中的不同个体,通常可分为语义分割与实例分割。
(1)语义分割
语义分割(Semantic Segmentation)为图像中的每个像素赋予语义类别,而不区分同一类别中的不同实例。例如,道路、天空、植被或同一类型的缺陷区域,都可以统一表示为对应类别的像素区域。该任务广泛应用于自动驾驶、遥感影像分析、医学影像以及工业缺陷检测等场景。
在 X-AnyLabeling 中,用户可以通过多边形对不同语义区域进行精细标注与编辑,并进一步生成二值或多类别掩码,在保留轮廓可编辑性的同时满足语义分割模型的训练需求。

(2)实例分割
实例分割(Instance Segmentation)不仅需要识别目标类别,还需要区分同一类别中的不同实例,并为每个实例生成独立的像素级轮廓。例如,画面中的多辆汽车即使属于同一类别,也会分别对应各自的实例掩码。相比目标检测,实例分割能够提供更加精确的目标边界,适用于目标计数、机器人操作、工业缺陷分析等需要精细区分个体的场景。
由于逐像素描绘复杂轮廓通常具有较高的人工成本,X-AnyLabeling 集成了 SAM 1/2/3、SAM-HQ、EdgeSAM、MobileSAM 等多种通用分割模型。用户可以通过点、框等交互提示快速生成目标掩码,再结合多边形编辑、编辑笔刷等工具对局部边界进行修正,从而将模型预测与人工精修结合起来,显著降低复杂轮廓的标注成本。

(3)图像抠图
图像抠图(Image Matting)与语义分割的输出看起来相似,目标却不同。语义分割为像素分配离散类别,抠图则估计前景透明度。头发、烟雾、玻璃和运动模糊边缘往往不属于绝对的前景或背景,而是介于两者之间的连续混合。
因此,抠图的交付物更接近带 Alpha 通道的透明前景,可直接用于图像合成、商品素材制作、人像背景替换与视觉特效。X-AnyLabeling 将抠图结果单独保存为透明图像,避免将连续透明度强行压缩成多边形边界。

跟踪
与单帧检测不同,目标跟踪不仅需要持续定位目标,还需要在时间维度上保持对象身份的一致性。随着目标运动、遮挡和视角变化,其位置与外观可能不断变化,但同一对象在连续帧中的身份应保持稳定。
(1)多目标跟踪
多目标跟踪(Multi-Object Tracking, MOT)通常包含目标检测与数据关联两个核心环节:首先定位当前帧中的目标,再将检测结果与已有轨迹进行匹配。检测误差可能造成目标漏跟,而关联错误则容易引发 ID Switch,破坏轨迹的连续性。因此,对于跟踪数据而言,准确的空间位置与稳定的目标身份同样重要。
在 X-AnyLabeling 中,轨迹 ID 通过跨帧保持一致的 group_id 进行管理,可用于水平框、旋转框、实例掩码以及姿态等多种标注对象。平台支持结合自动跟踪模型传播目标轨迹,并通过群组管理、逐帧复核和批量编辑对跟踪结果进行人工修正,最终可导出为 MOT、MOTS 等时序标注格式。

(2)交互式视频分割
交互式视频目标分割(Interactive Video Object Segmentation)将人工标注集中在少量关键帧上。用户只需通过正负点或矩形框指定目标,模型即可将该目标沿时间轴持续传播,生成连续的实例掩码与跟踪结果。当目标发生遮挡、形变或跟踪漂移时,也可以在当前帧补充交互提示,对后续结果进行重新校正,而无需重新标注整段视频。
在这一方向上,SAM 2 主要面向特定目标的视频分割与持续跟踪;SAM 3 则进一步引入概念驱动的视频分割能力,允许用户通过文本描述在视频中持续发现并跟踪符合语义条件的多个实例。前者强调对已指定目标的时序传播,后者则进一步将开放词汇理解能力扩展到了视频场景。

描述
相比分类与检测将视觉内容归纳为预定义标签或几何对象,描述类任务更强调对图像语义的开放表达。它既可以生成自然语言描述,也可以提取一组具有语义信息的标签:前者侧重对场景、对象及其关系的整体表达,后者则更关注关键概念的覆盖与检索。
(1)图像描述
图像描述(Image Captioning)旨在将图像内容转换为自然语言文本。除了识别画面中的对象,还需要理解其属性、动作、空间关系以及整体场景,并将这些视觉信息组织成连贯的语义描述。
在 X-AnyLabeling 中,用户可以借助视觉语言模型(Vision Language Models, VLMs)自动生成图像描述,并直接对生成结果进行编辑、复核和保存。通过统一的提示模板,还可以进一步约束描述的内容、粒度与输出格式,并结合人工校对修正小目标、场景文字、空间关系及专业术语等容易出现偏差的信息,从而构建质量更加稳定的图文数据。

(2)图像标记
图像标记(Image Tagging)旨在从图像中提取一组能够概括视觉内容的语义标签,而无需将其组织成完整的自然语言描述。例如,一张图片可以同时包含"海滩""日落""人群"等多个标签,用于图像检索、数据筛选、多标签分类以及数据集分析等场景。
X-AnyLabeling 集成了 RAM、RAM++ 等图像标记模型,可自动为整幅图像生成语义标签,并将预测结果直接用于后续编辑与复核。相比基于固定类别集合的多标签分类,开放词汇图像标记能够覆盖更加丰富的视觉概念,更适合大规模数据的自动语义化与内容检索。

计数
目标计数(Object Counting)的核心并不只是得到一个数量,而是在密集分布、尺度变化、遮挡以及开放类别等复杂场景下准确定位并统计目标。如果仅输出最终计数结果,一旦出现漏计或重复计数,往往难以进一步定位问题。因此,X-AnyLabeling 会将每个计数目标以检测框等可视化结果呈现在画布中,使最终数量成为可检查、可编辑、可追溯的聚合结果。
以 GeCo、GeCo2 等少样本计数模型为例,用户只需提供一个或少量参考目标,模型即可在图像中自动搜索并定位具有相似视觉特征的实例,无需针对每一种新类别重新训练专用检测器。这种基于示例的交互方式,使目标计数能够更灵活地适配长尾类别和临时新增的统计需求。

估计
估计类任务的输出通常不是离散类别,而是关键点、连续数值或其他结构化预测,用于描述目标的几何结构、局部状态或场景中的空间关系。
(1)姿态估计
姿态估计(Pose Estimation)通过一组具有明确语义的关键点描述人体、手部、动物或其他对象的结构与姿态。对于多人或多实例场景,仅有关键点坐标并不足以构成完整标注,还需要同时维护关键点类别、可见性以及实例归属关系。
在 X-AnyLabeling 中,可以通过统一的 group_id 将目标框与对应关键点进行关联,从而准确表达每组关键点所属的具体实例,并在密集、多目标场景中保持姿态标注结构的一致性。

(2)人脸估计
人脸估计(Face Estimation)通常由人脸检测与关键点定位组成:人脸框用于确定目标位置,眼角、鼻尖、嘴角等关键点则进一步描述人脸的局部几何结构。
在 X-AnyLabeling 中,人脸框与对应的关键点可以通过统一的 group_id 进行关联,从而在多人场景中保持清晰的实例归属关系,并支持整组移动、隐藏、编辑与复核。

(3)深度估计
深度估计(Depth Estimation)用于预测图像中各像素对应的场景深度,从而恢复物体之间的前后关系与空间层次。对于单目图像,模型通常根据视觉线索生成与原图对齐的稠密深度图,可用于场景理解、机器人感知、三维重建以及视觉特效等任务。
X-AnyLabeling 支持 Depth Anything 等深度估计模型,并可将预测结果以灰度图或伪彩色图的形式进行可视化与保存,方便用户与原始图像进行对照检查。

多模态
多模态模型通过统一的视觉与语言接口处理多种视觉任务,用户可以通过自然语言提示指定任务,模型则根据需求输出文本、边界框、关键点、多边形等不同形式的结果。对于标注平台而言,关键不仅在于调用模型完成推理,更在于将这些异构输出转换为可直接编辑、复核和保存的原生标注对象。
X-AnyLabeling 支持 Florence-2、Rex-Omni 等多模态视觉模型,可在统一工作流中完成图像描述、目标检测、短语定位、视觉指点、关键点定位、OCR、区域描述等多种任务。例如,可以通过"找到穿红衣服的人"定位对应目标,通过"指出交通灯"获得关键点,也可以针对指定区域生成自然语言描述。

光学字符识别
光学字符识别(OCR)不仅需要从图像中识别文字,还需要进一步恢复文字的位置、内容以及文档中的结构关系。对于复杂文档场景,通常还会涉及版面分析、阅读顺序、表格与公式识别、关键信息抽取等任务,从而将原始文档图像转换为可检索、可编辑和可结构化处理的数据。
(1)文档版面分析
文档版面分析(Document Layout Analysis)用于识别页面中的标题、正文、表格、图片、公式、页眉、页脚等不同内容区域,并恢复各区域之间的空间结构与阅读顺序,是后续文字识别和文档解析的重要基础。
X-AnyLabeling 支持 DocLayout-YOLO、PP-DocLayoutV3 等版面分析模型,可将模型预测的版面类别、区域边界等结果直接转换为可编辑的标注对象。用户可以在画布中继续调整区域范围、修正类别并完成结果复核,使模型预测能够直接进入后续的数据标注与文档解析流程。

(2)关键信息提取
关键信息提取(Key Information Extraction, KIE)关注的是从文档中识别具有特定语义的字段,并建立字段之间的结构化关系。例如在票据场景中,不仅需要识别"总金额"及其对应数值,还需要明确字段名称、文本内容以及二者之间的键值关系。因此,KIE 通常同时涉及实体识别与关系抽取。
在 X-AnyLabeling 中,可以使用对象标签表示实体类别,通过 description 保存对应的文本内容,并利用 group_id 对文字区域进行组织,再通过 KIE 连接显式建立字段之间的关系。这样,文本的位置、内容、语义类别以及实体间的关联都可以统一保存在同一套标注结构中,便于后续编辑、审核与导出。

(3)文本识别
文本识别(Text Recognition)通常包括文本检测与文字识别两个阶段:前者负责定位图像中的文字区域,后者则将对应区域转换为可编辑的文本内容。在 X-AnyLabeling 中,文本区域可以通过矩形框、旋转框或四边形进行标注,识别结果则保存到对象的 description 中,使文字位置与转录内容能够统一管理。
对于 OCR 数据,实际复核过程中经常出现"文字区域已经准确,仅识别内容需要更新"的情况。针对这类场景,X-AnyLabeling 支持直接复用已有文本区域,无需重新执行检测,即可对选中对象或现有标注批量进行文字识别。这样既能保留人工修正后的几何边界,也可以将复核重点集中在文本内容本身,减少不必要的重复处理。

(4)文档解析
文档解析(Document Parsing)是在 OCR 基础上进一步理解并重建文档结构的综合任务。除了识别文字内容,还需要解析标题、正文、表格、公式、图片等版面元素及其阅读顺序,并将页面内容还原为 Markdown、JSON 等结构化结果。相比单纯的文字识别,文档解析更关注原始文档的层级、布局与语义结构能否被完整保留。
X-AnyLabeling 提供独立的 PaddleOCR 文档解析工作区,支持图片与多页 PDF,并将原始页面、版面区域与结构化解析结果关联起来。用户既可以从页面中的版面区域定位对应解析内容,也可以从解析结果反向定位原文位置,并针对文本、LaTeX 公式和表格等不同内容进行编辑与校正。
在模型推理方面,既可以接入 PaddleOCR 官方 API,也可以通过 X-AnyLabeling-Server 在本地或私有环境中完成部署与推理,从而满足不同场景下的数据隐私与部署需求。

文档智能的误差会沿管线级联:版面分块错误会影响任务路由,阅读顺序错误会破坏上下文,识别错误则会进入最终结构。因此,可视化对齐、分块编辑和可追溯的人工修正,与模型本身的识别能力同样重要。
工作流
通用标注画布解决的是对象如何被绘制和编辑,但并不是所有数据生产任务都适合围绕几何对象展开。图像分类需要连续判断整张图片的语义,视频分类需要在时间轴上组织事件,文档解析需要对照原始版面校正结构,视觉问答与多模态对话则需要围绕字段和上下文构建数据。
X-AnyLabeling 为这些场景提供了相互独立、又能彼此衔接的专用工作流。每个工作区都按照对应数据形态重新组织预览、导航、AI 辅助、人工审核与成果交付,而不是要求所有任务迁就同一套界面。模型产生的结果仍然可以继续修改、统计、导出或进入训练,使"AI 生成首轮结果---人工确认质量---数据继续流转"成为各类工作流共享的产品逻辑。
图像分类器
图像分类器面向整幅图像的语义判断。与目标检测需要回答对象"在哪里"不同,这条工作流只关心当前图片"属于什么",因此将图像预览、类别选择、样本导航和进度检查集中在独立窗口中,让标注者能够持续完成判断,而不必在通用画布与多个对话框之间切换。
(1)分类模式与标签管理
图像分类器同时提供多类分类(MultiClass)和多标签分类(MultiLabel)两种模式。前者要求每张图片只保留一个互斥类别,适合物种、产品型号和场景类型等任务;后者允许同一张图片同时命中多个标签,适合天气、环境、内容与属性等可以共同成立的语义。
类别体系可以在工作区内集中创建和维护,并在任务进行过程中统一新增、重命名或删除。标注界面同时提供快速选类、未标注样本导航和数据分布统计,使类别定义、标注进度与样本均衡性能够在同一处被持续检查。
(2)AI 辅助与数据交付
分类器可以调用视觉语言模型,根据当前图片、候选类别和分类模式生成分类建议,也可以将同一套判断规则批量应用到整个数据集。AI 输出会直接回到可编辑的标签状态中,人工可以快速确认或纠正,并通过整体统计发现漏标、类别倾斜和异常样本。
因此,这条工作流不仅减少了逐图判断的重复劳动,也将类别设计、模型预分类、人工复核、质量检查和数据交付串联起来,适合快速构建和持续清洗图像分类数据集。
视频分类器
图像分类处理的是单个瞬间,视频分类面对的则是一段持续过程。人物何时开始动作、设备何时进入异常状态、一个完整操作由哪些阶段组成,都需要起点、终点、类别和语义描述共同构成答案。视频分类器因此以时间轴片段作为核心标注对象,而不是把视频简单拆成一组彼此孤立的图片。
工作区将视频预览、标签管理、片段列表和可缩放时间轴组织在同一界面中。用户可以直接创建时间区间,并对已有片段进行移动、裁切、拆分、归类和描述;逐帧检查、片段跳转以及撤销与重做则帮助标注者准确处理动作切换、短时事件和模糊边界。不同类别在时间轴上保持一致的视觉编码,即使面对长视频,也能快速观察事件分布与标注空缺。
当所选模型具备视频理解能力时,AI 可以先分析整段视频或局部片段,自动给出候选事件区间与内容描述;对于已经由人工划定的片段,也可以只补充语义描述而不改变时间边界。提示词始终可以按业务需求调整,模型结果也会回到时间轴中接受人工复核,从而将视频理解能力转化为可控制的标注效率,而不是一次不可解释的自动切分。
完成审核后,时间片段可以继续交付为动作识别、事件检测和视频片段分类所需的数据。整条工作流覆盖了从视频浏览、事件发现、边界精修到数据集整理的过程,使长视频标注不再依赖多个剪辑与表格工具之间的反复切换。
PaddleOCR
PaddleOCR 工作流面向扫描件、拍照文档与多页 PDF。对于这类数据,仅识别出文字并不足以完成交付,还需要恢复标题、正文、表格、公式、图片等版面区域及其阅读顺序,并让每一项结构化结果都能回到原始页面中被检查。
(1)文档导入与模型接入
工作区支持统一管理图片与多页 PDF,并通过文件导航、页面切换、状态筛选和任务重试组织批量文档处理。模型既可以通过 PaddleOCR 官方 API 快速接入,也可以借助 X-AnyLabeling-Server 部署在本地或私有网络中,使个人用户能够开箱使用,团队也可以根据数据安全和算力条件选择自己的推理方式。
(2)结构化校对与导出
解析完成后,左侧页面中的版面区域与右侧结果块会双向联动:选中原文区域可以定位对应结果,点击结果卡片也会反向高亮页面位置。正文、标题等内容可以在文本编辑器中修正,公式可以编辑 LaTeX 源码并实时预览,表格则可以直接修改单元格和行列结构,从而把不同类型的错误交给最合适的编辑方式处理。
工作区同时保留模型解析与人工校正之间的关系,使结果可以重新解析、持续编辑并按不同用途交付。相比只返回一段 OCR 文本的调用工具,这条工作流进一步覆盖了文档管理、模型解析、结构对齐、人工纠错和成果整理,使复杂文档能够稳定进入知识库、信息抽取和多模态数据生产流程。
视觉问答
视觉问答(Visual Question Answering, VQA)数据并不存在唯一结构。有的项目只保存问题与答案,有的还需要任务类型、难度、数据划分、属性标签或审核状态。为了适配这些差异,VQA 工作流并不预设固定表单,而是允许项目根据自己的数据定义组合标注组件。
当前支持文本输入框、单选按钮组、复选框组和下拉菜单四类组件,分别用于开放式问答、互斥选项、多标签判断和长候选列表。组件可以按项目自由组合并复用为统一模板,使不同数据集无需修改程序,就能定义自己的问题、答案和辅助字段。
文本组件还可以调用视觉语言模型进行 AI 辅助。模型不仅能够理解当前图像,还可以结合其他问题字段、已有回答和画布中的标注结果生成候选内容。例如,可以先由人工提出问题,再让模型生成答案;也可以要求模型依据已经确认的检测或分类结果作出解释,使视觉问答与前序标注成果形成关联。
提示模板可以沉淀并复用项目中的标注规范,所有模型输出仍可由人工继续修改。完成审核后,用户可以按需选择字段并导出结构化数据,使同一个工作区既能准备简单的图文问答,也可以承载监督微调、强化学习后训练等任务所需的复杂样本。
聊天机器人
Chatbot 并不是脱离标注数据的通用聊天窗口,而是一条围绕当前图像构建多模态对话的工作流。模型可以读取图片并生成单轮或多轮回答,标注者则可以继续编辑、删除或重新生成消息,使一次模型交互逐步沉淀为可审核的数据样本。
工作区将多种云端模型、本地模型和兼容接口的私有服务统一到同一套连接与参数配置中。用户可以根据视觉能力、数据隐私、调用成本和部署条件灵活选择模型,而无需因模型来源不同改变数据生产方式。这套配置也会被图像分类器、视频分类器和视觉问答等工作流复用,形成统一的多模态 AI 能力入口。
除了围绕单张图片连续提问,Chatbot 还可以将同一提示词批量应用到整个图片目录,并通过并发设置控制处理速度。模型结果仍然逐图保存,用户可以随时切换样本继续复核,而不是在批量推理完成后只得到一份难以追溯的汇总文本。
对话内容会与对应图片持续关联,并支持在单轮问答与多轮对话数据之间导入、审核和导出。由此,图像描述、视觉问答、数据清洗与对话构建不再停留在即时聊天层面,而成为可以追溯、复用并继续训练的多模态数据资产。
模型训练
标注数据的价值最终需要通过模型验证。相比先导出数据、编写训练脚本,再到另一个工具中查找日志,X-AnyLabeling 的 Ultralytics 训练工作流将数据检查、参数配置、任务启动、过程监控和模型回流收进同一个窗口,适合以"小批量标注---快速训练---发现问题---继续修正"的方式持续迭代数据集。
(1)数据准备
训练入口覆盖图像分类、目标检测、旋转目标检测、实例分割和姿态估计五类任务。开始训练前,数据页会汇总类别与有效样本,帮助用户先发现缺失标注、类别失衡和数据量不足等问题;训练数据既可以自动划分,也可以只使用已经审核通过的文件,使数据质量控制直接进入训练流程。
(2)配置与监控
配置页将常用参数与高级训练策略分层呈现,并自动识别可用的计算设备。初次训练的用户可以只调整必要选项,有经验的用户仍能控制优化、增强和验证策略;整套训练配置还可以保存与复用,便于在相同数据上持续比较实验结果。
训练启动后,任务状态、实时日志、进度和关键评估图表会集中显示,用户可以持续观察模型是否正常收敛,并在发现问题时及时停止。完成训练的模型还可以重新进入 X-AnyLabeling 的自动标注流程,对新数据生成首轮结果,再由人工复核和补充,从而形成"标注---训练---推理---再标注"的迭代闭环。
扩展服务
一个标注平台的扩展能力,不应只是"能够修改源码",更重要的是将不同类型的变化限制在清晰、稳定的边界内:模型交互变化时,无需重写标注画布;推理框架变化时,无需调整数据结构;业务流程变化时,仍可复用现有的文件、模型与审核能力;即使算力迁移到服务端,桌面端的使用方式也无需改变。
X-AnyLabeling 将扩展能力划分为四个层次:
| 扩展层次 | 可扩展内容 | 复用能力 | 典型场景 |
|---|---|---|---|
| 自定义组件 | 模型或任务所需的交互方式 | 统一界面、事件与状态管理 | 提示词、阈值、点框提示、任务选择等 |
| 自定义模型 | 模型加载、前后处理与推理逻辑 | 原生标注对象、批量处理、编辑与审核 | 自训练权重、新模型架构、新推理后端 |
| 自定义数据流 | 数据生成、标注、审核与交付流程 | 基础组件、模型能力与人工复核 | 面向特定业务构建专用数据生产流程 |
| 远程推理服务 | 模型运行环境、GPU 资源与服务部署 | 桌面端交互、结果编辑与项目管理 | 共享算力、隔离依赖、部署私有模型 |
这四个层次可以独立使用,也可以按需求逐步组合:从替换模型、增加专属交互,到构建完整的数据生产流程,再到将复杂模型与算力集中部署到服务端,为不同规模和复杂度的业务提供统一的扩展路径。
自定义组件
不同模型往往需要不同的交互方式:检测模型需要置信度控制,开放词汇模型需要文本提示,交互式分割需要点或框提示,多任务模型还需要动态切换任务。为了避免为每个模型单独开发界面,X-AnyLabeling 将自动标注面板设计为由模型能力动态驱动。
模型可以通过 Meta.widgets 声明所需的交互组件,远程模型则由 X-AnyLabeling-Server 返回对应的 widgets 元数据。客户端会根据当前模型自动生成文本输入、阈值控制、类别过滤、点框提示、输出类型、任务选择等控件,切换模型时界面也会同步更新。
这套机制同时适用于本地与远程模型。对于已有交互,开发者只需组合配置;如果模型需要新的交互方式,也可以扩展 Qt 组件并接入同一套能力声明机制,从而降低新模型和新任务的界面适配成本。
自定义模型
X-AnyLabeling 将自定义模型接入分为两个层次。对于已经完成架构适配的模型,用户只需替换权重和配置文件,即可加载自己的类别、阈值与模型参数,无需修改标注界面或重新开发完整推理流程。
对于尚未适配的新模型,平台提供统一的模型接口。开发者只需实现模型加载、前后处理与推理逻辑,预测结果即可转换为矩形、多边形、旋转框、关键点、文本描述等 X-AnyLabeling 原生标注对象,并自动复用现有的单图推理、批量预标注、人工编辑、审核与导出能力。
因此,自定义模型的接入并不止于"运行一次推理",而是能够真正融入完整的数据标注与生产流程。
自定义数据流
依托 X-AnyLabeling 提供的文件管理、原生标注对象、交互组件、自动标注模型、多模态模型、批量处理和人工审核能力,开发者可以按业务目标重新组合数据处理步骤,构建面向特定任务的数据合成与标定管线。平台负责稳定的数据承载与人机交互,业务只需定义各阶段如何衔接、结果如何筛选以及质量如何验收。
自定义数据流的关键,是让上一阶段的结构化结果直接成为下一阶段的输入。例如,类别发现可以驱动目标定位,定位结果可以继续生成区域描述,模型候选再进入人工修正和质量复核。由此,多个模型、规则与人工操作不再是彼此割裂的工具,而是一条可追踪、可干预的数据生产链路。
以 GroundingME 的数据构建过程为例,可以先组合 RAM++ 与 Grounding DINO,完成候选类别发现和边界框生成;再调用视觉语言模型,结合完整图像中的视觉提示或目标裁剪生成初始指代表达;最后由人工修正边界框与描述,并按照唯一性、主体清晰度、任务针对性和事实准确性完成筛选与精修。
X-AnyLabeling 已具备上述管线所需的模型、对象裁剪、可编辑描述和审核组件。基于这些开放能力,可以进一步开发专用数据流,将候选生成、语义合成、人工标定和质量控制收敛到同一环境中,并按任务需要替换模型、调整规则或扩展交付格式。

远程推理服务
随着模型规模增大、依赖环境日趋复杂,将完整推理环境部署到每一台标注设备上并不现实。X-AnyLabeling-Server 将模型与算力从桌面端解耦:客户端负责数据浏览、交互提示与结果审核,服务端集中完成模型加载、资源管理与推理执行。
连接 Server 后,客户端可以自动发现可用模型及其交互能力。服务端返回的检测框、轮廓、关键点和文本描述等结果,会直接转换为 X-AnyLabeling 原生标注对象,继续在画布中编辑与复核。对于多任务模型,也可以在不重复加载权重的情况下提供多个任务入口。
X-AnyLabeling-Server 同时提供身份认证、请求限流、并发控制、任务队列和日志管理等基础能力,并支持图像推理与交互式视频分割等任务。标注数据仍由桌面端管理,Server 只负责推理所需的输入与结构化结果返回,从而在保持客户端轻量的同时,为团队提供统一、可扩展的私有推理服务。
总结
回望 X-AnyLabeling 的发展历程,它俨然已经从一款模型辅助标注工具,逐步发展为覆盖基础组件、任务表达、专用工作流、模型训练与开放扩展的统一数据生产平台。其核心价值不在于简单叠加更多模型与功能,而在于让不同模型的输出都能转化为可编辑、可审核、可复用的数据,并将标注、推理、训练和模型回流连接为持续迭代的闭环。
面向未来,X-AnyLabeling 将陆续引入 Agent 机制,使系统能够围绕数据生产目标自主拆解任务、选择模型与工具,并协同完成数据合成、标注、审核和训练;同时继续拓展语音、音频、时间序列等更多数据模态,持续跟进主流基础模型、推理框架与训练范式。长期来看,希望 X-AnyLabeling 能够成为 AI 时代开放、轻量且可扩展的数据标注与生产基础设施。
X-AnyLabeling 的成长离不开每一位社区伙伴的使用、反馈与贡献。无论是学习交流、功能支持,还是产品合作,都欢迎添加微信 ww10874,或扫描下方二维码进一步沟通。添加时请根据需求备注"X-AnyLabeling 学习交流 / 功能支持 / 产品合作",后续将根据具体需求邀请加入相应交流群或进一步对接。
