web agent 学习 3:screen ai

学习论文:ScreenAI: A Vision-Language Model for UI and Infographics Understanding

摘要部分介绍了作者的screenai,是一个专门用于UI和信息图形理解的视觉语言模型。模型利用pix2struct灵活的补丁策略改进了PaLI架构,并在独特的数据集混合上进行了训练。

他的主要任务是屏幕注释(识别UI的类别,位置),用这些注释交给大语言模型,并自动生成问答(QA)、UI导航和摘要训练数据集。最后还做了消融实验。

主要贡献如下:

我们提出ScreenAI,一种视觉语言模型(VLM),作为一种整体解决方案,专注于理解UI和信息图形,利用其常见的视觉语言和设计复杂性。

•我们介绍了UI的文本表示,用于教我们的模型如何在预训练阶段理解UI。

•我们利用这种新的UI表示和大型语言模型(LLM)自动大规模生成训练数据。

•我们定义了预训练和微调混合物,涵盖了UI和信息图理解中的广泛任务。

•我们为第4.2节中描述的任务发布了三个评估数据集:Screen Annotation、ScreenQA Short和Complex ScreenQA。这些数据集使研究界能够利用我们的文本表示和al low对基于屏幕的问答模型进行更全面的基准测试。

模型结构如图:

可以看到,这里的图像和文字是一起embed,一起自注意力的,因为他们都是输入。记住decoder那边永远只会有字典,不会有正儿八经的输入数据走那边的。

接下里是重量级:数据集怎么做的。

首先作者收集了大量的截图,然后给他们做注释。注释就是给图像上的各个元素加上框框,同时解释一下是什么东西。这个其实就是一个分类任务,有现成的模型可以用。

接下来,在大语言模型的帮助下,可以生成更高级的任务,例如QA......

最后得到的数据集:

最后我们使用这个数据集训练模型,训练项目其实也就是注释,QA,Navigation(就是叫他'返回',他会知道要按哪个按钮),总结。

这样,在注释模型,常规多模态大语言模型的帮助下,我们做出了一个注重UI交互的数据集,并在此基础上训练出了一个重视理解UI能力的多模态大语言模型。

最后就是实验和收集数据。学习结束。

相关推荐
zhangrelay6 分钟前
《机器人控制器设计与编程》课程习题资料-2026
linux·笔记·学习·ubuntu
kkkkkkkkkk_Z29 分钟前
新手自学嵌入式|学习日记:从C语言到51单片机基础(GPIO、中断、定时器与PWM篇)
linux·笔记·学习·51单片机
陈年老古董42 分钟前
微博情感分析项目学习笔记
笔记·python·学习·机器学习·项目
老当益壮梁奶奶1 小时前
ARM汇编学习笔记(六):【i.MX6ULL】时钟系统与定时器(EPIT & GPT)
c语言·arm开发·嵌入式硬件·学习·51单片机
明德扬1 小时前
机器人多摄像头如何做FPGA多路视频聚合?
学习·fpga开发·fpga
曼巴UE52 小时前
UE5 客户端 需要的网络同步概念总结(3 )-事件同步 RPC 以及三种调用方式
网络·c++·网络协议·学习·rpc·ue5
昌原的儿子LEO2 小时前
IMX6ULL 时钟系统与 EPIT/GPT 定时器原理与配置
arm开发·学习
乌暮2 小时前
Java 抽象类与接口详解:半成品图纸 vs 能力合同
java·开发语言·后端·学习
AAA代码批发商2 小时前
Days 47 IMX6ULL 裸机开发:按键轮询实验 + 外部中断原理剖析(上)
笔记·学习·imx6ull·裸机开发·#arm中断
一条破秋裤2 小时前
Hi3516CV610 20S V4 开发板启动与调试流程
学习