
1. 数据可视化分类
1.1. 数据可视化的处理对象是数据
1.2. 自然地,数据可视化包含处理科学数据的科学可视化与处理抽象的、非结构化信息的信息可视化两个分支
1.3. 面向科学和工程领域的科学可视化研究带有空间坐标和几何信息的三维空间测量数据、计算模拟数据和医学影像数据等,重点探索如何有效地呈现数据中几何、拓扑和形状特征
1.4. 信息可视化的处理对象则是非结构化、非几何的抽象数据,如金融交易、社交网络和文本数据,其核心挑战是如何针对大尺度高维数据减少视觉混淆对有用信息的干扰
1.5. 由于数据分析的重要性,将可视化与分析结合,形成一个新的学科:可视分析学。科学可视化、信息可视化和可视分析学三个学科方向通常被看成可视化的三个主要分支
1.6. 科学可视化、信息可视化和可视分析三者之间没有清晰边界
2. 科学可视化
2.1. Scientific Visualization
2.2. 科学可视化是可视化领域最早、最成熟的一个跨学科研究与应用领域
2.3. 科学可视化的研究重点是带有空间坐标和几何信息的医学影像数据、三维空间信息测量数据、流体计算模拟数据等
2.4. 由于数据的规模通常超过图形硬件的处理能力,所以如何快速地呈现数据中包含的几何、拓扑、形状特征和演化规律是其核心问题
- 2.4.1. 随着图形硬件和可视化算法的迅猛发展,单纯的数据显示已经得到了较好的解决
2.5. 面向的领域主要是自然科学,如物理、化学、气象气候、航空航天、医学、生物学等各个学科,这些学科通常需要对数据和模型进行解释、操作与处理,旨在寻找其中的模式、特点、关系以及异常情况
2.6. 鉴于数据的类别可分为标量(密度、温度)、向量(风向、力场)、张量(压力、弥散)等三类,科学可视化也可粗略地分为三类
3. 标量场可视化
3.1. 标量指单个数值,即在每个记录的数据点上有一个单一的值
3.2. 标量场指二维、三维或四维空间中每个采样处都有一个标量值的数据场
3.3. 第一类从扫描或测量设备获得,如从医学断层扫描设备获取的CT、MRI三维影像
3.4. 第二类从计算机或机器仿真中获得,如从核聚变模拟中产生的壁内温度分布
3.5. 可视化数据场f(x,y,z)的标准做法有三种
-
3.5.1. 将数值直接映射为颜色或透明度,如用颜色表达地球表面的温度分布
-
3.5.2. 根据需要抽取并连接满足f(x,y,z)=c的点集,并连接为线(二维情形)或面(三维情形),称为等值线或等值面方法,如地图里的等高线,标准的算法有移动四边形法或移动立方体法
-
3.5.3. 将三维标量数据场看成能产生、传输和吸收光的媒介,光源透过数据场后形成半透明影像,称为直接体绘制方法
4. 向量场可视化
4.1. 向量场在每一个采样点处是一个向量(一维数组)
4.2. 向量代表某个方向或趋势,例如,来源于测量设备的风向和漩涡等;来源于数据仿真的速度和力量等
4.3. 向量场可视化的主要关注点是其中蕴含的流体模式和关键特征区域
4.4. 由于二维或三维流场是最常见的向量场,所以流场可视化是向量场可视化中最重要的组成部分
4.5. 对向量场直接进行可视化的方法包括三类
-
4.5.1. 粒子对流法,其关键思想是模拟粒子在向量场中以某种方式流动,获得的几何轨迹可以反映向量场的流体模式
- 4.5.1.1. 包括流线、流面、流体、迹线和脉线等
-
4.5.2. 将向量场转换为一帧或多帧纹理图像,为观察者提供直观的影像展示
- 4.5.2.1. 标准做法有随机噪声纹理法、线积分卷积(LIC)法等
-
4.5.3. 采用简化易懂的图标编码单个或简化后的向量信息,可提供详细信息的查询与计算
- 4.5.3.1. 标准做法有线条、箭头和方向标志符等
5. 张量场可视化
5.1. 张量是矢量的推广:标量可看作0阶张量,矢量可看作1阶张量
5.2. 张量场可视化方法分为基于纹理、几何和拓扑三类
5.3. 基于纹理的方法将张量场转换为静态图像或动态图像序列,图释张量场的全局属性
- 5.3.1. 其思路是将张量场简化为向量场,进而采用线积分法、噪声纹理法等方法显示
5.4. 基于几何的方法显式地生成刻画某类张量场属性的几何表达
-
5.4.1. 图标法采用某种几何形式表达单个张量,如椭球和超二次曲面
-
5.4.2. 超流线法将张量转换为向量(如二阶对称张量的主特征方向),再沿主特征方向进行积分,形成流线、流面或流体
5.5. 基于拓扑的方法计算张量场的拓扑特征(如关键点、奇点、灭点、分叉点和退化线等),依次将感兴趣区域剖分为具有相同属性的子区域,并建立对应的图结构,实现拓扑简化、拓扑跟踪和拓扑显示
6. 信息可视化
6.1. Information Visualization
6.2. 信息可视化处理的对象是抽象的、非结构化数据集合(如文本、图表、层次结构、地图、软件、复杂系统等)
6.3. 信息可视化的核心问题主要有高维数据的可视化、数据间各种抽象关系的可视化、用户的敏捷交互和可视化有效性的评断等
6.4. 传统的信息可视化起源于统计图形学,又与信息图形、视觉设计等现代技术相关
6.5. 时空数据可视化
-
6.5.1. 时间与空间是描述事物的必要因素,因此,地理信息数据和时变数据的可视化也显得至关重要
-
6.5.2. 对于地理信息数据可视化来说,合理地选择和布局地图上的可视化元素,从而呈现尽可能多的信息是关键
-
6.5.3. 时变数据通常具有线性和周期性两种特征,需要依此选择不同的可视化方法
6.6. 层次与网络结构数据可视化
-
6.6.1. 网络(图)数据是现实世界中最常见的数据类型之一
-
6.6.2. 人与人之间的关系、城市之间的道路连接、科研论文之间的引用都组成了网络
6.7. 文本和跨媒体数据可视化
- 6.7.1. 随着网络媒体,特别是社交媒体的迅速发展,每天都会产生海量的文本数据,人们对于视觉符号的感知和认知速度远远高于文本,因此,通过可视化呈现其中蕴含的有价值的信息将大大提高人们对于这些数据的利用率
6.8. 多变量数据可视化
-
6.8.1. 用于描述现实世界中复杂问题和对象的数据通常是多变量的高维数据,如何将其在二维屏幕上呈现是可视化面临的挑战
-
6.8.2. 多变量数据的可视化方法包括将数据降维到低维度空间,使用相互关联的多视图同时表现不同维度
7. 可视分析学
7.1. Visual Analytics
7.2. 可视分析学被定义为一门以可视交互界面为基础的分析推理科学
7.3. 综合了图形学、数据挖掘和人机交互等技术
7.4. 以可视交互界面为通道,将人的感知和认知能力以可视的方式融入数据处理过程,形成人脑智能和机器智能优势互补和相互提升,建立螺旋式信息交流与知识提炼途径,完成有效的分析推理和决策
7.5. 智能数据分析所产生的知识与人类掌握的知识的差异正是导致新的知识发现的根源,而表达、分析与检验这些差异必须充分利用人脑智
7.6. 当前的数据分析方法大都基于先验模型,易于检测已知模式和规律,对复杂、异构、大尺度数据的自动处理经常会失效
-
7.6.1. 不知道数据中蕴含的模式
-
7.6.2. 搜索空间过大
-
7.6.3. 特征模式过于模糊
-
7.6.4. 参数很难设置
-
7.6.5. 人的视觉识别能力和智能恰好可以辅助解决这些问题
7.7. 自动数据分析的结果通常带有噪声,需要人工干预排除
7.8. 为了有效结合人脑智能与机器智能,一个必经途径是以视觉感知为通道,通过可视交互界面,形成人脑和机器智能的双向转换,将人的智能特别是"只可意会,不能言传"的人类知识和个性化经验可视地融入整个数据分析和推理决策过程中,使得数据的复杂度逐步降低到人脑和机器智能可处理的范围
7.9. 可视分析学可看成将可视化、人的因素和数据分析集成在内的一种新思路
-
7.9.1. 感知与认知科学研究人在可视分析学中的重要作用
-
7.9.2. 数据管理和知识表达是可视分析构建数据到知识转换的基础理论
-
7.9.3. 地理分析、信息分析、科学分析、统计分析、知识发现等是可视分析学的核心分析论方法
-
7.9.4. 在整个可视分析过程中,人机交互必不可少,用于驾驭模型构建、分析推理和信息呈现等整个过程
-
7.9.5. 可视分析流程中推导出的结论与知识最终需要向用户表达、作业和传播
7.10. 在可视化方面,有信息可视化、科学可视化与计算机图形学
7.11. 与数据分析相关的领域包括信息获取、数据处理和数据挖掘
7.12. 在交互方面,则有人机交互、认知科学和感知等学科融合
7.13. 可视分析偏重于从各类数据综合、意会和推理出知识,其实质是可视地完成机器智能和人脑智能的双向转换,整个探索过程是迭代的、螺旋式上升的过程