ARTICLE DETAIL

资讯详情

深耕郑州网站建设与运营推广的一线实战洞察。

ADS305 big data Lecture3.2 data visualization

ADS305 big data Lecture3.2 data visualization 文章目录1. 可视化的动机2. 可视化的原则2.1 最大化数据与墨水的比例2.2 不要在尺度上撒谎2.3 最小化图表垃圾2.4 清晰、详细且全面的标签3. 可视化的类型3.1 分布Distribution3.1.1 直方图Histograms3.1.2 散点图scatter plots3.2 关系Relationship3.2.1 气泡图bubble chart3.2.2 通过多个低维度图表发现关系3.3 构成Composition3.3.1 饼图Pie Chart3.3.2 堆叠面积图Stacked Area Graph3.4 比较Comparison3.4.1 多重直方图Multiple Histograms3.4.2 箱形图Boxplots3.4.2.1 正偏态Right-Skewed和负偏态Left-Skewed4. 可视化的例子5. 可视化工具1. 可视化的动机术语补充Terminology可视化Visualization数据可视化Data Visualization可视化的动机Motivation for Visualization简单统计特征Summary Statistics图形表示Graphical Representation数据分布Data Distribution。下图展示了四个数据集的简单统计特征它们的统计特征相同但它们的图形表示和数据分布却大不相同。所以仅仅依赖于简单的统计特征是不够的还需要考虑数据的分布和图形表示。下图用散点图展示了它们的数据分布。所以即使统计特征相同数据的实际分布和关系可能大不相同。再比如某次作业的平均分是7.64分看上去分数还可以但是我们看一下分布图。虽然平均分是7.64但实际上大多数学生的成绩远低于这个平均值只有少数学生的成绩较高从而拉高了平均分。因此数据可视化是一种工具可以帮助我们更直观地理解和分析数据。术语补充Terminology模式Pattern趋势Trend假设Hypothesis分析Analysis建模Modeling。通过可视化我们可以发现数据中可能不易察觉的模式和趋势。帮助我们形成假设即对数据可能展示的某种关系或模式的初步猜测。传达分析结果的强大工具。帮助我们简洁地呈现信息和观点提供证据和支持以及影响和说服他人。确定分析/建模的下一步。2. 可视化的原则2.1 最大化数据与墨水的比例术语补充Terminology数据与墨水的比例Data-Ink Ratio数据墨水Data Ink非数据墨水Non-Data Ink。核心思想是尽量让图表中的视觉元素服务于数据表达。这个原则强调在图表中应该尽可能多地展示数据而减少不必要的装饰和非数据元素。目的是让图表更加简洁使观众能够更容易地看到和理解数据本身。2.2 不要在尺度上撒谎术语补充Terminology图表尺度Chart Scale坐标轴Axis轴起点/基线Axis Baseline刻度间隔Tick Interval谎言因子Lie Factor。这个原则也称为“谎言因子”Lie Factor指的是不应该通过调整图表的尺度如轴的起点或间隔来误导观众对数据的解读。图表的尺度应该公正地反映数据的真实情况。如下图左边使用了非常小的尺度范围从8.090到8.100这使得两者之间的差异看起来非常大尽管实际上差异非常小只有0.01英里。下图右边是个正确的示例。2.3 最小化图表垃圾术语补充Terminology图表垃圾Chartjunk装饰性元素Decorative Elements视觉干扰Visual Distraction。在图表中只展示数据的变化而不是设计的变化。图表垃圾指的是图表中那些对数据理解无益的装饰性元素它们可能会分散观众的注意力甚至误导观众。这一点与第一点近似。下图左边就是个错误的示例右边是正确的示例。2.4 清晰、详细且全面的标签术语补充Terminology标签Labels轴标签Axis Labels图例Legend标题Title注释Annotation。标签应该易于阅读使用清晰、易读的字体和大小。而且标签应该提供足够的信息以便观众能够理解图表的内容和上下文。需要确保图表中的所有元素都有适当的标签包括轴标签、图例、标题和任何注释。3. 可视化的类型术语补充Terminology分布Distribution关系Relationship构成Composition比较Comparison。这四类分别侧重“数据如何分布”“变量如何关联”“部分与整体如何组成”以及“不同对象如何比较”。每种类型都针对数据的不同方面有多种类型分布Distribution这种类型的可视化用于展示一个或多个变量在可能值范围内的分布情况。常见的分布可视化包括直方图、箱型图和密度图。它们可以帮助我们了解数据的集中趋势、分散程度以及是否存在异常值。关系Relationship关系可视化用于展示数据集中多个变量之间的关联性。散点图、气泡图和热力图是展示变量之间关系的常用工具。通过这些图表我们可以观察变量之间是否存在线性或非线性关系以及它们之间的相关性强度。构成Composition构成可视化用于展示数据集中某一部分与整体的关系。饼图、条形图和堆叠条形图是展示构成的常用图表。它们可以帮助我们理解各个部分在整体中所占的比例以及各部分之间的相对大小。比较Comparison比较可视化用于展示不同变量或数据集之间的差异和相似性。条形图、折线图和雷达图是进行比较的常用工具。通过这些图表我们可以直观地比较不同类别、时间点或条件下的数据趋势和变化。3.1 分布Distribution术语补充Terminology定量值/定量变量Quantitative Value / Quantitative Variable值域Value Range集中趋势Central Tendency离散程度Dispersion异常值Outlier。当我们想要研究定量值即可以用数字表示的值如身高、体重、分数等如何沿着某个轴通常是图表的x轴或y轴分布时分布图表是一个很好的选择。通过观察数据的形状即数据在图表上的分布形态用户可以识别数据的以下特征值的范围Value range数据集中最小值和最大值之间的差异这可以帮助我们了解数据的总体分布范围。集中趋势Central tendency数据集中趋势的度量通常包括平均值mean、中位数median和众数mode。这些度量可以帮助我们了解数据的中心位置。异常值Outliers数据集中远离其他数据点的值。这些值可能是由于错误、特殊情况或极端情况造成的识别它们对于理解数据的整体分布和进行进一步分析非常重要。3.1.1 直方图Histograms术语补充Terminology直方图Histogram区间/箱Bin频数/频率Frequency箱宽Bin Width箱数量Number of Bins。直方图是一种可视化工具用于展示一维数据在特定值范围内的分布情况。它通过将数据分成若干个区间称为“bins”或“桶”并计算每个区间内数据点的数量频率来展示数据的分布形态。注意直方图中的趋势对“bins”的数量非常敏感。3.1.2 散点图scatter plots术语补充Terminology散点图Scatter Plot二维数据Two-Dimensional Data多维数据Multidimensional Data相关性Correlation正相关Positive Correlation。散点图是一种数据可视化工具用于展示多维数据在特定值范围内的分布情况。它通过在二维平面上绘制点来表示数据点每个点的位置由数据的两个属性决定。散点图也可以用来展示多维数据在不同值上的分布情况。通过观察散点图中点的分布我们可以了解数据的分布特征如集中趋势、分散程度和异常值。散点图更常用于展示多维数据中两个不同属性之间的关系。通过观察点的排列方式我们可以识别变量之间的相关性、趋势和模式。例如在图中展示的散点图中x轴和y轴分别代表两个不同的变量。从图中可以看出随着x轴值的增加y轴值也呈现出增加的趋势这表明这两个变量之间可能存在正相关关系。3.2 关系Relationship术语补充Terminology统计相关性Statistical Correlation群组/聚类结构Clusters / Cluster Structure视觉编码Visual Encoding分类属性Categorical Attribute高维数据High-Dimensional Data。通过可视化我们可以识别变量之间是否存在某种统计相关性。可视化可以帮助我们快速识别这些异常值它们可能是由于错误或特殊事件造成的。通过可视化我们可以观察到数据点是否倾向于聚集在一起形成不同的群组。人类的视觉能力有限我们通常只能同时理解三个维度的数据。然而通过将额外的变量映射到数据点的大小、颜色或形状上我们可以在二维或三维空间中可视化更多的信息。下面的图用颜色编码来有效地表示三维数据中的分类属性。这里的散点图展示了一组鸢尾花Iris的测量数据包括花瓣长度、萼片长度和鸢尾花的类型。这里使用了三种不同的颜色来表示三种不同类型的鸢尾花所以更多维度并不总是更好例如下面的图展示了一组高维数据。其中x轴表示体重y轴表示身长z轴表示年龄。所以说过多的维度可能会使图表变得复杂难以解读。3.2.1 气泡图bubble chart术语补充Terminology气泡图Bubble Chart大小编码Size Encoding定量属性Quantitative Attribute颜色编码Color Encoding。对于三维数据可以通过气泡图中的大小来编码定量属性。图中展示了一组消费者产品的数据每个气泡代表一个产品。x轴表示消费者评分从0%到100%y轴表示收入以百万美元为单位从0到16m气泡的大小表示生产成本从$100到$600。不同颜色的气泡代表不同类型的产品Product 1到Product 4。3.2.2 通过多个低维度图表发现关系术语补充Terminology低维度图表Low-Dimensional Plot变量对Variable Pair成对比较Pairwise Comparison。通过观察多个二维图表我们可以更容易地识别数据中的模式和关系。如图所示。第一个散点图红色展示了变量“weight”重量与“length”长度之间的关系。图中的点呈现出一定的正相关趋势即随着重量的增加长度也倾向于增加。第二个散点图绿色展示了变量“weight”重量与“age”年龄之间的关系。图中的点分布较为分散显示出这两个变量之间的关系可能不太明显或存在较大的变异性。第三个散点图蓝色展示了变量“length”长度与“age”年龄之间的关系。图中的点同样分布较为分散表明这两个变量之间的关系可能也不明显。这样我们观察这些二维散点图我们就可以更清晰地看到每个变量对之间的关系而不是试图在一个高维图表中同时理解多个变量。3.3 构成Composition术语补充Terminology部分与整体关系Part-to-Whole Relationship相对值Relative Value绝对值Absolute Value静态数据Static Data时间序列数据Time-Series Data。构成图用于展示数据集中某一部分与整体的关系。这种类型的图表可以帮助我们理解各个部分在整体中所占的比例以及各部分之间的相对大小。构成图可以同时展示相对值如百分比和绝对值如具体的数量或金额。构成图不仅可以用于展示静态数据即某一时刻的数据分布也可以用于展示时间序列数据即随时间变化的数据分布。这使得构成图成为一种非常灵活的可视化工具可以应用于多种不同的数据分析场景。3.3.1 饼图Pie Chart术语补充Terminology饼图Pie Chart扇区Slice / Sector比例Proportion类别Category。饼图是一种可视化变量或单个组静态构成也就是分布的方法尽管饼图可以直观地展示各部分与整体的关系但它们在比较不同分类的比例时可能不如条形图直观尤其是当分类很多或者比例相近时。条形图通常更容易比较不同类别的大小因此在实际应用中更受青睐。3.3.2 堆叠面积图Stacked Area Graph术语补充Terminology堆叠面积图Stacked Area Chart / Stacked Area Graph分类变量Categorical Variable定量变量Quantitative Variable随时间变化Change over Time。堆叠面积图是一种可视化组的构成随时间或其他定量变量变化的方法。这展示了一个分类变量AgeGroup与一个定量变量年份之间的关系。如图所示不同颜色的区域代表不同的年龄组图例说明了每种颜色对应的年龄组。这个堆叠面积图表示了不同年龄组AgeGroup随时间变化的人口数量。3.4 比较Comparison术语补充Terminology条形图Bar Chart柱状图Column Chart折线图Line Chart类别比较Categorical Comparison时间趋势Temporal Trend。比较图表用于比较数据集中不同值的大小以及轻松识别数据中的最小值或最大值。如果需要比较随时间变化的值折线图line charts或条形图bar charts通常是最佳选择因为它们能够展示数据随时间的趋势和变化。条形图或柱状图Bar or column charts适用于比较不同项目或类别之间的值。折线图Line charts适用于展示数据随时间的连续变化它们通过线条连接各个数据点给人一种连续性的感觉适合展示趋势和模式。饼图Pie charts也可以用来比较数据特别是当需要展示各部分占整体的比例时。每个扇区的大小表示该部分在整体中的相对重要性或比例。3.4.1 多重直方图Multiple Histograms术语补充Terminology多重直方图Multiple Histograms核密度估计Kernel Density Estimate, KDE密度曲线Density Curve分布形状Distribution Shape。在同一轴上绘制多个直方图以及这里的分布核密度估计是一种可视化不同变量如何比较或同一变量在特定组别中如何变化的方法。除了直方图图中还包含了核密度估计Kernel Density EstimatesKDE曲线这些曲线提供了分布的平滑估计有助于更清晰地展示分布的形状。3.4.2 箱形图Boxplots术语补充Terminology箱形图/箱线图Boxplot / Box-and-Whisker Plot四分位数Quartile中位数Median须Whisker四分位距Interquartile Range, IQR异常值Outlier。箱形图是一种简化的可视化方法用于比较不同组别的定量变量。它突出显示了数据集中的范围、四分位数、中位数和任何异常值。每个箱形图由一个矩形框表示数据的四分位数范围、一条中线表示中位数、以及上下的“须”表示数据的范围不包括异常值组成。“Minimum”最小值Q1第一四分位数减去1.5倍的四分位距IQR即Q3-Q1。“Q1”第一四分位数数据中有25%的值小于或等于这个值。“Median”中位数数据中有50%的值小于或等于这个值。“Q3”第三四分位数数据中有75%的值小于或等于这个值。“Maximum”最大值Q3加上1.5倍的四分位距。“Interquartile Range (IQR)”四分位距Q3和Q1之间的范围表示数据的中间50%的分布。除此以外还有异常值Outliers这些点位于“须”之外表示与其他数据点有显著差异的值。3.4.2.1 正偏态Right-Skewed和负偏态Left-Skewed术语补充Terminology偏度/偏态Skewness左偏/负偏Left-Skewed / Negative Skew右偏/正偏Right-Skewed / Positive Skew对称分布Symmetric Distribution正态分布Normal Distribution。如果数据看起来不是对称的每个样本是否显示出相同类型的不对称性呢下图展示了三种情况左偏态Left-Skewed分布的尾部在左侧意味着较小的值比大的值更多数据的中位数Q2位于均值平均值的右侧。对称Symmetric分布是对称的呈现出钟形曲线中位数、均值和众数大致重合。右偏态Right-Skewed分布的尾部在右侧意味着较大的值比小的值更多数据的中位数Q2位于均值的左侧。其分别对应不同的箱线图负偏态Negative Skew箱形图显示左侧的“须”更长表示数据分布的尾部在左侧。正态分布Normal Distribution箱形图显示数据均匀分布没有明显的偏态。正偏态Positive Skew箱形图显示右侧的“须”whisker更长表示数据分布的尾部在右侧。4. 可视化的例子术语补充Terminology分组条形图Grouped Bar Chart分组Group类别Category抗性Resistance。我们现在尝试一个数据集。我们可以先试着用分组条形图展示每种细菌对每种药物的抗性比较。现在我们再尝试通过分组条形图来可视化每种细菌对每种药物的抗性比较我们按照分组来排序。前一组结果不清晰但是这一组很清晰。Group1对药物3的抗性都很高而Group2对药物1的抗性较高。5. 可视化工具术语补充Terminology可视化工具Visualization Tools交互式可视化Interactive Visualization仪表板Dashboard网络可视化Network Visualization声明式可视化语法Declarative Visualization Grammar。TREEVIS.NET是一个专注于可视化技术资源的在线平台其提供了一个可视化技术目录用户可以通过它来探索和了解不同的数据可视化方法和工具。Gephi 是一个开源的图形可视化和探索软件平台主要用于处理和分析各种类型的图形和网络数据。R/shinyShiny 是 R 语言的一个包它允许用户创建交互式网页应用程序。通过 Shiny数据科学家和分析师可以轻松地将他们的分析转化为交互式的报告或仪表板。plotly/dashPlotly 是一个用于创建交互式图表的库支持多种编程语言包括 Python 和 R。Dash 是 Plotly 提供的一个框架用于构建复杂的交互式数据应用程序。Tableau 是一个流行的商业智能和数据可视化工具它提供了一个拖放式的界面用户可以轻松地创建交互式和可分享的仪表板。D3.jsData-Driven Documents是一个基于 JavaScript 的库它允许用户使用 HTML、SVG 和 CSS 来创建复杂的交互式图形和数据可视化。Vega 和 Vega-Lite 是两个相关的可视化语法和工具它们允许用户以声明式的方式创建交互式图形。其中Vega-Lite 是 Vega 的一个轻量级版本它提供了一个更简单、更易于学习的语法适合快速创建基本的图表和可视化。
返回列表