Distribution Plots in Python
讲座描述
Learn about Data Visualization with Seaborn and Python!
通过完整课程学习更多知识
Python for Data Science and Machine Learning Bootcamp
Learn how to use NumPy, Pandas, Seaborn , Matplotlib , Plotly , Scikit-Learn , Machine Learning, Tensorflow , and more!
24:46:40的随选视频 • 更新于 May 2020
Use Python for Data Science and Machine Learning
Use Spark for Big Data Analysis
Implement Machine Learning Algorithms
Learn to use NumPy for Numerical Data
Learn to use Pandas for Data Analysis
Learn to use Matplotlib for Python Plotting
Learn to use Seaborn for statistical plots
Use Plotly for interactive dynamic visualizations
Use SciKit-Learn for Machine Learning Tasks
K-Means Clustering
Logistic Regression
Linear Regression
Random Forest and Decision Trees
Natural Language Processing and Spam Filters
Neural Networks
Support Vector Machines
简体中文 [自动]
大家好, 欢迎参加Seaborn的分布图讲座。 在这堂课中, 我们将与Seaborn讨论不同的图类型, 这些图类型使我们能够可视化数据集的分布。 让我们跳到Jupiter笔记本电脑开始吧。 好的, 我在笔记本前。 我想从进口海运开始, 按照惯例, 我们进口海运作为asinus。 因为我在笔记本里, 所以我会继续说, 马特图是实时的, 这样我就可以看到笔记本里的可视化效果。 好吧, 我会的 现在, 让我们来看看海运图中的一些数据, 它实际上包含一些内置的数据集, 您可以直接加载这些数据。 我将抓取一个名为tips的数据框, 并将其保存为一个名为tips的数据框。 您可以通过简单地说Tipps等于Asinus加载数据集, 然后将tips作为字符串传递来实现。 这将加载提示数据集, 然后我可以检查帧状态的头部, 它看起来像这样。 这里有七列, 这些基本上都是关于那些吃过饭之后留下小费的人的数据. 所以你有这顿饭的总价格或者账单, 剩下多少小费, 留下小费的人的性别, 不管他们是不是吸烟者, 他们在哪一天和什么时候在外面吃饭。 然后是聚会的规模。 好吧, 我会的 让我们继续讨论第一种图类型, 这是CISC图, 这种图可以显示一组单变量观测值的分布, 这是一种不同的表达方式。 让我们进去看看。 我会说Asinus认为这个图, 然后对于这个图, 你要做的就是传入数据框中的一列。 在本例中, 我们来看看总账单是如何分配的。 所以我会说总账单, 然后运行单元格, 你应该会得到一个像这样的图。 如果你在这里得到警告, 不要担心。 这实际上必须做的, 如果另一个包称为统计的模型。 它不会影响你的实际Seaborn代码。 但在这里, 我们没有任何警告, 所以我们没事。 注意这里我得到的基本上是一个直方图, 也就是所谓的k d e, 核密度估计, 就是这条线。 在这节课的后面, 我们会讨论凯蒂是什么, 以及我们如何建立这个概念。 但是现在我们可以把它去掉, 如果我们想的话, 我们可以说, 这里的附加论证, Katie等于false。 只要输入凯蒂就等于假。 现在你基本上只需要一个直方图, 直方图基本上就是总账单的分布。 这里你可以看到, y轴上有一个计数, 然后X轴上有这些条作为bin。 这基本上意味着你的大部分账单都在10到20美元之间。 如果你想得到更多的信息, 你可以改变箱子的数量, 这样你就可以继续了, 还有第三个参数, 萨宾的, 然后是合适的出价数量, 这个数量实际上取决于你的数据集。 但我们先进去选30个。 现在我们可以得到一个更基本的定义, 我们仍然可以看到大多数账单发生在10到20之间。 如果您选择的值太高, 例如, 我们输入100, 您将开始出现一种奇怪的情况, 您基本上开始绘制每一个价格点的每一个总账单实例。 所以通常我想试着在大小上找到一个平衡, 但那真的取决于你的情节本身。 好的, 我会的 看起来我们对这里的信息有一个很好的了解。 如果他看得懂这张图, 他就可以说, 大部分账单都发生在10到20美元之间, 随着价格越来越高, 账单开始消失。 这是一个曲线图, 它可以让你看到分布, 基本上是一个直方图, 你可以在上面加一个蛋糕。 但我们稍后会了解凯蒂的情节。 我们来讨论一下联合图和海运联合图, 我可以说, Asinus联合图基本上可以通过各种数据与此图匹配, 这意味着基本上可以联合收割机两个不同的分布图。 而通过非常它只是两个变量。 当你有了一个参数, 我们可以选择如何比较这两个分布。 让我进去给你们展示一下我们如何用本质作为一个起点情节。 首先你要传入一个x变量, 然后你要传入一个Y变量, 然后你要传入你的数据集。 让我们从后端开始, 将旅客数据设置为提示。 这样的数据框, 然后对于x和y, 你只需要传递和作为列名的字符串。 这两样东西你要互相比较。 例如, 我可能想比较总账单的分布与小费大小。 让我们开始吧。 我要说总帐单作为我的前和在我的方式访问我会把在小费小费列。 现在我把总账单列和小费列输入, 然后数据等于小费, 我得到一个图, 看起来像这样, 实际上就是两个分布图. 您可以在y轴上看到小费, 在x轴上看到总账单, 然后缩小, 这样您就可以看到整个图。 然后我有一个散点图, 这个散点图实际上是有意义的, 因为它看起来有一个趋势, 当你的总账单越高, 你的小费也会越高, 这是有意义的, 因为小费通常与你的总账单成比例。 现在联合图实际上给予你一个额外的参数, 叫做种类参数, 这个种类参数允许你影响联合图内部的实际情况。 现在默认情况下是散点, 但是你也可以传入一个参数, 比如hex, hex允许你基本上做一个六边形的分布表示。 它类似于散点图, 除了基本上, 如果六边形有一定数量的点, 它会变暗, 如果点少, 它会变亮, 本质上, 这只是一种不必把所有的散点都放在上面的方法, 而是用这些六边形来显示分布。 我们可以为kind提出的另一个论证是e g, 它代表回归。 这看起来很像一个散点图, 除了西伯恩实际上要在上面画一条回归线。 现在我们还没有真正学习到线性回归, 直到机器学习这个话题, 但稍后我们会回到这个话题, 讨论这条线是如何建立的。 但本质上这只是对散乱点数据的线性拟合, 你可以看到它在皮尔森系数中有一个P值, 我们在后面讨论线性回归的时候会讨论这个。 最后一种你可以放在这里的是KDE, 它也允许你拥有这个。 我提到了K-T, 它实际上只是显示了这些点最匹配的密度。 好了, 我们继续, 从联合图开始, 通常使用默认散点图, 因为它是最容易阅读的, 并且可以立即提供大量信息。 我们将继续展开这个概念, 向你们展示配对图, 配对图本质上是在整个数据框架中, 至少是在数字列中, 绘制配对关系。 它还支持分类列的色调参数, 稍后我会给你们看。 但是我们在上面看到了这个联合图, 这个图本质上要做的是, 为这个数据框中数值列的每一个可能的组合做这个联合图。 让我去给你看看我的意思。 因为它会对所有的组合都这样做。 基本上你只需要调用S和S思想每图和传递你的数据帧。 这也是我们在整个课程中要做的。 请记住, 数据框越大, 绘制每个图所需的时间越长。 因此, 如果您有一个非常大的数据框, 而不是相对较小的帧, 那么每个图的很多时间都需要一段时间。 所以我们没事了。 这里我们基本上有一个所有数值列值的配对图。 因此, 我们有大小与 总账单大小与小费。 然后当你看到一个参数与它本身的关系, 比如大小与大小的关系, 而不是做散点图, 当它有意义的时候, 你只会看到一条直线。 您会看到直方图。 小费对小费也是一样。 对于总账单与总账单, 这意味着每图是快速可视化数据的一种非常好的方式。 更好的是你可以在you eat中加入一个hue参数hewe参数就是你在列中传递的位置. 在分类中, 分类列的目的不是指数字或连续的, 而是指实际的类别。 例如性别栏是分类的因为里面有两个类别, 男性和女性. 当你传入这个参数的时候, 当你殖民地名称equal sex的时候, 它会根据你输入的颜色列给数据点着色。 所以这里所有的绿色点都是雌性的根据这个传说所有的都是雄性的。 我们要把画面拉远, 这样我们就能看到整个画面。 所有的蓝色点都是男性。 作为第三个参数, 你可以指定一个调色板, 调色板允许你用一些特定的调色板来给它着色。 我们将在海运系列讲座的最后讨论调色板、 颜色和风格。 现在我给你们看一个例子。 实际上, 这些颜色映射字符串来自实时绘图, 您可以将其传递到调色板中, 它们将为任何参数选择特定颜色。 这里我们可以看到, 邮件是蓝色的, 而女性是这种淡粉色的。 好吧, 我会的 我们将在调色板上更多地接触它的颜色和风格。 让我们继续讲Roug图和rogue图, 其实是一个非常简单的概念, 但我们要用rogue图的概念来实际构建。 是的, 我是 解释一下我们之前看到的K-T图, 我会继续说S。 答。 Roug图, 就像画分布图一样, 你要在这里传递到一个单列中。 现在我们来说说提示, 然后我们来看看总账单列, 地毯图的作用是, 它是一个非常简单的概念。 它只是画了一个破折号, 表示这个均匀或唯一的变量分布上的每一个点, 本质上是一个单一的变量。 因此, 与其像直方图一样, 让我继续, 让这个图再一次进行比较。 我会说只要这个情节提示总法案。 运行, 让我们去说凯蒂是假的。 下面的直方图与Rugge图的区别在于, 直方图本质上有条柱, 它计算该条柱中有多少个破折号, 然后在这里显示为一个数字, 这意味着大约有10到11个破折号。 45个破折号。 它们都是一层一层的。 然后在这里, 随着我们进一步计算总账单价格, Roug或破折号的数量会减少, 这意味着Ben的价格会降低。 这就是SR-GR RAM和这个流氓情节之间的基本关系, 流氓情节真的很简单。 您只需为配电线上的每个点绘制一个虚线标记。 好吧, 我会的 这是全部帐单。 我们要做的是建立在流氓阴谋的基础上来解释这个真正的Kaytee阴谋是什么, 这就是这条线。 我们如何真正建立这条线的基础上, 这些流氓阴谋。 你可以看到, 它和恶意图计数有关系, KDE图代表核密度估计图, 你可以在谷歌上搜索这个, 看看维基百科上关于核密度估计图的内容, 页面会看起来像这样, 卷曲密度估计, 这是一个真正的向下滚动。 这是一个非常好的图, 我们要试着去构建它。 你会注意到这里的每一个黑色虚线都是流氓情节。 所以实际分。 然后在每一点的顶部都有这些正态高斯分布。 然后你把它们全部加起来。 所以你得到了这个最终的Currence核密度估计。 现在我所说的正态分布或高斯分布是什么意思。 如果你也在维基百科上查一下Nessus的概率论, 正态分布, 我会说可能是最常见的连续概率分布。 这是一种正态分布, 你可以说, 每个人的考试成绩如何, 你给所有学生打分, 然后看到分数的分布。 通常情况下, 像这样的标准化的东西, 比如人的年龄, 或者人的身高, 通常很多东西都是服从正态分布的。 好的, 我会的 让我们跳回到Jupiter笔记本上, 更详细地讨论这些主题。 我将从笔记本中复制并粘贴一些代码, 您无需担心如何理解这些代码。 这只是为了建立一个图表的解释在一个去复制和粘贴这一点。 我已经复制并粘贴了这些代码, 让我真实的快速分析一下这些代码。 我只有一些进口货。 我创建了一个随机数据集。 然后我对随机数据进行地毯图。 我设置了图的x轴。 使用任何Ohlund空间创建100个等间距的点从X战警的X最大值, 然后在这里。 这可能是最难理解的部分, 因为它使用库。 我们还没谈过呢。 这不正常。 所有这一切都是为了绘制每个地毯点的正态分布。 看起来像这样。 我们继续放大这个画面。 这是我的数据集, 这是一个随机数据集。 所以, 如果你今年跑, 可能会看起来有点不同, 但请记住, 我们不再看与小费。 我们只是在研究一些随机数据。 请注意, 这里有蓝色虚线, 这些灰色线代表正态分布。 在这些蓝色虚线的顶部。 这是以破折号为中心的正态分布。 我们有一堆这样的人。 我们接下来要做的是, 把其中的一些, 全部加起来, 得到核密度基函数。 这是所有这些正态分布的总和。 好吧, 我会的 复制并粘贴笔记本上的第二段代码, 这样我们就可以把所有的基函数加起来, 也就是正态分布, 当她把它们加起来时。 你会得到这样的图, 这就是之前的图, 这就是从圆盘图构建图的方法。 第一张图我们看到了t下面的最大T。 好吧, 我会的 这些都是显示数据分布的主要方法, 我们已经看到了很多。 让我们快速回顾一下这台计算机和绘图类型的所有各种绘图类型。 我们向上滚动。 这是一个图, 同样, 这是一个图, 你可以用两种方法, 让Kaytee等于假, 基本上只是看到一个直方图, 或者让这个空白。 然后你可以看到, Caity, 核密度估计, 它解释了终点是粗糙A图联合图周围所有正态分布的总和, 这和这个想法非常相似, 在两列中传递, 你把它们作为x和y参数。 如果您的第三个参数等于数据, 则我们学习的下一个图是配对图, 该图只是在图的基础上构建的, 本质上是数据集中每一列或数值列的联合图, 这意味着您只需传入数据集本身, 即数据框, 如果您想按分类列实际着色, 则可以传入色调和调色板Roug图通常不会用到Roug图, 但它是为你准备的, 使用rogue图的主要思想是构建核密度估计图的逻辑, 这是通过这段代码完成的。 你们可以花点时间通读这段代码, 但我只是想让大家明白, 当你使用一个流氓图, 你想为Katie图建立一个核密度估计图, 你可以这样做, 流氓图中的每个点都是正态分布, 然后取所有点的和。 这是核密度估计图。 我们已经看到了如何使用这个图来做, 如果你使用这个图, 我们知道我们可以通过说Kaytee等于false来摆脱K-T图。 如果你真的只是想要K-T图, 而不想在这里实际的Beenz, 你可以实际上pasan, 而不是图, 你可以做Asinus KDE图, 然后passen提示。 总账单, 这将构建K-T图, 没有任何条形分布。 好吧, 我会的 希望你能意识到Seaborn是非常强大的, 而且就你需要写的代码来说也非常简单。 我们所做的一切都是在一条线上完成的。 如果你试着这样做, 它地图绘图库, 它会采取你多行, 但什么是好的, 这是它的工作, 你知道什么绘图现场, 我们会看到很多, 当我们谈论样式和颜色。 很多地图情节活的知识将被转移到实际编辑这个情节中的小东西。 好的, 我希望你们开始喜欢Seaborn了, 就像我之前提到的, 它是我最喜欢的图书馆之一, 我迫不及待地想给你们看接下来我们要学习的关于Seaborn的情节类型。 谢谢大家, 我们下节课再见