如何用 AI 制作散点图:逐步指南

散点图展示了两个数值变量之间的关系,每个轴代表一个变量,图中的每个点代表一个观测值。要使用 AI 制作散点图,只需上传一个包含两个数值列的文件,并为每个轴的变量命名。要求生成带有趋势线和相关性的图表,然后解读其模式并检查异常值。
本指南将解释散点图展示的内容,以及何时使用散点图而不是折线图。它涵盖了在 Excel 和 Google Sheets 中手动制作的步骤、三步 AI 制作法、如何解读结果以及一个实际案例。
散点图展示了什么
《NIST/SEMATECH 统计方法电子手册》给出了标准定义。散点图“揭示了两个变量之间的关系或关联”。这些关系“通过图表中的任何非随机结构表现出来”。
其布局非常简单。该手册将其描述为“Y 值与对应 X 值的图表”。纵轴代表响应变量,横轴代表你认为可能与其相关的变量。
NIST 列出了散点图可以回答的五个问题:
- 这两个变量相关吗?
- 它们是线性相关吗?
- 它们是非线性相关吗?
- Y 的变化是否取决于 X?
- 是否存在异常值?
该手册还解释了为什么该图表在分析中如此重要。它称其为“用于揭示变量之间关系的存在和性质的最重要、使用最频繁的图形工具”。
何时使用散点图而不是折线图
散点图和折线图看起来可能很相似,尤其是当点与连接线相连时。两者的区别在于横轴。
微软的 Excel 文档对此进行了清晰的解释。“散点图始终有两个数值轴。”而折线图只有一个数值轴,其横轴显示的是等间距的类别。
这引出了一个简单的规则。微软建议,“如果你的数据包含非数值型 x 值,请使用折线图。”对于数值型 X 值,它补充道,“通常最好使用散点图。”
| 在以下情况下使用散点图 | 在以下情况下使用折线图 |
|---|---|
| 两个变量都是数字,例如价格和销量 | 横轴是时间或类别 |
| 你想观察两个指标是否同步变化 | 你想展示等间隔时间内的趋势 |
| 点可以落在横轴上的任何位置 | 点按周期均匀分布 |
| 你计划添加趋势线或相关性 | 你计划对比随时间变化的多个序列 |
一个快速测试方法:如果你能将横轴的值从小到大排序,且排序后仍有实际意义,那么散点图就适用。
开始前需要准备什么
一张干净的图表始于干净的数据列。首先检查以下四点。
两个数值列。 一个用于 X 变量,一个用于 Y 变量。清除单元格中输入的单位,例如“12 km”,因为它们会将数字变成文本。
每行代表一个观测值。 每一行应该描述一个客户、一个订单、一天或一次测试。同一列中的总计和分小计会使图表失真。
足够的数据点。 寥寥几个点很难展现出真实的模式。目标是至少 20 个观测值,如果数据噪声较大,则需要更多。
明确的问题。 在绘图之前,决定你期望发现什么。相比于“给我看数据”,“送货时间是否随距离增加而增加?”是一个更好的切入点。
如何在 Excel 或 Google Sheets 中制作散点图
手动制作非常适合单张图表。这些方法不需要任何插件。
方法 1:Excel
将 X 值放在左侧列,Y 值放在右侧列,首行作为表头。选择这两列(包括表头)。
在“插入”选项卡上,打开“插入散点图(X, Y)或气泡图”菜单,然后选择“散点图”。Excel 会将每一行绘制为一个点。
要添加趋势线,请选择图表,打开“图表元素”,然后勾选“趋势线”。在“设置趋势线格式”中,你可以在图表上显示公式和 R-squared 值。至于相关系数本身,请在空白单元格中输入 =CORREL(A2:A31,B2:B31)(根据你的实际范围进行调整)。
方法 2:Google Sheets
选择这两列,然后依次选择“插入”和“图表”。在图表编辑器中,如果 Sheets 没有自动选择,请将图表类型设置为“散点图”。
在“自定义”选项卡上,打开“系列”并勾选“趋势线”。你也可以在此处显示 R-squared。=CORREL() 函数的使用方法与 Excel 相同。
手动制作在三个地方会降低效率:数据通常需要先进行清洗;异常值必须手动寻找并标记;当你想要测试多对变量时,必须对每对变量重复所有步骤。
如何使用 AI 制作散点图
AI 工作空间只需一个请求即可清洗数据列、构建图表、添加趋势线并标记异常值。以下三个步骤使用的是 Powerdrill Bloom。其 scatter graph creator 页面描述了相同的流程:上传数据集、在对话中描述图表,然后下载结果。
第 1 步:上传数据并命名两个变量
上传包含数据的电子表格或 CSV 文件。scatter graph creator 页面说明它支持 CSV 和 Excel 等格式。
然后在你的请求中命名这两个变量。说明哪一列放在横轴,哪一列放在纵轴。将你认为起主导作用的变量放在横轴上,这符合 NIST 的惯例。
如果文件有很多列,可以添加一句话作为背景信息。例如:“每一行代表一次配送。我想看看时间是否取决于距离。”这有助于 AI 选择正确的列并忽略其他列。
第 2 步:要求生成散点图、趋势线 and 相关性
在同一个请求中要求生成图表、线性趋势线和相关系数。一个好的请求示例如下:“制作一张送货时间与距离的散点图。添加一条线性趋势线,并显示相关系数和 R-squared。”
同时要求提供关于数据清洗的说明。AI 应该告诉你它因缺失值或非数值而删除了多少行。如果这个数字让你感到意外,请修正源文件并重新运行。
如果你有多个候选变量,可以要求每对变量生成一张图表,或者先生成一个相关性表。我们关于 correlation matrix 的指南涵盖了这一更广泛的初步筛选步骤。
第 3 步:解读模式并标记异常值
在看数字之前,先观察形状。是否有明确的方向?关系是直线还是曲线?随着 X 的增长,分布是否变宽?
然后让 AI 标记出任何异常值及其行详细信息。远离其他点的数据点往往是图表中最有用的。它可能是一个数据输入错误,也可能是你的经理会问及的特殊情况。
最后在图表下方用一句话进行总结。陈述方向、强度和任何注意事项。例如:“送货时间随距离增加而增加,呈强线性关系,但因道路封闭导致的三笔延迟订单除外。”scatter graph creator 页面指出,你可以将图表下载为高分辨率的 PNG 格式,用于幻灯片或报告。
如何解读散点图
NIST 手册通过示例图展示了常见的模式。这些是你最常遇到的模式。
| 模式 | 外观特征 | 暗示了什么 |
|---|---|---|
| 无关系 | 无规则的云状分布 | 无法根据 X 预测 Y |
| 强正相关 | 点紧密分布在一条上升的线附近 | 较大的 X 对应较大的 Y |
| 强负相关 | 点紧密分布在一条下降的线附近 | 较大的 X 对应较小的 Y |
| 曲线关系 | 点呈弯曲排列 | 直线趋势线会产生误导 |
| 分布变宽 | 随着 X 增长,点呈扇形散开 | Y 的变异程度取决于 X |
| 异常值 | 一个点远离其他所有点 | 在得出结论前先检查该行数据 |
对于无关系的情况,NIST 描述为在给定的 X 下,Y 的值“到处分布”。对于强正相关关系,它指出“一条直线可以很好地穿过数据”,并且“围绕直线的散点非常小”。
这种变宽的模式有一个专业名称。NIST 称其为异方差性(heteroscedasticity),意为“Y 在 X 的不同值上的变异性不恒定”。这很重要,因为简单的趋势线假设分布是大致均匀的。
要用数字来衡量直线关系的强度,请使用 correlation coefficient。接近 1 或 -1 的值表示强线性关系。接近 0 的值表示几乎没有线性关系,但可能仍然存在曲线关系。
相关性不等于因果关系
散点图展示的是关联性,而不是因果关系。
NIST 手册对此直截了当:“散点图揭示了关联性,这是走向因果关系的第一步。”它补充道,“尽管因果关系意味着关联性,但关联性并不意味着因果关系。”
在实践中,在声称存在因果关系之前,先寻找第三个变量。冰淇淋销量和晒伤人数在夏天都会上升,但两者之间并没有因果关系。当散点图显示出强烈的模式时,问问自己还有什么在随着 X 一起变化。
如果你需要对这种关系进行建模,下一步是进行 regression analysis,它可以估算出 X 每变化一个单位,Y 会变化多少。
实际案例
以下是一个使用虚拟数据的说明性示例。一个配送团队记录了 30 笔订单,其中距离单位为公里,送货时间单位为分钟。
图表显示出清晰的上升趋势。2 到 5 公里的短途配送需要 15 到 25 分钟。20 到 25 公里的长途配送需要 55 到 70 分钟。趋势线稳定上升,相关系数为 0.91。
有三个点明显高于趋势线。每个点代表一笔 6 到 8 公里的订单,但耗时超过 60 分钟。对其进行标记后发现,这三笔订单都发生在同一个下午,当时正值道路封闭。
标记出这三笔订单后,结论就很简单了。距离解释了送货时间的大部分变异,且异常值有已知的原因。团队可以根据距离规划路线,并将道路封闭视为一个单独的风险。
这就是此类图表所擅长的总结方式:一张图表、一句话,以及一个简短的例外清单。
保持客观的变体与格式设置
当你有两个以上的变量时,有两种变体可以提供帮助。NIST 手册对这两者都进行了描述。
散点图矩阵(scatterplot matrix)“在单页上生成所有成对的散点图”。在选择要研究的变量之前,这是快速浏览数据集中每一对变量的便捷方法。
条件图(conditioning plot),“也称为共绘图或子集图”,展示了在第三个变量的不同值下 Y 随 X 的变化。它能回答诸如“距离和时间的关系在工作日和周末是否同样成立”之类的问题。
格式设置也很重要。NIST 指出,最受欢迎的版本在每个数据点上使用标记,“并且没有连接数据点的线”。点之间的连线可能会暗示数据本身并不存在的某种顺序。
另外三个习惯可以让图表保持易读性:
- 用变量名称和单位标记两个轴。
- 从合理的数值开始设置坐标轴,如果不是从零开始,请予以说明。
- 数据点使用一种颜色,趋势线使用对比色。
常见错误
以下是最常导致图表产生误导的错误:
- 对数值型 X 值使用折线图。 微软的指南明确指出,数值型 X 值通常应该使用散点图。
- 颠倒坐标轴。 将起主导作用的变量放在横轴,结果变量放在纵轴。
- 强行将直线趋势线套用到曲线上。 先观察形状,然后再选择趋势线。
- 未加检查就删除异常值。 异常值可能是一个错误,也可能是图表中最重要的一点。
- 由相关性断定因果关系。 强烈的模式只说明值得进一步研究,并不代表结论。
- 绘制的数据点太少。 8 个点中呈现的模式可能会在 80 个点中消失。
当你想要测试同一个文件中的多个变量对时,可以尝试 Powerdrill Bloom。它会为每张图表构建趋势线并标记异常值。
常见问题解答
散点图有什么用途?
散点图用于观察两个数值变量是否相关。每个点代表一个观测值,每个轴上有一个数值。NIST 手册指出,它可以回答变量是否相关、关系是否为线性、变异性是否随 X 变化以及是否存在异常值。
如何在 Excel 中制作散点图?
将 X 值放在左侧列,Y 值放在右侧列,然后选择这两列。在“插入”选项卡上,打开“插入散点图(X, Y)或气泡图”菜单,然后选择“散点图”。从“图表元素”中添加趋势线,并使用 CORREL 函数计算相关系数。
散点图和折线图有什么区别?
散点图有两个数值轴,因此点可以落在横轴上的任何位置。折线图有一个类别轴,点呈等间距分布,适合时间序列。微软推荐对数值型 X 值使用散点图,对非数值型 X 值使用折线图。
如何解读散点图?
观察方向、形状和分布。点一起上升表示正相关关系,点下降表示负相关关系。无规则的云状分布表示没有关系,而变宽的扇形表示变异性取决于 X。在得出结论之前,先检查任何异常值。
AI 可以根据电子表格制作散点图吗?
是的。将电子表格上传到 AI 工作空间,命名这两个列,并要求生成带有趋势线和相关性的散点图。Powerdrill Bloom 的 scatter graph creator 支持 CSV 和 Excel 文件,并允许你将图表下载为 PNG 格式。
来源: NIST/SEMATECH e-Handbook, Scatter Plot · NIST, Strong Linear Relationship · NIST, No Relationship · NIST, Heteroscedastic Variability · Microsoft Support, Present your data in a scatter chart or a line chart。指南阅读于 2026 年 9 月 24 日。