สัปดาห์ลดราคาสุดพิเศษClaude Skills — ลด 20%
Tips

วิธีสร้างแผนภาพการกระจายด้วย AI: คู่มือทีละขั้นตอน

Powerdrill Bloom·
วิธีสร้างแผนภาพการกระจายด้วย AI: คู่มือทีละขั้นตอน

แผนภูมิการกระจายแสดงความสัมพันธ์ระหว่างตัวแปรเชิงตัวเลขสองตัว โดยตัวแปรแต่ละตัวจะอยู่บนแต่ละแกน และมีจุดแสดงแทนแต่ละข้อมูลที่สังเกตได้ หากต้องการสร้างแผนภูมินี้ด้วย AI ให้คุณอัปโหลดไฟล์ที่มีคอลัมน์ตัวเลขสองคอลัมน์และระบุชื่อตัวแปรสำหรับแต่ละแกน จากนั้นขอให้สร้างแผนภูมิพร้อมเส้นแนวโน้มและค่าสหสัมพันธ์ แล้วจึงอ่านรูปแบบและตรวจสอบข้อมูลที่ผิดปกติ

คู่มือนี้จะอธิบายว่าแผนภูมิการกระจายแสดงอะไรบ้าง และควรใช้เมื่อใดแทนที่จะใช้แผนภูมิเส้น โดยจะครอบคลุมถึงวิธีการทำด้วยตนเองใน Excel และ Google Sheets วิธีการใช้ AI แบบสามขั้นตอน วิธีการอ่านผลลัพธ์ และตัวอย่างการใช้งานจริง

แผนภูมิการกระจายแสดงอะไรบ้าง

คู่มืออิเล็กทรอนิกส์ด้านวิธีการทางสถิติ NIST/SEMATECH e-Handbook of Statistical Methods ได้ให้คำนิยามมาตรฐานไว้ว่า แผนภูมิการกระจาย "เผยให้เห็นความสัมพันธ์หรือความเกี่ยวข้องกันระหว่างตัวแปรสองตัว" ซึ่งความสัมพันธ์เหล่านั้นจะ "แสดงออกมาให้เห็นผ่านโครงสร้างที่ไม่ใช่การสุ่มในแผนภูมิ"

โครงสร้างของแผนภูมินั้นเรียบง่าย โดยในคู่มืออธิบายไว้ว่าเป็น "การพล็อตค่าของ Y เทียบกับค่าของ X ที่สอดคล้องกัน" แกนตั้งจะแสดงตัวแปรตอบสนอง ส่วนแกนนอนจะแสดงตัวแปรที่คุณคาดว่าอาจมีความเกี่ยวข้องกับตัวแปรแรก

NIST ได้ระบุคำถาม 5 ข้อที่แผนภูมิการกระจายสามารถตอบได้ ดังนี้

  • ตัวแปรทั้งสองมีความสัมพันธ์กันหรือไม่?
  • ตัวแปรทั้งสองมีความสัมพันธ์กันแบบเชิงเส้นหรือไม่?
  • ตัวแปรทั้งสองมีความสัมพันธ์กันแบบไม่เป็นเชิงเส้นหรือไม่?
  • ความแปรปรวนของ Y เปลี่ยนแปลงไปตาม X หรือไม่?
  • มีข้อมูลที่ผิดปกติหรือไม่?

คู่มือดังกล่าวยังอธิบายด้วยว่าทำไมแผนภูมิตัวนี้จึงมีความสำคัญอย่างยิ่งในการวิเคราะห์ โดยระบุว่าเป็น "เครื่องมือทางกราฟิกที่สำคัญที่สุดและถูกใช้งานมากที่สุดในการค้นหาการมีอยู่และลักษณะของความสัมพันธ์ระหว่างตัวแปร"

เมื่อใดควรใช้แผนภูมิการกระจายแทนแผนภูมิเส้น

แผนภูมิการกระจายและแผนภูมิเส้นอาจดูคล้ายกัน โดยเฉพาะอย่างยิ่งเมื่อมีการลากเส้นเชื่อมต่อระหว่างจุดต่างๆ แต่ข้อแตกต่างที่สำคัญคือแกนนอน

เอกสารประกอบการใช้งาน Excel ของ Microsoft อธิบายเรื่องนี้ไว้อย่างชัดเจนว่า "แผนภูมิการกระจายจะมีแกนค่าสองแกนเสมอ" ส่วนแผนภูมิเส้นจะมีแกนค่าเพียงแกนเดียว และแกนนอนจะแสดงหมวดหมู่ที่มีระยะห่างเท่าๆ กัน

นั่นนำไปสู่กฎง่ายๆ โดย Microsoft แนะนำว่า "ให้ใช้แผนภูมิเส้นหากข้อมูลของคุณมีค่า x ที่ไม่ใช่ตัวเลข" และสำหรับค่า X ที่เป็นตัวเลข "โดยทั่วไปแล้วการใช้แผนภูมิการกระจายจะเหมาะสมกว่า"

ใช้แผนภูมิการกระจายเมื่อ ใช้แผนภูมิเส้นเมื่อ
ตัวแปรทั้งสองเป็นตัวเลข เช่น ราคาและจำนวนหน่วยที่ขายได้ แกนนอนเป็นเวลาหรือหมวดหมู่
คุณต้องการดูว่าตัววัดสองตัวเคลื่อนไหวไปในทิศทางเดียวกันหรือไม่ คุณต้องการแสดงแนวโน้มในช่วงเวลาที่เท่ากัน
จุดข้อมูลสามารถอยู่ตรงไหนก็ได้บนแกนนอน จุดข้อมูลมีระยะห่างเท่าๆ กันตามช่วงเวลา
คุณวางแผนที่จะเพิ่มเส้นแนวโน้มหรือค่าสหสัมพันธ์ คุณวางแผนที่จะเปรียบเทียบข้อมูลหลายชุดเมื่อเวลาผ่านไป

การทดสอบสั้นๆ สามารถช่วยตัดสินใจได้ หากคุณสามารถเรียงลำดับค่าบนแกนนอนจากน้อยไปหามากแล้วค่านั้นยังคงมีความหมาย แผนภูมิการกระจายก็ถือว่าเหมาะสม

สิ่งที่คุณต้องเตรียมก่อนเริ่มต้น

แผนภูมิที่ชัดเจนเริ่มต้นจากคอลัมน์ข้อมูลที่สะอาดเรียบร้อย ควรตรวจสอบ 4 สิ่งนี้ก่อนเป็นอันดับแรก

คอลัมน์ตัวเลขสองคอลัมน์ คอลัมน์หนึ่งสำหรับตัวแปร X และอีกคอลัมน์หนึ่งสำหรับตัวแปร Y ให้ลบหน่วยที่พิมพ์ลงในเซลล์ออก เช่น "12 กม." เนื่องจากจะทำให้ตัวเลขกลายเป็นข้อความ

หนึ่งแถวต่อหนึ่งข้อมูลสังเกตการณ์ แต่ละแถวควรระบุข้อมูลของลูกค้าหนึ่งราย คำสั่งซื้อหนึ่งรายการ วันหนึ่งวัน หรือการทดสอบหนึ่งครั้ง ยอดรวมและยอดรวมย่อยในคอลัมน์เดียวกันจะทำให้แผนภูมิคลาดเคลื่อน

จำนวนจุดข้อมูลที่เพียงพอ จุดข้อมูลเพียงไม่กี่จุดแทบจะไม่สามารถแสดงรูปแบบที่แท้จริงได้ ควรตั้งเป้าหมายไว้ที่อย่างน้อย 20 ข้อมูลสังเกตการณ์ และมากกว่านั้นหากข้อมูลมีความผันผวนสูง

คำถามที่ชัดเจน ตัดสินใจว่าคุณคาดหวังจะพบอะไรก่อนที่จะเริ่มพล็อตแผนภูมิ คำถามเช่น "เวลาในการจัดส่งเพิ่มขึ้นตามระยะทางหรือไม่?" เป็นจุดเริ่มต้นที่ดีกว่าคำถามกว้างๆ อย่าง "แสดงข้อมูลให้ฉันดูหน่อย"

วิธีสร้างแผนภูมิการกระจายใน Excel หรือ Google Sheets

วิธีการทำด้วยตนเองนั้นเหมาะอย่างยิ่งสำหรับการสร้างแผนภูมิเพียงชิ้นเดียว ซึ่งตัวเลือกเหล่านี้ไม่จำเป็นต้องใช้โปรแกรมเสริมใดๆ

ทางเลือกที่ 1: Excel

ใส่ค่า X ในคอลัมน์ซ้ายและค่า Y ในคอลัมน์ขวา โดยมีหัวตารางอยู่ในแถวที่ 1 จากนั้นเลือกทั้งสองคอลัมน์รวมถึงหัวตารางด้วย

ในแท็บ แทรก (Insert) ให้เปิดเมนู แทรกแผนภูมิแบบกระจาย (X, Y) หรือแผนภูมิฟองสบู่ (Insert Scatter (X, Y) or Bubble Chart) แล้วเลือก แบบกระจาย (Scatter) Excel จะพล็อตข้อมูลแต่ละแถวเป็นหนึ่งจุด

หากต้องการเพิ่มเส้นแนวโน้ม ให้เลือกแผนภูมิ เปิด องค์ประกอบแผนภูมิ (Chart Elements) และทำเครื่องหมายที่ เส้นแนวโน้ม (Trendline) ในส่วน จัดรูปแบบเส้นแนวโน้ม (Format Trendline) คุณสามารถเลือกแสดงสมการและค่า R-squared บนแผนภูมิได้ สำหรับค่าสัมประสิทธิ์สหสัมพันธ์ ให้ใส่สูตร =CORREL(A2:A31,B2:B31) ในเซลล์ที่ว่างอยู่ โดยปรับช่วงข้อมูลให้ตรงกับของคุณ

ทางเลือกที่ 2: Google Sheets

เลือกทั้งสองคอลัมน์แล้วเลือก แทรก (Insert) จากนั้นเลือก แผนภูมิ (Chart) ในหน้าต่างแก้ไขแผนภูมิ ให้ตั้งค่าประเภทแผนภูมิเป็น แผนภูมิกระจาย (Scatter chart) หาก Google Sheets ไม่ได้เลือกให้โดยอัตโนมัติ

ในแท็บ ปรับแต่ง (Customize) ให้เปิดส่วน อนุกรม (Series) แล้วทำเครื่องหมายที่ เส้นแนวโน้ม (Trendline) คุณสามารถเลือกแสดงค่า R-squared ได้ที่นี่เช่นกัน โดยฟังก์ชัน =CORREL() จะทำงานในลักษณะเดียวกับใน Excel

วิธีการทำด้วยตนเองนั้นมีจุดที่ทำให้ล่าช้าอยู่ 3 ประการ ได้แก่ บ่อยครั้งที่ข้อมูลจำเป็นต้องได้รับการทำความสะอาดก่อน ข้อมูลที่ผิดปกติจะต้องถูกค้นหาและใส่ป้ายกำกับด้วยตนเอง และเมื่อคุณต้องการทดสอบตัวแปรหลายๆ คู่ คุณจะต้องทำซ้ำขั้นตอนทั้งหมดสำหรับตัวแปรแต่ละคู่

วิธีสร้างแผนภูมิการกระจายด้วย AI

พื้นที่ทำงานของ AI สามารถทำความสะอาดคอลัมน์ สร้างแผนภูมิ เพิ่มเส้นแนวโน้ม และระบุข้อมูลที่ผิดปกติได้ในการสั่งงานเพียงครั้งเดียว ทั้งสามขั้นตอนด้านล่างนี้จะใช้ Powerdrill Bloom โดยหน้า scatter graph creator ของระบบได้อธิบายขั้นตอนการทำงานแบบเดียวกันไว้ นั่นคือ อัปโหลดชุดข้อมูล อธิบายแผนภูมิในแชท และดาวน์โหลดผลลัพธ์

ขั้นตอนที่ 1: อัปโหลดข้อมูลและระบุชื่อตัวแปรทั้งสอง

อัปโหลดสเปรดชีตหรือไฟล์ CSV ที่มีข้อมูลของคุณ หน้า scatter graph creator ระบุว่ารองรับรูปแบบไฟล์ต่างๆ เช่น CSV และ Excel

จากนั้นระบุชื่อตัวแปรทั้งสองในคำสั่งของคุณ โดยบอกว่าคอลัมน์ใดควรอยู่บนแกนนอนและคอลัมน์ใดควรอยู่บนแกนตั้ง ให้วางตัวแปรที่คุณคิดว่าเป็นตัวขับเคลื่อนตัวแปรอื่นไว้บนแกนนอน ซึ่งสอดคล้องกับข้อกำหนดของ NIST

หากไฟล์มีหลายคอลัมน์ ให้เพิ่มบริบทสั้นๆ หนึ่งประโยค เช่น "แต่ละแถวคือการจัดส่งหนึ่งครั้ง ฉันต้องการดูว่าเวลาขึ้นอยู่กับระยะทางหรือไม่" วิธีนี้จะช่วยให้ AI เลือกคอลัมน์ที่ถูกต้องและข้ามคอลัมน์ที่เหลือไปได้

การอัปโหลดสเปรดชีตเพื่อสร้างแผนภูมิการกระจายด้วย AI ใน Powerdrill Bloom

ขั้นตอนที่ 2: ขอให้สร้างแผนภูมิการกระจาย เส้นแนวโน้ม และค่าสหสัมพันธ์

ขอให้สร้างแผนภูมิ เส้นแนวโน้มเชิงเส้น และค่าสัมประสิทธิ์สหสัมพันธ์ในการสั่งงานเพียงครั้งเดียว คำสั่งที่ดีควรมีลักษณะดังนี้: "สร้างแผนภูมิการกระจายของเวลาจัดส่งเทียบกับระยะทาง เพิ่มเส้นแนวโน้มเชิงเส้น และแสดงค่าสัมประสิทธิ์สหสัมพันธ์รวมถึงค่า R-squared"

ขอให้ระบุหมายเหตุเกี่ยวกับการทำความสะอาดข้อมูลด้วย โดย AI ควรแจ้งให้คุณทราบว่ามีกี่แถวที่ถูกคัดออกเนื่องจากข้อมูลสูญหายหรือไม่ใช่ค่าตัวเลข หากตัวเลขดังกล่าวทำให้คุณประหลาดใจ ให้แก้ไขไฟล์ต้นฉบับแล้วรันใหม่อีกครั้ง

หากคุณมีตัวแปรที่น่าสนใจหลายตัว ให้ขอแผนภูมิหนึ่งรูปต่อตัวแปรหนึ่งคู่ หรือขอตารางสหสัมพันธ์ก่อน คู่มือของเราเกี่ยวกับ correlation matrix จะครอบคลุมขั้นตอนแรกที่กว้างขึ้นนี้

ขั้นตอนที่ 3: อ่านรูปแบบและใส่ป้ายกำกับข้อมูลที่ผิดปกติ

ให้พิจารณารูปร่างก่อนดูตัวเลข มีทิศทางที่ชัดเจนหรือไม่? ความสัมพันธ์เป็นแบบเส้นตรงหรือเส้นโค้ง? การกระจายตัวกว้างขึ้นเมื่อ X เพิ่มขึ้นหรือไม่?

จากนั้นขอให้ AI ใส่ป้ายกำกับข้อมูลที่ผิดปกติพร้อมรายละเอียดแถวข้อมูล จุดที่อยู่ห่างจากจุดอื่นๆ มักจะเป็นจุดที่มีประโยชน์ที่สุดในแผนภูมิ เพราะอาจเป็นข้อผิดพลาดในการป้อนข้อมูล หรืออาจเป็นกรณีพิเศษที่ผู้จัดการของคุณจะถามถึง

ปิดท้ายด้วยสรุปหนึ่งประโยคใต้แผนภูมิ โดยระบุทิศทาง ความแข็งแกร่งของความสัมพันธ์ และข้อควรระวัง เช่น "เวลาในการจัดส่งเพิ่มขึ้นตามระยะทาง โดยมีความสัมพันธ์เชิงเส้นที่แข็งแกร่ง ยกเว้นคำสั่งซื้อที่ล่าช้า 3 รายการในช่วงที่มีการปิดถนน" หน้า scatter graph creator ระบุว่าคุณสามารถดาวน์โหลดแผนภูมิเป็นไฟล์ PNG ความละเอียดสูงเพื่อนำไปใช้ในสไลด์หรือรายงานได้

การตรวจสอบแผนภูมิการกระจายพร้อมเส้นแนวโน้มและข้อมูลที่ผิดปกติที่ใส่ป้ายกำกับแล้วใน Powerdrill Bloom

วิธีอ่านแผนภูมิการกระจาย

คู่มือของ NIST แสดงรูปแบบทั่วไปพร้อมตัวอย่างแผนภูมิ ซึ่งรูปแบบเหล่านี้คือสิ่งที่คุณจะได้พบเจอบ่อยที่สุด

รูปแบบ ลักษณะที่ปรากฏ สิ่งที่บ่งชี้
ไม่มีความสัมพันธ์กัน กลุ่มจุดที่ไม่มีรูปทรงแน่นอน ไม่สามารถคาดการณ์ค่า Y จาก X ได้
ความสัมพันธ์เชิงบวกที่แข็งแกร่ง จุดข้อมูลอยู่ใกล้กับเส้นที่ลาดเอียงขึ้น ค่า X ที่มากขึ้นจะมาคู่กับค่า Y ที่มากขึ้น
ความสัมพันธ์เชิงลบที่แข็งแกร่ง จุดข้อมูลอยู่ใกล้กับเส้นที่ลาดเอียงลง ค่า X ที่มากขึ้นจะมาคู่กับค่า Y ที่น้อยลง
โค้งมน จุดข้อมูลเรียงตัวตามแนวโค้ง เส้นแนวโน้มเชิงเส้นตรงจะทำให้เข้าใจผิด
การกระจายตัวที่กว้างขึ้น กลุ่มจุดกระจายตัวออกเป็นรูปพัดเมื่อ X เพิ่มขึ้น ความแปรปรวนของ Y ขึ้นอยู่กับ X
ข้อมูลที่ผิดปกติ (Outlier) มีจุดข้อมูลหนึ่งจุดอยู่ห่างจากจุดอื่นๆ มาก ให้ตรวจสอบแถวข้อมูลนั้นก่อนที่จะสรุปผล

สำหรับกรณีที่ไม่มีความสัมพันธ์กัน NIST อธิบายว่าค่าของ Y จะ "กระจายไปทั่วทุกทิศทุกทาง" สำหรับค่า X ที่กำหนด ส่วนความสัมพันธ์เชิงบวกที่แข็งแกร่งนั้น "เส้นตรงสามารถลากผ่านข้อมูลได้อย่างลงตัวพอดี" และ "การกระจายตัวรอบเส้นนั้นมีน้อยมาก"

รูปแบบการกระจายตัวที่กว้างขึ้นนี้มีชื่อเรียกทางเทคนิค โดย NIST เรียกว่า heteroscedasticity ซึ่งหมายถึง "ความแปรปรวนที่ไม่คงที่ของ Y ตลอดช่วงค่าของ X" เรื่องนี้มีความสำคัญเนื่องจากเส้นแนวโน้มแบบง่ายจะสมมติว่าการกระจายตัวนั้นมีความสม่ำเสมอกันโดยประมาณ

หากต้องการระบุความแข็งแกร่งของความสัมพันธ์เชิงเส้นตรงเป็นตัวเลข ให้ใช้ ค่าสัมประสิทธิ์สหสัมพันธ์ ค่าที่ใกล้เคียง 1 หรือ -1 หมายถึงความสัมพันธ์เชิงเส้นที่แข็งแกร่ง ค่าที่ใกล้เคียง 0 หมายถึงมีความสัมพันธ์เชิงเส้นน้อยมาก แม้ว่าอาจจะยังมีความสัมพันธ์ในลักษณะเส้นโค้งอยู่ก็ตาม

สหสัมพันธ์ไม่ได้หมายถึงการเป็นเหตุเป็นผลกัน

A scatter plot shows association. It does not show cause.

คู่มือของ NIST กล่าวถึงเรื่องนี้อย่างตรงไปตรงมาว่า "แผนภูมิการกระจายเผยให้เห็นความเกี่ยวข้องกัน ซึ่งเป็นขั้นตอนแรกไปสู่การพิสูจน์ความเป็นเหตุเป็นผล" และเสริมว่า "แม้ว่าความเป็นเหตุเป็นผลจะบ่งชี้ถึงความเกี่ยวข้องกัน แต่ความเกี่ยวข้องกันไม่ได้บ่งชี้ถึงความเป็นเหตุเป็นผลเสมอไป"

ในทางปฏิบัติ ให้มองหาตัวแปรที่สามก่อนที่คุณจะอ้างความเป็นเหตุเป็นผล ยอดขายไอศกรีมและอาการผิวไหม้จากแดดต่างก็เพิ่มขึ้นในฤดูร้อน แต่สิ่งหนึ่งไม่ได้เป็นสาเหตุของอีกสิ่งหนึ่ง เมื่อแผนภูมิการกระจายแสดงรูปแบบที่แข็งแกร่ง ให้ตั้งคำถามว่ามีอะไรอีกบ้างที่เปลี่ยนแปลงไปพร้อมกับ X

หากคุณต้องการสร้างแบบจำลองความสัมพันธ์ ขั้นตอนต่อไปคือ การวิเคราะห์การถดถอย (regression analysis) ซึ่งจะประมาณการว่าค่า Y เปลี่ยนแปลงไปเท่าใดต่อหนึ่งหน่วยของ X

ตัวอย่างการใช้งานจริง

นี่คือตัวอย่างประกอบเพื่อความเข้าใจโดยใช้ตัวเลขสมมติ ทีมจัดส่งได้บันทึกข้อมูลคำสั่งซื้อ 30 รายการ โดยมีระยะทางเป็นกิโลเมตรและเวลาจัดส่งเป็นนาที

แผนภูมิแสดงรูปแบบแนวโน้มขาขึ้นอย่างชัดเจน การเดินทางระยะสั้น 2 ถึง 5 กม. ใช้เวลา 15 ถึง 25 นาที การเดินทางระยะไกล 20 ถึง 25 กม. ใช้เวลา 55 ถึง 70 นาที เส้นแนวโน้มลาดเอียงขึ้นอย่างสม่ำเสมอ และมีค่าสัมประสิทธิ์สหสัมพันธ์เท่ากับ 0.91

มีจุดข้อมูล 3 จุดที่อยู่สูงกว่าเส้นแนวโน้มอย่างเห็นได้ชัด โดยแต่ละจุดเป็นคำสั่งซื้อระยะทาง 6 ถึง 8 กม. แต่ใช้เวลามากกว่า 60 นาที การใส่ป้ายกำกับจุดเหล่านี้แสดงให้เห็นว่าทั้งสามเหตุการณ์เกิดขึ้นในบ่ายวันเดียวกัน ซึ่งเป็นช่วงที่มีการปิดถนน

เมื่อมีการระบุคำสั่งซื้อทั้งสามรายการนั้นแล้ว ข้อสรุปก็ง่ายขึ้นมาก ระยะทางสามารถอธิบายความแปรปรวนส่วนใหญ่ของเวลาจัดส่งได้ และข้อมูลที่ผิดปกติก็มีสาเหตุที่แน่ชัด ทีมงานจึงสามารถวางแผนเส้นทางตามระยะทาง และจัดการเรื่องการปิดถนนเป็นความเสี่ยงแยกต่างหากได้

นี่คือประเภทของบทสรุปที่แผนภูมินี้สามารถแสดงผลได้ดีเยี่ยม แผนภูมิหนึ่งรูป ประโยคหนึ่งประโยค และรายการข้อยกเว้นสั้นๆ

รูปแบบที่หลากหลายและการจัดรูปแบบที่ช่วยรักษาความถูกต้องของข้อมูล

รูปแบบที่หลากหลายสองแบบนี้จะช่วยได้เมื่อคุณมีตัวแปรมากกว่าสองตัว ซึ่งคู่มือของ NIST ได้อธิบายไว้ทั้งสองแบบ

เมทริกซ์แผนภูมิการกระจาย (scatterplot matrix) "จะสร้างแผนภูมิการกระจายของทุกคู่ตัวแปรไว้ในหน้าเดียว" ซึ่งเป็นวิธีที่รวดเร็วในการสแกนข้อมูลทุกคู่ในชุดข้อมูลก่อนที่จะเลือกคู่ที่ต้องการศึกษา

แผนภูมิแบบมีเงื่อนไข (conditioning plot) "หรือที่เรียกว่า co-plot หรือ subset plot" จะแสดงค่า Y เทียบกับ X ณ ค่าต่างๆ ของตัวแปรที่สาม ซึ่งจะช่วยตอบคำถาม เช่น ความสัมพันธ์ระหว่างระยะทางและเวลายังคงเหมือนเดิมทั้งในวันธรรมดาและวันหยุดสุดสัปดาห์หรือไม่

การจัดรูปแบบก็มีความสำคัญเช่นกัน NIST ระบุว่ารูปแบบที่ได้รับความนิยมมากที่สุดคือการใช้เครื่องหมายที่จุดข้อมูลแต่ละจุด "และไม่มีเส้นเชื่อมต่อระหว่างจุดข้อมูล" เนื่องจากเส้นเชื่อมโยงระหว่างจุดอาจบ่งบอกถึงลำดับขั้นตอนที่ข้อมูลจริงไม่ได้มีอยู่

แนวทางปฏิบัติอีก 3 ประการที่ช่วยให้แผนภูมิอ่านง่ายขึ้น ได้แก่

  • ใส่ป้ายกำกับทั้งสองแกนด้วยชื่อตัวแปรและหน่วยวัด
  • เริ่มต้นแกนด้วยค่าที่เหมาะสม และระบุให้ชัดเจนหากแกนไม่ได้เริ่มต้นที่ศูนย์
  • ใช้สีหนึ่งสำหรับจุดข้อมูล และใช้สีที่ตัดกันสำหรับเส้นแนวโน้ม

ข้อผิดพลาดที่พบบ่อย

ต่อไปนี้คือข้อผิดพลาดที่มักจะทำให้แผนภูมิสื่อความหมายผิดเพี้ยนไป

  • การใช้แผนภูมิเส้นสำหรับค่า X ที่เป็นตัวเลข คำแนะนำของ Microsoft ระบุไว้อย่างชัดเจนว่าค่า X ที่เป็นตัวเลขควรใช้กับแผนภูมิการกระจาย
  • การสลับแกนข้อมูล ให้วางตัวแปรต้น (ตัวขับเคลื่อน) ไว้บนแกนนอน และวางตัวแปรตาม (ผลลัพธ์) ไว้บนแกนตั้ง
  • การบังคับใช้เส้นแนวโน้มแบบเส้นตรงกับข้อมูลที่เป็นเส้นโค้ง ให้พิจารณารูปร่างของข้อมูลก่อน แล้วจึงเลือกเส้นแนวโน้มที่เหมาะสม
  • การลบข้อมูลที่ผิดปกติออกโดยไม่ได้ตรวจสอบ ข้อมูลที่ผิดปกติอาจเป็นข้อผิดพลาดหรืออาจเป็นจุดข้อมูลที่สำคัญที่สุดในแผนภูมิก็เป็นได้
  • การอ้างความเป็นเหตุเป็นผลจากค่าสหสัมพันธ์ รูปแบบความสัมพันธ์ที่แข็งแกร่งเป็นเหตุผลให้ต้องศึกษาเพิ่มเติม ไม่ใช่การด่วนสรุปผล
  • การพล็อตจุดข้อมูลน้อยเกินไป รูปแบบที่เห็นจากจุดข้อมูล 8 จุดอาจหายไปเมื่อมีจุดข้อมูลเพิ่มเป็น 80 จุด

เมื่อคุณต้องการทดสอบตัวแปรหลายๆ คู่จากไฟล์เดียวกัน คุณสามารถ ลองใช้ Powerdrill Bloom ซึ่งจะช่วยสร้างแผนภูมิแต่ละรูปพร้อมเส้นแนวโน้มและระบุข้อมูลที่ผิดปกติให้โดยอัตโนมัติ

คำถามที่พบบ่อย

แผนภูมิการกระจายใช้ทำอะไร?

แผนภูมิการกระจายใช้เพื่อดูว่าตัวแปรเชิงตัวเลขสองตัวมีความสัมพันธ์กันหรือไม่ โดยแต่ละจุดคือหนึ่งข้อมูลสังเกตการณ์ที่มีค่าหนึ่งค่าบนแต่ละแกน คู่มือของ NIST ระบุว่าแผนภูมินี้สามารถตอบคำถามได้ว่าตัวแปรมีความสัมพันธ์กันหรือไม่ ความสัมพันธ์นั้นเป็นเชิงเส้นหรือไม่ ความแปรปรวนเปลี่ยนแปลงไปตาม X หรือไม่ และมีข้อมูลที่ผิดปกติหรือไม่

วิธีสร้างแผนภูมิการกระจายใน Excel ทำอย่างไร?

ใส่ค่า X ในคอลัมน์ซ้ายและค่า Y ในคอลัมน์ขวา จากนั้นเลือกทั้งสองคอลัมน์ ในแท็บ แทรก (Insert) ให้เปิดเมนู แทรกแผนภูมิแบบกระจาย (X, Y) หรือแผนภูมิฟองสบู่ (Insert Scatter (X, Y) or Bubble Chart) แล้วเลือก แบบกระจาย (Scatter) เพิ่มเส้นแนวโน้มจาก องค์ประกอบแผนภูมิ (Chart Elements) และใช้ฟังก์ชัน CORREL สำหรับหาค่าสัมประสิทธิ์สหสัมพันธ์

แผนภูมิการกระจายและแผนภูมิเส้นแตกต่างกันอย่างไร?

แผนภูมิการกระจายมีแกนค่าสองแกน ดังนั้นจุดข้อมูลจึงสามารถอยู่ตรงไหนก็ได้บนแกนนอน ส่วนแผนภูมิเส้นจะมีแกนหมวดหมู่ที่มีจุดข้อมูลห่างเท่าๆ กัน ซึ่งเหมาะสำหรับข้อมูลอนุกรมเวลา Microsoft แนะนำให้ใช้แผนภูมิการกระจายสำหรับค่า X ที่เป็นตัวเลข และใช้แผนภูมิเส้นสำหรับค่าที่ไม่ใช่ตัวเลข

วิธีอ่านแผนภูมิการกระจายทำอย่างไร?

ให้พิจารณาทิศทาง รูปร่าง และการกระจายตัว จุดข้อมูลที่ลาดเอียงขึ้นพร้อมกันแสดงถึงความสัมพันธ์เชิงบวก และจุดข้อมูลที่ลาดเอียงลงแสดงถึงความสัมพันธ์เชิงลบ กลุ่มจุดที่ไม่มีรูปทรงแน่นอนแสดงว่าไม่มีความสัมพันธ์กัน และการกระจายตัวแบบพัดที่กว้างขึ้นแสดงว่าความแปรปรวนขึ้นอยู่กับ X ควรตรวจสอบข้อมูลที่ผิดปกติก่อนที่จะสรุปผล

AI สามารถสร้างแผนภูมิการกระจายจากสเปรดชีตได้หรือไม่?

ได้ คุณสามารถอัปโหลดสเปรดชีตไปยังพื้นที่ทำงานของ AI ระบุชื่อคอลัมน์ทั้งสอง และขอให้สร้างแผนภูมิการกระจายพร้อมเส้นแนวโน้มและค่าสหสัมพันธ์ โดยเครื่องมือสร้างแผนภูมิการกระจาย (scatter graph creator) ของ Powerdrill Bloom รองรับไฟล์ CSV และ Excel และช่วยให้คุณดาวน์โหลดแผนภูมิเป็นไฟล์ PNG ได้

แหล่งที่มา: NIST/SEMATECH e-Handbook, Scatter Plot · NIST, Strong Linear Relationship · NIST, No Relationship · NIST, Heteroscedastic Variability · Microsoft Support, Present your data in a scatter chart or a line chart ข้อมูลคู่มือ ณ วันที่ 24 กันยายน 2026