Hoe maak je een correlatiematrix met AI: 5 eenvoudige controles in 2026

Een correlatiematrix zet elke numerieke kolom af tegen elke andere kolom en rapporteert hoe nauw elk paar samenhangt. Deze gids legt uit wat de matrix is en hoe u er handmatig een opbouwt. Vervolgens worden drie stappen beschreven om deze te genereren op basis van een export. Tot slot volgen de vijf controles die een nuttige matrix onderscheiden van een raster met misleidende getallen.
Wat een correlatiematrix u vertelt
De documentatie van Microsoft voor de Analysis ToolPak definieert het object goed. De tool Correlatie "levert een uitvoertabel, een correlatiematrix." Die tabel "toont de waarde van CORREL (of PEARSON) toegepast op elk mogelijk paar meetvariabelen."
Er staat ook in wanneer u er een nodig heeft. De tool "is vooral nuttig wanneer er meer dan twee meetvariabelen zijn voor elk van de N subjecten." Met twee kolommen berekent u gewoon één getal. Met twaalf wilt u het raster.
De coëfficiënt zelf wordt eenvoudig beschreven. Het is "a maatstaf voor de mate waarin twee meetvariabelen 'samen variëren'." De nuttige eigenschap is schaling. In tegenstelling tot covariantie "is deze zo geschaald dat de waarde onafhankelijk is van de eenheden" waarin de variabelen zijn uitgedrukt.
Dat is waarom de matrix leesbaar is. Omzet in dollars en bezoeken in aantallen leveren een coëfficiënt op dezelfde schaal op, waardoor de cellen met elkaar vergeleken kunnen worden.
Het lezen van de waarden is ook gedocumenteerd. Een coëfficiënt "dichter bij +1 of -1" duidt op een "positieve (+1) of negatieve (-1) correlatie tussen de matrices." Een coëfficiënt "dichter bij 0 duidt op geen of een zwakke correlatie." Voor de versie met één paar van dit concept behandelt de uitleg over de correlatiecoëfficiënt de definitie op zich.
Wat u nodig heeft voordat u begint
- Een export met één rij per subject: een klant, een winkel, een week, een campagne.
- Ten minste drie numerieke kolommen. Daaronder is een matrix meer werk dan het waard is.
- Een duidelijk beeld van wat een "subject" is. Rijen moeten van hetzelfde type zijn, anders betekenen de coëfficiënten niets.
- Een overzicht van welke kolommen van elkaar zijn afgeleid. Omzet en omzet-per-bestelling zullen door hun opbouw sowieso correleren.
- Een besluit over hoe om te gaan met lege cellen, genomen voordat u iets uitvoert.
Dat laatste punt verandert het antwoord, niet alleen de presentatie. Dit is het onderwerp van Controle 2 hieronder.
Hoe u dit handmatig doet
Option 1: Gebruik de tool Correlatie van de Analysis ToolPak
Dit is de kortste route en deze levert direct de matrix op. Microsoft beschrijft de taak van de invoegtoepassing als het besparen van stappen. U "levert de gegevens en parameters voor elke analyse." De tool gebruikt vervolgens "macrofuncties om de resultaten te berekenen en weer te geven in een uitvoertabel."
Er zijn twee beperkingen die handig zijn om vooraf te weten. De uitvoer is een statisch blok getallen, dus deze wordt niet bijgewerkt wanneer de gegevens veranderen. En volgens de documentatie "kunnen de gegevensanalysefuncties op slechts één werkblad tegelijk worden gebruikt."
Option 2: Schrijf een raster van CORREL-formules
Zet uw kolomnamen aan de zijkant en bovenaan, en vul vervolgens elke cel met CORREL voor de twee bereiken.
Het voordeel is dat het opnieuw berekent. Het nadeel is de schaal. Een matrix met twaalf kolommen betekent 144 cellen met een mix van absolute en relatieve verwijzingen. Eén verkeerd gesleepte formule zet het verkeerde paar in de verkeerde cel, zonder dat er een foutmelding verschijnt.
Option 3: Bereken het buiten het spreadsheet
Elke statistische bibliotheek retourneert een correlatiematrix in één regel en gaat expliciet om met ontbrekende gegevens.
Dit is de meest betrouwbare route en de minst deelbare. De collega die wil weten waarom twee kolommen gecorreleerd zijn, kan uw script niet openen, en de matrix komt aan als een geplakte afbeelding.
Waar de handmatige route vertraagt
De berekening is direct klaar. Wat tijd kost, is alles eromheen.
De eerste kostenpost is de kolomselectie. Een ruwe export bevat ID-kolommen, datumkolommen die als getallen zijn opgeslagen en statusvlaggen die zijn gecodeerd als 0 en 1. Ze zijn allemaal numeriek, dus ze komen allemaal in de matrix terecht. Een correlatie tussen klant-ID en omzet is ruis die er toch uitziet als een gewone cel.
De second cost is reading it. A twelve-variable matrix has 66 distinct pairs above the diagonal. Scanning 66 numbers for the interesting ones is exactly the task people skip, which is why matrices get produced and then ignored.
De derde kostenpost is herhaling. Niemand maakt slechts één correlatiematrix. Men maakt er een per cohort, per regio of per kwartaal, en het kolomselectiewerk begint telkens opnieuw.
Hoe u een correlatiematrix maakt met Powerdrill Bloom
Step 1: Upload de export met één rij per subject
Sleep het bestand naar Powerdrill Bloom zonder vooraf kolommen te selecteren. Het gratis abonnement dekt uploads van Excel, CSV, PDF en documenten, dus de ruwe export kan zonder betaald abonnement worden ingevoerd.
Laat de ID- en datumkolommen staan. Het uitsluiten ervan is deel van de opdracht, en dit expliciet aangeven is betrouwbaarder dan kolommen verwijderen en vergeten welke u heeft weggehaald.
Step 2: Geef aan welke kolommen moeten worden opgenomen en hoe om te gaan met lege cellen
Formuleer dit in natuurlijke taal. Maak een lijst van de kolommen die echte metingen bevatten en noem de kolommen die moeten worden uitgesloten. Geef vervolgens aan of rijen met een ontbrekende waarde moeten worden weggelaten of paar voor paar moeten worden behandeld.
Geef ook aan welke kolommen van andere zijn afgeleid. Een matrix die een overduidelijke rekenkundige relatie als een ontdekking presenteert, verspilt direct de tijd van de lezer.
Step 3: Genereer de matrix als een tabel en een heatmap
Vraag om de uitvoer die u nodig heeft. Dat is de matrix als een tabel met coëfficiënten, plus een heatmap van hetzelfde raster. Voeg een korte lijst toe van de paren die de moeite waard zijn om te bekijken, inclusief hun steekproefomvang. De tarievenpagina beschrijft het verkrijgen van een onderbouwd antwoord met grafieken, tabellen en exports, en de pagina voor geavanceerde analyses vermeldt Heatmap onder de visualisaties.
Als de matrix wordt opgenomen in een schriftelijke analyse, breidt het Pro-abonnement dit uit naar uitgebreidere Office-documentuitvoer.
De 5 controles die elke correlatiematrix moet doorstaan
Check 1: Hebben de gepaarde kolommen dezelfde lengte?
Dit is de meest voorkomende oorzaak van een defecte cel. De documentatie van Microsoft voor de functie is specifiek: "als matrix1 en matrix2 een verschillend aantal gegevenspunten hebben, retourneert CORREL de foutwaarde #N/B."
In een handmatig gebouwd raster gebeurt dit wanneer het ene bereik één rij verder is gesleept dan het andere. De oplossing is eenvoudig; het opmerken ervan is het moeilijke deel, omdat een enkele #N/B in een raster van 144 cellen gemakkelijk over het hoofd wordt gezien.
Check 2: Verdwijnen lege cellen en tekst zoals u denkt?
Twee gedocumenteerde gedragingen trekken hier in verschillende richtingen, en het kennen van beide voorkomt een echte fout.
De functie laat niet-getallen per paar vallen. Volgens Microsoft worden "tekst, logische waarden of lege cellen" in een argument genegeerd. Maar "cellen met nulwaarden worden wel opgenomen." Een lege cel wordt overgeslagen; een nul telt mee.
De tool Correlatie van de ToolPak is strenger. De documentatie ervan stelt dat "elke ontbrekende waarneming voor een subject ertoe leidt dat dit subject in de analyse wordt genegeerd." Eén lege cel verwijdert de hele rij uit elk paar in de matrix.
Dezelfde gegevens kunnen dus twee verschillende matrices opleveren, afhankelijk van de route die u heeft gekozen. Als een kolom veel lege cellen bevat, kan de ToolPak-route het raster stilletjes berekenen op basis van een veel kleinere steekproef.
Check 3: Is er een kolom constant?
Een kolom met dezelfde waarde in elke rij heeft geen variatie om te correleren. Het gedocumenteerde resultaat is een foutmelding. Als "s (de standaarddeviatie) van hun waarden gelijk is aan nul", dan "retourneert CORREL de foutwaarde #DEEL/0!."
Dit komt vaker voor dan verwacht. Een vlag die altijd waar was in de periode die u heeft geëxporteerd, of een tarief dat niet is gewijzigd, gedragen zich beide op deze manier.
Check 4: Heeft u naar de vorm gekeken, en niet alleen naar het getal?
De coëfficiënt meet hoe consistent twee kolommen samen bewegen in een rechte lijn. Een relatie die stijgt en vervolgens daalt, kan dicht bij nul liggen, terwijl deze in een grafiek sterk en overduidelijk is.
Een cel die bijna nul is, is dus geen bewijs van onafhankelijkheid. Het is een uitspraak over een rechtlijnig verband. Breng de twee of drie paren die voor u belangrijk zijn in kaart voordat u conclusies trekt, en controleer of een handvol extreme rijen een coëfficiënt omhoog trekt. De gids voor uitbijters behandelt die stap.
Check 5: Houdt u rekening met het aantal paren dat u heeft bekeken?
Een matrix met tien kolommen bevat 45 verschillende paren. Een matrix met twaalf kolommen bevat er 66. Als u genoeg paren scant, zullen er een paar zonder reden sterk lijken.
Twee gewoonten lossen dit op. Bepaal welke relaties u verwachtte voordat u het raster leest, en behandel de rest als kandidaten in plaats van als bevindingen. En noteer de steekproefomvang naast elke coëfficiënt die u wilt citeren, omdat statistische significantie daarvan afhangt.
Wat dit bespaart
| Taak | Handmatig | Vanuit de geüploade export |
|---|---|---|
| ID-, datum- en vlagkolommen uitsluiten | Handmatig, opnieuw gedaan per run | Eenmalig aangegeven in de aanvraag |
| Het raster bouwen | 144 formules of een statisch ToolPak-blok | Deel van de vraag die u stelde |
| Eén regel voor ontbrekende gegevens toepassen | Hangt af van de route die u heeft gebruikt | Expliciet aangegeven |
| Selecteren van paren die het lezen waard zijn | 45 tot 66 cellen op het oog scannen | Geretourneerd samen met de matrix |
| De versie voor het volgende kwartaal maken | Kolomselectie begint opnieuw | Zelfde aanvraag, nieuw bestand |
Best practices
Rapporteer de coëfficiënt met de bijbehorende steekproefomvang. Een cel met een waarde van 0,7 op basis van elf rijen is niet dezelfde claim als 0,7 op basis van elfduizend rijen.
Laat een van de kolommen weg bij paren die van elkaar zijn afgeleid. Afgeleide kolommen blazen de matrix op met relaties die u al kende.
Toon de matrix als een heatmap om te scannen en als een tabel om te citeren. De heatmap brengt het patroon in kaart; de tabel geeft het getal dat iemand in een document zal plakken.
Laat de matrix niet het model bepalen. Het selecteren van voorspellers op basis van de sterkste correlatie is hoe collineaire variabelen samen worden gekozen. Regressieanalyse is het juiste instrument voor die vraag.
Schrijf de uitsluitingslijst naast de matrix. De tweede vraag van de lezer is altijd welke kolommen zijn weggelaten.
Conclusie
Een correlatiematrix is goedkoop te berekenen en wordt snel overgeanalyseerd. Excel biedt beide routes aan, en de twee verschillen van mening over ontbrekende gegevens op een manier die wel is gedocumenteerd, maar zelden wordt opgemerkt.
De waarde zit in de Siliconen- en vijf controles en niet in het raster zelf. Paren van gelijke lengte, een vastgestelde regel voor lege cellen, geen constante kolommen, een blik op de werkelijke vorm en eerlijkheid over het aantal gescande paren.
Als u wel de export heeft, maar geen zin heeft in een raster van 144 cellen, probeer dan Powerdrill Bloom met het ruwe bestand. De route via de Excel AI-assistent is geschikt voor gegevens die al in een werkmap staan.
Veelgestelde vragen
Wat is een correlatiematrix?
Het is een tabel die de correlatiecoëfficiënt toont voor elk paar numerieke variabelen in een dataset. De documentatie van Microsoft beschrijft de uitvoer van de Analysis ToolPak als een correlatiematrix die CORREL of PEARSON toepast op elk mogelijk paar. Het is het meest nuttig zodra u meer dan twee meetvariabelen heeft.
Hoe maak ik een correlatiematrix in Excel?
Er zijn twee routes. De Analysis ToolPak heeft een tool Correlatie die de matrix in een uitvoertabel schrijft. Als alternatief bouwt u een raster van CORREL-formules, dat opnieuw berekent maar veel cellen en nauwkeurige verwijzingen vereist.
Hoe gaat Excel om met ontbrekende waarden in een correlatie?
Dat hangt af van de route die u gebruikt. De functie CORREL negeert tekst, logische waarden en lege cellen, maar neemt nullen wel mee. De tool Correlatie van de ToolPak sluit elk subject met een ontbrekende waarneming uit van de gehele analyse.
Wat geldt als een sterke correlatie?
De richtlijnen van Microsoft zijn eerder richtinggevend dan numeriek. Waarden dichter bij +1 of -1 duiden op een sterkere positieve of negatieve correlatie. Waarden dichter bij 0 duiden op geen of een zwakke correlatie. Elke vaste drempelwaarde hangt af van uw vakgebied en uw steekproefomvang.
Betekent een hoge correlatie dat de ene variabele de andere veroorzaakt?
Nee. De coëfficiënt beschrijft hoe consistent twee kolommen samen bewegen, en zegt niets over de richting of het mechanisme. Een derde factor die beide aanstuurt, of een kolom die van de andere is afgeleid, levert dezelfde waarde op.