XLSX-bestanden beheersen met AI: structuur, limieten en best practices

Een XLSX-bestand is geen spreadsheet. Het is een gezipt pakket van XML-documenten dat door een spreadsheettoepassing wordt gelezen. Dat ene feit verklaart het meeste vreemde gedrag waar mensen tegenaan lopen. Bestanden die enorm groot worden, formules die in een vreemde volgorde herberekenen en klein ogende werkmappen die er een eeuwigheid over doen om te openen.
Deze gids behandelt wat er in het formaat zit, de limieten die Microsoft publiceert en de gewoonten die ervoor zorgen dat een XLSX-bestand bruikbaar blijft voor anderen.
Wat een XLSX-bestand eigenlijk is
XLSX is het standaard Excel-formaat dat werd geïntroduceerd met de Office Open XML-standaard. Waar het oudere binaire formaat alles in één ondoorzichtige blob opsloeg, XLSX slaat gestructureerde XML-onderdelen op in een container.
Die verandering is de reden waarom moderne tools het formaat kunnen lezen zonder dat Excel is geïnstalleerd. Het is ook de reden waarom een XLSX-bestand kan worden geïnspecteerd, vergeleken en gerepareerd op manieren die bij zijn voorganger niet mogelijk waren.
Het praktische gevolg voor iedereen die met gegevens werkt: een XLSX-bestand bevat veel meer dan alleen waarden. Opmaak, formules, pivot-caches, voorwaardelijke regels en de berekeningsvolgorde reizen er allemaal in mee.
Binnenin het pakket
De SpreadsheetML-documentatie van Microsoft beschrijft het skelet nauwkeurig. De structuur "bestaat uit het element <workbook/> dat de elementen <sheets/> en <sheet/> bevat die verwijzen naar de werkbladen in de werkmap."
Dan volgt het detail dat de meeste mensen verrast. "Voor elk werkblad wordt een apart XML-bestand gemaakt." Een werkmap met tien tabbladen bestaat uit ten minste tien documenten plus een manifest, niet uit één bestand met tien secties.
Microsoft vermeldt deze als "de minimale elementen die vereist zijn voor een geldig spreadsheetdocument." Daarnaast kan een werkmap "<table/>, <chartsheet/>, <pivotTableDefinition/> of andere spreadsheetgerelateerde elementen bevatten."
Vier van die extra onderdelen verklaren het meeste gedrag van bestanden in de praktijk.
De gedeelde stringtabel. Microsoft beschrijft <sst/> as "een constructie die één exemplaar bevat van elke unieke tekenreeks die op alle werkbladen in een werkmap voorkomt." Tekst wordt eenmalig opgeslagen en overal naar verwezen, wat verklaart waarom een bestand met veel herhaling goed comprimeert.
De berekeningsketen. <calcChain/> "specificeert de volgorde waarin cellen in de werkmap voor het laatst zijn berekend." Het is een cache, en een beschadigde cache is een klassieke oorzaak van werkmappen die zich vreemd gedragen totdat dit onderdeel wordt verwijderd.
De pivot-cache. <pivotCacheDefinition/> definieert de bron van de gegevens van een PivotTable, terwijl <pivotCacheRecords/> "een cache van de brongegevens" bevat. Een PivotTable kan daarom een volledige kopie van zijn bronrijen in het bestand meedragen.
Tabellen en grafiekbladen. Een <table/> markeert een bereik als een enkele dataset, en een <chartsheet/> is een grafiek die als een eigen blad is opgeslagen.
Microsoft haalt ook de ECMA-376-standaard aan voor de ondergrens: de kleinst mogelijke lege werkmap heeft nog steeds een enkel blad, een blad-ID en een relatie nodig. Een XLSX-bestand met helemaal niets erin bestaat simpelweg niet.
XLSX versus CSV
Beide formaten bevatten tabelgegevens. Over al het andere verschillen ze van mening.
| XLSX | CSV | |
|---|---|---|
| Container | Gezipt pakket van XML-onderdelen | Eén plat tekstbestand |
| Meerdere bladen | Ja | Nee |
| Formules | Opgeslagen, met een berekeningsketen | Niet ondersteund |
| Opmaak en typen | Behouden | Niet behouden |
| Grafieken en PivotTables | Opgeslagen in het bestand | Niet ondersteund |
| Leesbaar zonder tools | Nee | Ja |
| Typische foutmodus | Overmatige omvang en verborgen status | Verloren typen en onduidelijkheid over scheidingstekens |
Geen van beide is in abstracte zin het betere formaat. CSV wint wanneer een machine aan de andere kant alleen rijen nodig heeft, wat in detail wordt behandeld in onze gids over het beheersen van CSV-bestanden.
XLSX wint wanneer een persoon aan de andere kant de structuur nodig heeft. De tabbladindeling, de getalnotaties en de kolom met opmerkingen die alleen logisch is naast de aangrenzende kolom.
De fout is om XLSX te gebruiken als transportformaat tussen systemen. Al die extra status moet door iets worden verwerkt, en het biedt geen enkel voordeel wanneer de bestemming een database is.
De limieten die Microsoft publiceert
De pagina met specificaties en limieten van Microsoft vermeldt de harde grenzen. Dit zijn de grenzen die er toe doen bij het verwerken van echte exports.
| Item | Gepubliceerde limiet |
|---|---|
| Rijen bij kolommen op een werkblad | 1,048,576 bij 16,384 |
| Tekens in een enkele cel | 32,767 |
| Bladen in een werkmap | Beperkt door beschikbaar geheugen |
| Lengte van formule-inhoud | 8,192 tekens |
| Kolombreedte | 255 tekens |
| Unieke items per PivotTable-veld | 1,048,576 |
| Rapportfilters in een PivotTable | 256 |
De bestandsgrootte verdient een eigen opmerking, want het antwoord is geen getal. Microsoft stelt dat de "64-bits omgeving geen harde limieten oplegt aan de bestandsgrootte." In plaats daarvan is "de grootte van de werkmap alleen beperkt door het beschikbare geheugen en de systeembronnen."
Er is een gerelateerd detail voor iedereen die nog steeds 32-bits Excel gebruikt. Vanaf Excel 2016 zegt Microsoft dat de Large Address Aware-functionaliteit "ervoor zorgt dat 32-bits Excel twee keer zoveel geheugen verbruikt" op een 64-bits Windows-besturingssysteem.
De gepubliceerde cijfers zijn van toepassing op Excel voor Microsoft 365, 2024, 2021, 2019 en 2016.
Wat die limieten in de praktijk betekenen
De maximale grens voor rijen wordt het meest geciteerd en is het minst belangrijk. Zeer weinig teams bereiken 1,048,576 rijen, en de teams die dat wel doen, zijn spreadsheets meestal om andere redenen al ontgroeid.
De limieten die echt problemen veroorzaken, zijn minder opvallend. Een cel die beperkt is tot 32,767 tekens kapt lange tekstvelden geruisloos af bij sommige importtrajecten. Een PivotTable die beperkt is tot 256 rapportfilters faalt pas nadat een rapport twee jaar lang is gegroeid.
Geheugen is de werkelijke beperking. Zowel het aantal bladen als de bestandsgrootte worden begrensd door het beschikbare geheugen in plaats van een vast getal. Hetzelfde XLSX-bestand kan daarom prima openen op de ene machine en vastlopen op de andere.
Drie dingen verhogen die geheugenkosten meer dan het aantal rijen: pivot-caches die een duplicaat van de brongegevens bevatten, opmaak die wordt toegepast op hele kolommen in plaats van op het gebruikte bereik, en formules die naar hele kolommen verwijzen.
Best practices voor XLSX-bestanden die andere mensen zullen openen
Houd één tabel per blad aan. Een blad met drie gestapelde tabellen is voor de meeste tools moeilijk te verwerken, en meestal moet een mens het eerst uitleggen.
Plaats koppen in een enkele bovenste rij. Samengevoegde koppen of koppen met twee niveaus verstoren bijna elke tool verderop in het proces, en ze zijn de meest voorkomende reden waarom een import onzin oplevert.
Formatteer het gebruikte bereik, niet hele kolommen. Kolom A selecteren om een opvulling toe te passen is de snelste manier om megabytes aan een bestand toe te voegen.
Verberg geen status in het bestand. Verborgen bladen, gefilterde weergaven en de handmatige berekeningsmodus reizen allemaal mee met de werkmap en verrassen de volgende persoon.
Stuur waarden als waarden het enige zijn wat nodig is. Als de ontvanger alleen getallen nodig heeft, lost exporteren naar CSV een hele categorie problemen op.
Geef dingen namen die begrijpelijk zijn voor buitenstaanders. Kolomnamen zijn de interface, en de snelste oplossing voor een verwarrende werkmap is meestal een korte verklarende lijst ernaast.
Waar XLSX niet langer de juiste container is
Een XLSX-bestand is een goed document en een matige database. Het is prima geschikt als werkversie voor één team, maar loopt vast zodra meerdere mensen het tegelijkertijd moeten aanpassen.
De signalen zijn consistent. Bestandsnamen krijgen versiesuffixen. Twee mensen noemen verschillende totalen. Iemand houdt een tabblad bij dat de andere tabbladen met elkaar in overeenstemming brengt.
Op dat moment is het bestand niet het probleem dat moet worden opgelost. Dat is de workflow eromheen, en het overstappen op een grotere spreadsheet stelt de afrekening alleen maar uit.
Werken met XLSX-bestanden zonder het handmatig te doen
Het meeste werk dat een XLSX-bestand oplevert, is geen analyse. Het is het openen, scannen, herformatteren en opnieuw opbouwen van dezelfde grafiek voor de derde maand op rij.
Powerdrill Bloom neemt dat deel voor zijn rekening. U uploadt de werkmap en beschrijft in natuurlijke taal wat u eruit wilt halen. Wat u terugkrijgt is een kant-en-klaar resultaat: een samenvatting, een grafiek, een presentatie of een Excel-analyse. Uploads voor Excel, CSV, PDF en documenten zijn opgenomen in het gratis abonnement, en Pro voegt daar slides, Office-documenten en Excel-analyses aan toe.
Onze pagina over de Excel AI-assistent behandelt de directe route, en de hub voor Excel AI-tools vermeldt de specifiekere taken. De pagina grafieken maken van Excel behandelt het maken van grafieken. Als draaitabellen het onderdeel zijn dat u liever overslaat, Excel-gegevens samenvatten zonder draaitabellen loodst u door het alternatief.
Het begrijpen van het formaat is wat u uit de problemen houdt. Het overdragen van het herhalende deel aan iets anders is wat u de middag oplevert. Probeer Powerdrill Bloom op de meest rommelige werkmap die u heeft.
Veelgestelde vragen
Waar staat XLSX voor?
Het is de bestandsextensie voor het Office Open XML-spreadsheetformaat. De laatste X weerspiegelt dat het pakket XML-onderdelen bevat in plaats van de oudere binaire indeling.
Hoeveel rijen kan een XLSX-bestand bevatten?
Microsoft publiceert een werkbladlimiet van 1,048,576 rijen bij 16,384 kolommen. Een werkmap kan meerdere bladen bevatten, begrensd door het beschikbare geheugen in plaats van een vast aantal.
Is er een maximale bestandsgrootte voor XLSX?
Geen vaste. Microsoft stelt dat een 64-bits omgeving geen harde limieten oplegt aan de bestandsgrootte. De grootte van de werkmap is alleen begrensd door het beschikbare geheugen en de systeembronnen.
Waarom is mijn XLSX-bestand zo groot?
De gebruikelijke oorzaken zijn opmaak die is toegepast op hele kolommen, pivot-caches die een tweede kopie van de bronrijen opslaan, en afbeeldingen. Het aantal rijen alleen verklaart het zelden.
Moet ik XLSX of CSV gebruiken om gegevens te delen?
Gebruik XLSX wanneer een persoon de structuur, formules of meerdere bladen nodig heeft. Gebruik CSV wanneer een systeem de rijen nodig heeft en al het andere overbodige ballast is.