Super Sale WeekClaude Skills — 20% OFF
News

GLM-5.3-Flash: Wat is er nieuw, hoe krijg je toegang, en gratis alternatieven (2026)

Powerdrill Bloom·
GLM-5.3-Flash: Wat is er nieuw, hoe krijg je toegang, en gratis alternatieven (2026)

Z.ai heeft op 25 augustus 2026 open weights voor GLM-5.3-Flash gepubliceerd, en de documentatie voor ontwikkelaars is voor het laatst bijgewerkt op 26 augustus.

Alles hieronder is afkomstig uit twee officiële bronnen. De ene is de modelkaart in de zai-org/GLM-5.3-Flash-repository. De andere is de Z.ai-documentatie voor ontwikkelaars. Beide zijn gelezen op 27 augustus 2026.

Wat GLM-5.3-Flash is

De modelkaart begint met een bewering die het waard is om letterlijk te citeren. Z.ai schrijft: "We introduceren GLM-5.3-Flash, het eerste native multimodale model in de GLM-5-serie."

Twee getallen bepalen de vorm. De kaart vermeldt "320 miljard totale parameters en slechts 18 miljard actieve parameters", wat duidt op een sparse mixture-ontwerp in plaats van een dense ontwerp.

De kaart doet één vergelijkende claim. Er staat dat het model "beter presteert dan GLM-5.2 op benchmarks en praktijkgerichte workloads tegen een tiende van de prijs." Het beschrijft het model ook als "Claude Opus 4.8 naderend op het gebied van coderings- en agentic-benchmarks."

De licentie is het belangrijkste onderdeel voor iedereen die het model wil draaien. De metadata van de repository vermeldt MIT, wat een van de meest permissieve licenties is die op grote schaal worden gebruikt.

De architectuurwijzigingen, in de woorden van de leverancier

Z.ai beschrijft drie specifieke wijzigingen in plaats van een algemene vernieuwing.

Een nieuw basismodel. De kaart vermeldt dat GLM-5.3-Flash "start vanuit een nieuw getraind basismodel, waarvan de architectuur en het trainingsrecept opnieuw zijn ontworpen met het oog op capaciteit en efficiëntie."

Hybride aandacht. Voor het eerst in deze serie combineert Z.ai "sparse en lineaire aandacht, wat de kosten voor het serveren van lange contexten drastisch verlaagt met behoud van nauwkeurige lange-contextmogelijkheden."

mHC. Het model maakt gebruik van wat de kaart "Manifold-Constrained Hyper-Connections (mHC)" noemt om de schaalbaarheidsefficiëntie verder te verbeteren.

Het trainingscorpus wordt ook genoemd. Z.ai schrijft de efficiëntiewinst toe aan "ons nieuwste multimodale pre-trainingscorpus van 30 biljoen tokens".

Waar de multimodale claim begint en ophoudt

De documentatie is specifiek over hoe afbeeldingen worden ingevoerd. De gids van Z.ai adviseert om "een inhoudsblok met type: image_url toe te voegen aan messages[].content[]", waarbij een afbeeldings-URL of een Base64-data-URL wordt doorgegeven.

Er wordt meer dan één afbeelding per verzoek ondersteund. Dezelfde pagina vermeldt dat er meerdere afbeeldingen kunnen worden toegevoegd door meerdere van dergelijke blokken op te nemen.

Context is het andere speerpunt. De documentatie vermeldt ondersteuning voor "een contextvenster van 1 miljoen tokens", en de voetnoten van de evaluatie ondersteunen dit door melding te maken van één benchmarkrun "onder 1 miljoen context".

Wat de modelkaart niet meet

Dit gedeelte is er omdat de ontbrekende informatie belangrijker is dan de hoogtepunten.

De modelkaart rapporteert een afbeeldingsbenchmark genaamd BabyVision. Ook de voorverwerking is gedocumenteerd. Afbeeldingen worden zo geschaald "dat hun kortere zijde ten minste 1,5K pixels is", zodat visuele vermogens daadwerkelijk worden gemeten.

Er wordt geen tabelbenchmark genoemd. Zoeken op de modelkaart naar table, spreadsheet, document en chart levert nul resultaten op. De evaluaties die wel worden genoemd, hebben in plaats daarvan betrekking op codering, agents, terminals en automatisering.

Die afwezigheid is geen bewijs van zwakte. Het betekent simpelweg dat niemand u kan beloven dat dit model uw spreadsheet-screenshots betrouwbaar leest, omdat de leverancier hier geen cijfers over heeft gepubliceerd.

Nog een omissie is het vermelden waard. Het enige tarief dat in de documentatie over prijzen wordt genoemd, is voorzien van een voorbehoud. Dat maakt het onveilig om als vast tarief te citeren, dus is het hier weggelaten.

Hoe u toegang krijgt

Er zijn twee routes, die geschikt zijn voor verschillende doelgroepen.

Route Wat u nodig heeft Waar het is gedocumenteerd
Gehoste API Een Z.ai API Platform-account De GLM-5.3-Flash-gids in de Z.ai-documentatie voor ontwikkelaars
Open weights Uw eigen GPU's en een van de vier serving-frameworks De modelkaart in de Hugging Face-repository

Voor de gehoste route vermeldt de documentatie dat GLM-5.3-Flash "nu volledig beschikbaar is in het GLM Coding Plan." Dezelfde regel schrijft dit toe aan native multimodale mogelijkheden en een drie keer zo hoog quotum.

Het is de moeite waard om de voetnoten van de evaluatie te lezen voordat u een workload plant. Ze noemen benchmarks voor codering, terminals, agents en automatisering, en elk daarvan vermeldt een eigen contextlengte en beoordelingsmodel. Dat laat zien waar de leverancier op heeft geoptimaliseerd.

Voor lokaal serveren noemt de kaart vier frameworks en linkt naar een recept voor elk: SGLang, vLLM, TokenSpeed en KTransformers. Het technische rapport achter de serie is te vinden op arXiv.

Gratis alternatieven als u open weights wilt

GLM-5.3-Flash is zelf gratis te downloaden onder de MIT-licentie. Als u een tweede optie wilt, is de vergelijking die er toe doet licentie plus modaliteit, niet de benchmarkpositie.

Qwen3.8 is de dichtstbijzijnde gepubliceerde gelijke. De Hugging Face-modelkaart vermeldt Apache-2.0 en accepteert tekst, afbeeldingen en video. Het vermeldt een native context van 262.144 tokens, uitbreidbaar tot één miljoen.

Onze Qwen3.8-bespreking behandelt die release op zijn eigen merites. Het naast elkaar lezen van de twee modelkaarten is de snelste manier om te zien welke aansluit bij uw hardware.

Het praktische verschil zit in wat u al draait. Beide modellen serveren via dezelfde open frameworks, so de overstapkosten bestaan meestal uit een configuratiewijziging in plaats van een herschrijving.

Een model is geen eindproduct

Weights en een API geven u een mogelijkheid. Ze geven u niet het rapport, de presentatie of de opgeschoonde spreadsheet waar iemand op zit te wachten.

De 'last mile' is eerder een workflow-vraagstuk dan een model-vraagstuk. Powerdrill Bloom neemt het bestand dat u al heeft en levert het gewenste resultaat.

De connectorpagina vermeldt de verwerking van Excel, TSV en CSV naast text-to-SQL. De afbeelding-naar-tekstpagina beschrijft het uploaden van JPG-, JPEG-, PNG-, WEBP- en GIF-bestanden. Vervolgens stelt u er vragen over in natuurlijke taal.

Let op de eerlijke grens op die tweede pagina. Die pagina beschrijft een samenvatting van de belangrijkste punten van een afbeelding, plus de vertaling van de gegenereerde tekst. Er staat niet dat er een gestructureerde tabel uit een foto kan worden gehaald, dus houd daar in uw planning geen rekening mee.

Abonnementen staan vermeld op de tarievenpagina, en het gratis niveau is voldoende om de vorm van de workflow te testen. Als u die 'last mile' wilt uitproberen op een echte export, start dan met Powerdrill Bloom.

Veelgestelde vragen

Is GLM-5.3-Flash gratis te gebruiken?

De weights vallen onder de MIT-licentie, dus het zelf downloaden en draaien ervan brengt geen licentiekosten met zich mee. De hostingkosten zijn voor uw eigen rekening, en de gehoste API is een afzonderlijk commercieel traject.

Kan GLM-5.3-Flash afbeeldingen lezen?

Ja. De documentatie voor ontwikkelaars beschrijft een image_url-inhoudsblok dat een URL of een Base64-data-URL accepteert, evenals meerdere afbeeldingen per verzoek.

Hoe groot is het contextvenster?

De documentatie vermeldt een contextvenster van 1 miljoen tokens. Eén gepubliceerde evaluatie werd uitgevoerd onder die volledige context.

Begrijpt GLM-5.3-Flash spreadsheets en documenten?

De modelkaart publiceert geen tabel- of documentbenchmark, dus er is geen cijfer van de leverancier om te citeren. Beschouw het lezen van spreadsheets als ongetest in plaats van als een vermelde functie.

Waar kan ik het op draaien?

De modelkaart noemt SGLang, vLLM, TokenSpeed en KTransformers, en linkt naar een handleiding of recept voor elk. De hardwarevereisten vloeien voort uit de documentatie van die frameworks en niet uit de kaart zelf.