Tutorials

Hoe werkt AI beeldgeneratie? de technologie simpel uitgelegd

Hoe werkt AI beeldgeneratie? de technologie simpel uitgelegd

De magie achter het beeld

Je typt een paar woorden, "een kat in een astronautenpak, olieverfschilderij", en binnen seconden verschijnt er een beeld dat er precies zo uitziet. Hoe kan een computer dat? Hoe gaat een stuk software van tekst naar een gedetailleerd beeld dat lijkt op iets wat een menselijke kunstenaar zou maken?

Als je ooit je eerste AI-afbeelding hebt gemaakt en je afvroeg wat er onder de motorkap gebeurt, dan is dit je artikel. We leggen de technologie uit zonder wiskundeformules, zonder jargon-overload, en met analogieën die gewoon kloppen.

Het grote plaatje: van tekst naar pixels

Voordat we inzoomen op de details, hier het overzicht van wat er gebeurt als je een prompt invoert:

Stapsgewijze visualisatie van het AI beeldgeneratieproces van tekst naar pixels

  1. Jouw tekst wordt vertaald naar een reeks getallen die de "betekenis" van je woorden vastleggen
  2. Het model begint met ruis, letterlijk een beeld van willekeurige pixels, zoals een televisie op een dood kanaal
  3. Stap voor stap wordt de ruis verfijnd in de richting van een beeld dat past bij jouw beschrijving
  4. Het eindresultaat wordt opgeschaald naar de uiteindelijke resolutie

Elke stap is een apart stuk technologie. Laten we ze één voor één doorlopen.

Stap 1: hoe een computer tekst "begrijpt" (CLIP)

Computers begrijpen geen woorden. Ze werken met getallen. Dus de eerste uitdaging: hoe vertaal je "een kat in een astronautenpak" naar iets waarmee een beeldmodel kan werken?

Hier komt CLIP in beeld, een model dat is ontwikkeld door OpenAI en beschreven in het CLIP onderzoekspaper. CLIP is getraind op honderden miljoenen paren van afbeeldingen en bijbehorende teksten van het internet. Door al die paren te analyseren, heeft CLIP geleerd welke woorden bij welke visuele concepten horen.

Hoe CLIP werkt

Stel je een enorme ruimte voor, niet een fysieke ruimte, maar een wiskundige. In die ruimte heeft elk concept een locatie. "Kat" zit dicht bij "kitten" en "huisdier", maar ver van "vrachtauto". Een foto van een kat en het woord "kat" bevinden zich op dezelfde plek in die ruimte.

CLIP bestaat uit twee onderdelen:

  • Een tekst-encoder: vertaalt woorden naar een positie in die ruimte
  • Een beeld-encoder: vertaalt een afbeelding naar een positie in diezelfde ruimte

Tijdens de training leert CLIP om afbeeldingen en hun bijbehorende beschrijvingen dicht bij elkaar te plaatsen, en niet-passende combinaties ver uit elkaar.

Simpel gezegd: CLIP is de tolk tussen jouw woorden en de beeldenwereld. Het vertaalt je prompt naar een soort coördinaat die zegt: "het eindresultaat moet hier in de buurt liggen."

Wanneer je een prompt intypt in Stable Diffusion of een vergelijkbaar model, zet CLIP die tekst om in een compact pakketje getallen, een embedding, dat de essentie van je beschrijving vastlegt. Dit pakketje stuurt vervolgens het hele beeldgeneratieproces aan.

Stap 2: de latent space, waar het echt gebeurt

Nu wordt het interessant. Je zou verwachten dat het model direct begint met het tekenen van pixels. Maar dat is niet wat er gebeurt. Moderne beeldgeneratoren werken in een latent space, een gecomprimeerde versie van de beeldwereld.

Waarom niet gewoon pixels?

Een afbeelding van 512 bij 512 pixels in kleur bevat bijna 800.000 datapunten. Dat is enorm veel informatie om mee te werken. Het is alsof je een boek wilt schrijven door elke individuele letter tegelijk te kiezen.

De oplossing: comprimeer het beeld eerst. Een speciaal netwerk (een variational autoencoder, of VAE) perst die 800.000 datapunten samen tot zo'n 4.000 getallen. Dat klinkt als een enorm verlies, maar die 4.000 getallen vangen verrassend goed de essentie van het beeld, de vormen, kleuren, compositie en sfeer.

De analogie

Denk aan latent space als een soort blauwdruk. Een architect tekent geen muur steen voor steen. Hij tekent een plattegrond die de essentie van het gebouw vastlegt. De stenen komen later, bij de bouw.

Op dezelfde manier werkt het AI-model niet in "pixel-space" maar in "latent space": een abstracte, gecomprimeerde wereld waar elke positie overeenkomt met een bepaald soort beeld. Pas aan het einde wordt de blauwdruk "gebouwd", omgezet naar echte pixels.

Key takeaway: latent space maakt het hele proces haalbaar. Zonder deze compressie zou het genereren van één beeld minuten tot uren duren in plaats van seconden.

Stap 3: diffusion, van ruis naar beeld

Dit is het hart van de technologie. Het proces heet "diffusion" en is voor het eerst beschreven in het baanbrekende paper Denoising Diffusion Probabilistic Models (DDPM). Het werkt, misschien verrassend, door achteruit te gaan.

Eerst vooruit: ruis toevoegen

Tijdens de training pakt het model een echte foto, bijvoorbeeld van een landschap. Vervolgens voegt het stap voor stap willekeurige ruis toe. Een beetje, dan nog wat meer, dan nog meer, totdat er van het originele beeld niets meer over is. Alleen ruis.

Stel je voor dat je een foto van een zonsondergang langzaam bedekt met steeds meer zandkorrels. Na één korrel zie je de foto nog prima. Na duizend korrels is het een zandhoop.

Dan achteruit: ruis verwijderen

Het model leert nu het omgekeerde: gegeven een ruisig beeld, voorspel welke ruis er is toegevoegd en verwijder die. Dit leerproces herhaalt zich miljoenen keren met miljoenen verschillende beelden.

Na de training kan het model iets opmerkelijks: het kan beginnen met pure ruis en daar stapsgewijs een coherent beeld uit construeren. Niet in één keer, maar in tientallen kleine stappen. Bij elke stap wordt het beeld een fractie duidelijker.

Waar komt je prompt in beeld?

Hier komt de CLIP-embedding terug. Bij elke denoising-stap "kijkt" het model naar jouw prompt-embedding en past het de ruisverwijdering aan zodat het resultaat steeds beter overeenkomt met je beschrijving. Het is alsof je iemand blinddoekt, ze een kleibeeld laat vormen, en bij elke stap fluistert: "meer naar links, iets ronder, voeg een staart toe."

Dit is waarom promptkeuze zo belangrijk is. Hoe specifieker en duidelijker je prompt, hoe preciezer de "fluisterinstructies" die het model bij elke stap ontvangt.

Stap 4: van latent space terug naar pixels

Na 20 tot 50 denoising-stappen heeft het model een helder resultaat in latent space. Maar dat is nog geen afbeelding die je kunt bekijken. Het is nog steeds die gecomprimeerde blauwdruk.

Voor en na: van pure ruis naar een afgewerkt AI-beeld in het diffusion-proces

De VAE-decoder, het tweede deel van de variational autoencoder, pakt die blauwdruk en bouwt er een volledige afbeelding van. Van 4.000 getallen terug naar 800.000 pixels, met alle details, texturen en kleurnuances.

Sommige modellen voegen hier nog een extra stap aan toe: upscaling. Een apart neuraal netwerk vergroot het beeld en voegt extra details toe, zodat je van 512x512 naar 1024x1024 of zelfs 2048x2048 kunt gaan. Midjourney v8.1 maakt dit overbodig voor veel gebruikers: het model genereert standaard 2K-beelden natively, zonder externe upscalestap.

De trainingsdata: waar komt de "kennis" vandaan?

Een diffusion model is zo goed als de data waarop het is getraind. En die datasets zijn gigantisch.

Hoe training werkt

Het model ziet tijdens de training honderden miljoenen combinaties van afbeeldingen en bijbehorende tekstbeschrijvingen. Het leert niet individuele beelden uit het hoofd, het leert patronen. Het leert dat een "zonsondergang" warme kleuren heeft, dat "portret" een gezicht op de voorgrond betekent, dat "aquarel" zachte randen en vloeiende overgangen impliceert.

Dit is een belangrijk punt: het model slaat geen beelden op. Het slaat patronen, relaties en waarschijnlijkheden op. Wanneer je vraagt om "een kat op de maan", combineert het geleerde patronen van katten, manen en de relatie daartussen tot iets nieuws.

De ethische kant

De trainingsdata is een bron van controverse. Veel datasets bevatten beelden van het internet, waaronder werk van kunstenaars die nooit toestemming hebben gegeven. De EU AI Act vereist vanaf 2026 dat AI-bedrijven transparant zijn over hun trainingsdata en opt-out-mogelijkheden bieden. Dit is een evoluerend onderwerp dat we behandelen in ons artikel over de geschiedenis van AI beeldgeneratie.

De kernvraag: als een model geleerd heeft van het werk van miljoenen kunstenaars, wie bezit dan het resultaat? Juridisch is het antwoord: niemand heeft automatisch auteursrecht. Ethisch is het antwoord complexer.

Waarom sommige prompts beter werken dan andere

Nu je begrijpt hoe het proces werkt, wordt ook duidelijk waarom sommige prompts betere resultaten opleveren.

Specificiteit helpt

"Een hond" geeft het model weinig sturing. Het kan elke kant op. "Een golden retriever die door een herfstbos rent, warm zonlicht, fotografisch, ondiepe scherptediepte" geeft bij elke denoising-stap veel preciezere instructies. Hoe specifieker je beschrijving, hoe minder het model hoeft te "gokken".

Stijltermen zijn krachtig

Termen als "olieverf", "digitale kunst", "fotorealistisch" of "anime" activeren hele clusters van patronen die het model tijdens de training heeft geleerd. Ze beïnvloeden niet alleen hoe het beeld eruitziet, maar ook de compositie, kleuren en texturen.

Negatieve prompts

Veel tools ondersteunen negatieve prompts: beschrijvingen van wat je niet wilt zien. "Geen tekst, geen watermerken, geen vervormde handen" geeft het model extra informatie bij de denoising-stappen, als het ware: "ga niet die richting op."

Wil je hier dieper op ingaan? Lees dan onze gids over prompt engineering voor AI-beelden.

De modellen vergeleken: wat maakt ze anders?

Stable Diffusion, GPT Image 2 en Midjourney v8.1 gebruiken allemaal verwante diffusion- of flow-architecturen als basis, maar de uitvoering verschilt sterk.

Voorbeeld van hoe dezelfde prompt verschillende resultaten geeft bij elke generatie

Stable Diffusion

  • Open source: je kunt het model downloaden en lokaal draaien
  • Enorme community die custom-modellen en fine-tunes maakt
  • Maximale controle, maar steilere leercurve
  • Trainingsdata: LAION-5B dataset (5 miljard beeld-tekst-paren)

GPT Image 2 (via ChatGPT)

  • In juni 2026 de meest gebruikte cloud-generator, verwerkt tekst in beelden met circa 95% nauwkeurigheid
  • Geïntegreerd in ChatGPT, dus je kunt in gewoon Nederlands een beeld vragen
  • Drie kwaliteitsniveaus (Low/Medium/High) en drie resoluties tot 1536x1024
  • Sterke veiligheidsfilters: weigert geweld, naaktheid en herkenbare personen
  • Gesloten systeem: je weet niet precies hoe het model is getraind

Midjourney v8.1

  • Gelanceerd op 30 april 2026 als het snelste Midjourney-model tot nu toe
  • Draait via een eigen webinterface (geen Discord meer verplicht)
  • HD Mode genereert native 2K-beelden, 3x sneller en 3x goedkoper dan de vorige upscaler
  • Betere promptvolgzaamheid en verbeterde coherentie voor texturen en details
  • Kost $10/maand (Basic) tot $120/maand (Mega)

FLUX.2

  • Van Black Forest Labs: 32 miljard parameters met een Rectified Flow Transformer-architectuur
  • Uitstekend in fotorealisme en letterweergave in beelden
  • Kontext Engine maakt natuurlijk-taalgebaseerde beeldbewerking mogelijk
  • Megapixel-gebaseerde prijsstelling via API: FLUX.2 Klein vanaf $0,014/MP, FLUX.2 Pro vanaf $0,03/MP

Nano Banana 2 (Google)

  • Gelanceerd in februari 2026, gebouwd op Gemini 3.1 Flash
  • Genereert tot 3840x2160 pixels in circa 3 seconden
  • Rendert tekst met hoge nauwkeurigheid en kan infographics en datavisualisaties maken
  • Gratis tier: 20 beelden per dag op 1K resolutie; betaalde abonnementen vanaf $7,99/maand

Nieuwere namen om te kennen

De markt groeit snel. Ideogram V3 blinkt uit in typografie en stijlvariatie. Recraft V4 is de enige generator die echte SVG-vectorbestanden uitvoert (direct bruikbaar in Illustrator of Figma). Seedream 5 van ByteDance richt zich op fysiek bewustzijn, ondersteunt tot 3K resolutie en tot veertien referentiebeelden tegelijk. De kernprincipes die je in dit artikel hebt geleerd, gelden voor al deze modellen.

Van theorie naar praktijk

Je hoeft dit allemaal niet te begrijpen om AI beeldgeneratie te gebruiken. Maar het helpt. Als je weet dat specificiteit in je prompt zich vertaalt naar preciezere sturing bij elke denoising-stap, ga je vanzelf betere prompts schrijven. Als je begrijpt wat latent space is, snap je waarom bepaalde combinaties wel en niet werken.

De technologie is complex, maar het principe is elegant: begin met ruis, en verfijn stap voor stap in de richting van wat je hebt beschreven. Alles wat je als gebruiker doet, je prompt kiezen, instellingen aanpassen, een stijl selecteren, beïnvloedt die verfijning.

Klaar om zelf aan de slag te gaan? Begin met onze beginnersgids voor AI afbeeldingen maken, of duik dieper in de geschiedenis van AI beeldgeneratie om te zien hoe we van vage blobs naar fotorealistische beelden zijn gekomen.

Bronnen

Key takeaway: achter elke AI-gegenereerde afbeelding zit een elegant proces van ruis verwijderen, gestuurd door jouw woorden. Het model droomt niet en het creëert niet bewust, het voert een wiskundig verfijningsproces uit dat toevallig verbluffend mooie resultaten oplevert.

Veelgestelde vragen

Kopiëren AI beeldgeneratoren bestaande afbeeldingen?

Nee, niet letterlijk. Het model slaat geen afbeeldingen op. Het leert patronen uit miljoenen trainingsbeelden, kleuren, vormen, texturen, composities, en combineert die tot iets nieuws. Vergelijk het met een kunstenaar die na jarenlang kijken naar kunst een eigen stijl ontwikkelt.

Waarom geeft dezelfde prompt verschillende resultaten?

Omdat het proces begint met willekeurige ruis (noise). Elke keer dat je een prompt invoert, start het model met een ander patroon van ruis, waardoor het eindresultaat verschilt. Je kunt dit controleren met een 'seed', een vast startgetal dat dezelfde ruis genereert.

Wat is het verschil tussen Stable Diffusion, GPT Image 2 en Midjourney?

Ze zijn alle drie gebaseerd op diffusion- of flow-architecturen, maar verschillen in training, interface en stijl. Stable Diffusion is open source en lokaal te draaien. GPT Image 2 (via ChatGPT) is geïntegreerd in een chatinterface en blinkt uit in tekstnauwkeurigheid. Midjourney v8.1 draait via een eigen webinterface en staat bekend om zijn artistieke, gedetailleerde stijl.

Heb ik een krachtige computer nodig?

Alleen als je Stable Diffusion lokaal wilt draaien, dan heb je een videokaart met minstens 8GB VRAM nodig. Cloud-gebaseerde tools als GPT Image 2, Midjourney v8.1 en Leonardo AI draaien volledig op servers van de aanbieder.

Wat is een diffusion model in één zin?

Een neuraal netwerk dat geleerd heeft om stap voor stap ruis te verwijderen uit een beeld, totdat er een herkenbare afbeelding overblijft die past bij jouw tekstbeschrijving.