Een revolutie in twaalf jaar tijd
Twaalf jaar. Meer heeft de wereld niet nodig gehad om van onscherpe, pixelige computerkunstjes te gaan naar fotorealistische beelden die je niet meer van echt kunt onderscheiden. De geschiedenis van AI beeldgeneratie leest als een techno-thriller: briljante doorbraken, felle concurrentiestrijd, ethische dilemma's en een complete transformatie van wat we als "creativiteit" beschouwen.
In dit artikel nemen we je mee langs elk keerpunt, van de allereerste GAN in een lab in Montreal tot de multimodale krachtpatsers van vandaag. Geen droge opsomming, maar het verhaal achter de technologie die de creatieve wereld op zijn kop zette.
Wil je eerst begrijpen hoe de technologie technisch werkt? Lees dan ons artikel over hoe AI beeldgeneratie werkt.
2014-2017: het GAN-tijdperk begint
2014, de vonk
Het verhaal begint in juni 2014 in een bar in Montreal. Ian Goodfellow, destijds PhD-student aan de Université de Montréal, krijgt tijdens een avond met collega's een idee: wat als je twee neurale netwerken tegen elkaar laat strijden? Het ene netwerk (de generator) maakt afbeeldingen, het andere (de discriminator) beoordeelt of ze echt of nep zijn. Door ze tegen elkaar te trainen, worden ze allebei beter.
"Het idee kwam bij me op tijdens een discussie in een bar. Ik ging naar huis, programmeerde het, en het werkte meteen de eerste keer." , Ian Goodfellow, over de uitvinding van de GAN
Het paper "Generative Adversarial Nets" verscheen in december 2014 op de NeurIPS-conferentie. De gegenereerde beelden waren nog onscherp en klein, we praten over 64x64 pixels, maar het principe was revolutionair. Voor het eerst kon een AI-systeem leren om zelf beelden te creëren, zonder dat een mens pixel voor pixel de regels moest voorschrijven.
2015-2017, snelle verbetering
De academische wereld stortte zich op GANs. Binnen drie jaar verschenen er honderden papers met varianten: DCGAN (2015) gebruikte convolutionele lagen voor scherpere beelden. Conditional GAN maakte het mogelijk om de output te sturen met labels ("maak een kat" in plaats van willekeurige beelden). En WGAN (2017) loste veel van de trainingsproblemen op die de oorspronkelijke GAN instabiel maakten.
De beelden werden groter en scherper, maar nog steeds kon je als mens vrij makkelijk zien dat iets "niet klopte". Vreemde artefacten, vervormde vingers, onlogische achtergronden, het was duidelijk dat we nog aan het begin stonden.
Tijdlijn 2014-2017:
- Juni 2014, Ian Goodfellow bedenkt de GAN
- December 2014, GAN-paper op NeurIPS
- 2015, DCGAN maakt GAN-training stabieler
- 2016, Conditional GANs; pix2pix (beeld-naar-beeld vertaling)
- 2017, WGAN en Progressive GAN verbeteren kwaliteit drastisch
2018-2020: de doorbraak naar realisme
2018, StyleGAN: gezichten die er echt uitzien
In december 2018 deed NVIDIA iets wat de wereld deed opschrikken. Onderzoekers Tero Karras, Samuli Laine en Timo Aila publiceerden StyleGAN, een GAN-architectuur die gezichten kon genereren die vrijwel niet van foto's te onderscheiden waren. De resolutie was 1024x1024 pixels, de details waren verbluffend: huidtextuur, haarlokken, belichting.
Kort daarna, in februari 2019, bouwde Uber-engineer Phillip Wang de website "This Person Does Not Exist". Bij elke refresh toonde de site een nieuw, compleet verzonnen gezicht. Het werd viraal en gaf miljoenen mensen voor het eerst een visceraal besef van wat AI kon.
Het was een wake-up call. Niet alleen voor het publiek, maar ook voor beleidsmakers. Als je niet meer kunt zien of een gezicht echt is, wat betekent dat dan voor identiteitsfraude, nepnieuws en privacy?
2019-2020, verfijning en controle
StyleGAN2 volgde in februari 2020 en loste de kenmerkende "waterdruppel-artefacten" van het eerste model op. Ondertussen verscheen StyleGAN3 in 2021 als "alias-free" versie.
Maar GANs hadden een fundamenteel probleem: ze waren geweldig in één specifiek domein (gezichten, slaapkamers, auto's) maar slecht in het genereren van willekeurige scènes op basis van tekst. Je kon geen prompt typen als "een astronaut op een paard" en verwachten dat er iets bruikbaars uitkwam.
Daar was een andere aanpak voor nodig.

Tijdlijn 2018-2020:
- December 2018, NVIDIA publiceert StyleGAN
- Februari 2019, "This Person Does Not Exist" gaat viraal
- Februari 2020, StyleGAN2 met verbeterde beeldkwaliteit
- 2020, OpenAI begint te experimenteren met CLIP (tekst+beeld)
2021: DALL-E en de tekst-naar-beeld-revolutie
In januari 2021 onthulde OpenAI DALL-E, vernoemd naar de kunstenaar Salvador Dalí en de Pixar-robot WALL-E. Het was het eerste model dat overtuigend beelden kon genereren op basis van tekstbeschrijvingen. "Een fauteuil in de vorm van een avocado"? Geen probleem.
DALL-E 1 gebruikte een aangepaste versie van GPT-3 met 12 miljard parameters. Het was traag, de resultaten waren niet altijd fotorealistisch, en het was niet publiek beschikbaar. Maar de implicaties waren enorm: voor het eerst kon je in gewone taal beschrijven wat je wilde zien, en een AI maakte het voor je.
De academische wereld realiseerde zich dat de combinatie van taalmodellen en beeldgeneratie de toekomst was. De race was begonnen.
2022: het jaar dat alles veranderde
Als er één jaar is dat de AI beeldgeneratie-revolutie echt begon, dan is het 2022. Drie ontwikkelingen vielen samen en creëerden een perfecte storm.
DALL-E 2 (april 2022)
OpenAI lanceerde DALL-E 2 in april 2022. De beeldkwaliteit was spectaculair vergeleken met de eerste versie, hogere resoluties, betere compositie, realistischere texturen. In september 2022 verdween de wachtlijst en kon iedereen het gebruiken.
Midjourney (juli 2022)
Terwijl OpenAI een bedrijf met miljarden aan funding was, begon Midjourney als een klein team onder leiding van David Holz (ex-NASA, ex-Leap Motion). De open bèta lanceerde in juli 2022 via Discord, een ongebruikelijk platform voor een AI-tool. Maar het werkte. De artistieke, dromerige stijl van Midjourney sloeg aan bij kunstenaars en ontwerpers. Binnen maanden had het miljoenen gebruikers.
Stable Diffusion (augustus 2022)
De echte gamechanger was Stable Diffusion, gelanceerd op 22 augustus 2022 door Stability AI in samenwerking met onderzoekers van de Ludwig Maximilian University of Munich. Het model was gebaseerd op het paper "High-Resolution Image Synthesis with Latent Diffusion Models" (Rombach et al., 2022). Het was het eerste hoogwaardige text-to-image model dat volledig open-source werd vrijgegeven.
Stable Diffusion deed voor AI beeldgeneratie wat Linux deed voor besturingssystemen: het gaf de macht aan de community.
Iedereen met een fatsoenlijke GPU kon het lokaal draaien. Geen abonnement, geen API-kosten, geen censuur. De community explodeerde. Binnen weken verschenen er interfaces als Automatic1111, aangepaste modellen, LoRA-finetunes en complete ecosystemen rondom het model.
Tijdlijn 2022:
- April 2022, DALL-E 2 lancering
- Juli 2022, Midjourney open bèta via Discord
- Augustus 2022, Stable Diffusion open-source release
- September 2022, DALL-E 2 beschikbaar zonder wachtlijst
- Najaar 2022, Explosie van community-modellen en tools
2023: verfijning en mainstream adoptie
DALL-E 3 (oktober 2023)
OpenAI bracht DALL-E 3 uit in oktober 2023, dit keer direct geïntegreerd in ChatGPT. De grote verbetering: het model begreep nu veel complexere prompts en kon tekst betrouwbaarder in beelden plaatsen. Door de integratie in ChatGPT werd AI beeldgeneratie toegankelijk voor honderden miljoenen mensen die nooit een aparte tool zouden installeren.
Stable Diffusion XL (juli 2023)
Stability AI lanceerde SDXL, dat met hogere resoluties en betere compositie de lat voor open-source beeldgeneratie weer hoger legde. De kwaliteitskloof met gesloten modellen werd kleiner.
Midjourney V5 en V6
Midjourney evolueerde snel door meerdere versies. V5 (maart 2023) leverde dramatisch betere fotorealisme, V6 (december 2023) voegde daar tekst-rendering en nog fijnere details aan toe.
Tijdlijn 2023:
- Maart 2023, Midjourney V5
- Juli 2023, Stable Diffusion XL
- Oktober 2023, DALL-E 3 in ChatGPT
- December 2023, Midjourney V6
2024: nieuwe spelers en nieuwe architecturen
Flux betreedt het toneel
In 2024 verscheen een opvallende nieuwkomer: Flux, ontwikkeld door Black Forest Labs, opgericht door dezelfde onderzoekers die achter Stable Diffusion zaten. Flux gebruikte een flow matching-architectuur in plaats van traditionele diffusion en leverde indrukwekkende fotorealistische resultaten. Het model werd geïntegreerd in Grok (het chatbot-platform van X) en Le Chat van Mistral AI.
Stable Diffusion 3 en 3.5
Stability AI lanceerde SD3 in juni 2024 en SD3.5 in oktober 2024. De 3.5-versie gebruikte een verbeterde transformer-architectuur met 8 miljard parameters en Query-Key Normalization voor stabielere training. Maar de relatie van Stability AI met de community was verslechterd door restrictievere licenties.
Het jaar van de transformer
2024 markeerde een architectonische verschuiving: Diffusion Transformers (DiTs), een hybride architectuur die diffusion-gebaseerde beeldsynthese combineerde met transformer-aandachtsmechanismen, werden de nieuwe standaard. Deze aanpak verbeterde zowel de kwaliteit als de generatiesnelheid.
Tijdlijn 2024:
- Februari 2024, Stability AI restructurering
- Juni 2024, Stable Diffusion 3 release
- Zomer 2024, Flux 1 lancering door Black Forest Labs
- Oktober 2024, Stable Diffusion 3.5
2025: AI leert echt "zien"
GPT-4o native beeldgeneratie verandert de spelregels (maart 2025)
Op 25 maart 2025 lanceerde OpenAI iets fundamenteel anders, zoals beschreven in hun research blog. In plaats van een apart beeldmodel aan te roepen (zoals DALL-E), kreeg GPT-4o native beeldgeneratie, het taalmodel zelf kon nu direct beelden produceren. Geen diffusion, maar een autoregressieve methode, vergelijkbaar met hoe het model tekst genereert.
De implicaties waren enorm:
- Tekst in beelden werkte eindelijk betrouwbaar
- Conversationele beeldbewerking: je kon iteratief aanpassingen doen via chat
- Context-bewust: het model onthield eerdere beelden en instructies
- Naadloze integratie: geen aparte tool meer, gewoon chatten
DALL-E 3 verloor zijn centrale rol. De technologie was opgegaan in het taalmodel zelf.
GPT-4o's beeldgeneratie voelde als het moment dat AI-beeldgeneratie ophield een apart vakgebied te zijn en gewoon een functie werd, net als spellingscontrole of automatisch aanvullen.
Midjourney V7 (april 2025)
Midjourney lanceerde V7 in alpha op 3 april 2025, met een aantal opmerkelijke vernieuwingen:
- Standaard personalisatie: het model leerde je stijlvoorkeuren
- Draft Mode: halve kosten, 10x snellere rendering
- Spraakbesturing: ideeën verbaal beschrijven en in real-time beelden zien ontstaan
- Videogeneratie: clips van 5-21 seconden (vanaf juni 2025)
Flux 2 (november 2025)
Black Forest Labs lanceerde Flux 2 op 25 november 2025, een sprong vooruit. Het model had 32 miljard parameters en koppelde een Mistral-3 24B vision-language model aan een rectified flow transformer. Resultaat: beelden tot 4 megapixel resolutie met realistische belichting en fysica. In januari 2026 volgde Flux 2 Klein, het snelste model uit de familie, en Flux 2 Pro voor maximale kwaliteit.
Google Nano Banana Pro (eind 2025)
Google lanceerde Nano Banana Pro (onderdeel van de Gemini 3-familie) in het laatste kwartaal van 2025. Het model combineerde Google's jarenlange zoekinfrastructuur met een nieuw multimodaal architectuur. In de LLM Arena image-ranglijst staat het model in mei 2026 op de eerste positie voor algehele kwaliteit en prompt-nauwkeurigheid.
Tijdlijn 2025:
- Maart 2025, GPT-4o native beeldgeneratie; DALL-E verliest centrale rol
- April 2025, Midjourney V7 alpha
- Juni 2025, Midjourney videogeneratie
- September 2025, Sora 2 (OpenAI videogeneratie)
- November 2025, Flux 2 lancering door Black Forest Labs
- December 2025, Google Nano Banana Pro; Kling 2.6 met simultane audio+video generatie
2026: waar we nu staan
Begin 2026 is AI beeldgeneratie geen niche meer, het is infrastructuur. De grootste namen in het veld hebben allemaal nieuwe versies uitgebracht die de lat opnieuw hoger leggen.
Midjourney V8 en V8.1
Midjourney V8 alpha verscheen op 17 maart 2026, gevolgd door V8.1 alpha op 14 april en de volledige V8.1-release op 30 april 2026. V8.1 brengt native 2K HD-output zonder upscaling, 3x snellere HD-rendering en een bijgewerkte "Run as HD"-knop waarmee je elk eerder gegenereerd beeld opnieuw kunt draaien in hogere resolutie. De esthetiek sluit aan bij V7, moodboards en stijlreferenties zijn stabiel, en het model accepteert nu ook afbeeldingen als invoerreferentie.
GPT Image 2 (april 2026)
Op 21 april 2026 lanceerde OpenAI GPT Image 2, dat op 12 mei 2026 DALL-E 3 officieel verving. Het model introduceert een "Thinking Mode" waarbij de AI eerst plant wat het gaat genereren, wat resulteert in foutloze typografie, consistente karakters door een complete beeldenserie heen en tekst-nauwkeurigheid boven de 99%, inclusief CJK-schriften en mixed fonts. Voor marketeers en content creators is dit een fundamentele upgrade.
FLUX.2 (2026)
Black Forest Labs bouwt verder op het Flux 2-fundament met FLUX.2-varianten die gericht zijn op specifieke use cases: maximale kwaliteit (Pro), maximale snelheid (Klein) en een middenweg die kostenefficiënt werkt voor batch-generatie. FLUX.2 is daarmee een directe concurrent van de proprietary modellen geworden, maar dan met transparante API-pricing.
Nano Banana 2 (Google)
De opvolger van Nano Banana Pro staat op de LLM Arena-ranglijst bovenaan voor totale beeldkwaliteit. Google positioneert het model als de beste gratis optie via Google AI Studio en Gemini, wat het bereik enorm vergroot.
Tijdlijn 2026 (tot nu):
- Januari 2026, Flux 2 Klein en Flux 2 Pro; 4K standaard bij topmodellen
- Maart 2026, Midjourney V8 alpha (17 maart)
- 14 april 2026, Midjourney V8.1 alpha
- 21 april 2026, GPT Image 2 lancering
- 30 april 2026, Midjourney V8.1 volledige release
- 12 mei 2026, DALL-E 3 officieel met pensioen; GPT Image 2 enige standaard
Vergelijking actuele topmodellen (juni 2026):
| Model | Sterk in | Beste voor |
|---|---|---|
| GPT Image 2 | Tekst-in-beeld, conversationeel | Marketing, social media, iteratief werken |
| Midjourney V8.1 | Artistieke stijl, 2K HD | Creatieve en artistieke beelden |
| FLUX.2 Pro | Fotorealisme, lage kosten via API | Fotorealistisch, batch-generatie |
| Nano Banana 2 | Totale kwaliteit, gratis beschikbaar | Algemeen gebruik, gratis tier |
| Ideogram 3.0 | Typografie, logo's | Grafisch ontwerp |
Benieuwd waar dit naartoe gaat? Lees ons artikel over de toekomst van AI beeldgeneratie.
De opkomst van video en multimodaal
Een trend die we niet kunnen negeren: de grens tussen beeld en video vervaagt razendsnel. Wat begon als stilstaande beelden is uitgegroeid tot een volledig multimodaal ecosysteem:
- OpenAI Sora 2 genereert video's tot 25 seconden met gesynchroniseerd geluid
- Google Veo 3.1 levert bioscoopachtige video's met native audio
- Kling 2.6 produceert video's tot twee minuten op 1080p met spraak, geluidseffecten en achtergrondgeluid in één keer
De technologie die ooit alleen stilstaande beelden kon maken, genereert nu complete audiovisuele ervaringen. En dat in minder dan drie jaar na de eerste diffusion-modellen.
Wat deze geschiedenis ons leert
Als je de tijdlijn overziet, vallen een paar patronen op:
De versnelling is exponentieel. Van GAN tot het eerste bruikbare text-to-image model duurde zeven jaar (2014-2021). Van DALL-E 1 tot de huidige generatie? Vijf jaar. En elk jaar bracht meer vooruitgang dan het vorige.
Open-source versnelt alles. Stable Diffusion bewees dat openheid innovatie in een stroomversnelling brengt. De community bouwde in maanden wat bedrijven in jaren niet konden. Flux zet die traditie voort.
De architectuur verschuift constant. GANs domineerden tot 2021, diffusion-modellen van 2022-2024, en nu zien we autoregressieve methoden (GPT Image 2) en flow matching (Flux) de boventoon voeren. Wie vandaag de beste architectuur heeft, is dat morgen niet per se meer.
Toegankelijkheid wint. Niet het technisch beste model wint, maar het meest toegankelijke. GPT Image 2's integratie in ChatGPT bereikte meer mensen dan elk gespecialiseerd model ooit kon. Nano Banana 2 verlaagt de drempel verder via een gratis tier.
Bronnen
- Goodfellow, I. et al. (2014), Generative Adversarial Nets, arxiv.org/abs/1406.2661, het oorspronkelijke GAN-paper dat het vakgebied startte
- Rombach, R. et al. (2022), High-Resolution Image Synthesis with Latent Diffusion Models, arxiv.org/abs/2112.10752, het paper achter Stable Diffusion en latent diffusion
- OpenAI Research Blog, openai.com/research, officiële publicaties over GPT-4o beeldgeneratie, GPT Image 2 en aanverwante technologieën
- Midjourney Updates, updates.midjourney.com, officiële release notes voor V8.1 en eerdere versies
De vraag is niet meer óf AI beeldgeneratie de creatieve industrie transformeert, maar hoe snel. En als de afgelopen twaalf jaar iets hebben bewezen, dan is het dat "snel" een understatement is.
Veelgestelde vragen
Wat was het eerste AI-model dat realistische afbeeldingen kon genereren?
De GAN (Generative Adversarial Network), bedacht door Ian Goodfellow in 2014, wordt algemeen beschouwd als het eerste model dat echt overtuigende beelden kon genereren. Eerdere modellen bestonden wel, maar leverden veel minder realistische resultaten.
Wat is het verschil tussen GAN en diffusion?
Een GAN gebruikt twee neurale netwerken die tegen elkaar 'strijden', een generator en een discriminator. Diffusion-modellen werken anders: ze leren geleidelijk ruis toe te voegen aan een beeld en dat proces vervolgens om te keren. Diffusion levert doorgaans stabielere en gevarieerder resultaten op.
Waarom was Stable Diffusion zo belangrijk?
Stable Diffusion (2022) was het eerste hoogwaardige AI-beeldmodel dat open-source werd vrijgegeven. Iedereen kon het gratis downloaden en lokaal draaien, wat de hele community explodeerde en de basis legde voor duizenden aangepaste modellen.
Is DALL-E nog steeds beschikbaar?
DALL-E 3 is op 12 mei 2026 officieel met pensioen gestuurd en vervangen door GPT Image 2. Er komt geen DALL-E 4, OpenAI heeft de technologie volledig geïntegreerd in hun chatplatform, wat betere resultaten oplevert.
Welk AI-beeldmodel is op dit moment het beste?
Dat hangt af van je gebruik. Voor de hoogste overall kwaliteit en prompt-nauwkeurigheid staat Google Nano Banana Pro bovenaan in de LLM Arena-ranglijst (mei 2026). Voor fotorealisme is FLUX.2 toonaangevend. Voor artistieke beelden blinkt Midjourney v8.1 uit. GPT Image 2 is de absolute winnaar voor tekst-in-beeld en conversationele beeldbewerking. Lees onze reviews voor gedetailleerde vergelijkingen.