Publieksbeoordeling: 27 AI-modellen, ChatGPT op de 8e plaats – dit zijn de modellen die het beter deden
Hoewel de wereld van kunstmatige intelligentie (AI) vaak een turbulente omgeving lijkt, vindt er achter de schermen verrassend veel analyse, prestatiemeting en testen plaats. Dit wordt niet alleen gedaan door de bedrijven zelf, maar ook door groepen die zijn opgericht om hun eigen ranglijsten op te stellen.

Deze groepen testen alles, van het vermogen van een chatbot om wiskundetests te voltooien,
Maak afbeeldingen, of logische verklaringen geven, of zelfs medisch advies geven, of gewoon laten zien hoe emotioneel intelligent ze is.
Tijdens deze uiteenlopende tests onthullen de modellen hun sterke en zwakke punten op verschillende gebieden. Zo blinkt GPT-5 bijvoorbeeld uit in wetenschappelijke deductie, maar blijft het achter bij modellen als Gemini en Claude wat betreft het vermogen om zich aan nieuwe concepten aan te passen.
Elk van deze tests vertelt ons iets nieuws over AI-modellen en is belangrijk om ons eraan te herinneren welke tools het beste zijn in verschillende scenario's. Maar er ontbreekt vaak één statistiek: welke AI-modellen leveren de beste gebruikerservaring?
Humaine classificatiesysteem

Het Britse technologiebedrijf Prolific heeft een AI-ranglijst ontwikkeld genaamd Humaine . In plaats van de capaciteit van AI om taken uit te voeren te testen, heeft Prolific verschillende gebruikerservaringen met deze modellen getest.
Door de ervaringen van 21,352 mensen met de tools te evalueren, konden ze niet alleen een algehele winnaar aanwijzen, maar konden ze de resultaten ook uitsplitsen naar leeftijd, locatie (de tests werden uitgevoerd in zowel het Verenigd Koninkrijk als de VS) en politieke overtuigingen.
Dit omvat individuele vermeldingen voor:
- Verenigd Koninkrijk: Leeftijdsgroepen
- Verenigd Koninkrijk: Race
- Verenigd Koninkrijk: Politiek standpunt
- Verenigde Staten: Leeftijdsgroepen
- Verenigde Staten: Ras
- Verenigde Staten: Politiek standpunt
Het team liet elke deelnemer met twee afzonderlijke AI-modellen interacteren om ze met elkaar te vergelijken en vroeg hen feedback te geven over welk model in welke interactie beter presteerde.
Dit resulteerde in een algehele winnaar en een ranglijst voor prestaties, maar ook aparte ranglijsten voor basistaakuitvoering en redeneren, en een winnaar voor communicatie, veerkracht, vertrouwen en ethiek.
Wat laten de resultaten zien?

Na een grondige evaluatie kwam er een duidelijke winnaar naar voren, niet alleen in de algehele prestatiecategorie, maar in de meeste subcategorieën. De Gemini 2.5-Pro blonk uit in bijna elke benchmark die de test onderzocht.
Jongvolwassenen van 18 tot 34 jaar in het VK, Democratische kiezers en 55-plussers in de VS waren het erover eens dat Gemini 2.5 Pro het beste model in het algemeen was. Het enige gebied waar alle demografische groepen Grok-3 hoger inschatten dan Gemini, was vertrouwen, ethiek en veiligheid – een enigszins ironische bevinding gezien de recente problemen met de veiligheid en ethiek van dit AI-model.
Interessant genoeg zijn de drie modellen die na Gemini opdoken Deepseek, Magistral Le Chat en Grok . Hoewel Deepseek eerder dit jaar aanzienlijk populair was, is het de laatste tijd wat uit de schijnwerpers verdwenen. Le Chat daarentegen is een minder populaire chatbot, maar heeft wel een trouwe aanhang.
Waar past het wereldberoemde ChatGPT dan in dit geheel? Het staat helemaal onderaan de lijst, op de achtste plaats met zijn topmodel, de GPT-4.1. Nog slechter doet Claude het , waarvan de twee versies (4.0 en 4.0) respectievelijk de elfde en twaalfde plaats innemen.
Wat betekent dit nu allemaal?
Betekent dit dat Gemini de beste AI-chatbot ter wereld is? Betekent dit dat je ChatGPT moet laten vallen…? Nou, niet helemaal.
Deze resultaten weerspiegelen niet noodzakelijkerwijs de prestaties van deze modellen. Wanneer we ze testen met de meeste andere statistieken, zien we meestal ChatGPT, Gemini, Claude en Grok bovenaan staan.
Dit is echter een belangrijke aanvulling op deze tests. Ze helpen ons AI beter te begrijpen vanuit het perspectief van de menselijke ervaring. Zo scoort Le Chat niet hoog op standaard benchmarks, maar wordt het vaak genoemd als een uitstekende keuze qua ervaring en betrouwbaarheid.
Hoewel de prestaties van Anthropic en OpenAI dit niveau in deze testronde niet helemaal haalden, was het wederom een sterke prestatie voor zowel Gemini als Grok. Beide bedrijven behalen vaak hoge scores op standaardbenchmarks, en dat bleven ze ook hier doen.
Reacties zijn gesloten.