GPT-6 Sol en Luna naast Opus 5.5: zo test je het zelf
Inhoud
Deze week kwamen er op dezelfde dag twee aankondigingen die je als ondernemer niet moet negeren. OpenAI lanceerde GPT-6 Sol en Luna, met de belofte van lagere kosten en minder fouten. Anthropic bracht Claude Opus 5.5 uit, ook met lagere prijzen en prestaties op het niveau van Claude Fable. Twee grote spelers, één boodschap: goedkoper en beter.
Dat klinkt als goed nieuws voor je AI-budget, en dat kan het ook zijn. Maar 'goedkoper en beter' is wat de makers zelf zeggen. Of het ook geldt voor jouw offertes, klantmails en productteksten, weet je pas als je het test. Dat kost je een middag, geen project.
In dit artikel lees je wat er is aangekondigd, hoe je de twee lanceringen eerlijk naast elkaar zet, waarom goedkoper niet automatisch goedkoper is voor jou, en hoe je zelf een test draait. Zonder overstapstress en zonder AVG-problemen.
Elke dag AI begrijpen, zonder de hype?
Ontvang de gratis MKB AI Quickstart-gids en mijn nuchtere AI-updates. Uitschrijven met 1 klik.
Wat OpenAI aankondigde: GPT-6 Sol en Luna
Volgens TechCrunch brengt OpenAI twee nieuwe modellen uit: GPT-6 Sol en GPT-6 Luna. OpenAI zegt dat ze uit hetzelfde hout zijn gesneden als GPT-6 Astra, het model waar ik eerder over schreef. De twee grote beloftes: lagere kosten en minder fouten.
Twee dingen om te onthouden. Ten eerste: dit zijn claims van de maker. 'Minder fouten' betekent pas iets als je weet welke fouten, op welke taken en hoe ze zijn gemeten. Ten tweede: het zijn twee modellen. Hoe je tussen Sol en Luna kiest, heb ik gisteren al uitgewerkt, dus dat herhaal ik hier niet.
Voor jouw praktijk is dit het relevante deel: de meeste MKB-taken zijn geen ingewikkelde denkpuzzels, maar mails, samenvattingen en teksten. Daar telt de prijs per afgeronde taak zwaarder dan de hoogste score op een ranglijst. Dat is mijn mening, geen feit uit de aankondiging.
Anthropic reageert met Claude Opus 5.5
TechCrunch meldt op dezelfde dag dat Anthropic Opus 5.5 uitbrengt, met lagere prijzen en prestaties op Fable-niveau. Anthropic noemt het zelf 'het best presterende model dat we tot nu toe hebben getest'.
Ook hier gaat het om de eigen woorden van de maker. Anthropic heeft het over de eigen tests, niet over die van jou. Het patroon is wel opvallend: beide bedrijven beloven dat de prijs omlaag gaat en de kwaliteit blijft of stijgt. Dat past in de AI-prijzenoorlog tussen OpenAI en Anthropic waar ik in augustus al over schreef.
GPT-6 Sol en Luna vs Claude Opus 5.5: zo zet je ze naast elkaar
Wie wint? Dat kan niemand je op basis van twee aankondigingen vertellen, ik ook niet. Wat je wel kunt doen: per model vaststellen wat bekend is en wat je nog zelf moet uitzoeken.
GPT-6 Sol en Luna (OpenAI)
Bekend: twee modellen, lagere kosten, minder fouten en verwantschap met Astra, allemaal volgens OpenAI. Nog niet bekend voor jou: hoeveel goedkoper ze uitpakken bij jouw gebruik, welke fouten verdwijnen en hoe ze omgaan met Nederlandse zakelijke teksten.
Claude Opus 5.5 (Anthropic)
Bekend: lagere prijzen, prestaties op Fable-niveau en de claim van Anthropic dat het hun best presterende model is. Nog niet bekend voor jou: hoe het presteert op jouw taken en hoe de totale kosten uitpakken.
Wat past bij jouw bedrijf?
Werk je al met ChatGPT en loopt dat goed, dan is de drempel om Sol of Luna te proberen laag. Werk je met Claude, dan geldt hetzelfde voor Opus 5.5. Wil je echt vergelijken, gebruik dan dezelfde taken en dezelfde opdrachten voor alle modellen. Vergelijk op vier dingen:
- Kwaliteit van het resultaat
- Aantal fouten
- Tijd die jij kwijt bent aan nakijken en aanpassen
- Kosten per afgeronde taak
Goedkoper is niet automatisch goedkoper voor jou
AI-modellen rekenen af per hoeveelheid tekst die erdoorheen gaat, vaak 'tokens' genoemd: kleine stukjes tekst. Een lagere prijs per stukje klinkt goed. Maar de rekening die telt is de prijs per afgeronde taak, inclusief jouw tijd.
Een rekenvoorbeeld met verzonnen bedragen, alleen om het principe te laten zien. Model A kost 2 cent per klantmail, model B 3 cent. Bij A moet één op de vijf mails door een mens worden aangepast, en dat kost 10 minuten. Bij een uurtarief van 60 euro is dat 10 euro per aangepaste mail, dus gemiddeld ongeveer 2 euro per mail. Bij B moet één op de twintig mails worden aangepast: gemiddeld ongeveer 50 cent per mail. Model B is 1 cent duurder in tokens, maar per mail bijna 1,50 euro goedkoper.
Daarom weegt 'minder fouten' zwaarder dan 'lagere prijs'. Als de belofte van OpenAI of Anthropic klopt voor jouw taken, levert dat je tijd op. Klopt het niet, dan is de prijskorting zo weer weg.
Zo test je Sol, Luna en Opus 5.5 in een middag
Je hebt geen technische kennis nodig, wel wat discipline. Doe dit in deze volgorde:
- Pak tien echte taken uit de afgelopen maand. Denk aan een offertemail, een samenvatting van een lang gesprek, een productomschrijving en een lastige klantvraag.
- Haal namen, adressen en bedragen eruit, of vervang ze door verzonnen gegevens.
- Geef dezelfde opdracht aan je huidige model en aan de nieuwe modellen.
- Laat een collega de resultaten beoordelen zonder te weten welk model wat maakte.
- Noteer per taak het aantal fouten, de tijd die het nakijken kostte en de kosten.
- Beslis op basis van die cijfers, niet op basis van de aankondiging.
Zo'n test is geen wetenschap, maar hij vertelt je meer dan elke lancering. En als je dit eenmaal hebt gedaan, ken je je eigen maatstaf voor de volgende release.
AVG: een nieuw model verandert de regels niet
Een nieuw model is geen vrijbrief om klantgegevens ergens in te plakken. De AVG geldt voor Sol, Luna en Opus 5.5 precies zoals voor elk ander AI-model. Testen met echte klantmails kan alleen in een zakelijke omgeving waar je een verwerkersovereenkomst voor hebt en waarvan je weet wat er met je gegevens gebeurt. Twijfel je, anonimiseer dan eerst.
In Nederland is de Autoriteit Persoonsgegevens de toezichthouder, en die kijkt kritisch mee naar nieuwe technologie. Onlangs adviseerde de AP organisaties nog om het gebruik van camerabrillen te verbieden, omdat je mensen daarmee vrijwel nooit mag filmen. Andere technologie, dezelfde houding: privacy gaat voor gemak.
Lees bij elk model de voorwaarden van de versie die je gebruikt. Worden je gegevens gebruikt om modellen te trainen? Waar worden ze verwerkt en hoe lang bewaard? Dat verschilt per abonnement, en ik ga niet gokken wat voor deze nieuwe modellen geldt. Dat moet je zelf nalezen.
Waarom een beetje scepsis past
Dezelfde week wijst MIT Technology Review in de nieuwsbrief The Download op een stuk van Timnit Gebru, directeur van het Distributed AI Research Institute, en Emily M. Bender, hoogleraar taalkunde. De titel: 'Don't be fooled by this summer of AI hype'. Je hoeft het niet met ze eens te zijn om er iets van te leren: elke lancering komt met grote woorden, en het is aan jou om die om te zetten naar cijfers.
Sceptisch zijn is niet hetzelfde als afwachten. Ik zeg niet: doe niets. Ik zeg: laat je niet leiden door de aankondiging, maar door je eigen test.
Daarom blijf ik zeggen: liever niet op één AI-model bouwen. Als je taken zo zijn ingericht dat je makkelijk kunt wisselen, wordt elke prijsverlaging van OpenAI of Anthropic gewoon jouw voordeel, en hoef je nooit te wedden op één merk.
Wat dit betekent voor jou
Mijn take: de prijsdaling is echt nieuws voor het Nederlandse MKB. Als twee grote spelers op dezelfde dag goedkoper worden, verschuift er iets in wat AI je kost. Maar de belofte van minder fouten is pas iets waard als je hem op je eigen werk hebt gemeten.
Wat je deze week kunt doen: pak tien echte taken, test ze op je huidige model en op de nieuwe, reken de kosten per taak uit en beslis dan pas. Geen haast, wel een plan.
Wil je hulp bij het opzetten van zo'n test, dan kun je een korte sparring boeken. Dan kijken we samen welke taken je moet meenemen en waar de risico's zitten. Vanuit Enschede help ik MKB-bedrijven met dit soort keuzes, zonder jargon en zonder verkooppraatje.
Werkt deze AI-ontwikkeling door in jouw bedrijf? een korte sparring boeken.
Wat zijn GPT-6 Sol en Luna?
Twee nieuwe AI-modellen van OpenAI. Volgens OpenAI zijn ze goedkoper en maken ze minder fouten, en komen ze uit dezelfde modelfamilie als GPT-6 Astra. Dat zijn claims van de maker, en je weet pas wat het voor jou betekent als je ze op je eigen taken test.
Is Claude Opus 5.5 beter dan GPT-6 Sol?
Dat is op basis van de aankondigingen niet te zeggen. Beide bedrijven noemen hun eigen resultaten, met eigen tests en eigen maatstaven. Wil je het weten, gebruik dan dezelfde tien taken voor beide modellen en laat een collega blind beoordelen welk resultaat beter is.
Moet ik nu overstappen naar een nieuw AI-model?
Niet blind. Werkt je huidige model goed, dan is er geen haast. Test binnen een paar weken wel of een nieuw model je tijd of geld bespaart, zeker als je veel AI gebruikt. Bij grotere volumes lopen kleine prijsverschillen snel op.
Hoe test ik een AI-model op mijn eigen werk?
Pak tien echte taken uit de afgelopen maand en anonimiseer ze. Geef dezelfde opdracht aan je huidige en het nieuwe model, laat een collega de resultaten blind beoordelen en noteer per taak fouten, nakijktijd en kosten. Beslis op die cijfers.
Mag ik klantgegevens gebruiken om een nieuw AI-model te testen?
Alleen als je aan de AVG voldoet. Dat betekent: een zakelijke omgeving, een verwerkersovereenkomst en duidelijkheid over wat er met de gegevens gebeurt. Twijfel je, gebruik dan geanonimiseerde of verzonnen voorbeelden. De Autoriteit Persoonsgegevens is de toezichthouder in Nederland.
Is een goedkoper AI-model altijd beter voor mijn budget?
Nee. Wat telt is de prijs per afgeronde taak, inclusief de tijd die jij of je medewerkers kwijt zijn aan nakijken en aanpassen. Een model dat iets meer kost per tekst, maar minder fouten maakt, kan per saldo goedkoper zijn.
Grip op AI, zonder de hype
Ontvang de gratis MKB AI Quickstart-gids plus mijn nuchtere AI-updates. Uitschrijven kan altijd met 1 klik.