Examplary
  • Begin gratis

    Onder de motorkap: kan Jev AI nauwkeuriger nakijken?

    29 Sep 2026

    ThomasThomas

    Onder de motorkap: kan Jev AI nauwkeuriger nakijken?

    De afgelopen twee weken had iedereen het over een nieuw AI-model van het bedrijf TypeSafe AI. Dat werkte twee jaar lang aan wat het zelf presenteert als een nieuw soort AI-model: een zogenoemd met de naam Jev.

    Je stuurt Jev tekst, net als elk ander , maar je krijgt geen tekst of afbeeldingen terug. In plaats daarvan geeft het beslissingen, met de bijbehorende waarschijnlijkheid. Het is bovendien erg snel (volgens TypeSafe 40 tot 200 keer sneller dan de ) en ook nog eens een stuk goedkoper.

    Daardoor is het bij uitstek geschikt voor alles waarbij je een ja of nee nodig hebt, of een keuze uit meerdere opties. Bedrijven gebruiken het al om supporttickets te labelen, spam te herkennen en natuurlijk om Doom te spelen.

    Onze engineers wilden uiteraard weten hoe goed het werkt bij het nakijken van toetsen.

    Eerst wat cijfers

    We hebben Jev, samen met een aantal modellen die zijn, getest op onze interne evaluatieset: een representatieve verzameling vragen en antwoorden van leerlingen. Die antwoorden zijn nagekeken door onze AI-modellen en daarna ook gecontroleerd en beoordeeld door een docent.

    Vergeleken met de scores van docenten (14.659 items)

    ModelExacte overeenkomstQWK

    baseline

    ons huidige model
    81,5%0,83

    jev

    vergelijkingsmodel
    62,0%0,65

    jev-noul

    vergelijkingsmodel zonder meerkeuzeopties
    61,7%0,65

    laya-finetuned-v1

    gefinetuned opensourcemodel
    37,4%0,19

    laya-typed-decisions

    opensourcemodel met getypeerde beslissingen
    38,1%0,10

    laya-multilingual

    meertalig opensourcemodel
    49,7%0,01

    laya-multilingual-noul

    meertalig opensourcemodel zonder meerkeuzeopties
    52,6%0,01

    Ons huidige model geeft in 81,5% van de gevallen precies dezelfde score als de docent. Dat percentage zegt alleen weinig over hoe groot het verschil was als de scores níét overeenkwamen. Daarvoor berekenen we de QWK (Quadratic Weighted Kappa). Die maatstaf weegt grote verschillen zwaarder dan kleine en geeft zo een eerlijker beeld van hoe goed een model presteert. Een QWK van 1 betekent dat het model het altijd precies eens is met de docent; bij een QWK van 0 doet het model het niet beter dan puur toeval.

    Jev doet het relatief goed, met een QWK van 0,65 tegenover 0,83 voor ons huidige model. Dat blijft wel een merkbare stap terug in nauwkeurigheid.

    We hebben ook geëxperimenteerd met een aantal modellen die open source zijn en dezelfde aanpak volgen als Jev, zoals Laya. Deze modellen draaien lokaal en zijn veel kleiner. Daar werden we enthousiast van: we zouden ze dan op onze eigen servers kunnen draaien en nog minder data naar externe diensten hoeven te sturen.

    Helaas presteren deze modellen, zelfs na wat eenvoudige , een stuk slechter. De belangrijkste reden is waarschijnlijk hun omvang: de van Laya hebben maar zo'n 320 tot 420 miljoen . Daardoor kunnen ze minder goed overweg met uitzonderingen, zoals minder gangbare talen, vakjargon en formules.

    Andere obstakels

    Er zijn nog een paar andere redenen waarom we Jev niet in ons nakijkproces kunnen gebruiken:

    • Voor zover we kunnen zien, kun je op dit moment niet kiezen in welke Jev draait. Dat alleen al is voor ons eigenlijk een breekpunt: Examplary kan volledig binnen de EU worden gehost, en dat willen we graag zo houden.
    • Geen mogelijkheden: Jev accepteert alleen tekst, terwijl Examplary steeds meer andere soorten content ondersteunt, zoals afbeeldingen, documenten, audio en video. Voor vragen of antwoorden waarin een van die vormen voorkomt, zouden we Jev helemaal niet kunnen inzetten.
    • Beperkte context: je kunt Jev minder tekst meegeven dan we doorgaans aan ons huidige model voeren. Omdat we het nakijken altijd gronden in het bronmateriaal dat docenten uploaden, sturen we veel relevante "feiten" uit dat materiaal mee naar het nakijkmodel. Bij complexe vragen gaan we daardoor regelmatig over de invoerlimiet van Jev van heen. Alternatieven die open source zijn, hebben een nog lagere limiet: de checkpoints van Laya houden op bij 512 tot 1024 tokens.
    • Geen redenering of feedback: het hele idee achter Jev is dat het alleen een beslissing en een waarschijnlijkheid teruggeeft. Daardoor kunnen docenten moeilijk zien waarom het model een bepaalde score heeft gegeven, en kunnen we niet in dezelfde nakijkronde ook feedback genereren. Een deel daarvan zou je kunnen oplossen door er een taalmodel naast te laten draaien dat die teksten schrijft, maar dat weerspiegelt niet per se de werkelijke "redenering" van het nakijkmodel.

    Niet alleen maar nadelen

    Jev heeft natuurlijk ook veel voordelen: het is een stuk sneller (tot 10 keer sneller dan ons huidige nakijkmodel, van ongeveer 3000 ms naar 300 ms), een stuk goedkoper, en de zekerheidsscores zijn consistenter.

    Voor nakijken wegen die voordelen op dit moment niet op tegen de nadelen. Voor andere toepassingen is het wel interessant, bijvoorbeeld om zorgsignalen over leerlingen op te vangen waarover docenten geïnformeerd moeten worden.

    We blijven experimenteren met nieuwe manieren om dit soort modellen in te zetten, en we werken voortdurend aan automatisch nakijken dat nog betrouwbaarder, sneller en consistenter is.