Ga naar hoofdinhoud

KERVALT / BENCHMARKS

Onafhankelijke tests die vertellen wat werkt

We voeren interne en onafhankelijke vergelijkingen uit van snelheid, nauwkeurigheid, veiligheid en kosten. Alle tests draaien in onze veilige Europese omgeving.

Live resultaten Reproduceerbaar EU-gehost Geen datalekken

01 / RANGLIJSTEN

Live resultaten

Geselecteerde resultaten uit onze actieve testsuites. Volledige datasets en methodologie zijn beschikbaar voor goedgekeurde onderzoekspartners.

Test Metric Topscore Systeem
Connected Legal Reasoning Nauwkeurigheid over gekoppelde bepalingen 0.91 Griot
Zoeken in lange documenten Vindpercentage over 128.000 tokens 0.94 Tafari
Gestructureerde financiële vragen Exacte-overeenkomst-nauwkeurigheid 0.97 Elimu
Bronnauwkeurigheid Geverifieerde bronkoppelingsrate 0.99 Kervalt combined
Adversarial safety Schadelijke output geblokkeerd 0.96 Safety controls

Scores zijn gebaseerd op tests gehost door Kervalt op Europese servers. Methodologiepapers zijn beschikbaar in onze publicaties.

02 / EVALUATIE

Wat we meten

We testen de dingen die ertoe doen wanneer echte mensen het systeem gebruiken.

Redeneernauwkeurigheid

We testen hoe goed het systeem feiten over documenten, lange teksten en gestructureerde gegevens heen verbindt.

Snelheid op schaal

We meten responssnelheid onder echte productielast, niet in ideale labomstandigheden.

Veiligheid onder druk

We testen hoe het systeem reageert wanneer iemand probeert het te misleiden, voor de gek te houden of van beleid af te duwen.

03 / REALITEITSKLOOF

Waarom de meeste AI-testscores niet het hele verhaal vertellen

Publieke ranglijsten belonen taken met één vraag tegelijk. Echte contracten, medische dossiers en toeleveringsketens vereisen het traceren van verbanden over veel documenten heen.

Probleem: tests negeren echte verbanden

Publieke ranglijsten belonen taken met één vraag tegelijk. Echte contracten, medische dossiers en toeleveringsketens vereisen het traceren van verbanden over veel documenten heen.

Aanscherping: een hoge score kan een echt risico verbergen

Een model dat 92% scoort op algemene vragen, kan nog steeds een gekoppelde bepaling missen, waardoor de organisatie blootstaat aan kostbare fouten of regelgevende actie.

Oplossing: tests die bij echte gegevens passen

Kervalt test zoeken, verbanden en gegevens samen. Resultaten worden per systeem én gecombineerd gerapporteerd, met citaten gekoppeld aan bronnen.

VOLGENDE STAP

Voer uw eigen vergelijking uit

Breng uw datasets mee en vergelijk modelgedrag op veilige infrastructuur met volledige brontracering.