KERVALT / BENCHMARKS
Onafhankelijke tests die vertellen wat werkt
We voeren interne en onafhankelijke vergelijkingen uit van snelheid, nauwkeurigheid, veiligheid en kosten. Alle tests draaien in onze veilige Europese omgeving.
01 / RANGLIJSTEN
Live resultaten
Geselecteerde resultaten uit onze actieve testsuites. Volledige datasets en methodologie zijn beschikbaar voor goedgekeurde onderzoekspartners.
| Test | Metric | Topscore | Systeem |
|---|---|---|---|
| Connected Legal Reasoning | Nauwkeurigheid over gekoppelde bepalingen | 0.91 | Griot |
| Zoeken in lange documenten | Vindpercentage over 128.000 tokens | 0.94 | Tafari |
| Gestructureerde financiële vragen | Exacte-overeenkomst-nauwkeurigheid | 0.97 | Elimu |
| Bronnauwkeurigheid | Geverifieerde bronkoppelingsrate | 0.99 | Kervalt combined |
| Adversarial safety | Schadelijke output geblokkeerd | 0.96 | Safety controls |
Scores zijn gebaseerd op tests gehost door Kervalt op Europese servers. Methodologiepapers zijn beschikbaar in onze publicaties.
02 / EVALUATIE
Wat we meten
We testen de dingen die ertoe doen wanneer echte mensen het systeem gebruiken.
Redeneernauwkeurigheid
We testen hoe goed het systeem feiten over documenten, lange teksten en gestructureerde gegevens heen verbindt.
Snelheid op schaal
We meten responssnelheid onder echte productielast, niet in ideale labomstandigheden.
Veiligheid onder druk
We testen hoe het systeem reageert wanneer iemand probeert het te misleiden, voor de gek te houden of van beleid af te duwen.
03 / REALITEITSKLOOF
Waarom de meeste AI-testscores niet het hele verhaal vertellen
Publieke ranglijsten belonen taken met één vraag tegelijk. Echte contracten, medische dossiers en toeleveringsketens vereisen het traceren van verbanden over veel documenten heen.
Probleem: tests negeren echte verbanden
Publieke ranglijsten belonen taken met één vraag tegelijk. Echte contracten, medische dossiers en toeleveringsketens vereisen het traceren van verbanden over veel documenten heen.
Aanscherping: een hoge score kan een echt risico verbergen
Een model dat 92% scoort op algemene vragen, kan nog steeds een gekoppelde bepaling missen, waardoor de organisatie blootstaat aan kostbare fouten of regelgevende actie.
Oplossing: tests die bij echte gegevens passen
Kervalt test zoeken, verbanden en gegevens samen. Resultaten worden per systeem én gecombineerd gerapporteerd, met citaten gekoppeld aan bronnen.
VOLGENDE STAP
Voer uw eigen vergelijking uit
Breng uw datasets mee en vergelijk modelgedrag op veilige infrastructuur met volledige brontracering.