KERVALT / BENCHMARKS
Des tests indépendants qui disent ce qui fonctionne
Nous effectuons des comparaisons internes et indépendantes de vitesse, précision, sécurité et coût. Tous les tests s'exécutent dans notre environnement européen sécurisé.
01 / CLASSEMENTS
Résultats en direct
Résultats sélectionnés de nos suites de tests actives. Les jeux de données complets et la méthodologie sont disponibles pour les partenaires de recherche approuvés.
| Test | Métrique | Meilleur score | Système |
|---|---|---|---|
| Raisonnement juridique connecté | Précision sur les clauses liées | 0.91 | Griot |
| Recherche dans des documents longs | Taux de découverte sur 128 000 tokens | 0.94 | Tafari |
| Questions financières structurées | Précision exacte | 0.97 | Elimu |
| Précision des sources | Taux de liens source vérifiés | 0.99 | Kervalt combiné |
| Sécurité adverse | Sortie nuisible bloquée | 0.96 | Contrôles de sécurité |
Les scores reflètent des tests hébergés par Kervalt sur des serveurs européens. Les papiers méthodologiques sont disponibles dans nos publications.
02 / ÉVALUATION
Ce que nous mesurons
Nous testons les éléments qui comptent lorsque de vraies personnes utilisent le système.
Précision du raisonnement
Nous testons dans quelle mesure le système relie les faits entre documents, longs textes et enregistrements structurés.
Vitesse à l'échelle
Nous mesurons la vitesse de réponse sous une charge de production réelle, pas dans des conditions de laboratoire idéales.
Sécurité sous pression
Nous testons le comportement du système lorsque quelqu'un essaie de le tromper, d'induire en erreur ou de le faire sortir de sa politique.
03 / FOSSÉ DE RÉALITÉ
Pourquoi la plupart des scores de test IA ne disent pas tout
Les classements publics récompensent les tâches une question à la fois. Les vrais contrats, dossiers médicaux et chaînes d'approvisionnement nécessitent de retracer des liens entre de nombreux documents.
Problème : les tests ignorent les liens du monde réel
Les classements publics récompensent les tâches une question à la fois. Les vrais contrats, dossiers médicaux et chaînes d'approvisionnement nécessitent de retracer des liens entre de nombreux documents.
Agitation : un bon score peut cacher un vrai risque
Un modèle qui obtient 92% aux questions générales peut toujours manquer une clause connectée, exposant l'entreprise à des erreurs coûteuses ou à une action réglementaire.
Solution : des tests correspondant aux vraies données
Kervalt test la recherche, les connexions et les enregistrements ensemble. Les résultats sont rapportés par système et combinés, avec des citations liées aux sources.
PROCHAINE ÉTAPE
Effectuer votre propre comparaison
Apportez vos jeux de données et comparez le comportement des modèles sur une infrastructure sécurisée avec une traçabilité complète des sources.