Passer au contenu principal

KERVALT / BENCHMARKS

Des tests indépendants qui disent ce qui fonctionne

Nous effectuons des comparaisons internes et indépendantes de vitesse, précision, sécurité et coût. Tous les tests s'exécutent dans notre environnement européen sécurisé.

Résultats en direct Reproductible Hébergé en UE Pas de fuites de données

01 / CLASSEMENTS

Résultats en direct

Résultats sélectionnés de nos suites de tests actives. Les jeux de données complets et la méthodologie sont disponibles pour les partenaires de recherche approuvés.

Test Métrique Meilleur score Système
Raisonnement juridique connecté Précision sur les clauses liées 0.91 Griot
Recherche dans des documents longs Taux de découverte sur 128 000 tokens 0.94 Tafari
Questions financières structurées Précision exacte 0.97 Elimu
Précision des sources Taux de liens source vérifiés 0.99 Kervalt combiné
Sécurité adverse Sortie nuisible bloquée 0.96 Contrôles de sécurité

Les scores reflètent des tests hébergés par Kervalt sur des serveurs européens. Les papiers méthodologiques sont disponibles dans nos publications.

02 / ÉVALUATION

Ce que nous mesurons

Nous testons les éléments qui comptent lorsque de vraies personnes utilisent le système.

Précision du raisonnement

Nous testons dans quelle mesure le système relie les faits entre documents, longs textes et enregistrements structurés.

Vitesse à l'échelle

Nous mesurons la vitesse de réponse sous une charge de production réelle, pas dans des conditions de laboratoire idéales.

Sécurité sous pression

Nous testons le comportement du système lorsque quelqu'un essaie de le tromper, d'induire en erreur ou de le faire sortir de sa politique.

03 / FOSSÉ DE RÉALITÉ

Pourquoi la plupart des scores de test IA ne disent pas tout

Les classements publics récompensent les tâches une question à la fois. Les vrais contrats, dossiers médicaux et chaînes d'approvisionnement nécessitent de retracer des liens entre de nombreux documents.

Problème : les tests ignorent les liens du monde réel

Les classements publics récompensent les tâches une question à la fois. Les vrais contrats, dossiers médicaux et chaînes d'approvisionnement nécessitent de retracer des liens entre de nombreux documents.

Agitation : un bon score peut cacher un vrai risque

Un modèle qui obtient 92% aux questions générales peut toujours manquer une clause connectée, exposant l'entreprise à des erreurs coûteuses ou à une action réglementaire.

Solution : des tests correspondant aux vraies données

Kervalt test la recherche, les connexions et les enregistrements ensemble. Les résultats sont rapportés par système et combinés, avec des citations liées aux sources.

PROCHAINE ÉTAPE

Effectuer votre propre comparaison

Apportez vos jeux de données et comparez le comportement des modèles sur une infrastructure sécurisée avec une traçabilité complète des sources.