Verificator soumet vos modèles quantitatifs à un protocole verrouillé — blind test à critères écrits à l'avance, diagnostic de mécanisme, certificats formels, forward test — et vous dit non seulement si votre modèle cassera, mais pourquoi.
Chaque étape de la méthodologie a été exécutée en conditions réelles avant d'entrer au catalogue. Rien de théorique.
Métrique de décision unique, découpage chronologique, critères de succès chiffrés — écrits et scellés par hash avant tout accès aux données de test. Toute modification ultérieure = redémarrage déclaré.
Votre modèle (gelé par hash, code scoré = code déclaré) affronte une période qu'il n'a jamais vue. Verdict ternaire : conforme, non concluant, non conforme.
Quand ça casse, on ne vous rend pas un score : on identifie le shift de régime en cause et le terme fautif, attribution chiffrée à l'appui.
Où votre modèle tient-il — autres actifs, autres horizons, autres régimes ? Sa performance vient-elle de sa structure (robuste) ou de ses coefficients fins (fragile) ?
Avant chaque évaluation, l'attendu chiffré est déposé. L'écart prédiction/observé figure au rapport — la preuve que l'auditeur ne raconte pas l'histoire après coup.
Les invariants de votre modèle — positivité, monotonies, bornes — prouvés en Lean 4 + Mathlib. Par théorème, pas par test.
Un protocole de re-scoring sur données futures — inexistantes le jour de l'audit — avec fourchettes falsifiables déposées, exécutable par n'importe quel tiers. L'audit ne s'arrête pas au passé.
Le runner d'audit s'exécute dans votre infrastructure ; seuls des agrégats typés en sortent, par une allowlist appliquée côté runner. Personne ne fait confiance à personne : les hashes sont vérifiés dans les deux sens.
Le modèle « OLS-11 » — régression à 11 facteurs pour la prévision de volatilité intraday — était stable depuis trois ans en validation interne. Voici ce que le protocole verrouillé a montré.
| Période | Validation interne (3 ans) | Blind test verrouillé (6 mois) |
|---|---|---|
| Performance vs référence naïve | −14 à −16 % d'erreur | +0,4 % (pire que le naïf) |
| Dégradation par sous-période | stable | 0,85 → 1,07 → 1,15 (décrochage progressif) |
Cause identifiée, pas seulement constatée : un shift de régime silencieux (+46 % sur le ratio range/volatilité réalisée, à volatilité constante) que le coefficient linéaire du modèle convertit mécaniquement en +19,3 % de surprédiction systématique. Le terme fautif est nommé. Un modèle de référence à réponse concave traverse la même période sans dégradation — la casse n'était pas une fatalité du marché, c'était un choix de forme.
Chaque chiffre de ce cas est reproductible : protocole, scripts et verdicts scellés par SHA-256, données de référence publiques. Le dossier complet est fourni sur demande.
Critères de succès écrits, chiffrés et hashés avant la première évaluation. Un audit dont les règles peuvent bouger en cours de route ne prouve rien.
« Votre modèle dégrade de X % » ne vous aide pas. « Ce coefficient convertit ce shift de régime en ce biais » vous permet de corriger.
Là où c'est possible, les propriétés critiques sont prouvées formellement (Lean 4) — un niveau de garantie qu'aucun audit statistique n'offre.
Génération, contre-validation croisée et arbitrage sont menés par des agents indépendants orchestrés. Ce qu'un cabinet facture en semaines s'exécute en une journée.
Le même pipeline a été validé sur des séries physiques (prévision de variabilité du vent, transfert de site à site). Énergie, météo, trafic, IoT : toute série à régimes est auditable.
SR 11-7, attentes EBA, EU AI Act : la documentation produite — protocole, verdicts, reproductibilité — parle la langue de votre validation interne et de votre régulateur.
La valeur d'un tampon dépend de ce qu'il refuse de tamponner.
Nos propres candidats recalés figurent dans nos classements publics, au même rang que les succès. Un « non concluant » est un résultat, pas un échec à cacher.
Nous ne revendiquons jamais une découverte que la littérature a déjà faite, et nous vous dirons si une heuristique simple suffit à votre usage — même quand cela réduit notre facture.
Prédictions déposées avant scoring, écarts publiés, forward tests que vous pouvez faire exécuter par un tiers. Si nous nous trompons, vous le verrez.
Décrivez votre modèle (famille, fréquence, enjeu) — nous revenons vers vous avec un protocole d'audit proposé, ses critères et son calendrier. Premier échange sans engagement.
Nous écrire