Périmètre en un coup d’œil
Comment lire cette publication
- Périmètre
- Portée : cet aperçu examine les processus liés à la littérature scientifique et technique, en particulier la synthèse des éléments probants, leur provenance, leur vérification et la réplication. Il s’agit du premier volet technique de l’axe de recherche plus large consacré à l’IA pour la création de connaissances, et non d’un traitement exhaustif de toutes les formes de création de connaissances.
- Position
- Publier des éléments probants accompagnés d’une piste de provenance vérifiable. Réviser, suspendre ou escalader lorsque les critères prédéfinis de vérification et d’incertitude ne sont pas satisfaits.
- Décision
- Publier / réviser / suspendre
Taxonomie des preuves
Les affirmations n’ont pas toutes le même poids
Recherche de littérature
Conclusion ou résultat rapporté par une source externe.
Méthode proposée
Architecture ou flux de travail qu’inAi recommande ou prévoit d’évaluer.
Prototype
Mis en œuvre mais expérimental.
Pratique actuelle
Effectivement utilisé par inAi à ce jour.
Objectif de recherche
Seuil souhaité ou résultat futur, pas un résultat démontré.
Question ouverte
Non résolue.
Thèse axée sur la vérification
Résumé et périmètre
Les index scientifiques ouverts donnent désormais accès à la recherche à une échelle qu’aucune personne ne peut examiner manuellement. Sans provenance ni vérification, la lecture assistée par un LLM peut amplifier des éléments probants utiles aux côtés de contenus de faible qualité, fabriqués ou générés par machine. Cette synthèse propose un processus axé sur la vérification, qui combine graphes de provenance, contrôles du contexte de citation, benchmarks d’erreurs scientifiques, dossiers de réplication et décisions calibrées de publication, de révision ou de suspension. Toute garantie statistique ne s’applique qu’à la fonction de perte définie, aux données d’étalonnage, à la fonction de score et aux hypothèses ; elle ne certifie pas qu’une synthèse longue est vraie.
Résultats de la littérature
État des lieux — avec les limites des indicateurs indirects bien visibles
Provenance et intégrité des citations
- FineCite améliore l’extraction fine du contexte de citation ; des classificateurs distincts de fonction de citation, tels que SciCite, peuvent ensuite indiquer si une citation apporte un contexte, utilise une méthode, étaye un résultat ou contraste avec des travaux antérieurs. Ces signaux doivent aider la revue, non déterminer à eux seuls la validité d’une référence.
- Les classifications « étaye », « contraste avec » et « mentionne » sont des signaux contextuels, non des étiquettes de vérité ; elles doivent être examinées au niveau de l’énoncé associé à la citation et combinées à la qualité de la source ainsi qu’aux éléments probants propres à l’affirmation.
- Dette d’intégrité des citations : problèmes non résolus dans la chaîne de sources d’une affirmation, tels que des identifiants manquants, des incohérences de métadonnées, des éléments probants inaccessibles, un contexte de citation incorrect, une inférence non étayée ou des transformations qui rompent la traçabilité.
Estimation de la nouveauté
- SchNovel fournit un indicateur indirect utile pour l’évaluation, mais ses étiquettes supposent que le second article de chaque paire est le plus novateur. La récence d’une publication ne doit donc pas être considérée comme une mesure de référence de la nouveauté.
- GraphMind — classification de la nouveauté assistée par graphes et recherche d’information ; 3 063 articles ICLR/NeurIPS ; exactitude de 0,52 à 0,74 selon le modèle ; scores d’originalité de la revue par les pairs utilisés comme étiquettes indirectes ; comparaisons de justifications évaluées par GPT-4o ; article de démonstration EMNLP 2025.
- Mise à jour postérieure à la date de référence — les travaux de 2026 renforcent la nécessité de la prudence. NovBench et RINoBench font état d’écarts substantiels entre les jugements de nouveauté des modèles et l’évaluation d’experts, tandis que les tests axiomatiques montrent qu’aucun indicateur de nouveauté existant ne se comporte de manière fiable pour tous les critères testés. Les scores de nouveauté doivent donc être considérés comme des signaux organisant les éléments probants, non comme des verdicts définitifs.
Vérification scientifique
- Lors d’exécutions répétées, les modèles redécouvrent rarement les mêmes erreurs : les performances de vérification sont donc non seulement faibles, mais instables.
- Évaluer les méthodes candidates de vérification à l’aide de tâches de détection d’erreurs au niveau de l’article, du type de SPOT.
- Plage globale des modèles dans PRISMM-Bench v3 27,8 % à 53,9 %
Trois tâches structurées, portant sur 384 incohérences signalées par des évaluateurs dans 353 articles ; accepté à ICLR 2026. 4. PRISMM-Bench évalue des tâches structurées d’identification, de correction et d’appariement. Ses scores ne doivent pas être interprétés comme la fiabilité de bout en bout d’une revue par les pairs. 5. CliniFact fournit 1 970 instances d’affirmation et d’éléments probants cliniques permettant une vérification factuelle et logique propre à un domaine à partir de résumés d’articles liés. Il doit être considéré comme un benchmark clinique, et non comme un jeu de données général de détection des contradictions dans les articles.
Flux de travail de réplication
- Utiliser les lignes directrices de compte rendu adaptées au type de revue — par exemple PRISMA 2020 pour les revues systématiques et PRISMA-ScR pour les revues de portée — et les associer à des normes distinctes de provenance et de conditionnement des artefacts.
- Inclure une fiche de données lorsqu’un jeu de données est publié, une carte de modèle lorsqu’un modèle entraîné est publié, ainsi qu’un manifeste général d’artefacts pour chaque dossier.
- Garder le manifeste et l’exemple exécutable légers. Archiver les données, modèles et résultats volumineux dans des dépôts pérennes dotés d’identifiants, de hachages, de licences et de liens versionnés. Un dossier doit documenter le code, l’environnement, les scripts, les paramètres, les graines aléatoires lorsque cela a un sens, les résultats attendus, les exigences matérielles et d’exécution, les conditions d’accès aux données et la provenance.
- Reproduction complète / Reproduction partielle / Inspection de la méthode uniquement / Reproduction avec accès contrôlé
- L’évaluation d’artefacts EuroSys de 2021 à 2025 fait état de 161 artefacts disponibles, 136 fonctionnels, 75 résultats reproduits et d’environ 58 % de participation parmi les articles acceptés. Ces chiffres décrivent des résultats d’évaluation d’artefacts propres à cette conférence, et non un taux universel de reproductibilité.
Gain de temps humain
- Présélection des résumés — 119 691 notices ; le meilleur ensemble de modèles, à sensibilité parfaite, a réduit la charge de travail de 41,81 % ; les performances variaient fortement selon les revues et nécessitent une validation propre au domaine.
- Synthèse des éléments probants cliniques — TrialReviewBench : 100 revues systématiques et 2 220 études ; dans un essai pilote humain-IA, le rappel a progressé de 71,4 % par rapport au travail manuel et le temps de présélection a diminué de 44,2 % ; résultat propre au domaine clinique.
- Les gains de temps dépendent du flux de travail, du domaine, du modèle, du seuil et de la personne chargée de la revue. Indiquer, à côté du gain de temps, le point de fonctionnement et tout compromis entre sensibilité et rappel.
Contrôle du risque conforme
- Le contrôle du risque conforme peut calibrer une règle de décision pour une perte mesurable définie sur des données réservées, sous les hypothèses énoncées. Un déploiement doit définir la perte, la fonction de score, l’ensemble d’étalonnage, la taille de l’échantillon, le risque cible et le processus de surveillance. La garantie s’applique à cette configuration formelle ; elle ne certifie pas qu’une synthèse longue est vraie, n’élimine pas les erreurs inconnues et ne demeure pas automatiquement valide en cas de changement de domaine.
- Un résultat ne peut être diffusé que lorsque les contrôles requis sur les sources et les métadonnées sont satisfaits, qu’aucune contradiction détectée ne reste sans résolution et que toute règle de décision calibrée respecte ses conditions de fonctionnement déclarées. Sinon, le système doit réviser, suspendre ou escalader le résultat, en consignant les éléments probants, les versions du modèle et des outils, la configuration des seuils, la décision de revue et sa justification.
Intégrité de la recherche et pression des usines à articles scientifiques
Des documents de recherche de faible qualité, fabriqués, générés par machine ou systématiquement manipulés alourdissent l’examen des éléments probants. Les signaux de provenance et d’intégrité peuvent aider au tri, mais une manipulation présumée nécessite une enquête humaine et ne doit pas être inférée d’un seul détecteur automatisé.
Schéma illustratif
Provenance des affirmations et des éléments probants
Modèle de provenance des affirmations et des éléments probants
Modèle illustratif de provenance des affirmations et des éléments probants. La citation, l’étayage, la contradiction, la dérivation et le contrôle sont représentés comme des relations distinctes ; les résultats transformés conservent des liens vers leurs versions sources et les étapes de traitement.
Schéma illustratif : les identifiants et les valeurs sont des espaces réservés et non les résultats d’une étude d’inAi.
Index des preuves
Les benchmarks de vérification scientifique restent loin d’être fiables
Benchmarks de vérification scientifique — résultats associés à une version précise
Tâches et métriques différentes · version fixée · pas de classement agrégé · intervalles de confiance non rapportés ici
Lors d’exécutions répétées, les modèles ont rarement redécouvert les mêmes erreurs, de sorte que les performances de vérification sont non seulement faibles, mais aussi instables.
Plage globale des scores des modèles pour PRISMM-Bench v3 27,8 % à 53,9 %
Trois tâches structurées sur 384 incohérences signalées par les évaluateurs dans 353 articles ; accepté à ICLR 2026.
| Source | Statut | Domaine/tâche | Corpus | Résultat rapporté | Mise en garde requise |
|---|---|---|---|---|---|
| [SPOT](https://arxiv.org/abs/2505.11855) | Préimpression | Détection d’erreurs scientifiques au niveau des articles | 83 articles ; 91 erreurs confirmées | Meilleure précision de 6,1 % ; 21,1 % de rappel | Les erreurs ont été validées par les auteurs ou dans le cadre d’un contrôle humain ; leur redécouverte lors d’exécutions répétées était faible ; il s’agit d’un benchmark, non d’un détecteur de production |
| [PRISMM-Bench v1](https://arxiv.org/abs/2510.16505v1) | Préimpression à la date limite d’octobre 2025 | Identification d’incohérences multimodales structurées, proposition de correction et appariement de paires | 262 incohérences ; 242 articles | plage globale des scores de modèles : 26,1 % à 54,2 % | Conserver v1 comme référence ; il ne s’agit pas d’une évaluation par les pairs ouverte |
| [PRISMM-Bench v3](https://arxiv.org/abs/2510.16505) | Accepté ICLR 2026 | Benchmark multimodal structuré mis à jour | 384 incohérences ; 353 articles | 27,8 % à 53,9 % | Utiliser uniquement dans la mise à jour post-vintage ou mettre à jour la page entière |
| [GraphMind](https://doi.org/10.18653/v1/2025.emnlp-demos.21) | Démo EMNLP 2025 évaluée par des pairs | Classification de la nouveauté assistée par les graphes et la recherche documentaire | 3 063 articles ICLR/NeurIPS | Exactitude de GraphMind : 0,52 à 0,74 selon le modèle | Les scores médians d’originalité des évaluateurs sont des indicateurs indirects ; les justifications ont été évaluées avec GPT-4o |
| [SchNovel](https://doi.org/10.18653/v1/2025.aisd-main.5) | Article d’atelier évalué par les pairs | Indicateur indirect de nouveauté scientifique par paires | 15 000 paires d’articles ; six domaines | RAG-Novelty surpasse les références publiées | L’article le plus récent est supposé plus novateur ; la récence est un indicateur indirect bruité |
| [FineCite](https://doi.org/10.18653/v1/2025.findings-acl.1259) | Article évalué par les pairs, Findings of ACL 2025 | Extraction du contexte de citation | 1 056 contextes annotés manuellement, auxquels s’ajoutent des jeux de référence publics | Jusqu’à 25 % d’amélioration de l’analyse du contexte de citation | Ne constitue pas, à lui seul, un modèle général d’intégrité des citations ou de vérité |
| [CliniFact](https://doi.org/10.1038/s41597-025-04417-x) | Article Scientific Data 2025 évalué par les pairs | Vérification des affirmations cliniques | 1 970 instances d’affirmations et d’éléments probants | Ensemble de données de référence | Éléments probants cliniques et au niveau des résumés ; il ne s’agit pas d’une extraction générique de contradictions |
| [JAMIA screening](https://doi.org/10.1093/jamia/ocaf050) | Évalué par les pairs 2025 | Présélection des résumés pour une revue systématique | 119 691 enregistrements | Réduction de la charge de travail de 41,81 % avec une sensibilité parfaite pour le meilleur ensemble de modèles | Les performances variaient selon les revues ; une validation propre au domaine est nécessaire |
| [TrialMind](https://doi.org/10.1038/s41746-025-01840-7) | Article évalué par les pairs, npj Digital Medicine 2025 | Synthèse des preuves cliniques | 100 revues ; 2 220 études | Étude pilote humain-IA : +71,4 % de rappel ; −44,2 % de temps de sélection | Résultat pilote dans la synthèse des preuves cliniques, pas d’effet universel |
| [EuroSys AE](https://doi.org/10.1145/3736731.3746152) | Évalué par les pairs 2025 | Évaluation des artefacts | Données propres à la conférence, de 2021 à 2025 | 161 disponibles ; 136 fonctionnels ; 75 résultats reproduits ; environ 58 % de participation | Les décomptes et la participation sont propres à chaque conférence ; il ne s’agit pas d’un pourcentage universel de reproductibilité |
Ces entrées couvrent différents domaines, formulations de tâches, corpus et indicateurs. Elles constituent un répertoire d’éléments probants, non un classement unique comparable.
Méthode proposée
Réplication et publication / révision / suspension
Complétude du dossier de réplication
Affirmation de recherche → manifeste des sources et des versions → code et environnement → données ou déclaration d’accès → instructions d’exécution → résultats attendus et hachages → périmètre de reproduction → résultat de reproduction indépendant
Décision de publier, réviser ou suspendre
Les détecteurs produisent des signaux · les réviseurs interprètent les preuves · le calibrage régit une perte définie · aucune couche ne certifie seule la vérité
Une décision de publier ou de suspendre combine l’intégrité des sources, la vérification au niveau de chaque affirmation, l’examen du périmètre et une règle de fonctionnement calibrée. L’étalonnage statistique ne remplace pas la revue des éléments probants.
Modèles de flux de travail
Carte des méthodes
- Aucun index n’est exhaustif. Les notices doivent conserver la source de référence, la date de récupération, l’identifiant, la version, le statut d’accès ainsi que l’état de correction ou de rétractation ; les doublons doivent être résolus sans effacer les métadonnées propres à la source.
- Extraire du texte, des tableaux et des figures les affirmations candidates ; conserver exactement les passages sources et leur modalité ; évaluer les méthodes de vérification à l’aide de tâches SPOT, PRISMM et spécifiques au domaine telles que CliniFact ; soumettre les cas non résolus à un examen par domaine.
- Rédiger à partir de sources ayant passé les contrôles documentés de métadonnées, d’éligibilité et de qualité. Conserver le statut des sources et les questions non résolues plutôt que de réduire leur qualité à une unique étiquette « propre / non propre ».
- Utiliser plusieurs perspectives de recherche documentaire et inclure une recherche explicite d’éléments infirmants ou extérieurs au voisinage. Les méthodes de voisinage organisent l’attention ; elles n’établissent pas l’exhaustivité.
- Regrouper le code, l’environnement, les scripts, les paramètres, les résultats attendus, les conditions d’accès aux données, les identifiants, les hachages et la provenance. Utiliser un manifeste d’artefacts pour chaque dossier ; ajouter une fiche descriptive pour les jeux de données publiés et une fiche de modèle pour les modèles entraînés publiés. Stocker les objets volumineux dans des dépôts pérennes et les relier au moyen d’identifiants versionnés, plutôt que d’imposer une taille maximale universelle à chaque lot.
- Utiliser le désaccord entre modèles comme l’un des signaux d’escalade. L’accord seul ne valide pas une affirmation ; les résultats à forts enjeux exigent une validation indépendante au niveau des éléments probants et un examen humain approprié.
- Surveiller les distributions des fonctions de citation afin de détecter les anomalies et examiner les concentrations inhabituelles. Ne pas imposer de quota universel entre les genres documentaires ou les disciplines sans validation.
- Principe de transfert : les dossiers métiers peuvent réutiliser les méthodes de provenance et de traçabilité des affirmations, mais la qualité, l’actualité, l’autorité, la confidentialité et la portée juridique des sources doivent être évaluées pour le domaine métier. Une URL qui se résout ne prouve pas qu’une affirmation commerciale est vraie.
- Le courriel peut avertir les examinateurs, mais le registre faisant autorité doit être un journal d’audit versionné et à accès contrôlé contenant la décision, l’examinateur, l’horodatage, les versions des sources, les liens vers les éléments probants, les versions du modèle et des outils, la configuration des seuils et la justification.
Mise à jour 2026
Note de recherche postérieure à la date de référence
Mise à jour postérieure à la date de référence — 2026
Les recherches publiées après la date limite initiale d’octobre 2025 renforcent deux conclusions. Premièrement, l’évaluation automatisée de la nouveauté reste difficile : NovBench et RINoBench font état d’écarts substantiels entre les évaluations des modèles et le jugement d’experts, même lorsque les justifications du modèle semblent plausibles. Deuxièmement, la détection des erreurs scientifiques reste incomplète : PaperAudit-Bench et FLAWS étendent l’évaluation au-delà des configurations initiales de SPOT et de PRISMM, mais les systèmes actuels passent encore à côté de nombreuses erreurs substantielles.
De nouveaux travaux sur le contrôle du risque conforme précisent aussi les limites des garanties statistiques. L’étalonnage peut contrôler une perte définie dans des conditions données, mais des objectifs de risque stricts peuvent être irréalisables pour des tâches difficiles, et le changement de distribution exige une surveillance ou une adaptation explicite. Ces avancées renforcent l’intérêt d’une revue au niveau des éléments probants, d’une abstention visible et d’une escalade humaine plutôt que d’une publication automatique.
Questions ouvertes
Ce qui reste en suspens
35.1 Divergence entre experts et modèles pour l’évaluation de la nouveauté
Comment un système doit-il réagir lorsque les justifications du modèle semblent convaincantes, mais que le jugement final sur la nouveauté diverge de celui des experts du domaine ?
Sources pertinentes : RINoBench, NovBench.
35.2 Validité des indicateurs indirects
Quels indicateurs de nouveauté mesurent la nouveauté plutôt que l’impact, la qualité de l’article, les préférences des évaluateurs, l’ancienneté ou la popularité d’un domaine ?
Source pertinente : Axiomatic novelty benchmark.
35.3 Erreurs naturelles ou synthétiques
Comment comparer les résultats entre des erreurs confirmées par les auteurs, des incohérences signalées par des évaluateurs et des défauts insérés de manière synthétique ?
Sources pertinentes : SPOT, PRISMM, FLAWS, PaperAudit-Bench.
35.4 Auditabilité au niveau des processus
Comment la recherche d’informations, l’extraction, la transformation, le calcul, l’inférence de modèle et l’édition humaine peuvent-ils être représentés comme une seule chaîne de provenance vérifiable ?
Normes pertinentes : W3C PROV et Workflow Run RO-Crate.
35.5 Étalonnage en cas de changement de domaine ou de flux de travail
Lorsqu’un modèle, un prompt, un corpus, un domaine ou une tâche change, à quelle vitesse les garanties d’étalonnage deviennent-elles peu fiables, et qu’est-ce qui déclenche le réétalonnage ?
Sources pertinentes : travaux de contrôle conforme tenant compte du changement de domaine et analyse de faisabilité du CRC de 2026.
35.6 Vérification multimodale et numérique
Comment les systèmes peuvent-ils vérifier des valeurs et des relations dans la prose, les tableaux, les graphiques, les équations, les fichiers complémentaires et le code, sans réduire la tâche à un choix multiple ?
35.7 Charge de l’audit humain et dépendance excessive
Un assistant de vérification réduit-il le travail, ou produit-il suffisamment de fausses alertes plausibles pour que la revue par des experts devienne plus lente ou plus biaisée ? Comment les interfaces de revue doivent-elles présenter l’incertitude sans créer de biais d’automatisation ?
Sources primaires
Références et architecture de correction
Ouvrir la liste de références principale
Provenance, contexte de citation et fonction de citation
- Jantsch et coll. FineCite : Une nouvelle approche pour une analyse fine du contexte des citations. Résultats de l'ACL 2025. DOI
- Cohan et coll. Échafaudages structurels pour la classification des intentions de citation dans les publications scientifiques. NAACL 2019. DOI
- Nicholson et coll. scite : un index de citations intelligent qui affiche le contexte des citations et classe leur intention. Quantitative Science Studies, 2021. Article
- W3C. PROV-O : L'ontologie PROV. Standard
- W3C. Amorce du modèle PROV. Primer
Nouveauté
- Lin et coll. Évaluation et amélioration des grands modèles linguistiques pour l'évaluation de la nouveauté dans les publications scientifiques. AISD 2025. DOI
- da Silva et coll. GraphMind : système interactif d'évaluation des nouveautés pour accélérer la découverte scientifique. Démonstrations du système EMNLP 2025. DOI
- Wu et coll. NovBench : Évaluation de grands modèles linguistiques sur l'évaluation de la nouveauté des articles académiques. Résultats de l'ACL 2026. DOI
- Schopf et Färber. Est-ce une idée nouvelle ? Une référence automatisée pour le jugement des idées de recherche. Préimpression 2026. arXiv
- Liu et Zhai. Une référence axiomatique pour l'évaluation des mesures de nouveauté scientifique. Préimpression 2026. arXiv
Vérification et détection d'erreurs
- Son et al. Quand les co-scientifiques en IA échouent : SPOT : une référence pour la vérification automatisée de la recherche scientifique. Préimpression 2025. arXiv
- Selch et coll. PRISMM-Bench : Une référence des incohérences multimodales fondées sur l'examen par les pairs. Accepté ICLR 2026. Current arXiv · v1
- Zhang et coll. Un ensemble de données pour évaluer les allégations de recherche clinique dans de grands modèles linguistiques. Données scientifiques, 2025. DOI
- Tu et coll. PaperAudit-Bench : analyse comparative de la détection des erreurs dans les documents de recherche pour un examen critique automatisé par les pairs. Préimpression 2026. arXiv
- Xi et coll. FLAWS : Une référence pour l'identification et la localisation des erreurs dans les articles scientifiques. Préimpression 2025. arXiv
Synthèse des preuves et temps humain
- Sanghera et coll. Criblage de résumés automatisé haute performance avec de grands ensembles de modèles de langage. JAMIA, 2025. DOI
- Wang et coll. Accélération de la synthèse des preuves cliniques avec de grands modèles linguistiques. npj Digital Medicine, 2025. DOI
- Page et coll. La déclaration PRISMA 2020. BMJ, 2021. DOI
- Tricco et coll. Extension PRISMA pour les examens de portée. Annals of Internal Medicine, 2018. DOI
Calibrage des risques
- Angelopoulos et coll. Contrôle conforme des risques. ICLR 2024. OpenReview
- Cherian et coll. ** Validité du modèle de langage étendu via des méthodes de prédiction conforme améliorées. ** NeurIPS 2024. Paper
- Kotte. Quand le contrôle conforme des risques peut-il certifier les résultats du LLM ? Préimpression 2026. arXiv
- Prédiction conforme basée sur le changement de domaine pour les grands modèles linguistiques. Version 2026. arXiv HTML
Reproductibilité, artefacts et métadonnées logicielles
- D'Elia et al. Leçons tirées de cinq années d'évaluations d'artefacts à EuroSys. ACM REP 2025. DOI
- ACM. Révision des artefacts et marquage des badges. Guidance
- RO-Crate. ** Caisse d'objets de recherche. ** Portail de spécifications
- Workflow Run RO-Crate. Profils de provenance d'exécution de workflow. Specification portal
- Gebru et coll. Fiches techniques pour les ensembles de données. Communications de l'ACM, 2021. Specification portal
- Mitchell et coll. Cartes modèles pour les rapports de modèles. FAT* 2019. DOI
- Format du fichier de citation. CITATION.cff. DOI
- CodeMeta. Vocabulaire de métadonnées de logiciels de recherche. Specification
- Wilkinson et coll. Les principes directeurs FAIR pour la gestion et la gestion des données scientifiques. Données scientifiques, 2016. Project
Intégrité de la recherche
- COPE et STM. Usines de papier — Rapport de recherche. DOI
- Association STM. STM Integrity Hub. Report
Glossaire technique ouvert
- provenance ;
- citance ;
- contexte de citation ;
- intention de citation ;
- couplage bibliographique ;
- co-citation ;
- indicateur indirect de nouveauté ;
- détection de contradictions ;
- réplication / reproduction / répétabilité ;
- WSS@95 ;
- contrôle conforme du risque ;
- abstention ;
- échangeabilité ;
- changement de domaine ;
- usine à articles scientifiques.
Historique des versions
Dossier de publication
Version 1.1 — dates des sources et métadonnées des benchmarks corrigées ; distinction clarifiée entre méthodes proposées et méthodes mises en œuvre ; références et notes postérieures à la date de référence ajoutées.


