Périmètre en un coup d’œil
Comment lire cette publication
- Position
- Hypothèse de travail La performance effectivement obtenue par un système peut progresser grâce à l’orchestration comme grâce à des modèles de base plus performants. L’équilibre dépend de la tâche, de la qualité du routeur ou du vérificateur, ainsi que du coût et de la latence totaux du processus.
- Périmètre
- Profondeur de décomposition, routage des modèles, qualité des vérificateurs, étalonnage, recherche documentaire sélective, mémoire et état, changement de distribution, réparation, ingénierie de la latence et fiabilité à long horizon.
- Pertinence du produit
- Ces schémas peuvent éclairer les systèmes produits qui nécessitent des liens vers des éléments probants, une escalade contrôlée, l’abstention, la réparation et des chemins de décision inspectables. Leur valeur doit être validée sur la distribution de tâches propre au produit.
Taxonomie des preuves
Les affirmations n’ont pas toutes le même poids
Constatation externe
Résultat rapporté par un article ou un benchmark nommé.
Synthèse inAi
Interprétation ou connexion faite par inAi à travers les sources.
Modèle illustratif
Un diagramme conceptuel ou un exemple synthétique, pas des données empiriques.
Schéma d’ingénierie
Un modèle de conception de produit ou de système proposé pour évaluation.
Question ouverte
Une question qui reste en suspens.
Position de recherche
Résumé et limites des affirmations
Dans certains benchmarks et contextes de déploiement, les techniques d’orchestration — dont la décomposition par étapes, le routage des modèles, la recherche d’information, la sélection guidée par un vérificateur et les boucles planifier–agir–vérifier — ont parfois égalé ou dépassé des modèles de référence plus grands, à un coût d’inférence ou à une latence moindres. Le résultat n’est pas universel : les gains dépendent de la structure de la tâche, des capacités du modèle de base, de la qualité du routeur et du vérificateur, de la qualité de la recherche d’information et du coût des appels supplémentaires.
Cette synthèse rassemble les éléments publiés jusqu’en octobre 2025, présente un cadre illustratif pour la décomposition, la propagation des erreurs et la reprise, et transforme la littérature en questions vérifiables pour la conception de systèmes d’IA. Elle n’affirme ni que l’orchestration remplace toujours des modèles plus performants, ni que le même compromis s’applique à tous les domaines.
Comment interpréter les indicateurs
Dans cette synthèse :
La qualité désigne la métrique propre à la tâche rapportée par la source ; elle n’est pas supposée comparable d’une étude à l’autre.
Le coût désigne un coût d’inférence observé ou estimé pour un modèle, un fournisseur, un nombre de jetons et une date de tarification explicitement indiqués.
La latence désigne le temps écoulé de bout en bout dans une configuration d’exécution donnée.
La fiabilité désigne l’exécution répétable d’une tâche selon un protocole d’évaluation déclaré, y compris le comportement en cas d’échec, d’abstention et de reprise.
L’auditabilité désigne la présence de preuves, d’états, de traces ou de dossiers décisionnels inspectables ; c’est une propriété du système, et non un score de benchmark.
Carte des contributions aux publications
Ce que cette synthèse apporte — et ce qu’elle n’affirme pas
- Carte des éléments probants, 2024–octobre 2025
Une synthèse reliée aux sources sur le routage, les cascades, le calcul au moment de l’inférence, la recherche guidée par un vérificateur, l’étalonnage de l’incertitude, la recherche sélective d’informations et l’efficacité de l’inférence. 2. Cadrage analytique
Un modèle conceptuel reliant la compétence du modèle de base, la profondeur de l’orchestration, la propagation des erreurs, la réparation et l’utilité totale. En l’absence de données empiriques, il doit être présenté comme une synthèse d’inAi, et non comme une théorie formelle. 3. Effets rapportés des composants
Une comparaison de résultats propres à chaque étude concernant l’échantillonnage multiple, l’arrêt précoce, les vérificateurs, les méthodes conformes, le déclenchement de la recherche documentaire et le décodage spéculatif. Les valeurs ne constituent pas une unique ablation interétudes et ne doivent pas être agrégées comme si les tâches et les indicateurs étaient identiques. 4. Implications de conception
Des modèles d’ingénierie que les équipes produit peuvent tester : état relié aux éléments probants, recherche sélective d’informations, escalade graduelle de modèles, seuils de vérification, abstention, budgets de réparation et suivi de la dérive. 5. Programme de recherche ouvert
Budgets de réparation, étalonnage multilingue et interdomaines, défaillance des vérificateurs, corruption d’état sur de longues séquences, recherche sélective en cas de changement de distribution et caractérisation formelle des régions où l’orchestration apporte un gain sous conditions.
Résultats externes
Ce que soutiennent les preuves – et où elles s’arrêtent
Le routage, le calcul à l’inférence, la vérification, l’étalonnage, la recherche documentaire et les boucles agentiques forment une même carte du domaine. Chaque résultat reste conditionnel à la tâche évaluée, à l’ensemble de modèles, à l’estimateur et au régime de coûts considérés.
Un nombre croissant de travaux évalue les systèmes d’IA selon le compromis entre coût et performance, plutôt qu’à partir du seul score de la tâche. Les études sur le routage et les cascades montrent que la sélection de modèles peut réduire le coût d’inférence dans certaines distributions de requêtes. Les études sur le calcul au moment de l’inférence montrent qu’une recherche ou une révision supplémentaire peut aider lorsque le modèle de base est suffisamment compétent et que la tâche se prête à une vérification utile. D’autres travaux en montrent les limites : des estimateurs de qualité faibles, des vérificateurs imparfaits, des erreurs de recherche d’information et des tâches difficiles ou dont la distribution a changé peuvent plafonner ou inverser les gains.
Les sections suivantes résument des éléments propres à chaque étude. Les résultats doivent être lus à la lumière des modèles, benchmarks, hypothèses de tarification et méthodes d’évaluation utilisés par chaque source.
Routage et cascades
Les études sur le routage et les cascades montrent que la sélection de modèles peut améliorer le compromis coût–performance lorsque les modèles ont des atouts complémentaires et que l’estimateur de qualité peut déterminer quel modèle suffit pour une requête.
FrugalGPT a rapporté jusqu’à 98 % de réduction des coûts tout en égalant le modèle individuel le plus performant dans le contexte évalué. Il s’agit d’un maximum propre à cette étude, non d’un effet universel du routage ; l’économie dépend de l’ensemble de modèles, de la distribution des tâches, de l’usage des jetons et de la date de tarification.
Des travaux ultérieurs sur le routage unifié en cascade confirment une limite centrale : la sélection n’est utile qu’à la hauteur de l’estimateur utilisé pour prédire la qualité de la réponse.
Le routage peut échouer lorsque la distribution des tâches évolue, que les versions de modèles ou les coûts changent, ou que le signal de confiance du routeur est corrélé aux mêmes erreurs que celles commises par le modèle sélectionné. Un routeur de production doit donc être réétalonné après toute modification importante des modèles ou de la distribution, puis comparé à une solide référence sur un modèle unique.
Éléments à rapporter pour le coût
- fournisseur et version exacte du modèle ;
- nombre de jetons d’entrée et de sortie ;
- date de tarification ;
- politique de nouvelles tentatives et de cache ;
- nombre d’appels ;
- traitement des appels en échec ;
- indicateur de qualité ;
- prise en compte ou non du surcoût du routage et de la vérification.
Calcul du temps de test
- Dans certains régimes de raisonnement, le calcul au moment de l’inférence peut se substituer à une partie de l’échelle de préentraînement, mais son bénéfice dépend de la difficulté du prompt et de la compétence du modèle de base. Dans une analyse MATH à FLOPs comparables, une inférence optimale en calcul avec un modèle plus petit a surpassé un modèle environ quatorze fois plus grand pour des problèmes où ce petit modèle avait déjà une réussite non négligeable.
Cela ne montre pas que la recherche dépasse généralement les modèles plus performants. Pour les tâches plus difficiles, ou lorsque les vérificateurs produisent des faux positifs ou classent mal les chemins valides, l’échantillonnage ou la recherche supplémentaires peuvent plafonner ou réduire l’utilité nette. 2. Le calcul au moment de l’inférence exige un niveau minimal de compétence.
La recherche ne peut améliorer un ensemble de candidats que lorsque le modèle de base produit suffisamment de candidats utiles et que le système peut les distinguer. Un échantillonnage accru ne répare pas un vérificateur qui accepte systématiquement des résultats incorrects.
Piles de vérificateurs
Le choix du vérificateur modifie le compromis qualité–calcul. La vérification au niveau du processus a surpassé, dans certaines configurations de raisonnement mathématique, la vérification du seul résultat final ; des travaux théoriques et empiriques ultérieurs montrent toutefois que cet avantage dépend de la structure de la tâche, de la qualité de la supervision, de la procédure de recherche et du profil de faux positifs et de faux négatifs du vérificateur.
La recherche guidée par un vérificateur doit donc rapporter séparément l’exactitude du vérificateur et celle du système de bout en bout. Une procédure de recherche plus poussée ne peut compenser un vérificateur qui classe systématiquement des chemins incorrects devant des chemins valides.
Indicateurs du vérificateur
- précision et rappel du vérificateur ;
- taux de faux positifs ;
- taux de faux négatifs ;
- étalonnage ;
- indicateur de classement ;
- changement de domaine des tâches ;
- nombre de candidats ;
- seuil d’acceptation ;
- résultat de la tâche de bout en bout ;
- calcul dépensé par réponse acceptée.
Choix du vérificateur
Les effets rapportés dépendent de la tâche et de la configuration. Les vérificateurs de processus ont amélioré la sélection dans certaines expériences MATH ; des vérificateurs imparfaits, qu’ils portent sur le processus ou sur le résultat, peuvent à la fois mal classer les candidats et perdre en efficacité à mesure que le budget de recherche augmente.
Incertitude et méthodes conformes
- Les méthodes conformes peuvent étalonner un objectif de couverture, de violation ou de risque sous les hypothèses de la procédure choisie et des données d’étalonnage. Le paramètre α doit être présenté comme la tolérance pertinente de non-couverture ou de violation, non comme un taux de rejet. Les taux d’abstention et d’escalade doivent être mesurés empiriquement.
Tout seuil conforme utilisé dans un produit doit être réétalonné après une modification importante de la distribution ou du modèle et surveillé afin de détecter des échecs de couverture propres à un sous-groupe ou à un domaine. 2. Des seuils conformes étalonnés selon une tolérance déclarée de violation ou de non-couverture, avec publication empirique des taux d’escalade, d’abstention et des performances par sous-groupe. 3. La couverture n’est pas l’exactitude dans tous les cas.
Une garantie marginale de couverture de 90 % ne signifie pas que chaque réponse acceptée a 90 % de chances d’être correcte. L’interprétation exacte dépend de la cible conforme, du protocole d’étalonnage, des hypothèses et de la population pour laquelle la garantie est énoncée.
Recherche sélective d’informations
- La recherche sélective d’informations détermine si une requête nécessite une recherche externe. Self-Routing RAG fait état de compromis favorables entre exactitude et recherche documentaire dans la configuration évaluée par ses auteurs, mais l’ampleur de ces effets varie selon le benchmark et le modèle.
RAFT répond à une autre question : adapter un modèle à l’utilisation d’éléments probants récupérés propres à un domaine et à l’ignorance de documents distracteurs. Il doit être cité comme méthode de qualité de recherche documentaire et d’adaptation de domaine, non comme source d’un résultat sur le déclenchement de la recherche. 2. La recherche d’informations peut réduire la fiabilité lorsque les éléments probants sont non pertinents, périmés, contradictoires, incomplets ou classés selon la similarité lexicale plutôt que selon leur suffisance pour répondre. Une politique de recherche doit donc évaluer au moins trois questions distinctes :
- Le système doit-il rechercher des informations ?
- A-t-il récupéré des éléments probants pertinents et suffisants ?
- Le générateur les a-t-il utilisés fidèlement ?
- La recherche sélective doit être comparée à une solide référence à contexte long ; la taille de la fenêtre de contexte ne prouve toutefois pas à elle seule que le modèle peut identifier et raisonner de manière fiable sur les informations pertinentes.
Systèmes planificateur-exécuteur-vérificateur
Les architectures planificateur–exécuteur–vérificateur ont amélioré l’achèvement des tâches dans plusieurs systèmes d’agents évalués par benchmark, mais leur bénéfice dépend du planificateur, de l’interface des outils, de la qualité du vérificateur, de la politique de retour à l’état antérieur et de la structure de la tâche. Les points de contrôle de vérification créent des possibilités de réparation ; ils ne garantissent pas que le système détecte la bonne défaillance ni qu’il rétablisse un état valide.
Indicateurs de fiabilité des agents
- réussite de la tâche ;
- pass^k ou fiabilité lors d’exécutions répétées ;
- conformité aux règles applicables ;
- validité des appels d’outils ;
- exactitude de l’état ;
- succès du rétablissement ;
- nombre d’actions ;
- intervention humaine ;
- latence et coût de bout en bout.
Les politiques de routage en pratique
- Routage statique par tâche ou type de contenu
Utile lorsque les catégories sont stables et faciles à identifier. Il échoue lorsque la difficulté varie fortement au sein d’une catégorie ou lorsque la taxonomie devient obsolète. 2. Routage appris
Estimer l’utilité attendue pour chaque modèle, y compris la qualité prévue, le coût, la latence et les pénalités liées à l’échec ou à l’abstention. La cible et la méthode d’étalonnage doivent être indiquées ; un score de confiance n’est pas automatiquement une probabilité d’exactitude. 3. Acceptation a posteriori
Exécuter d’abord un modèle moins coûteux et escalader lorsqu’un score d’acceptation échoue. Le risque principal est un vérificateur produisant des faux positifs et acceptant une réponse plausible mais incorrecte. 4. Routage unifié en cascade
Combiner la sélection ex ante du modèle avec l’acceptation a posteriori. Le bénéfice dépend d’un estimateur de qualité qui demeure valide pour l’ensemble des modèles et types de requêtes. 5. Toutes les politiques de routage doivent être réévaluées après une mise à niveau du modèle, un changement de fournisseur, de prompt, de prix important ou de distribution des requêtes réelles.
Modèles de récupération et de mémoire
- Un référentiel contrôlé de terminologie, d’unités, de schémas et de règles de normalisation approuvés. Le versionner et consigner la règle qui a influencé chaque résultat.
- Un état reliant un résultat ou une décision aux passages sources, aux résultats d’outils ou aux enregistrements utilisés pour le produire. Les liens vers les éléments probants améliorent l’auditabilité, mais ne prouvent pas à eux seuls que le résultat est correct.
- Une couche de recherche pour les enregistrements antérieurs ou les entités de longue traîne. Évaluer la fraîcheur, la duplication, la contamination, le contrôle d’accès et la validité de l’état récupéré pour la tâche en cours.
- considérer le contexte récupéré comme correct du seul fait qu’il a été récupéré ;
- laisser persister un état obsolète sans contrôle d’expiration ou de version ;
- réécrire en mémoire des affirmations générées par un modèle sans validation ;
- perdre la provenance lorsque des enregistrements sont résumés ou fusionnés ;
- supposer qu’une longue fenêtre de contexte supprime le besoin d’évaluer la recherche documentaire ;
- utiliser un même score de similarité comme signal à la fois de pertinence et de suffisance des éléments probants.
Modèles illustratifs
Zones où l’orchestration apporte un gain sous conditions
Zones où l’orchestration apporte un gain sous conditions
Exemple de compromis coût-latence à un seuil de qualité fixe
Synthèse conceptuelle éclairée par RouterBench, FrugalGPT, le routage unifié en cascade, l’inférence optimale en calcul au moment de l’inférence et les recherches sur les limites de mise à l’échelle des vérificateurs. Il ne s’agit pas de la reproduction d’une figure tirée d’un article précis.
La profondeur de l'orchestration peut aider, stagner ou nuire
Modèle illustratif, et non données mesurées par inAi. La forme et les points de croisement dépendent de la compétence du modèle de base, de la difficulté de la tâche, de la qualité du vérificateur et du coût des étapes supplémentaires.
Synthèse conceptuelle éclairée par l’inférence optimale en calcul au moment de l’inférence et par les recherches sur les limites de la recherche et du rééchantillonnage guidés par un vérificateur.
Enregistrements spécifiques à la source
Index d’éléments probants — pas un classement
| Sujet | Configuration source et évaluée | Résultat rapporté | Ce qu'il établit | Principale limite |
|---|---|---|---|---|
| Routage multimodèle | RouterBench ; ensemble de modèles et tâches de benchmark de l’étude | Évaluation comparative coût-performance entre les routeurs | La qualité du routage varie et une évaluation standardisée est nécessaire | N'établit pas un meilleur routeur universel |
| Cascade d'API | FrugalGPT ; Ensemble API/modèle historique | Coût jusqu'à 98 % inférieur tout en correspondant au modèle individuel le plus performant dans le contexte signalé | Les cascades peuvent tirer parti de l’économie hétérogène des modèles | Le résultat dépend des modèles historiques, des tâches et des prix |
| Calcul du temps de test | Snell et coll.; PaLM 2-S* et MATH | Un modèle plus petit dépassait un modèle ~ 14 × plus grand sur certaines strates problématiques correspondant aux FLOP | Le calcul d’inférence adaptative peut surpasser l’échelle dans un régime conditionnel | Non présenté comme résultat universel ; les tâches les plus difficiles ont favorisé une pré-formation plus solide |
| Recherche guidée par le vérificateur | Yu et coll.; GSM8K/MATH et modèles/vérificateurs sélectionnés | Les gains à petit budget peuvent diminuer et s'inverser à mesure que la recherche se développe | L’erreur du vérificateur peut devenir le goulot d’étranglement de la mise à l’échelle | Spécifique aux mathématiques et dépendant de la configuration du vérificateur |
| Auto-cohérence à arrêt précoce | ESC ; six benchmarks de raisonnement | 33,8 à 84,2 % d'échantillons en moins avec des performances comparables dans les expériences des auteurs | Un arrêt précoce peut réduire les coûts d'auto-cohérence | Le plus fort là où les réponses peuvent être comparées de manière fiable |
| Mélange d'agents | ICLR 2025 ; indicateur LC d’AlpacaEval 2.0 | 65,1 % ± 0,6 contre 57,5 % pour GPT-4 Omni dans la configuration rapportée | L'agrégation multimodèle peut améliorer les mesures de préférences automatisées | Dépend du juge et de l'indice de référence ; pas une « qualité » universelle |
| Recherche sélective d’informations | Self-Routing RAG ; quatre benchmarks, trois modèles de la classe 7B | Gains de précision propres à l’étude avec moins de recherches documentaires | La recherche documentaire peut être conditionnée comme décision de sélection des sources | Les résultats varient selon le benchmark/modèle et n'incluent pas RAFT |
| Décodage spéculatif/en cascade | Article cité et configuration matérielle / modèle | Signaler l'accélération exacte mesurée à partir de cette configuration | Les méthodes parallèles ou spéculatives peuvent réduire la latence | La vitesse dépend fortement du taux d'acceptation, du matériel, du traitement par lots et de la longueur de la séquence |
Les résultats ne sont pas directement comparables d’une ligne à l’autre. Chaque étude utilise ses propres modèles, tâches, indicateurs, hypothèses de tarification, matériel et protocole d’évaluation. Le tableau est un index d’éléments probants, pas un classement.
Comparaisons de composants spécifiques à l'étude
Effets rapportés des composants dans les études
Comparaisons de composants propres à chaque étude
Effet : peut améliorer les indicateurs de vote majoritaire ou de sélection pour les tâches dont les réponses sont extractibles, au prix d’une consommation de jetons et d’une latence plus élevées.
Limite : davantage d’échantillons peuvent amplifier l’acceptation de faux positifs lorsque le vérificateur est faible.
Auto-cohérence avec arrêt précoce
Résultat rapporté : de 33,8 % à 84,2 % d’échantillons en moins dans six benchmarks de raisonnement évalués, pour une performance de tâche comparable.
Limite : l’adéquation est maximale pour les tâches où les réponses candidates peuvent être comparées ou normalisées de manière fiable.
Calibre une cible déclarée de couverture ou de risque selon les hypothèses de la méthode. L’efficacité, la rétention, l’abstention et le comportement des sous-groupes doivent être mesurés.
Schéma d’ingénierie
Évaluation opérationnelle et posture de publication
Séparez l’incertitude sur les instances de tâches de l’incertitude sur les tâches stochastiques court. Pour une notation déterministe, signalez la confiance par paire ou par bootstrap intervalles sur les instances d’évaluation. Pour le décodage stochastique ou agent flux de travail, exécutions répétées par tâche et moyenne du rapport, dispersion, taux d'échec, et la fiabilité des essais répétés. Choisissez le nombre de répétitions grâce à une précision ou objectif de puissance plutôt qu’un seuil de départ universel.
Modèle et version API Version d'invite ou de stratégie Paramètres de température, de top-p et de décodage Configuration des outils et de la récupération Date d'évaluation Répartition des tâches et exclusions Nombre d'exécutions par tâche Traitement du cache et des nouvelles tentatives Conditions de concurrence et de matériel/fournisseur Nombre de jetons d'entrée et de sortie Calcul des coûts et date de tarification Latence de bout en bout p50, p95 et p99 L’échec, l’abstention et la réparation comptent Modèle de jugement, invite de jugement et procédure d'audit humain
Signalez séparément les exécutions à froid et à chaud lors de la mise en cache, du chargement du modèle ou l’initialisation de l’outil affecte sensiblement la latence.
Signalez le coût total du flux de travail, et pas seulement le coût du jeton du modèle final. Inclure le routeur, récupération, intégration, vérificateur, outil, nouvelle tentative et surcharge d'appel échoué où matériel.
Lorsqu'un juge LLM est utilisé, publiez le modèle de juge et invitez, randomisez répondre à l'ordre, mesurer les effets de position et de longueur et auditer manuellement un échantillon de désaccords.
Libellés recommandés pour le statut des sources
Conférence / revue évaluée par les pairs Atelier évalué par les pairs Préimpression Benchmark / rapport officiel Synthèse inAi Figure illustrative
Implications en matière de conception
Modèles de produits et questions non résolues
Les systèmes de produits peuvent utiliser une mémoire terminologique, un état lié à des preuves, une récupération, escalade de modèle par étapes, portes de vérification, abstention et limites réparation. Ces modèles doivent être validés par rapport à un modèle unique solide base de référence sur la répartition des tâches propre au produit.
Les portes du vérificateur nécessitent des taux de faux positifs et de faux négatifs mesurés. Les seuils conformes nécessitent des données d'étalonnage représentatives et une revalidation sous changement de distribution. Les moniteurs de dérive peuvent déclencher une enquête ou rollback, mais la règle de surveillance, la taille minimale de l'échantillon et le coût des fausses alarmes doit être documenté.
Les réductions de coûts ne doivent être signalées qu'après le routeur, la récupération, la vérification, les nouvelles tentatives, les outils et les frais généraux de révision humaine sont inclus.
Terminologie de la dérive et limite des affirmations sur le produit
- Règles de la carte de contrôle de Western Electric
- Ces règles ne constituent qu’un signal de dérive possible et non une garantie spécifique à l’IA. Leur sensibilité accrue augmente également la fréquence des fausses alarmes.
- peut informer peut réduire devrait être évalué dans le réglage du produit mesuré
- réduit les coûts améliore l'auditabilité stabilise la production
Novembre 2025 – juillet 2026
Note de recherche postérieure à la date de référence
Plusieurs développements survenus après la fenêtre initiale des preuves renforcent la nécessité pour les réclamations conditionnelles plutôt qu’universelles.
Une révision de mars 2026 de The Limits of Inference Scaling Through Resampling renforce l’analyse des plafonds de faux positifs des vérificateurs et signale que les budgets de rééchantillonnage optimaux peuvent rester faibles dans des coûts de services publics réalistes.
La mise à jour de l’horizon temporel d’achèvement des tâches de METR de mai 2026 fournit une une vision de la fiabilité à long terme pour les logiciels, l'apprentissage automatique et tâches de cybersécurité. La métrique ne doit pas être lue comme une mesure générale de tout travail autonome; il estime la difficulté d'une tâche grâce à son achèvement humain temps dans une suite de tâches définie.
Un article de l'atelier de recherche étudiant ACL de juillet 2026 applique l'étalonnage conforme directement au routage LLM et fournit des garanties de taux de violation dans le cadre du cadre d’étalonnage indiqué dans le document. Il constate également que le routage est dépendant conjointement du modèle et de la tâche.
Ces résultats ne bouleversent pas le bilan d’octobre 2025. Ils l'aiguisent question principale : les gains d'orchestration dépendent de la qualité de l'estimateur, du régime de tâches, et les hypothèses selon lesquelles la fiabilité est mesurée.
Aide à la lecture
Glossaire
Définitions techniques ouvertes
Un glossaire compact et extensible améliorerait la page.
##Cascade
Une séquence qui commence avec un modèle moins cher ou plus petit et qui s'intensifie lorsqu'une règle d'acceptation n'est pas respectée.
Routeur
Une stratégie qui sélectionne un modèle, un outil ou un flux de travail avant ou pendant l'exécution.
Vérificateur
Un modèle, un programme, un test ou une règle qui note, classe ou accepte les résultats des candidats.
Vérificateur de résultats / modèle de récompense des résultats
Un vérificateur qui évalue le résultat final.
Vérificateur de processus / modèle de récompense de processus
Un vérificateur qui évalue les étapes de raisonnement intermédiaires ou les transitions d'état.
Récupération sélective
Une politique qui décide si et où récupérer des preuves externes plutôt que de les récupérer pour chaque requête.
Calibrage conforme
Famille de méthodes qui calibrent les objectifs de couverture ou de risque selon des hypothèses énoncées à l'aide de données d'étalonnage retenues.
Abstention
Une décision de ne pas répondre ou d'agir lorsqu'une condition d'acceptation n'est pas remplie.
Budget de réparation
Une limite déclarée sur les tentatives, les révisions, les appels d’outils ou les tentatives d’escalade.
Calcul au moment du test
Calcul supplémentaire utilisé lors de l'inférence, tel que l'échantillonnage, la recherche, la révision ou la vérification.
Frontière de Pareto
Un ensemble de configurations pour lesquelles améliorer un objectif nécessite d’en aggraver un autre. Les objectifs et les contraintes doivent être explicitement définis.
Sources primaires
Références sélectionnées
Ouvrir l'architecture de référence complète
Routage et cascades
Hu et coll. RouterBench: A Benchmark for Multi-LLM Routing System. arXiv, 2024.
Évaluation standardisée du routeur et grand ensemble de données de résultats enregistrés.Chen, Zaharia et Zou. FrugalGPT: How to Use Large Language Models While Reducing Cost and Improving Performance. TMLR/arXiv, 2023-2024.
Cascades apprises et réductions de coûts spécifiques à l’étude.Dekoninck, Baader et Vechev. Une approche unifiée du routage et de la mise en cascade pour les LLM. ICML 2025.
Routage en cascade unifié et importance des estimateurs de qualité.Uddin et Bauer. Conformal LLM Routing with Distribution-Free Safety Guarantees. Atelier de recherche pour étudiants de l'ACL, 2026.
Résultat de routage conforme post-vintage avec paramètres de violation et de confiance explicites.
Limites du calcul et du vérificateur au moment du test
Snell et coll. Scaling LLM Test-Time Compute Optimally Can Be More Effective Than Scaling Model Parameters. ICLR 2025.
Allocation de calcul en fonction de la difficulté et résultat conditionnel du modèle plus petit ou plus grand.Stroebl, Kapoor et Narayanan. The Limits of Inference Scaling Through Resampling. Préimpression, révisée en 2026.
Plafonds de vérificateurs faussement positifs et rééchantillonnage limité par l'utilité.Yu, Li et Wang. Scaling Flaws of Verifier-Guided Search in Mathematical Reasoning. Préimpression, 2025.
Diminution et inversion des gains de recherche guidée par le vérificateur.Lightman et coll. Let’s Verify Step by Step. ICLR 2024.
Supervision des processus de raisonnement mathématique.Jia, Rakhlin et Xie. Do We Need to Verify Step by Step?. ICML 2025 / enregistrement de préimpression.
Défi théorique de la supériorité universelle de la supervision des processus.Li et coll. Escape Sky-high Cost: Early-stopping Self-Consistency for Multi-step Reasoning. ICLR 2024.
Échantillonnage réduit dans le cadre de la configuration de référence de raisonnement des auteurs.
Incertitude et méthodes conformes
Cherian, Gibbs et Candès. Large Language Model Validity via Enhanced Conformal Prediction Methods. NeurIPS 2024.
Validité conforme des résultats du LLM, conditionnalité et compromis d'utilité.Wang et coll. ConU: Conformal Uncertainty in Large Language Models with Correctness Coverage Guarantees. Résultats de l’EMNLP 2024.
Incertitude conforme pour une génération ouverte.Kapoor et coll. Calibration-Tuning: Teaching Large Language Models to Know What They Don’t Know. IncertainNLP 2024.
Réglage fin axé sur l'étalonnage ; utilisez le lieu exact de l’atelier.
Récupération et contexte long
Zhang et coll. RAFT: Adapting Language Model to Domain Specific RAG. 2024.
Récupération spécifique au domaine, réglage fin et gestion des distractions augmentées.Wu et coll. Self-Routing RAG: Binding Selective Retrieval with Knowledge Verbalization. Préimpression, révisée en 2026.
Routage sélectif des sources et compromis entre précision et récupération spécifiques à l’étude.Liu et coll. Lost in the Middle: How Language Models Use Long Contexts. TACL 2024.
Dégradation sensible à la position lors d’une utilisation en contexte long.Modarressi et coll. NoLiMa: Long-Context Evaluation Beyond Literal Matching. ICML 2025 / arXiv.
Dégradation du contexte long sans correspondance lexicale facile.Bai et coll. LongBench v2. ACL 2025.
Raisonnement réaliste à long contexte sur plusieurs catégories de tâches.
Agrégation et évaluation multi-agents
Wang et coll. Un mélange d'agents améliore les capacités des grands modèles de langage. ICLR 2025.
Agrégation multimodèle et résultats de préférences automatisés spécifiques à l'analyse de référence.Zheng et al. Judging LLM-as-a-Judge with MT-Bench and Chatbot Arena. NeurIPS 2023.
Utilité et préjugés connus des juges.Dubois et coll. Length-Controlled AlpacaEval. COLM 2024.
Atténuation du biais de longueur dans l’évaluation automatisée des préférences.Zheng et al. Cheating Automatic LLM Benchmarks: Null Models Achieve High Win Rates. ICLR 2025.
Limites et risques de jeu dans les benchmarks de préférences automatisés.
Agents et fiabilité à long terme
Yao et coll. τ-bench: A Benchmark for Tool-Agent-User Interaction in Real-World Domains. 2024.
Utilisation des outils, respect des règles et fiabilité des exécutions répétées.METR. Horizons temporels d'achèvement des tâches des modèles Frontier AI. Mis à jour en mai 2026.
Fiabilité des tâches à long terme sur une suite logicielle définie.
Latence d'inférence
Chen et coll. Cascade Speculative Drafting for Even Faster LLM Inference. NeurIPS 2024.
Rédaction spéculative en cascade ; l'accélération dépend de la configuration.Narasimhan et coll. Cascades plus rapides via le décodage spéculatif. ICLR 2025.
Traitement conjoint des cascades et décodage spéculatif.
Terminologie de surveillance
- NIST. Manuel de statistiques d'ingénierie — cartes de contrôle des variables et règles WECO.
Définition des règles de Western Electric et de leur compromis en matière de fausses alarmes.
Gouvernance des publications
Dossier de citation et de révision
NOTES DE RÉVISION Juillet 2026 — attribution de source clarifiée, champ d'application de l'analyse comparative, terminologie conforme, diagrammes illustratifs et recherche post-vintage.


