Périmètre en un coup d’œil
Comment lire cette publication
- Domaines
- **Domaines** Opérations de commerce de détail et de catalogue, flux de travail liés aux candidats à l’emploi et opérations d’assistance.
- Économie
- **Économie** Coût par résultat accepté, débit ajusté selon la qualité à budget fixe, temps de supervision et consacré aux reprises, charge de traitement des escalades et mesures des résultats en aval.
- Garde-fous
- **Garde-fous** Taux de défauts et de violations de contraintes, escalade humaine et reprise en main, suivi de l’équité et des effets lorsque des personnes sont concernées, posture de protection des données, réponse aux incidents et critères de retour à l’état antérieur.
Taxonomie des preuves
Les affirmations n’ont pas toutes le même poids
Résultat externe rapporté
Une entreprise, un fournisseur ou une équipe d’ingénierie a rendu ce résultat public ; ce dernier n’a pas nécessairement été reproduit de manière indépendante.
Exigence légale
Exigence émanant d’une loi, d’une règle ou d’une autorité officielle nommée, applicable uniquement à la juridiction et à l’usage concernés.
Méthode établie
Une méthode statistique ou de gestion des risques provenant d’une source technique faisant autorité.
Seuil proposé par inAi
Une règle de conception, d’évaluation ou d’exploitation proposée par inAi pour ce cadre.
Scénario illustratif
Un exemple synthétique utilisé pour expliquer un modèle de calcul ou de surveillance ; pas de données opérationnelles observées.
Résultat mesuré par inAi
Réservé aux expériences, produits ou déploiements documentés d’inAi chez des partenaires.
Aperçu de la recherche opérationnelle
Résumé et périmètre des éléments probants
L’IA passe d’une assistance isolée à des processus opérationnels, mais le niveau d’autonomie adapté reste propre à chaque tâche. Cette synthèse compare des éléments probants issus de cas publics dans le commerce de détail et les catalogues, les processus liés aux candidatures d’emploi et l’assistance, puis propose des seuils d’acceptation, des pratiques d’échantillonnage, de suivi, de retour à un état antérieur et de protection des données que les organisations peuvent adapter à leur tolérance au risque et à leurs conditions d’exploitation. Les résultats déclarés par des entreprises, les exigences légales, les méthodes établies, les exemples illustratifs et les recommandations d’inAi sont identifiés séparément.
Légende des éléments probants et de la provenance
Les types de preuve sont séparés afin que les cas rapportés, exigences légales, méthodes établies, exemples illustratifs et conclusions d’inAi ne soient pas confondus.
Configurations réversibles
Assistance, supervision et exécution comme modes de fonctionnement
Considérez l’assistance, la supervision et l’exécution comme des configurations opérationnelles réversibles, et non comme une échelle de maturité universelle. Une tâche délimitée ne devrait évoluer vers une plus grande autonomie que lorsque la valeur ajustée selon la qualité s’améliore, que les seuils de risque grave restent respectés, que la charge humaine et la gestion des exceptions restent acceptables, que le rétablissement est testé et que le cadre juridique ainsi que la gestion des données correspondent à l’usage réel. Une tâche peut rester supervisée indéfiniment, être divisée en sous-tâches soumises à des modes différents, ou revenir vers une supervision renforcée lorsque le modèle, les données, l’environnement, les règles ou les conséquences pour les utilisateurs changent.
Configurations de fonctionnement réversibles
Humain principal
Revue échantillonnée + exceptions
Intentions limitées + récupération
← conserver · réviser · séparer · rétablir →
L’assistance, la supervision et l’exécution sont des configurations de fonctionnement réversibles. Le bon mode dépend de la tâche, des éléments probants, de l’impact et des conditions de rétablissement, et non d’une progression universelle vers l’autonomie maximale.
Cas et limites
Éléments de preuve par domaine et par tâche
| Tâche | Mode de fonctionnement signalé ou proposé | Éléments probants / critères d’acceptation | Résultat opérationnel publié | Statut des éléments probants et date |
|---|---|---|---|---|
| **Commerce de détail : extraction simple d’attributs** | Extraction automatisée en production, avec échantillonnage périodique et examen humain des résultats à faible confiance | Utilisez une validation spécifique aux attributs, annotée par des humains. Instacart rapporte **95 % d’exactitude** pour un exemple simple d’attribut « organique » ; il ne s’agit pas d’un seuil universel de précision/rappel. L’évaluation par LLM doit être calibrée par rapport à des annotations humaines. | Pour les attributs simples, Instacart rapporte une qualité similaire avec un modèle moins puissant, pour **un coût de modèle inférieur de 70 %** ; pour les attributs difficiles, ce modèle a produit une **baisse de 60 % de l’exactitude**. | **Résultat rapporté externe** · Article d'ingénierie Instacart · Août 2025 |
| **Commerce de détail : extraction d'attributs complexes ou multimodaux** | Extraction automatisée avec échantillonnage périodique et examen des exceptions | Validez l’exactitude des attributs numériques, la cohérence des sources, les preuves manquantes et les modes de défaillance propres aux attributs à l’aide d’un échantillon annoté par des humains. | Pour `sheet_count`, Instacart indique que les LLM multimodaux ont augmenté le rappel de **10 % par rapport aux modèles textuels seuls**. Conservez la formulation de la source ; ne la transformez pas silencieusement en 10 points de pourcentage. | **Résultat rapporté externe** · Article d'ingénierie Instacart · Août 2025 |
| **Commerce de détail — ingestion, enrichissement et publication du catalogue** | Infrastructure automatisée avec validateurs, gestion des versions, détection des régressions et retour à l’état antérieur | Définissez la validation des schémas et des règles métier, la traçabilité des sources, les seuils de régression au niveau du catalogue et les tests de retour à un état antérieur. La source Uber ne fait pas état de « zéro violation de haute gravité » ni des règles de contrôle de WECO. | Uber rapporte qu’INCA traite **100 000 modifications par seconde**, des milliards de modifications par jour, avec validation lors de la publication, détection des régressions et retour à un état antérieur quasi instantané grâce à la gestion des versions du catalogue. | **Architecture de production rapportée externe** · Uber Engineering · août 2025 |
| **Sélection des candidats liée à l'emploi** | Aide à la décision avec responsabilité humaine ; le mode approprié dépend de l’usage prévu, de la juridiction et de l’impact | Lorsque la Local Law 144 de New York s’applique : audit indépendant des biais dans l’année précédant l’utilisation, résumé public et avis requis. Évaluer également la pertinence pour l’emploi, la qualité des données, l’accessibilité, la revue humaine, la contestabilité et les autres obligations applicables de non-discrimination et de confidentialité. | Ne prétendez pas que la conformité « limite le risque juridique ». La loi locale 144 crée des obligations spécifiques d'audit et de notification ; cela n’élimine pas les risques juridiques ou éthiques plus larges. | **Exigence légale et contrôles proposés par inAi** · Matériaux NYC DCWP · revérifié en juillet 2026 |
| **Assistance — attribution de tickets d’ingénierie** | Affectation automatisée avec un parcours d’exception ou de faible confiance défini localement | Mesurer l’affectation à la bonne équipe sur un échantillon représentatif annoté, ainsi que le coût des erreurs d’acheminement, le taux d’exception et le délai de correction. L’escalade conditionnée par la confiance est une recommandation d’inAi, sauf si la source la documente séparément. | Le témoignage client Gelato de Google Cloud fait état d'une précision augmentant de **60 % à 90 %** et de **120 heures de travail hebdomadaires économisées** pour l'attribution des tickets d'assistance technique. | **Étude de cas client hébergée par le fournisseur** · source actuelle révisée en juillet 2026 |
| **Assistance — questions-réponses encadrées sur une base de connaissances** | Réponse automatisée avec garde-fous en ligne, nouvelle tentative ou escalade, surveillance de la qualité hors ligne et étalonnage humain | Utilisez d’abord une vérification simple lorsque cela est pertinent, puis un évaluateur LLM pour les cas signalés ; calibrez le suivi automatisé sur des échantillons aléatoires contrôlés par des humains, et suivez séparément l’ancrage dans les sources, l’exactitude, la langue, la cohérence, la pertinence et les violations graves de politiques. | DoorDash rapporte une **réduction de 90 % des hallucinations globales** et une **réduction de 99 % des problèmes de conformité potentiellement graves**. La source n’affirme pas l’absence totale d’échecs. | **Résultat externe rapporté** · DoorDash Engineering · septembre 2024 |
| **Assistance — conversation de bout en bout avec passage à un humain** | Service automatisé pour des intentions délimitées, avec possibilité accessible d’escalade vers un humain | Suivez la satisfaction client, la résolution au premier contact, le taux de demandes répétées, les escalades, le délai de résolution, le taux de réclamations, les résultats pour les utilisateurs vulnérables et la qualité de service — pas uniquement le taux de traitement sans intervention humaine. | Klarna a indiqué en février 2024 que l’assistant traitait deux tiers des conversations, ramenait le temps moyen de résolution de 11 minutes à moins de 2 et atteignait un niveau de satisfaction équivalent à celui des agents humains. Des informations publiées en 2025 ont ensuite décrit un rééquilibrage stratégique en faveur du service humain et de la qualité. | **Rapport de lancement de l'entreprise et mise à jour indépendante ultérieure** · Février 2024 / septembre 2025 |
Les résultats rapportés, les exigences légales, les seuils proposés et les dates des éléments probants restent visiblement séparés.
Corrections spécifiques à la source
Ce que chaque cas opérationnel étaye — et ses limites
Instacart PARSE
- Seuils propres aux attributs, établis sur un échantillon de validation annoté par des humains ; Instacart rapporte une exactitude de 95 % pour un exemple simple d’attribut « organique ».
- Évaluation par LLM calibrée sur des échantillons annotés par des humains, les résultats à faible confiance et les résultats échantillonnés étant examinés par des humains.
- Instacart rapporte une qualité similaire pour un coût de modèle inférieur de 70 % dans le cas d’attributs simples ; les attributs difficiles ont subi une baisse d’exactitude de 60 % avec le modèle moins puissant.
- Instacart rapporte une augmentation du rappel de 10 % par rapport aux modèles textuels seuls pour l’expérience
sheet_count.
Uber INCA
Seuil : validation des schémas et des règles métier, traçabilité des sources, détection des régressions, retour en arrière versionné et conditions d’arrêt propres à l’incident.
Statut des éléments probants : architecture de production rapportée en externe ; il ne s’agit pas d’une mesure de l’autonomie par inAi.
Loi locale 144 de New York
- Ces contrôles répondent aux exigences précises de la loi locale 144 en matière d’audit et de notification, là où cette loi s’applique ; ils n’éliminent pas les obligations plus larges relatives à la discrimination, à la vie privée, à l’accessibilité, à l’emploi ou à la protection des données.
- Lorsque la loi locale 144 s’applique, conservez le dossier d’audit indépendant des biais, le résumé public et les avis requis destinés aux candidats ou aux employés. Considérez ces exigences comme un minimum, non comme un cadre complet d’équité ou de maîtrise du risque juridique. Le suivi continu devrait également examiner la pertinence pour l’emploi, la qualité des données, les résultats par sous-groupe, la possibilité de dérogation humaine, l’accessibilité, la contestabilité et les conséquences des faux positifs et des faux négatifs.
Données de suivi
- la grandeur suivie ;
- le dénominateur ;
- la population et la période considérée ;
- les tailles minimales d’échantillon ;
- les groupes intersectionnels ;
- le traitement à appliquer lorsque de petits échantillons rendent le graphique instable ;
- la différence entre un audit juridique, un suivi continu de l’équité et une alerte de maîtrise statistique des processus.
Gelato/Google Cloud
Le témoignage client Gelato de Google Cloud rapporte que l'attribution automatisée des tickets d'assistance technique a augmenté le routage correct de 60 % à 90 % et a permis d'économiser 120 heures de travail hebdomadaire. La source est une étude de cas client hébergée par le fournisseur ; le déploiement local doit mesurer séparément la confiance, la gestion des exceptions, le coût des erreurs de routage et le délai de correction.
DoorDash
- DoorDash indique une réduction de 99 % des problèmes de conformité potentiellement graves ; suivre le taux d’événements graves restants, son dénominateur, la période d’observation et l’issue de l’escalade.
- Une vérification simple en ligne traite les cas directs ; les réponses signalées font l’objet d’une évaluation par LLM, tandis qu’un suivi plus large de la qualité hors ligne est calibré sur des échantillons aléatoires revus par des humains.
- Exigence concernant l’évaluateur LLM
Traiter un évaluateur LLM comme un instrument de mesure calibré, non comme une vérité de référence. Le valider sur un jeu annoté par des humains, rapporter l’accord par classe de défaut et par langue, tester la sensibilité à l’ordre et à l’instruction, répéter un échantillon sur plusieurs exécutions et transmettre les cas incertains ou à fort impact à une revue humaine. Les seuils relatifs aux politiques graves ne doivent pas dépendre du seul jugement non calibré et sans référence.
Klarna
Les indicateurs publiés par Klarna lors du lancement en février 2024 illustrent l’ampleur et la vitesse possibles dans des processus de service client délimités. Les informations publiées en 2025 indiquent que l’entreprise a rééquilibré sa stratégie en faveur de la disponibilité humaine, de la qualité de service et de la croissance. Ce cas combiné étaye un modèle de configuration réversible : les niveaux d’automatisation doivent répondre aux résultats obtenus pour les clients et à la stratégie de l’organisation, et non au seul taux de confinement et au coût.
Indicateurs de résultat
- taux de contacts répétés ;
- taux de réclamations ;
- effort demandé au client ;
- réussite de l’escalade vers un humain ;
- résultat pour les utilisateurs vulnérables ;
- abandon ;
- taux de retour en arrière ou de correction ;
- couverture des intentions rares ;
- connaissances des employés et retour d’information sur la qualité ;
- revenu ou rétention en aval lorsque l’interprétation causale est crédible.
Scénario illustratif
Économie unitaire ajustée en fonction de la qualité
Coût par résultat accepté = (modèle + recherche d’information + garde-fous + contrôle humain + reprises + infrastructure + provision pour incidents) ÷ résultats acceptés après le seuil de qualité défini
Débit ajusté selon la qualité = résultats acceptés sans défaut grave ÷ temps total de fonctionnement humain et machine
Coût par résultat accepté
Seuil de qualité · période d’échantillonnage · nombre accepté · nombre de défauts graves
Les indicateurs issus de cas externes donnent un contexte sur l’échelle et les résultats opérationnels ; ils ne sont pas la source des valeurs illustratives en euros.
Catégories de coûts qui doivent rester visibles
- inférence du modèle ;
- recherche d’information ou accès aux données ;
- garde-fous et évaluation ;
- contrôle humain ;
- reprises ;
- intégration et orchestration ;
- suivi et observabilité ;
- enquête sur les incidents et rétablissement ;
- frais généraux liés aux fournisseurs et à l’infrastructure ;
- opérations juridiques et de conformité lorsqu’elles sont réellement imputables ;
- conduite du changement et formation des employés ;
- coût des erreurs en aval.
Méthodes établies
Échantillonnage et calibrage de l’évaluateur
Utilisez des méthodes classiques d’échantillonnage d’acceptation par attributs, telles que celles décrites dans le manuel de statistiques d’ingénierie du NIST/SEMATECH, lorsque le processus forme réellement des lots inspectables et que des défauts binaires peuvent être définis. Choisissez la taille de l’échantillon et le nombre d’acceptation à partir d’hypothèses explicites de niveau de qualité acceptable, de niveau de qualité rejetable, de risque du producteur et de risque du consommateur.
Hypothèses d’échantillonnage et stratification des risques
- un lot ou une période définie ;
- une taxonomie de défauts stable ;
- un échantillonnage aléatoire ou représentatif ;
- un traitement clair des résultats dupliqués ou corrélés ;
- une stratification lorsque le risque diffère selon la langue, la catégorie, le détaillant, le groupe de candidats, l’intention ou la complexité ;
- une explicitation du risque pour le producteur et le consommateur ;
- une procédure applicable aux lots rejetés ;
- une règle pour augmenter l’échantillonnage après des incidents ou des changements.
Échantillonnez proportionnellement au trafic pour estimer la qualité globale, mais suréchantillonnez les segments à faible volume, à fort impact, récemment modifiés, multilingues ou historiquement faibles. Présentez séparément les résultats globaux pondérés et les résultats par segment.
Surveillance illustrative
Dérive, limites de contrôle et rétablissement
Exemple de surveillance illustratif — données synthétiques
Exemple de suivi illustratif — données synthétiques
Ce graphique montre comment peuvent être présentés un signal de qualité, un retour en arrière et une intensification de l’échantillonnage. Il ne rend compte d’aucun incident impliquant inAi, PageMind, Emplo, un client ou un partenaire.
Un diagramme de contrôle détecte les changements de comportement d’un processus ; il ne détermine pas si le niveau de référence est acceptable. Maintenez des seuils distincts de qualité, de sécurité, de droit et de politique.
Responsabilités du plan d’action
- qui reçoit l’alerte ;
- qui peut arrêter le processus ;
- qui autorise la restauration ;
- quels éléments de preuve sont nécessaires ;
- comment les utilisateurs ou partenaires concernés sont informés, lorsque cela est pertinent.
Boucle de fonctionnement ajustée en qualité
Économie · impact humain · données et droit · récupération
L’IA opérationnelle est un problème de contrôle itératif. Le mode de déploiement doit changer lorsque les éléments probants, les risques, les données, le droit ou les résultats en aval changent.
Posture spécifique à la configuration
Protection des données et posture réglementaire
Protection des données et posture réglementaire
L’emplacement et la conservation des données doivent être vérifiés pour le fournisseur, le modèle, la fonctionnalité, le compte, la région et le contrat précis utilisés par le processus. Pour les charges de travail dans l’UE, documentez où les données sont stockées et traitées, et vérifiez les exceptions introduites par l’ancrage dans les sources, la recherche d’information, les fonctionnalités agentiques, l’état de session, les caches, la journalisation des requêtes et réponses, la surveillance des abus et les sous-traitants. Ne revendiquez aucune rétention de données sans que le flux de données entièrement configuré et les conditions contractuelles en vigueur ne l’établissent.
Lorsque le règlement européen sur l’IA ou un autre régime propre à l’IA peut s’appliquer, classez le système selon sa finalité prévue et distinguez les obligations des fournisseurs, déployeurs, employeurs et autres acteurs. Une IA liée à l’emploi peut relever d’une catégorie à haut risque, mais les obligations dépendent de l’usage, du rôle, du calendrier et des orientations définitives applicables. Datez cette note juridique et réglementaire et vérifiez-la de nouveau avant toute publication ou tout déploiement.
Les processus produit ne doivent définir que les enregistrements dont ils ont réellement besoin : liens vers les sources et les preuves lorsqu’ils sont utiles, journaux d’actions et d’approbations, versions de modèle et d’instruction, paramètres de localisation des données, règles de conservation et de suppression, dossiers d’incident et informations destinées aux utilisateurs ou aux travailleurs lorsque cela est requis. PageMind, Emplo et les autres produits nécessitent des évaluations distinctes et propres au produit ; cette synthèse ne formule aucune allégation générale de conformité à leur sujet.
Contrôles spécifiques à une tâche
Guides opérationnels par domaine
Flux de travail du commerce de détail et du catalogue
- Utilisez des contrôles terminologiques propres au domaine et des liens vers les sources ou les preuves au niveau de chaque ligne lorsqu’ils facilitent le contrôle. Pour les charges de travail dans l’UE, vérifiez le fournisseur précis et la configuration des fonctionnalités en matière d’emplacement des données, de conservation, de journalisation, d’ancrage dans les sources, de mise en cache et de sous-traitants ; ne vous fiez pas au seul libellé d’un point de terminaison.
- Mesurez les conséquences en aval dans le catalogue — rejet, correction, retour, échec de recherche, escalade de conformité et défaut affectant le client — et pas seulement la précision de l’extraction.
Processus liés aux candidats à l’emploi
- Lorsqu’une loi sur les AEDT ou un régime applicable aux IA à haut risque s’applique, conservez l’audit indépendant requis, le résumé public, l’avis et les dossiers propres au rôle. Considérez ces contrôles comme un minimum, et non comme un cadre complet pour l’équité ou le droit du travail.
- Suivez les résultats de sélection ou de notation, les conséquences des faux positifs et faux négatifs, la pertinence pour l’emploi, la qualité des données, les effets par sous-groupe et intersectionnels, les dérogations humaines, l’accessibilité et la possibilité de contestation. La stabilité statistique ne suffit pas, à elle seule, à établir l’équité.
- Conservez assez d’informations pour reconstruire le processus d’aide à la décision : outil et version, usage prévu, entrées et fonctionnalités lorsque la loi le permet, résultat produit, action du relecteur humain, dérogation ou recours, ainsi que le motif de la décision finale. N’enregistrez pas de données sensibles uniquement parce qu’elles pourraient être utiles ultérieurement.
- L’IA liée à l’emploi devrait soutenir une prise de décision humaine responsable, sauf si un usage licite, validé et adéquatement gouverné justifie une autre configuration. La page ne doit pas laisser entendre qu’un simple tableau de bord sur les biais rend la présélection automatisée sûre.
Opérations de support
- Utilisez des contrôles déterministes ou de similarité peu coûteux pour les cas simples où ils sont valides, puis appliquez un évaluateur LLM, une nouvelle tentative ou une escalade vers un humain aux cas signalés. Calibrez l’évaluateur par rapport à des échantillons aléatoires contrôlés par des humains et surveillez séparément les défauts graves.
- Suivez le taux de traitement sans intervention humaine ainsi que les contacts répétés, la résolution réussie, le taux de plaintes, la réussite du transfert vers un humain, l’effort du client, les abandons et les échecs à longue traîne. Un taux d’automatisation élevé ne constitue pas une preuve suffisante d’un meilleur service.
Schéma d’ingénierie
Liste de contrôle pour la migration
- Définissez la tâche et l’unité opérationnelle. Précisez la sous-tâche, l’utilisateur, la conséquence, la définition d’un résultat accepté et les conditions dans lesquelles le système doit s’abstenir ou faire remonter le cas.
- Mesurez le point de référence. Consignez la qualité actuelle, le débit, le temps humain, les reprises, les escalades, les résultats en aval et le coût total d’exploitation avant de changer de mode.
- Choisissez des critères d’acceptation propres à la tâche. Fixez les seuils de qualité, de défaut grave, d’impact humain, de droit et de reprise indépendamment de l’objectif économique.
- Validez sur des données représentatives et stratifiées selon le risque. Incluez les segments difficiles, multilingues, récemment modifiés, à faible volume et à fort impact.
- Étalonnez les évaluateurs automatisés. Comparez les juges LLM, les scores de confiance et les garde-fous à des échantillons annotés par des humains et définissez le comportement en cas d’incertitude ou d’escalade.
- Utilisez l’échantillonnage pour le bon objectif. Appliquez l’échantillonnage d’acceptation aux décisions sur les lots lorsque cela convient, et distinguez-le du suivi continu des processus pour la dérive et le diagnostic.
- Testez les défaillances et la reprise. Vérifiez le retour en arrière, la quarantaine, la nouvelle tentative, la reprise par un humain, la responsabilité de l’incident et les critères de remise en service avant d’augmenter l’autonomie.
- Vérifiez les données et la situation juridique. Contrôlez le fournisseur, le modèle, la fonctionnalité, la région, la journalisation, la conservation, le contrat, la finalité prévue et le rôle organisationnel effectivement concernés.
- Augmentez l’autonomie progressivement et de manière réversible. Commencez par un périmètre limité ou une tranche de trafic, suivez les résultats et prévoyez de revenir à la supervision.
- Réexaminez le système après tout changement significatif. Réévaluez le mode après des changements du modèle, de l’instruction, des outils, des données, du processus, du droit, de la politique ou de la population concernée.
Cette liste est plus longue que les cinq points actuels, mais elle reste compacte et nettement plus défendable.
Architecture de mesure
Familles d’indicateurs et terminologie précise
Familles d’indicateurs
15.1 Qualité des résultats
- précision, rappel, exactitude ou correspondance exacte lorsque cela s’y prête ;
- ancrage dans les sources ou cohérence avec elles ;
- taux de défauts graves ;
- étalonnage ;
- couverture et abstention ;
- performances multilingues et par segment ;
- cohérence entre les versions de modèle ou d’instruction.
15.2 Valeur opérationnelle
- résultats acceptés par heure ou pour un budget fixe ;
- coût par résultat accepté ;
- temps de revue et de reprise ;
- charge d’escalade ;
- délai jusqu’au résultat accepté ;
- coût des incidents et de la reprise ;
- charge d’intégration et de maintenance.
15.3 Résultats en aval
- correction et rejet dans le catalogue ;
- retour ou réclamation client ;
- nouveau contact avec le support ;
- délai jusqu’à la résolution effective ;
- réussite du transfert à un humain ;
- conséquences des faux positifs et faux négatifs pour les candidats ;
- résultat pour le salarié ou l’utilisateur ;
- chiffre d’affaires, rétention ou risque, uniquement lorsqu’une interprétation causale est crédible.
15.4 Effets humains et organisationnels
- maintien et apprentissage de l’expertise ;
- fatigue des relecteurs ;
- perte de compétences ou dépendance excessive ;
- comportement de dérogation et de recours ;
- répartition des gains entre travailleurs expérimentés et moins expérimentés ;
- redéfinition des tâches et clarté des rôles ;
- acceptation par les salariés et qualité du travail ;
- capacité de reprise lorsque le système automatisé est indisponible.
15.5 Gouvernance et reprise
- exhaustivité des journaux d’audit ;
- délai de détection d’un incident ;
- délai de confinement ;
- réussite du retour en arrière ;
- autorisation de remise en service ;
- population affectée ;
- notification et réparation lorsque cela s’y prête ;
- inventaire des fournisseurs, modèles et configurations ;
- date de la dernière revalidation.
| Terme ou modèle actuel | Remplacement recommandé | Raison |
|---|---|---|
| opérations liées aux candidatures | processus liés aux candidats à l’emploi | Plus précis et moins déshumanisant |
| élément accepté | résultat accepté | Fonctionne dans tous les domaines |
| migration vers l’autonomie | sélection ou reconfiguration du mode de fonctionnement | Évite d’impliquer des progrès inévitables à sens unique |
| gravir les échelons | évoluer vers plus d’autonomie / changement de mode | Réversible et spécifique à la tâche |
| Auto | automatisé dans un périmètre défini | Évite toute ambiguïté |
| Production | cas de production rapporté en externe / obligation légale / exemple illustratif | Révèle le type de preuve |
| Validation par juge LLM | évaluation LLM calibrée par rapport aux étiquettes humaines | Le juge ne constitue pas une vérité de terrain |
| zéro échec | taux observé de défauts graves sur N cas et sur une période donnée | Zéro nécessite un dénominateur et un intervalle de confiance |
| risque juridique limité | répond aux exigences légales citées ; un risque plus large demeure | Champ d'application juridique correct |
| absence de conservation | posture de rétention vérifiée du fournisseur/modèle/spécifique à la fonctionnalité | Éviter les affirmations générales |
| conformité | exigence nommée ou catégorie de politique | La « conformité » est trop large |
| violation de contrainte | défaut défini ou catégorie de politique | Nécessite une taxonomie |
| protection des données | emplacement des données, conservation, accès, journalisation, suppression et obligations spécifiques au rôle | Plus spécifique sur le plan opérationnel |
Termes du glossaire
- résultat accepté ;
- mode de fonctionnement ;
- seuil d’acceptation ;
- défaut grave ;
- évaluateur LLM ;
- échantillonnage d’acceptation ;
- diagramme p / diagramme u ;
- limite de contrôle ;
- limite de politique ou de spécification ;
- retour en arrière ;
- finalité prévue ;
- fournisseur / déployeur.
Ce que cette synthèse ne prétend pas établir
Limites de cet aperçu
Ce que la recherche organisationnelle actuelle ajoute
Les données de terrain actuelles ne permettent pas d’apporter une réponse unique à la question de savoir si l’IA doit assister, superviser ou exécuter le travail. Les résultats varient selon la tâche, le travailleur, l’expertise, la conception du flux de travail et l’adéquation de la tâche aux capacités du système. Certaines études constatent des gains de productivité substantiels à court terme, en particulier pour les travailleurs moins expérimentés ou les tâches situées dans la frontière des capacités. D’autres mettent en évidence des pertes de qualité lorsque les utilisateurs s’appuient sur l’IA en dehors de cette frontière. Les recherches sur les équipes indiquent également que la conception de la collaboration humains–IA et l’intégration de l’expertise comptent, et pas seulement la vitesse individuelle.
Pour les opérations d’entreprise, la conclusion pratique est d’évaluer l’ensemble du système de travail : décomposition des tâches, qualité, expertise humaine, escalade, incitations, effets en aval et réversibilité. Une production plus rapide n’est utile que lorsque l’organisation peut encore détecter les erreurs, préserver l’expertise et atteindre le résultat attendu.
Bibliothèque d’éléments probants
Références par type de source
Ouvrir la bibliothèque de références
Page actuelle
Cas appliqués
- Instacart Engineering, « Mise à l’échelle de l’extraction d’attributs de catalogue avec des LLM multimodaux », 1er août 2025.
- Uber Engineering, « From Restaurants to Retail: Scaling Uber Eats for Everything », 6 août 2025.
- DoorDash Engineering, « Vers une automatisation de haute qualité de l’assistance aux Dashers fondée sur les LLM », 17 septembre 2024.
- Google Cloud, étude de cas client Gelato.
- Klarna, « L’assistant d’IA traite les deux tiers des conversations du service client au cours de son premier mois », 27 février 2024.
- OpenAI, page consacrée au cas Klarna.
- Reuters, « Klarna, figure de proue européenne de l’IA, freine sur les chatbots », 10 septembre 2025.
Emploi et sources juridiques
- NYC Department of Consumer and Worker Protection, Automated Employment Decision Tools.
- NYC DCWP, FAQ sur les AEDT.
- NYC Council, dossier législatif de la loi locale 144.
- Commission européenne, lignes directrices destinées aux fournisseurs et déployeurs de systèmes à haut risque, page consultée en juillet 2026.
- Commission européenne, Navigating the AI Act.
- Commission européenne, projet de lignes directrices sur la classification des systèmes à haut risque, mai 2026.
Localisation et conservation des données
- Google Cloud, Agent Platform et absence de conservation des données.
- Google Cloud, surveillance des abus.
- Google Cloud, résidence des données.
- Google Cloud, conditions spécifiques au service.
- Google Cloud, conditions d’utilisation de la plateforme.
Méthodes statistiques et gestion des risques liés à l’IA
- NIST/SEMATECH, e-Handbook of Statistical Methods.
- NIST/SEMATECH, Qu’est-ce que l’échantillonnage d’acceptation ?.
- NIST/SEMATECH, plans d’échantillonnage d’acceptation de lots.
- NIST/SEMATECH, choisir un plan d’échantillonnage à partir d’une courbe OC donnée.
- NIST/SEMATECH, graphiques de contrôle des attributs.
- NIST/SEMATECH, règles WECO.
- NIST, AI Risk Management Framework.
- NIST, Generative AI Profile.
Recherche organisationnelle et sur la productivité
- Brynjolfsson, Li et Raymond, « L’IA générative au travail », Quarterly Journal of Economics, 2025.
- Dell’Acqua et al., « Navigating the Jagged Technological Frontier », Organization Science, 2026.
- Dell’Acqua et al., « The Cybernetic Teammate: A Field Experiment on Generative AI and Teamwork », Organization Science, 2026.
- OCDE, « Les effets de l’IA générative sur la productivité, l’innovation et l’entrepreneuriat », 2025.
- Raisch et al., « Rôles de l’intelligence artificielle dans la collaboration avec les humains », Management Science, 2025.
Recherche sur l’évaluation par LLM
- Shi et al., “A Systematic Study of Position Bias in LLM-as-a-Judge”, 2025.
- Panickssery et al., “LLM Evaluators Recognize and Favor Their Own Generations”, NeurIPS 2024.
- Sheng et al., “Analyzing Uncertainty of LLM-as-a-Judge”, EMNLP 2025.
- Li et al., “Opportunities and Challenges of LLM-as-a-judge”, EMNLP 2025.
Format de la carte source et ensemble minimum
SOURCE
Instacart Engineering — « Mise à l’échelle de l’extraction d’attributs de catalogue avec des LLM multimodaux »
Publié : 1er août 2025
Type d’élément probant : rapport d’ingénierie d’entreprise
Portée pertinente : extraction d’attributs de catalogue
Résultat rapporté : exactitude de 95 % pour un exemple simple d’attribut « organique » ; augmentation de 10 % du rappel pour sheet_count multimodal ; coût de modèle inférieur de 70 % pour les attributs simples ; baisse d’exactitude de 60 % pour les attributs difficiles avec un modèle moins puissant
Limites : il ne s’agit pas d’une référence comparative indépendante entre entreprises ; les résultats dépendent de l’attribut et de la configuration
[Lire la source]
- Instacart PARSE.
- Uber INCA.
- Automatisation de l’assistance DoorDash.
- Étude de cas client Gelato.
- Cas de lancement de Klarna et mise à jour ultérieure.
- Documents officiels relatifs à la loi locale 144 de New York.
- Documents officiels relatifs au règlement européen sur l’IA.
- Échantillonnage d’acceptation et graphiques de contrôle du NIST.
- NIST AI RMF.
Ce contenu peut prendre la forme d’un tiroir de références compact plutôt que d’une grande section visible.


