L'IA dans la production biopharmaceutique : on y est ?

Transcript — Les preuves : que dois-je montrer ?

This is the script the AI voices read, so it matches the audio word for word; times are from the render. Documenté, écrit et lu par des systèmes d'IA sous la direction de Jack Prior ; édition française traduite par l'IA à partir des épisodes anglais vérifiés. Sam et Sarah sont des personnages d'IA ; rien dans l'épisode n'est Jack qui parle, et rien n'engage ses opinions ni celles de son employeur. L'IA générative peut se tromper avec assurance — vérifiez les sources. Corrections : jack@jackprior.ai.

00:00 Narrator Voici On y est ? — un podcast sur l'évolution de l'IA dans la production biopharmaceutique, dirigé par Jack Prior. Un mot sur la façon dont il est fait. Cet épisode a été documenté, écrit et lu par des systèmes d'IA. Jack pose les questions et les cadres ; l'IA lit les documents et écrit la conversation que vous allez entendre, entre deux personnages d'IA : Sam, qui joue un praticien des sciences de la production, et Sarah, qui a lu les documents. Cette édition française est une traduction, par l'IA, des épisodes anglais. Rien de ce que vous entendez n'est Jack qui parle, et rien n'engage ses opinions ni celles de son employeur. Comme toute IA générative, elle peut se tromper — avec assurance, ou en manquant une nuance — ce qui est précisément le risque que cette industrie cherche à maîtriser, et précisément le sujet de cette saison. Vérifiez les sources avant de vous y fier. Les corrections sont les bienvenues à jackprior point A I. Place à l'épisode.

00:56 Sam Une ligne de remplissage-finition, une inspection européenne, deuxième jour. Le site a remplacé l'inspection manuelle du niveau de remplissage par un système de vision industrielle : validé, douze mois en service, taux de détection des défauts sur la diapositive. L'inspecteur lit le rapport de validation et pose trois questions d'affilée. Quel était le taux de détection de l'inspection manuelle que vous avez remplacée ? Qui, dans l'équipe de science des données, a eu accès aux images de test avant l'entraînement du modèle ? Et pour les flacons rejetés pendant les essais, qu'est-ce qui, dans l'image, a conduit à les rejeter ? La responsable de la validation a l'exactitude, la précision et une matrice de confusion. Elle n'a aucun chiffre pour le procédé manuel, personne ne lui a jamais demandé qui avait vu le jeu de test, et les cartes de chaleur, c'était quelque chose que le fournisseur avait montré dans une réunion commerciale. Aucune de ces questions n'était une question de validation il y a deux ans. Les trois figurent aujourd'hui dans un projet d'annexe de six pages.

01:57 Sarah C'est le cadre de ce soir, Sam. Que dois-je montrer ? Pas si le modèle fonctionne, mais ce qui compte comme preuve qu'il fonctionne, sur le papier, devant quelqu'un qui ne l'a pas construit.

02:05 Sam Et comment le mot pour ça a cessé d'être validation pour devenir assurance. Lisons.

Que dois-je montrer, et pourquoi maintenant

02:11 Sam Sarah, la question.

02:13 Sarah À quoi ressemble la crédibilité sur le papier, et comment la validation s'est-elle transformée en assurance ? Deux points d'ancrage. Le projet de la FDA de janvier deux mille vingt-cinq sur l'IA à l'appui des décisions réglementaires, dont nous avons lu les trois premières étapes dans l'épisode deux ; ce soir, l'étape quatre, le plan d'évaluation de la crédibilité, et l'étape six, le rapport. Et le projet d'annexe vingt-deux, dont nous avons lu le verrou la dernière fois ; ce soir, les sections derrière le verrou, de trois à neuf, la recette de preuves la plus concrète du corpus.

02:41 Sam Pourquoi maintenant, en une phrase, parce que j'ai déjà donné la version longue. Le capteur logiciel et le modèle de lot ont été validés pendant vingt ans selon un règlement qui disait validez et laissait le reste au site. Ce qui a changé, c'est que le règlement s'est mis à écrire noir sur blanc ce que sont les preuves, dans les deux mêmes années où l'assistant agentique est entré sans la moindre idée de ce à quoi ses preuves pourraient même ressembler. La recette est arrivée exactement au moment où le cas le plus difficile est arrivé.

03:12 Sam Provenance et maturité.

03:14 Sarah Le projet de la FDA : une guidance de régulateur du CDER avec le CBER, le CDRH et d'autres centres, janvier deux mille vingt-cinq, encore un projet, la production nommée dans son périmètre. L'annexe vingt-deux : couche loi et réglementation, une annexe au volume quatre d'EudraLex, rédigée par le groupe de travail des inspecteurs de l'EMA et soumise au PIC/S, en consultation de juillet à octobre deux mille vingt-cinq, environ mille trois cents commentaires, aucun texte révisé publié après l'atelier de l'EMA cet été, même si l'EMA dit qu'elle est en train de réviser le projet. Si je comprends bien, texte final à la Commission vers la fin de cette année et entrée en vigueur vers deux mille vingt-sept ; considérez cela comme des estimations. Ce sont deux projets. Ce sont deux textes qu'un évaluateur ou un inspecteur lit aujourd'hui.

03:56 Sam Les voix.

03:57 Sarah Quatre. La guidance Computer Software Assurance de la FDA, l'assurance des logiciels informatiques, pour les logiciels de production et de système de management de la qualité, côté dispositifs, finale en septembre deux mille vingt-cinq et rééditée le trois février deux mille vingt-six, d'où vient le mot assurance. Les dix principes de bonnes pratiques d'apprentissage automatique, les GMLP, de la FDA, de Santé Canada et de la MHRA en deux mille vingt et un, adoptés internationalement comme document N quatre-vingt-huit de l'IMDRF en janvier deux mille vingt-cinq. La guidance de la FDA de novembre deux mille vingt-trois, côté dispositifs, sur la crédibilité de la modélisation computationnelle, où le vocabulaire de la crédibilité a été couché par écrit. Et la guidance de BioPhorum de juin deux mille vingt-six sur le risque de l'IA, pratique de l'industrie, pour ce que huit entreprises proposent comme preuves une fois le risque gradué.

04:44 Sam Et le fil de la dernière fois. Le verrou disait quels modèles peuvent être là tout court. Ce soir, c'est ce que vous devez une fois que vous l'avez franchi.

FDA : planifier, exécuter, rapporter, proportionner

04:54 Sam Commençons par la FDA, parce que la réponse de la FDA à la question de la quantité de preuves est la plus courte.

05:01 Sarah Proportionnée au risque du modèle. La section sur le périmètre liste ce qui varie, le niveau de supervision, la rigueur des évaluations et des critères d'acceptation, l'atténuation des risques, l'étendue de la documentation, et dit que tout cela doit être, je cite, proportionné au risque du modèle d'IA et adapté au COU spécifique. La seule illustration concrète de l'étape quatre : les critères d'acceptation de performance doivent être plus stricts, et décrits à la FDA plus en détail, pour les modèles à haut risque que pour ceux à faible risque. Pour certains modèles à faible risque, la FDA peut demander des informations minimales ; pour le haut risque, tout ce qu'elle liste et davantage.

05:33 Sam Donc le cadre me dit que le bouton existe et dans quel sens le tourner. Il ne me dit pas le réglage.

05:39 Sarah Non, et il dit pourquoi : les étapes une à trois ont des exemples travaillés et l'étape quatre n'en a pas, parce que les activités appropriées varient avec les nuances d'un programme donné. Ce qu'il donne à la place, c'est une structure. L'étape quatre est un plan d'évaluation de la crédibilité en deux moitiés. Quatre A décrit le modèle et comment il a été développé : le modèle, les données utilisées pour le développer, et l'entraînement. Quatre B décrit comment le modèle est évalué sur des données de test. L'étape cinq exécute le plan. L'étape six documente les résultats, et tout écart par rapport au plan, dans un rapport d'évaluation de la crédibilité. L'étape sept décide si le modèle est adéquat pour le contexte d'utilisation.

06:16 Sam Et où va le rapport ? Une usine ne dépose pas une soumission pour chaque modèle.

06:21 Sarah Deux destinations. Un document autonome dans une soumission ou un dossier de réunion, ou bien, je cite, conservé et mis à la disposition de la FDA sur demande, par exemple lors d'une inspection. Une note de bas de page ajoute que pour les usages hors des voies de réunion habituelles, les promoteurs peuvent accomplir les sept étapes sans solliciter d'échange préalable. Donc la discipline plan puis rapport peut vivre dans le système qualité du site, avec le rapport conservé pour l'inspection.

06:46 Sam Ce qui est mon premier enseignement, en tant que praticien. Personne ne va vous dire quelle quantité suffit. Ce qu'on vous demandera, c'est si vous avez écrit le plan avant de lancer les essais, si le rapport correspond au plan, et si l'écart entre les deux est expliqué. La discipline est la preuve. Un site avec un magnifique chiffre d'exactitude et pas de plan a un résultat.

Annexe 22 : une utilisation prévue portée par un expert du procédé

07:07 Sarah L'annexe vingt-deux, c'est là que la structure devient concrète. Un projet sur la voie contraignante, un complément à l'annexe sur les systèmes informatisés, six pages, et après le verrou de la section un, elle porte presque entièrement sur les preuves. Je vais regrouper ses sections par idée plutôt que les lire dans l'ordre. La première idée, c'est que les preuves commencent avant le modèle, avec l'utilisation prévue.

07:27 Sam Ce que nous appellerions le contexte d'utilisation.

07:30 Sarah Même artefact, mot différent. La section trois dit que l'utilisation prévue, et les tâches spécifiques que le modèle est conçu pour assister ou automatiser, doivent être décrites en détail, sur la base d'une connaissance approfondie du procédé dans lequel le modèle est intégré. La description doit contenir une caractérisation complète des données que le modèle utilisera en entrée, et de toutes les variations courantes et rares. Le nom que le projet donne à cela, c'est, je cite, l'espace d'échantillonnage des entrées. Les limites et les entrées possiblement erronées ou biaisées doivent être identifiées. Un expert métier du procédé est responsable de l'adéquation de la description, et elle est documentée et approuvée avant le début des essais d'acceptation.

08:07 Sam Un expert du procédé. Pas le data scientist, pas le fournisseur. C'est le bon choix de conception. Le data scientist sait à quoi les données ont ressemblé ; la personne du procédé sait à quoi elles peuvent ressembler : la campagne sur l'ancienne sonde, le changement de fournisseur que personne n'a signalé, l'éclairage après le déplacement de la ligne. Les variations rares, ce sont celles que le jeu d'entraînement n'a jamais vues. Et cela fait du document d'utilisation prévue un document de procédé, ce qui veut dire que c'est le MSAT qui doit l'écrire.

08:40 Sarah Le point trois point deux divise l'espace d'échantillonnage en sous-groupes : la sortie de décision, accepter ou rejeter ; les caractéristiques de base du procédé, comme le site ou l'équipement ; le matériau ou le produit ; et la tâche, comme les types et la gravité des défauts. Tout ce qui suit se fait par sous-groupe : le jeu de test doit les inclure, les critères d'acceptation peuvent différer pour chacun, et l'exigence de taille s'applique à chacun.

09:02 Sam Les critères d'acceptation.

09:04 Sarah Deuxième idée, la section quatre : la note de passage est fixée avant l'examen. Les métriques de test sont définies pour l'utilisation prévue ; pour un classifieur, les exemples sont une matrice de confusion, la sensibilité, la spécificité, l'exactitude, la précision ou le score F1. Les critères d'acceptation peuvent différer par sous-groupe, un expert du procédé en est de nouveau responsable, et ils sont de nouveau approuvés avant les essais. Puis le point quatre point trois, intitulé Pas de diminution. Les critères d'acceptation d'un modèle doivent être, je cite, au moins aussi élevés que la performance du procédé qu'il remplace. Et la conséquence, dans les propres termes du projet : cela implique que la performance doit être connue pour le procédé qui doit être remplacé. Il renvoie à l'annexe onze révisée pour cela.

09:45 Sam Lis l'implication à voix haute, parce que c'est celle de l'ouverture. Si le critère d'acceptation doit être au moins la performance de l'inspection manuelle, il faut avoir mesuré l'inspection manuelle. La plupart des sites ne l'ont jamais fait. Ils ont une procédure, un dossier de formation et une hypothèse. Le projet transforme l'hypothèse en un chiffre que vous devez produire avant que le modèle soit testé. C'est une étude, avec son propre jeu de test, sur des personnes. Même logique que les essais en parallèle contre la méthode de référence dans les Points to Consider et le contrôle orthogonal dans l'exemple de la FDA : le procédé manuel est le comparateur.

Annexe 22 : données de test et exécution des essais

10:24 Sam Les données de test.

10:26 Sarah La section cinq, et l'idée, c'est que le jeu de test est un objet conçu, pas ce qui restait. La sélection : représentative de l'espace d'échantillonnage complet, et l'élargissant ; stratifiée ; incluant tous les sous-groupes et les variations rares ; avec les critères et la justification documentés. La taille : suffisante, pour l'ensemble et pour chaque sous-groupe, pour calculer les métriques avec une confiance statistique adéquate. L'étiquetage : vérifié par un processus qui garantit, je cite, un très haut degré d'exactitude ; les exemples sont la vérification indépendante par plusieurs experts, un équipement validé, ou des essais de laboratoire. Le prétraitement prédéfini. Toute exclusion documentée et pleinement justifiée. Et le point cinq point six : générer des données ou des étiquettes de test, par exemple par IA générative, je cite, n'est pas recommandé et tout usage de ce type doit être pleinement justifié.

11:13 Sam Donc pas de flacons synthétiques pour étoffer la classe des rejets. Et l'essai lui-même ?

11:18 Sarah La section sept. Il doit montrer que le modèle, selon la formule du projet, généralise bien, y compris la détection du sur- ou du sous-apprentissage. Un plan d'essai est approuvé avant le début de l'essai, contenant l'utilisation prévue, les métriques et critères d'acceptation prédéfinis, une référence aux données de test, un script d'essai, et la façon dont les métriques sont calculées, avec un expert du procédé impliqué. Tout écart par rapport au plan, tout manquement aux critères, ou toute omission d'utiliser l'ensemble des données de test est documenté, investigué et pleinement justifié. Et tout est conservé, y compris les données de test réelles, les objets physiques de test, et les enregistrements de contrôle d'accès et de piste d'audit, comme toute autre documentation BPF.

11:56 Sam Omission d'utiliser l'ensemble des données de test. Voilà une clause discrète qui a des dents. Vous ne pouvez pas laisser tomber le sous-groupe gênant le jour J.

12:06 Sam Je reformule avant l'indépendance, parce que c'est celle qui change qui fait quoi. La FDA veut un plan, puis un rapport qui lui correspond, dimensionné au risque du modèle, et personne ne dit quelle quantité suffit. L'annexe vingt-deux dit : commencez par une utilisation prévue portée par un expert du procédé, qui caractérise tout l'espace des entrées. Fixez les critères avant les essais, au moins aussi élevés que le procédé manuel, que vous devez donc avoir mesuré. Concevez un jeu de test stratifié avec des étiquettes vérifiées et sans données synthétiques. Exécutez-le selon un plan approuvé, investiguez chaque écart, conservez tout. Maintenant, la partie que la plupart des équipes de science des données n'ont jamais eu à faire.

L'indépendance est un contrôle des personnes et des accès

12:46 Sarah La section six, Indépendance des données de test. Le point six point un énonce le principe : des contrôles techniques ou procéduraux pour garantir que les données utilisées pour tester un modèle ne sont pas utilisées pendant son développement, son entraînement ou sa validation. Deux voies : capturer les données de test seulement après la fin de l'entraînement, ou les séparer d'un ensemble complet avant le début de l'entraînement. Le point six point deux est la clause de la voie par séparation. Il est, je cite, essentiel que les employés impliqués dans le développement et l'entraînement du modèle n'aient jamais eu accès aux données de test. Les données de test sont protégées par un contrôle d'accès et par une piste d'audit qui enregistre les accès et les modifications. Et, je cite, il ne doit y avoir aucune copie des données de test en dehors de ce dépôt.

13:25 Sam Aucune copie. Pas un tableur sur un portable, pas un notebook dans un bac à sable.

13:30 Sarah Le point six point trois : enregistrer quelles données ont été utilisées pour les essais, quand, et combien de fois. Le point six point quatre, pour les objets physiques : les objets utilisés pour l'essai final ne doivent pas avoir été utilisés auparavant pour entraîner ou valider le modèle. Le point six point cinq, Indépendance du personnel : des contrôles pour empêcher le personnel qui a eu accès aux données de test d'entraîner ou de valider le même modèle. Quand une organisation ne peut pas maintenir cette séparation, une telle personne ne peut travailler sur l'entraînement qu'avec un collègue qui n'a pas eu cet accès, ce que le projet appelle le principe des quatre yeux.

14:01 Sam Voici ce que ça fait. Ça convertit l'hygiène de science des données en un contrôle organisationnel que la qualité peut auditer. Qui a eu accès, c'est une question avec une piste d'audit derrière. Combien de fois le jeu de test a été utilisé, c'est un compteur. Si le flacon de l'essai final est déjà passé sous la caméra pendant le développement, c'est une question de chaîne de traçabilité. Rien de tout ça n'est une compétence de modélisation. C'est la discipline que le laboratoire de CQ a déjà pour les étalons de référence, appliquée à un jeu de données.

14:35 Sarah L'étape quatre de la FDA demande la même indépendance, dans le langage d'une soumission. Les données de test, je cite, doivent être indépendantes des données de développement et ne doivent pas être montrées à l'algorithme pendant l'entraînement. Le promoteur doit préciser comment l'indépendance a été obtenue, et l'un des exemples est, je cite, des données acquises sur des lots ou des produits différents. Tout usage de données qui se recoupe doit être expliqué et justifié, et la méthode de référence utilisée pour créer les données de test doit être décrite, avec un résumé de sa performance.

15:01 Sam Des lots ou des produits différents. Donc pour un modèle de procédé, on met de côté des lots entiers, pas des lignes prises au hasard dans chaque lot. Une séparation aléatoire dans une série temporelle fuit : des points voisins dans le même lot sont presque le même point. Le projet donne les lots comme unité ; le reste est ma lecture.

L'explicabilité et la confiance deviennent des preuves

15:23 Sam L'explicabilité. C'est celle qui va surprendre les fournisseurs de vision industrielle.

15:28 Sarah La section huit, deux clauses. Le point huit point un, Attribution des caractéristiques : pendant les essais de modèles utilisés dans des applications BPF critiques, les systèmes doivent capturer et enregistrer, je cite, les caractéristiques des données de test qui ont contribué à une classification ou une décision particulière, et il donne le rejet comme exemple. Le cas échéant, des techniques comme les valeurs SHAP, Shapley Additive Explanations, ou LIME, Local Interpretable Model-Agnostic Explanations, ou des outils visuels comme les cartes de chaleur, doivent mettre en évidence les facteurs clés. Le point huit point deux, Justification des caractéristiques : une revue de ces caractéristiques doit faire partie du processus d'approbation des résultats d'essai.

16:05 Sam Donc la carte de chaleur n'est pas une démo. C'est un enregistrement, produit pendant les essais, revu comme condition d'approbation de l'essai. Et le réviseur doit pouvoir dire que le modèle a rejeté le flacon pour le ménisque et pas pour une rayure sur le support.

16:21 Sarah La section neuf, Confiance. Le point neuf point un : lors des essais d'un modèle qui prédit ou classifie, le système doit, le cas échéant, consigner le score de confiance de chaque prédiction. Le point neuf point deux : les modèles doivent avoir un seuil approprié, et si le score de confiance est très bas, il faut envisager que le modèle, je cite, signale le résultat comme indéterminé, plutôt que de produire des prédictions ou des classifications potentiellement peu fiables.

16:43 Sam Une case indéterminé. Ce qui veut dire un processus aval pour les flacons indéterminés, une personne, un taux que vous surveillez, et un chiffre dans l'utilisation prévue pour le taux que vous attendez. La plupart des pipelines de capteurs logiciels et de vision que je peux imaginer ne font ni l'un ni l'autre. Ils émettent un chiffre. Ils ne disent pas à quel point ils sont sûrs, et personne ne conserve l'attribution.

Cinq demandes de la FDA que le MSAT n'attendrait pas

17:07 Sam Maintenant la liste de la FDA, mais regroupée, parce que je ne veux pas d'une check-list. Cinq choses dans l'étape quatre qu'une équipe de science de la production n'attendrait pas.

17:18 Sarah Premièrement, des statistiques avec des barres d'erreur. Le projet liste les métriques, l'aire sous la courbe ROC, la sensibilité, la spécificité, les valeurs prédictives, la précision, le F1, et puis la phrase qui compte, je cite : toutes les estimations de performance doivent être fournies avec des intervalles de confiance. Pas une exactitude ponctuelle ; un intervalle, ce qui demande un jeu de test assez grand pour le rendre étroit. Deuxièmement, l'indépendance expliquée, que nous avons couverte. Troisièmement, la provenance de tout ce que vous n'avez pas construit : préciser si un modèle pré-entraîné a été utilisé, et si oui, je cite, préciser le jeu de données utilisé pour le pré-entraînement et comment le modèle pré-entraîné a été développé et/ou obtenu. Les principes de l'IMDRF disent pourquoi : les systèmes génératifs peuvent employer des modèles de fondation qui ne sont pas sous la provenance du fabricant.

18:02 Sam Ce qui, pour l'agent, est tout le modèle.

18:05 Sarah Quatrièmement, l'humain. Dans quatre B : si le contexte d'utilisation implique un humain dans la boucle, je cite, s'assurer que les méthodes d'évaluation prennent en compte la performance de l'équipe humain-IA, plutôt que la seule performance du modèle isolé. Le principe sept de l'IMDRF dit la même chose pour les dispositifs, et liste les facteurs humains : les compétences des utilisateurs, l'expertise, la compréhension des limites du modèle, et le risque de dépendance excessive.

18:28 Sam Un signet pour l'épisode sept, et je fais court. Évaluer l'équipe, ça veut dire choisir un humain. Quel humain ? L'opérateur qui exécute la procédure à trois heures du matin, ou le scientifique qui comprend le modèle ? Des essais différents, des résultats différents, et le projet ne le dit pas. Si vous évaluez avec le scientifique et déployez avec l'opérateur, vous avez validé une équipe que vous ne faites pas tourner. Mis de côté.

18:52 Sarah Mis de côté. Cinquièmement, le logiciel. Quatre A demande, je cite, les procédures d'assurance et de contrôle qualité du logiciel informatique (y compris ses boîtes à outils et ses paquets) et la façon dont les changements de version ont été suivis, et quatre B demande les procédures de vérification du code. Le modèle est un logiciel, et les bibliothèques en dessous sont des logiciels, avec des versions.

19:12 Sam Ce qui veut dire que l'environnement Python est un élément de configuration. Figez-le, enregistrez-le, et le jour où un paquet se met à jour, c'est un changement. Je reformule. La structure de la FDA, c'est planifier, exécuter, rapporter, dimensionné au risque. L'annexe vingt-deux remplit le plan : une utilisation prévue portée par un expert du procédé ; des critères fixés à l'avance et pas inférieurs au procédé manuel ; un jeu de test conçu ; l'indépendance par le contrôle d'accès et la séparation du personnel ; l'attribution revue à l'approbation ; la confiance consignée avec un seuil d'indéterminé. La FDA ajoute les intervalles de confiance, la provenance, l'équipe humain-IA et l'assurance qualité du logiciel. Maintenant, le mot. Pourquoi tout cela s'appelle-t-il assurance et pas validation ?

De la validation à l'assurance : CSA et GMLP

20:03 Sarah Parce que la FDA l'a renommé, côté dispositifs, et que le côté pharma a emprunté le nom. La guidance Computer Software Assurance vient du CDRH et du CBER, avec le CDER consulté : projet en septembre deux mille vingt-deux, finale le vingt-quatre septembre deux mille vingt-cinq, rééditée le trois février deux mille vingt-six. Elle est écrite pour les logiciels de production de dispositifs ou de système de management de la qualité, donc en pharma elle s'applique par analogie, et le paysage la consigne comme le document le plus cité comme modèle pour la validation de l'IA en production. Elle définit l'assurance comme, je cite, une approche fondée sur le risque pour établir et maintenir la confiance qu'un logiciel est adapté à son utilisation prévue, et elle est le moins contraignante possible : je cite, la charge de validation n'est pas plus lourde que nécessaire pour traiter le risque.

20:48 Sam Qu'est-ce que ça change concrètement ?

20:50 Sarah Quatre mouvements. Identifier l'utilisation prévue. Décider si une défaillance présente un risque élevé pour le procédé, c'est-à-dire un problème de qualité qui compromet la sécurité de façon prévisible. Choisir des activités d'assurance proportionnées à cela : des essais non scriptés, par scénarios, par anticipation des erreurs et exploratoires, à côté des essais scriptés, et elle dit que le non scripté peut être mieux adapté même pour les fonctions à haut risque ; plus l'exploitation du travail de validation du fournisseur lui-même, des autres contrôles du procédé, et des données de surveillance que le logiciel génère en usage. Puis constituer l'enregistrement : utilisation prévue, analyse de risque, ce qui a été testé, problèmes trouvés, une conclusion déclarant l'acceptabilité, qui et quand, et l'approbation. Elle nomme les outils d'IA et d'apprentissage automatique, les bots et le cloud dans son propre périmètre.

21:35 Sam Et la philosophie de l'enregistrement.

21:37 Sarah Deux phrases. La documentation, je cite, n'a pas besoin d'inclure plus de preuves que nécessaire pour montrer que le logiciel fonctionne comme prévu pour le risque identifié. Et la FDA recommande, je cite, les journaux système, les pistes d'audit et les autres données générées et conservées par le logiciel, plutôt que du papier ou des captures d'écran.

21:55 Sam Voici ce que j'en retiens. La validation, à l'ancienne, c'était la preuve que vous aviez fait les documents. L'assurance, c'est la preuve que vous avez réfléchi : voici le risque, voici ce que j'ai fait à son sujet, voici ce que j'ai trouvé, voici pourquoi c'est suffisant. Et vous avez le droit de pointer le journal au lieu de l'imprimer. L'annexe vingt-deux, c'est la même posture avec le contenu rempli pour un modèle, et sa propre clause deux point trois dimensionne chaque activité au risque pour le patient, le produit et les données.

22:25 Sarah Deux autres sources fournissent le vocabulaire et la check-list. Le vocabulaire, c'est la guidance de la FDA de novembre deux mille vingt-trois, côté dispositifs, sur la crédibilité de la modélisation computationnelle. Elle dit d'elle-même qu'elle couvre les modèles fondés sur les premiers principes et non l'apprentissage automatique ; mais le projet de la FDA de deux mille vingt-cinq dit dans ses notes de bas de page que sa question d'intérêt, son contexte d'utilisation et son risque du modèle ont été inspirés par l'ASME V et V quarante, et renvoie à la guidance de deux mille vingt-trois pour la conséquence de la décision. Ses définitions sont celles à retenir. La crédibilité, c'est la confiance, établie par la collecte de preuves, dans la capacité prédictive d'un modèle pour un contexte d'utilisation. La vérification porte sur le code et le calcul.

23:08 Sam Et la validation, dans ce vocabulaire.

23:11 Sarah Je cite : le processus consistant à déterminer dans quelle mesure un modèle ou une simulation est une représentation exacte du monde réel. Elle ajoute que la comparaison doit se faire contre des données indépendantes des données utilisées pour créer le modèle, donc la calibration n'est pas une validation. L'applicabilité, c'est, je cite, la pertinence des activités de validation pour soutenir l'utilisation du modèle computationnel pour un contexte d'utilisation. Les facteurs de crédibilité sont les éléments du processus, chacun avec une gradation de rigueur et un objectif de crédibilité choisi selon le risque du modèle. L'évaluation de l'adéquation demande ensuite si les preuves, prises ensemble, sont suffisantes pour le risque.

23:46 Sam Donc quand quelqu'un dit que le modèle est validé, le vocabulaire de la crédibilité pose trois questions distinctes. Le code est-il juste ? Correspond-il à la réalité sur des données indépendantes ? Et l'essai que vous avez mené ressemble-t-il à l'usage que vous en avez ? La troisième est celle qu'on saute. C'est l'applicabilité, et c'est l'espace d'échantillonnage des entrées de l'annexe vingt-deux sous un autre nom.

24:09 Sarah La check-list, ce sont les dix principes de bonnes pratiques d'apprentissage automatique, désormais le document N quatre-vingt-huit de l'IMDRF, final, daté du vingt-sept janvier deux mille vingt-cinq. En titres : l'utilisation prévue comprise et une expertise pluridisciplinaire ; de bonnes pratiques d'ingénierie logicielle et de sécurité ; des jeux de données représentatifs ; des jeux d'entraînement indépendants des jeux de test, avec, je cite, l'étendue de la validation externe proportionnée au risque ; des standards de référence adaptés à l'usage ; un choix de modèle adapté aux données et à l'utilisation prévue ; l'équipe humain-IA évaluée, pas le dispositif seul ; des essais en conditions réelles ; une information claire aux utilisateurs ; et des modèles déployés surveillés, avec les risques du réentraînement gérés. Ils disent patient là où une usine dirait procédé, et chacun correspond à une clause que nous avons lue ce soir.

Le dossier de preuves de la caméra de volume de remplissage

24:57 Sam Maintenant, construisons-en un. La caméra de volume de remplissage de l'exemple de la FDA, sous l'annexe vingt-deux, clause par clause, et je jouerai le site.

25:06 Sarah Le système tel que la FDA l'a écrit : le médicament B, un produit parentéral en flacon multidose, le volume de remplissage comme attribut qualité critique, un système visuel d'IA qui évalue le niveau de remplissage de chaque flacon, avec les essais de libération qui mesurent toujours le volume de remplissage sur un échantillon par lot. Conséquence élevée, influence faible, risque du modèle moyen, de l'épisode deux. Ça règle le bouton. La section trois, l'utilisation prévue, portée par un expert du procédé : classer le niveau de remplissage de chaque flacon comme dans ou hors spécification à partir d'une image. L'espace d'échantillonnage des entrées, c'est chaque format de contenant sur la ligne, toute la plage de niveaux de remplissage y compris les extrêmes, l'éclairage selon les équipes et après les changements de lampes, la variation du verre entre fournisseurs, les positions des étiquettes et des bouchons, la condensation et la mousse. Les limites : un ménisque partiellement masqué, un flacon mal positionné dans le support.

25:56 Sam Sous-groupes et critères.

25:58 Sarah Sous le point trois point deux : accepter et rejeter ; la ligne et le site ; le contenant et le produit ; et les types de défauts, sous-remplissage, sur-remplissage, absence de remplissage, et leur gravité. La section quatre : la sensibilité à un flacon réellement hors spécification, la spécificité, et la matrice de confusion, par sous-groupe, avec des critères plus stricts là où la conséquence l'est, parce qu'un sous-remplissage manqué, c'est une dose manquante pour un patient. Et le point quatre point trois : ces critères doivent être au moins la performance de détection de l'inspection manuelle que la caméra remplace. Donc le site mène une étude sur ses inspecteurs avec un jeu connu de flacons et écrit ce chiffre en premier.

26:33 Sam Ce qui force une conversation que personne n'a eue : qu'est-ce que le procédé présente réellement à la caméra en un an ? C'est le MSAT qui l'écrit, pas le fournisseur.

26:43 Sarah La section cinq. Le jeu de test est conçu : stratifié sur chaque sous-groupe, dimensionné pour que la sensibilité de chaque sous-groupe ait un intervalle de confiance exploitable, ce qui pour les défauts rares veut dire fabriquer délibérément des flacons à rejeter, physiquement, pas synthétiquement, parce que le point cinq point six ne recommande pas les données générées. Des étiquettes vérifiées à un très haut degré d'exactitude : le remplissage réel de chaque flacon de test mesuré par gravimétrie ou par un équipement validé, pas à l'œil d'un autre inspecteur. Chaque flacon exclu du jeu de test, et pourquoi, enregistré. La section six : les flacons de test sont des objets physiques, donc le point six point quatre s'applique directement ; ils n'ont jamais été imagés pour l'entraînement ou le réglage, ils sont sous contrôle d'accès avec une piste d'audit, aucune copie des images ailleurs, et les personnes qui ont entraîné le modèle ne les ont jamais vus.

27:31 Sam Laisse-moi insister sur un point. Le fournisseur a entraîné le modèle. Le fournisseur a les images. La clause d'indépendance du site atteint-elle le fournisseur ?

27:41 Sarah Le point deux point deux dit que la documentation de ces activités doit être disponible pour l'utilisateur réglementé, et revue par lui, que le modèle ait été entraîné, validé et testé en interne ou par un fournisseur. Donc le site doit la preuve que le jeu d'entraînement du fournisseur et le jeu de test du site sont indépendants, et s'il ne peut pas l'obtenir, la voie du point six point un est de capturer le jeu de test après l'entraînement, à partir de flacons que le fournisseur n'a jamais eus.

28:03 Sam Puis l'essai, les cartes de chaleur et le seuil.

28:06 Sarah La section sept : un plan d'essai approuvé, les écarts investigués, tout conservé. La section huit : le système enregistre les régions de l'image qui ont motivé chaque rejet, et un réviseur confirme à l'approbation que le modèle regarde le ménisque et pas le support ou un reflet. La section neuf : un score de confiance par flacon, un seuil en dessous duquel le flacon va en indéterminé, et une procédure pour les flacons indéterminés avec le taux attendu dans l'utilisation prévue.

28:30 Sam Et ensuite la section dix de la dernière fois : contrôle des changements, contrôle de configuration, surveillance de la performance et de la dérive des entrées, pour que, quand on change les lampes, la métrique de dérive le dise avant la sensibilité. Voilà le dossier. Remarquez à quel point il ne porte pas sur le réseau de neurones. Il porte sur les flacons, les inspecteurs, la liste d'accès et le réviseur.

Capteur logiciel, modèle de lot et l'agent

28:53 Sam Maintenant les trois autres, et ce qui change. Le capteur logiciel.

28:57 Sarah Le capteur logiciel prédit un attribut qualité à partir de signaux de procédé, donc son étiquette est une mesure de laboratoire, et il n'y en a pas une pour chaque instant. Le point cinq point trois mord le plus fort : un très haut degré d'exactitude veut dire que chaque étiquette de test est un résultat d'analyse avec sa propre performance de méthode, ce qui est le résumé de méthode de référence que la FDA demande. Les sous-groupes sont les campagnes, les sites, les trains d'équipements et les changements de produit. L'indépendance veut dire mettre de côté des campagnes entières, ce que l'exemple lots-ou-produits de la FDA soutient. Le comparateur pas de diminution, c'est le processus d'échantillonnage et d'analyse qu'il remplace. Et l'attribution des caractéristiques pour une régression, c'est quels signaux ont motivé la prédiction, avec un expert du procédé qui juge s'ils sont physiquement plausibles.

29:42 Sam Le modèle de suivi de lot.

29:44 Sarah Le modèle multivarié vit déjà dans ce monde. Son explicabilité, c'est le graphique de contributions que la communauté multivariée utilise depuis des décennies, qui est de l'attribution des caractéristiques sous un autre nom, donc le point huit point un est satisfait en enregistrant et en revoyant ce qui existe déjà. Son jeu de test, ce sont des lots mis de côté, y compris des lots connus pour être mauvais. Son score de confiance, c'est la statistique de distance qu'il calcule déjà, et le seuil d'indéterminé est une limite de contrôle. Les nouvelles demandes sont organisationnelles : qui a choisi les lots de référence, si les lots exclus sont documentés sous le point cinq point cinq, et qui a vu les lots mis de côté avant l'ajustement du modèle.

30:20 Sam Et l'agent. Prends ton temps.

30:22 Sarah Sous l'annexe vingt-deux, la première phrase honnête, c'est qu'en usage critique l'agent n'atteint jamais les sections sur les preuves, parce que la section un dit qu'il ne devrait pas être là. En usage non critique, avec un humain qualifié qui porte chaque sortie, le projet dit que les principes peuvent être considérés le cas échéant. Alors appliquons-les. L'utilisation prévue : rédiger une investigation de déviation à partir des dossiers de lot ; l'espace d'échantillonnage des entrées, c'est chaque type de déviation que le site rencontre et chaque format de dossier qu'il lit. Les sous-groupes : type de déviation, produit, gravité, système source. La métrique : les métriques de classifieur du projet ne conviennent pas à un paragraphe. Ce qui s'en rapproche le plus dans tous les documents, c'est l'exemple travaillé de BioPhorum de juin deux mille vingt-six d'un module de déviation, qui propose un back-testing contre des déviations et des CAPA clôturées, une explicabilité cause-preuve, une justification obligatoire de l'investigateur, des signalements d'hallucination et des exigences de citation.

31:16 Sam Donc la métrique, c'est l'accord avec un jeu adjugé d'investigations historiques. Et l'indépendance, pour du texte ?

31:24 Sarah La section six lue littéralement : un jeu mis de côté de déviations clôturées, adjugé par des experts, dans un dépôt sous contrôle d'accès, aucune copie, et les personnes qui ont réglé les prompts et la recherche documentaire ne les ont jamais lues. La provenance, de la FDA : quel modèle de fondation, pré-entraîné sur quoi, obtenu comment, ce à quoi, pour un modèle commercial, le fournisseur ne peut peut-être pas entièrement répondre. L'explicabilité sous la section huit : une citation, quel dossier, quelle ligne, pour chaque affirmation factuelle du brouillon, revue par l'approbateur. La confiance sous la section neuf : le modèle refuse de rédiger là où il ne peut pas citer, un indéterminé pour du texte. Et l'équipe humain-IA selon la FDA : évaluer l'ingénieur avec le brouillon, pas le brouillon seul.

32:04 Sam Donc la réponse honnête pour l'agent, c'est un jeu adjugé de déviations historiques sous clé, une discipline d'une citation par affirmation, et une évaluation d'équipe. C'est constructible. Et dans l'UE, ça vous achète un usage non critique avec une personne qui porte chaque sortie, parce que le verrou ne s'ouvre jamais davantage. Ce n'est pas rien. C'est le premier dossier de preuves de ce genre dans la plupart des sites, et il vous en dira plus sur vos dossiers de déviation que sur le modèle.

32:33 Sarah Une divergence à noter. L'exemple de BioPhorum classe la rédaction de déviations en conséquence faible, efficacité opérationnelle, avec un modèle statique verrouillé et une approbation humaine, ce qui fait écho à l'exception d'efficacité opérationnelle de la FDA. La question de l'annexe vingt-deux n'est pas la conséquence mais si l'application est critique, et une investigation rédigée qui façonne une décision de disposition de lot touche la qualité du produit et l'intégrité des données. C'est l'avis de BioPhorum confronté à un projet d'annexe, et un site inspecté dans l'UE lit l'annexe.

Et alors, pour la bioproduction

33:01 Sam Et alors, pour la bioproduction. Opinions étiquetées. Premièrement : la discipline des preuves est connaissable et, pour l'essentiel, pas nouvelle. Un plan, des critères à l'avance, un essai indépendant, les écarts investigués, les enregistrements conservés ; le laboratoire de CQ fait ça pour les méthodes depuis des décennies. Trois choses sont nouvelles, et elles sont organisationnelles, pas mathématiques. L'indépendance des données de test est désormais une liste d'accès, une piste d'audit et une règle de personnel. La clause pas de diminution vous force à mesurer le procédé manuel que vous remplacez, et la plupart des sites n'ont jamais mesuré un inspecteur humain ou un plan d'échantillonnage comme un procédé avec une performance. Et l'explicabilité et la confiance sont des enregistrements produits pendant les essais et revus à l'approbation, pas une démo.

33:53 Sarah Les documents placent le premier artefact de la même façon. L'utilisation prévue de la section trois de l'annexe vingt-deux, portée par un expert du procédé, c'est ce qu'un inspecteur lit en premier. Le contexte d'utilisation de l'étape deux de la FDA, c'est ce qu'un évaluateur lit en premier. C'est le même document sous deux noms.

34:08 Sam Alors commencez là. Deuxièmement : écrivez ce document avant de toucher au modèle, et faites-le écrire par le MSAT, avec l'AQ et le data scientist dans la pièce, parce que la clause deux point un de l'annexe les y met tous dès la sélection de l'algorithme. Troisièmement, pour la qualité : traitez le jeu de test comme un étalon de référence. Un dépositaire, un emplacement, un journal d'accès, un compteur d'utilisation, une règle selon laquelle ceux qui entraînent ne le voient jamais, et une règle de binôme quand vous ne pouvez pas doter ça en personnel. Voici mon avis, en tant que praticien : si votre équipe de science des données ne peut pas vous dire qui a vu le jeu de test, vous n'avez pas encore de preuves. Vous avez des résultats.

34:52 Sarah Là où les équipes le ressentent. Le MSAT et la science des procédés portent l'utilisation prévue, les sous-groupes, et l'étude de comparaison du procédé manuel. La science des données porte les métriques, les intervalles de confiance, les enregistrements d'attribution et le versionnage du logiciel. La qualité porte la garde des données de test, les investigations d'écarts, et une approbation qui inclut désormais la revue des caractéristiques. Les affaires réglementaires CMC décident si le rapport va dans le dossier de demande ou reste pour l'inspection.

35:19 Sam Et pour l'agent, une de plus, étiquetée. Construisez le jeu adjugé de déviations maintenant, avant que quiconque le demande. C'est la preuve pour tout modèle de langage que vous ferez jamais tourner sur ces dossiers, et le construire vous montrera l'état de votre historique de déviations. C'est encore la cave. L'agent, c'est celui qui vous dit si elle est sèche.

Récapitulatif et prochain épisode

35:39 Sam Trois choses. Sarah.

35:41 Sarah Les preuves sont graduées, jamais fixes. Le projet de la FDA veut un plan d'évaluation de la crédibilité, exécuté, puis un rapport qui lui correspond, le tout proportionné au risque du modèle, déposé ou conservé pour l'inspection. Personne ne dit quelle quantité suffit, et la discipline plan puis rapport est elle-même la preuve.

35:58 Sam Deuxièmement, la mienne : l'annexe vingt-deux est la recette, et c'est un projet qu'un inspecteur de l'UE lit déjà. Une utilisation prévue portée par un expert du procédé, avec tout l'espace des entrées et ses sous-groupes. Des critères d'acceptation fixés avant les essais et au moins aussi bons que le procédé que vous remplacez, que vous devez donc mesurer. Un jeu de test conçu avec des étiquettes vérifiées. L'indépendance comme un contrôle des accès et des personnes. Des cartes de chaleur revues, et un seuil de confiance avec une case indéterminé. Le nouveau travail est organisationnel.

36:36 Sarah Troisièmement : la validation est devenue assurance parce que la guidance de la FDA sur l'assurance des logiciels a dimensionné les preuves au risque et a laissé le journal tenir lieu d'enregistrement ; le vocabulaire de la crédibilité, vérification, validation, applicabilité et adéquation, vient de la guidance sur la modélisation côté dispositifs ; et les dix principes d'apprentissage automatique sont la check-list qui correspond à chaque clause. Pour l'agent, rien de tout ça n'a été écrit en pensant au texte, et la meilleure réponse disponible est un jeu adjugé de déviations historiques, conservé comme un jeu de test, avec une citation pour chaque affirmation.

37:09 Sam La prochaine fois : les données. Mes données sont-elles adaptées à l'usage ? Chaque cadre ce soir a supposé que le jeu d'entraînement et le jeu de test étaient dignes de confiance, pertinents et fiables. Le prochain épisode lit ce que le règlement de l'intégrité des données, la révision de l'annexe onze et les textes sur l'IA exigent réellement, et demande où cela laisse un historian d'usine. Sommes-nous arrivés ? Nous savons ce qu'il faut prouver. Ensuite, nous verrons si les données peuvent le prouver.