L'IA dans la production biopharmaceutique : on y est ?
This is the script the AI voices read, so it matches the audio word for word; times are from the render. Documenté, écrit et lu par des systèmes d'IA sous la direction de Jack Prior ; édition française traduite par l'IA à partir des épisodes anglais vérifiés. Sam et Sarah sont des personnages d'IA ; rien dans l'épisode n'est Jack qui parle, et rien n'engage ses opinions ni celles de son employeur. L'IA générative peut se tromper avec assurance — vérifiez les sources. Corrections : jack@jackprior.ai.
00:00 Narrator Voici On y est ? — un podcast sur l'évolution de l'IA dans la production biopharmaceutique, dirigé par Jack Prior. Un mot sur la façon dont il est fait. Cet épisode a été documenté, écrit et lu par des systèmes d'IA. Jack pose les questions et les cadres ; l'IA lit les documents et écrit la conversation que vous allez entendre, entre deux personnages d'IA : Sam, qui joue un praticien des sciences de la production, et Sarah, qui a lu les documents. Cette édition française est une traduction, par l'IA, des épisodes anglais. Rien de ce que vous entendez n'est Jack qui parle, et rien n'engage ses opinions ni celles de son employeur. Comme toute IA générative, elle peut se tromper — avec assurance, ou en manquant une nuance — ce qui est précisément le risque que cette industrie cherche à maîtriser, et précisément le sujet de cette saison. Vérifiez les sources avant de vous y fier. Les corrections sont les bienvenues à jackprior point A I. Place à l'épisode.
00:56 Sam Deux heures quarante du matin, une suite de bioréacteurs, neuvième jour d'une culture. Le capteur logiciel recommande un ajustement de l'alimentation. L'opérateur vérifie la valeur par rapport à la plage de la procédure. Elle est dedans. Accepter, consigner, passer à la suite. Le titre ressort bas. L'investigation conclut qu'un nouveau lot de matière première avait poussé les entrées du capteur hors de tout ce sur quoi il avait été entraîné, et que le modèle, faisant exactement ce que font les modèles, a extrapolé. L'évaluation des risques de ce capteur est à moyen plutôt qu'à élevé, et le motif sur le formulaire tient en une ligne : l'opérateur revoit chaque recommandation.
01:38 Sarah Et la conclusion de l'investigateur ?
01:40 Sam Le contrôle humain dans la boucle a fonctionné comme prévu. Et je crois que cette phrase, c'est tout l'épisode. Il a fonctionné comme prévu, et il n'a rien attrapé, parce qu'il avait été conçu pour vérifier quelque chose qu'un ordinateur aurait pu vérifier, par une personne qui n'avait aucun moyen de savoir que c'était le modèle, et non le procédé, qui était en défaut.
01:59 Sarah C'est le cadre de ce soir, Sam. Les humains. Qui est responsable quand le modèle se trompe : ce que le contrôle humain veut dire à travers les documents, et pourquoi la FDA veut que l'équipe humain-IA soit évaluée, plutôt que le modèle seul.
02:11 Sam Et la question qu'on a mise de côté deux fois, depuis l'épisode quatre. Quel humain, avec quelle compétence, évaluant quelles entrées. Lisons.
02:20 Sam Sarah, la question et les documents.
02:23 Sarah Que veut dire le contrôle humain à travers les documents, et pourquoi la FDA veut-elle que l'équipe humain-IA soit évaluée ? Six documents en parlent, issus de trois couches. Du côté de la loi et de la réglementation : le règlement européen sur l'IA, dont l'article quatorze s'intitule contrôle humain, et le projet d'annexe vingt-deux. Du côté des guidances des autorités : le document de réflexion de l'EMA sur l'IA dans le cycle de vie du médicament, notre ancre de ce soir, et le projet de la FDA de janvier deux mille vingt-cinq. Du côté de l'harmonisation, versant dispositifs : les principes de bonnes pratiques d'apprentissage automatique, les GMLP, désormais un texte du Forum international des régulateurs de dispositifs médicaux. Et du côté de la pratique industrielle : le guide de BioPhorum sur les risques de juin deux mille vingt-six, le seul des six à définir ses termes de contrôle.
03:10 Sam Provenance et maturité de l'ancre.
03:12 Sarah Le document de réflexion de l'EMA sur l'utilisation de l'intelligence artificielle dans le cycle de vie du médicament. Publié par le comité des médicaments à usage humain avec son homologue vétérinaire ; rédigé en juillet deux mille vingt-trois, mis en consultation jusqu'à la fin de cette année-là, adopté en version finale le neuf septembre deux mille vingt-quatre. Un document de réflexion : l'expérience et les attentes actuelles de l'agence sur l'ensemble du cycle de vie, et ce qu'un évaluateur européen a lu. Sa section fabrication tient en un paragraphe ; son contenu sur le contrôle humain se trouve dans les sections déploiement, gouvernance et éthique. Il a fait du contrôle humain une attente européenne sur tout le cycle de vie, un an avant que l'annexe vingt-deux n'écrive l'expression dans les BPF.
03:52 Sam Pourquoi maintenant, rapidement, parce que j'ai dit dans l'épisode un pourquoi cette saison existe. Le capteur logiciel et le modèle de lot ont un humain qui les regarde depuis vingt ans, et personne n'a écrit à quoi servait cet humain ; l'ingénieur qui avait construit le modèle était généralement celui qui le surveillait. Ce qui a changé, c'est l'assistant agentique. Il rédige la déviation, classe les causes racines, propose la CAPA, et chaque document qui le laisse passer la porte le laisse passer à une condition : un humain dans la boucle. L'humain est désormais le mur porteur de tout l'argumentaire en faveur de l'IA générative dans les BPF. Et personne n'a spécifié le mur.
04:30 Sarah C'est là que l'épisode précédent nous a laissés. On peut faire porter les preuves aux données ; ce soir, on demande qui se tient dessus. Et la question mise de côté dans l'épisode cinq est celle de la FDA : évaluer l'équipe humain-IA, mais avec quel humain ?
04:42 Sam Commençons par les mots, parce que le contrôle humain s'avère être trois choses différentes.
04:47 Sarah Trois, et la plupart des documents ne disent pas laquelle. Le guide de BioPhorum de juin deux mille vingt-six les définit dans son glossaire, en citant l'ISO. Humain dans la boucle, que BioPhorum appelle approbation humaine : une personne doit revoir, approuver, modifier ou bloquer la sortie avant toute action conséquente. Humain sur la boucle : le système fonctionne de manière autonome, et une personne supervise son comportement et peut intervenir. Et un troisième que le glossaire appelle supervision humaine, qui recoupe le deuxième : une personne surveille mais n'approuve pas chaque décision. Sa matrice de risques utilise trois colonnes : humain dans la boucle, humain sur la boucle, et aucun contrôle humain.
05:21 Sam Et la colonne où vous êtes change le niveau.
05:23 Sarah Directement. Dans le cadre de BioPhorum, l'autonomie est l'un des deux axes de la maturité du modèle, l'autre étant l'adaptativité, et la maturité est ce que BioPhorum appelle l'influence du modèle, son terme de vraisemblance ; on l'a démêlé de l'influence du modèle au sens de la FDA dans l'épisode trois. Un modèle statique avec un humain dans la boucle est classé influence faible. Le même modèle avec un humain sur la boucle est modéré. Sans contrôle humain, élevé. Un modèle dynamique est modéré même avec un humain dans la boucle, et élevé dans les deux autres colonnes. Donc dans ce cadre, la configuration du contrôle vaut un niveau entier.
05:58 Sam Ce qui est précisément pourquoi une évaluation des risques qui dit juste HITL est dangereuse. L'ingénieur qui revoit la sortie du modèle de lot le lendemain matin est sur la boucle, pas dedans. Le lot est passé à autre chose. Si le formulaire dit dans la boucle, le formulaire revendique un niveau qu'il n'a pas mérité. Première règle ce soir : quand une évaluation des risques dit humain dans la boucle, demandez lequel des trois elle veut dire, et si l'humain est réellement devant la décision avant que la décision ne soit prise.
06:31 Sarah BioPhorum ajoute une mise en garde sur la même page. Le contrôle humain est un mécanisme par lequel l'autonomie peut être limitée, mais il en va de même d'autres contrôles limitant la décision ; ses exemples sont les essais de libération indépendants, la vérification orthogonale, l'échantillonnage redondant en cours de procédé et les verrouillages automatiques, et ceux-ci devraient compter quand on attribue l'autonomie. L'humain n'est pas la seule façon de faire baisser le niveau, et, comme on va le voir, souvent pas la meilleure.
06:55 Sam Maintenant, ce que les documents exigent vraiment. Commençons par le plus complet, même s'il ne nous atteint pour l'essentiel pas.
07:03 Sarah Le règlement européen sur l'IA, règlement deux mille vingt-quatre mille six cent quatre-vingt-neuf, en vigueur depuis août deux mille vingt-quatre. L'article quatorze ne s'applique qu'aux systèmes d'IA à haut risque, et, comme on l'a établi dans l'épisode trois, presque aucune IA de production pharmaceutique n'est à haut risque, sauf si elle est un composant de sécurité d'un dispositif réglementé. Les obligations du haut risque ont aussi été repoussées : d'après ce que je comprends, à décembre deux mille vingt-sept pour les catégories de l'annexe trois, par l'omnibus numérique de cet été. Alors lisez l'article quatorze pour ce qu'il est : l'énoncé le plus complet qui existe de ce en quoi le contrôle humain est censé consister, venu du seul document qui a dû l'écrire comme une loi.
07:42 Sam Lis-le.
07:43 Sarah Paragraphe un : les systèmes à haut risque doivent être conçus, y compris avec des outils d'interface homme-machine appropriés, de telle sorte que des personnes physiques puissent effectivement les contrôler pendant leur utilisation. Paragraphe deux : le contrôle vise à prévenir ou à réduire au minimum les risques qui apparaissent dans l'utilisation prévue ou dans une mauvaise utilisation raisonnablement prévisible, en particulier, je cite, lorsque ces risques persistent malgré l'application des autres exigences. Paragraphe trois : des mesures proportionnées aux risques, au niveau d'autonomie et au contexte d'utilisation, intégrées par le fournisseur ou mises en œuvre par le déployeur.
08:17 Sam Le paragraphe quatre, c'est celui-là.
08:19 Sarah Le paragraphe quatre liste ce que les personnes chargées du contrôle doivent être en mesure de faire. Cinq choses. Comprendre correctement les capacités et les limites pertinentes du système et surveiller son fonctionnement, y compris détecter et traiter les anomalies, les dysfonctionnements et les performances inattendues. Rester conscientes de la tendance possible à se fier automatiquement ou excessivement à la sortie, que le règlement nomme entre parenthèses : le biais d'automatisation. Interpréter correctement la sortie, en tenant compte des outils et méthodes d'interprétation disponibles. Décider, dans une situation particulière, de ne pas utiliser le système, ou d'ignorer, de passer outre ou d'inverser sa sortie. Et intervenir dans son fonctionnement, ou l'interrompre au moyen d'un bouton d'arrêt ou d'une procédure similaire.
08:58 Sam Regardez ce qu'est cette liste. Comprendre les limites, interpréter la sortie, détecter les performances inattendues. Ce n'est pas une vérification de bornes. C'est la description de quelqu'un qui sait comment le modèle se comporte. Le règlement ne dit pas qui c'est, mais c'est ce qui se rapproche le plus, dans tous les documents de ce soir, d'une description de l'expertise du modèle comme exigence pour la personne chargée du contrôle. Gardez ça en tête.
09:24 Sarah Le projet d'annexe vingt-deux, le texte BPF de la voie contraignante : rédigé par le groupe de travail des inspecteurs de l'EMA avec le PIC/S, mis en consultation de juillet à octobre deux mille vingt-cinq, environ mille trois cents commentaires, aucun texte révisé publié après l'atelier de juin, même si l'EMA dit qu'elle est en train de réviser le projet ; d'après ce que je comprends, texte final à la Commission vers la fin de cette année et entrée en vigueur vers deux mille vingt-sept. Il utilise l'expression humain dans la boucle à trois endroits, et dans les deux clauses opérationnelles, le mot qu'il emploie pour l'humain est opérateur.
09:54 Sam La clause un d'abord.
09:56 Sarah Clause un, le périmètre. L'IA générative et les grands modèles de langage ne devraient pas être utilisés dans les applications BPF critiques. S'ils sont utilisés dans des applications non critiques, du personnel disposant d'une qualification et d'une formation adéquates devrait toujours être responsable de s'assurer que les sorties de ces modèles conviennent à l'utilisation prévue, et le projet glose cette formule ainsi : c'est-à-dire un humain dans la boucle. Donc pour un modèle génératif hors usage critique, l'humain n'est pas une mesure d'atténuation. L'humain est la condition d'utilisation.
10:24 Sam Deux point un.
10:25 Sarah Deux point un, Personnel, nomme les parties : une coopération étroite entre les experts du procédé, l'assurance qualité, les data scientists, l'informatique et les consultants, pendant la sélection de l'algorithme, l'entraînement, la validation, les tests et l'exploitation, tous avec des qualifications adéquates, des responsabilités définies et un niveau d'accès approprié. C'est la distribution la plus complète des six documents, et regardez qui y figure : les data scientists, aux côtés des experts du procédé.
10:51 Sam Et trois point trois, qui est là où j'ai mis la question de côté dans l'épisode quatre.
10:57 Sarah Trois point trois, Humain dans la boucle, dans la section sur l'utilisation prévue. Lorsqu'un modèle est utilisé pour fournir une entrée à une décision prise par un opérateur humain, et lorsque l'effort de test de ce modèle a été réduit, la description de l'utilisation prévue devrait inclure la responsabilité de l'opérateur. Et ensuite : la formation et la performance constante de l'opérateur devraient être surveillées, je cite, comme tout autre procédé manuel. La clause dix point cinq complète la paire du côté de l'exploitation : dans la même situation, des enregistrements devraient être conservés, et selon la criticité du procédé et le niveau de test du modèle, cela peut impliquer une revue ou un test systématique de chaque sortie, selon une procédure.
11:32 Sam Lisez le marché que fait cette clause, parce qu'il est honnête. Vous pouvez tester le modèle moins parce qu'un humain est dans la boucle. En échange, l'humain devient un procédé manuel : responsabilité écrite, formation, performance surveillée, enregistrements. L'opérateur comme une opération unitaire avec sa propre qualification. Bon instinct. Ce qu'elle ne dit pas, c'est ce que fait l'opérateur quand il revoit. Ce qui est la question.
11:57 Sarah Elle ne le dit pas. Elle dit opérateur, et qualification et formation adéquates. Et entre deux point un, qui nomme les data scientists, et trois point trois, qui ne nomme que l'opérateur, le projet ne dit jamais laquelle des parties qu'il a listées est celle qui est dans la boucle.
12:11 Sam La FDA.
12:13 Sarah Le projet de la FDA de janvier deux mille vingt-cinq, toujours à l'état de projet, ne dit rien du contrôle humain comme exigence, et une chose précise à son sujet comme preuve. À l'étape quatre B, la partie évaluation du modèle du plan d'évaluation de la crédibilité, parmi les éléments à inclure, je cite : si le contexte d'utilisation implique un humain dans la boucle, s'assurer que les méthodes d'évaluation prennent en compte la performance de l'équipe humain-IA, plutôt que la seule performance du modèle isolé. C'est la phrase qu'on a mise de côté dans l'épisode cinq.
12:40 Sam Et c'est la phrase qui force la question, parce qu'on ne peut pas évaluer une équipe sans choisir l'humain. Les principes côté dispositifs ?
12:49 Sarah Les principes de bonnes pratiques d'apprentissage automatique : écrits par la FDA, Santé Canada et la MHRA britannique en deux mille vingt-et-un, adoptés par le Forum international des régulateurs de dispositifs médicaux sous le document N quatre-vingt-huit en janvier deux mille vingt-cinq. Principe sept : le dispositif est évalué en mettant l'accent sur les interactions humain-IA dans l'environnement d'utilisation prévu, y compris la performance de l'équipe humain-IA, plutôt que le seul dispositif isolé. Et son explication est le seul endroit de notre lecture de ce soir qui liste les ingrédients : les considérations de facteurs humains, dont les aptitudes de l'utilisateur, l'expertise de l'utilisateur, la compréhension par l'utilisateur des sorties et des limites du modèle, le risque de dépendance excessive, le niveau d'autonomie du dispositif et l'erreur de l'utilisateur, en usage normal et en mauvaise utilisation raisonnablement prévisible.
13:37 Sam Expertise de l'utilisateur, compréhension des sorties et des limites, dépendance excessive. C'est le paragraphe quatre du règlement sur l'IA en langage dispositifs. Les deux décrivent une personne qui connaît le modèle, et les deux s'arrêtent juste avant de le dire.
13:56 Sarah Et l'étape sept, brièvement : quand la crédibilité n'est pas à la hauteur du risque du modèle, les issues listées par la FDA comprennent l'abaissement de l'influence du modèle avec des preuves supplémentaires, et la mise en place de contrôles pour atténuer le risque. Un humain dans la boucle est un contrôle de ce type. Savoir s'il mérite l'abaissement, c'est ce que l'évaluation de l'équipe est censée montrer.
14:14 Sam Point d'étape, au tiers du chemin. Trois sens du contrôle humain, et la colonne déplace le niveau. Les cinq capacités du règlement sur l'IA, qui se lisent comme de l'expertise du modèle sans le dire. L'annexe vingt-deux fait de l'opérateur un procédé manuel mais ne dit pas ce qu'il vérifie. La FDA et les principes côté dispositifs disent d'évaluer l'équipe, et le texte dispositifs nomme l'expertise et la dépendance excessive. Maintenant, l'ancre.
14:43 Sarah Le document de réflexion aborde le contrôle humain par l'autre bout : il demande ce qui se passe quand il n'y en a pas. Section deux point cinq point six, déploiement du modèle : pour tous les modèles, surtout ceux où il n'y a pas d'humain dans la boucle, un plan de gestion des risques du système devrait être élaboré, qui définit les risques probables des modes de défaillance de l'algorithme. Ce plan couvre les conséquences de prédictions ou de classifications incorrectes, les approches de surveillance et d'atténuation ou de correction, la manière de déclencher une suspension ou une mise hors service du modèle, et la manière de la mener à bien.
15:15 Sam Donc la position par défaut de l'EMA, c'est : supposez que le modèle va échouer, écrivez comment, et écrivez comment vous l'arrêteriez. L'humain est un surtout, pas le plan.
15:25 Sarah Oui. Deux point deux place la responsabilité de s'assurer que tous les algorithmes, modèles, jeux de données et pipelines de traitement des données sont adaptés à leur finalité chez le promoteur, le demandeur, le titulaire de l'autorisation de mise sur le marché ou le fabricant. Deux point six, gouvernance : les procédures opératoires standard mettant en œuvre les principes GxP sur la gouvernance des données et des algorithmes devraient être étendues à toutes les données, tous les modèles et tous les algorithmes utilisés pour l'IA lorsque l'impact réglementaire ou le risque pour le patient est élevé. Et deux point huit liste sept principes éthiques empruntés au groupe d'experts de haut niveau de la Commission ; le premier est l'action humaine et le contrôle humain, et la section dit qu'une approche centrée sur l'humain devrait guider tout développement et tout déploiement.
16:07 Sam Le paragraphe sur la fabrication.
16:09 Sarah Deux point trois point six, un paragraphe. L'IA en fabrication, de la conception du procédé et de la montée en échelle au contrôle en cours de procédé et à la libération des lots, est appelée à croître ; le développement du modèle, l'évaluation de sa performance et la gestion de son cycle de vie devraient suivre les principes de la gestion des risques qualité, en gardant en vue la sécurité du patient, l'intégrité des données et la qualité du produit ; considérer ICH Q8, Q9 et Q10, dans l'attente de la révision des exigences réglementaires et des normes BPF actuelles. Cette dernière proposition est un renvoi à l'annexe vingt-deux avant qu'elle n'existe.
16:42 Sam Une de plus, Sarah, parce que je crois que c'est la phrase la plus utile du document pour ce soir, et elle est dans la conclusion.
16:49 Sarah La conclusion dit que des efforts devraient être faits dans toutes les organisations pour, je cite, intégrer réciproquement la compétence en science des données avec les domaines respectifs du développement, de la fabrication et de la pharmacovigilance des médicaments. Réciproquement. La compétence en science des données dans la fabrication, et la compétence en fabrication dans la science des données. C'est la seule phrase des six documents qui traite la question de la compétence comme un problème que l'organisation doit résoudre.
17:12 Sam Et un précédent quelques pages plus haut que je volerais volontiers. Pour l'IA en médecine de précision, le document demande des indications que les prescripteurs puissent appréhender de manière critique, et des stratégies de traitement de repli en cas de défaillance technique. Traduisez ça pour une usine : l'opérateur doit pouvoir appréhender de manière critique la recommandation, et il doit y avoir un repli quand le modèle échoue. Appréhender de manière critique, c'est la question de la compétence en quatre mots.
17:42 Sarah Maintenant le paradoxe, et les documents l'énoncent eux-mêmes. La section gouvernance de BioPhorum : le contrôle humain joue un double rôle dans la gestion des risques de l'IA et peut fonctionner à la fois comme un contrôle du risque et comme un facteur de risque. Les mécanismes de contrôle tels que l'humain dans la boucle sont essentiels, dit-elle, mais ils peuvent aussi introduire de la variabilité, des biais ou des contournements informels si les rôles, les compétences et les limites de décision ne sont pas clairement définis. Et sur les modèles adaptatifs, en citant l'annexe vingt-deux : se fier à la seule intervention humaine est insuffisant comme contrôle à long terme, parce que le comportement du système peut évoluer en dehors des hypothèses de l'état de validation initial.
18:17 Sam Et la phrase d'après, c'est celle que j'accrocherais au mur.
18:21 Sarah Une gouvernance efficace de l'IA doit définir explicitement quand et comment le contrôle humain fonctionne comme un contrôle validé, et quand il constitue une source de risque supplémentaire exigeant formation, contrôles procéduraux et surveillance continue. La contribution du règlement sur l'IA, c'est le nom du mode de défaillance, le biais d'automatisation, et l'exigence que les personnes chargées du contrôle en restent conscientes. Et la réponse de l'annexe vingt-deux, au trois point trois, c'est de traiter l'humain comme un procédé manuel avec sa propre performance surveillée.
18:48 Sam Mettez ces trois-là ensemble et vous obtenez une règle qui n'est écrite dans aucun d'eux et qui découle de tous : un contrôle qu'on ne peut pas mesurer n'est pas un contrôle. Si la revue de l'opérateur est un contrôle, elle a une performance : un taux auquel elle attrape les erreurs du modèle, mesuré par rapport à quelque chose. Si personne ne l'a mesuré, et que personne ne peut dire ce qu'elle attraperait, ce n'est pas un contrôle. C'est une signature.
19:16 Sarah L'exemple détaillé de BioPhorum lui-même fait la démonstration. Son annexe note un module de déviations d'un système qualité fonctionnalité par fonctionnalité. Pour les suggestions de causes racines classées, elle liste la dépendance excessive des utilisateurs comme source de risque, et une justification obligatoire de l'investigateur comme contrôle. Pour l'action corrective et préventive proposée, elle note la conséquence élevée et l'influence modérée, avec une approbation humaine en place, et le risque composite ressort quand même élevé. La propre illustration du document que la boucle n'achète pas automatiquement le niveau.
19:45 Sam Alors voici la question, correctement posée cette fois. C'est à moi de la poser, Sarah, et tu me dis où les documents atterrissent. Une revendication d'humain dans la boucle affirme qu'une personne attrapera ce que le modèle rate. Quelles entrées cette personne évalue-t-elle, qui n'auraient pas pu être codées dans le système ?
20:04 Sarah Découpe-la.
20:06 Sam Deux cas. Cas un : la revue veut dire vérifier que la sortie, ou les diagnostics, sont dans des bornes définies. La recommandation est dans la plage ; la confiance est au-dessus du seuil ; les entrées sont à l'intérieur de l'enveloppe d'entraînement. Chacune de ces choses est une règle, et une règle, c'est quelque chose qu'un ordinateur applique mieux qu'une personne, à chaque fois, à trois heures du matin. Cas deux : la revue veut dire arrêter quelque chose d'inattendu ou d'inapproprié. Ça, c'est un jugement, et il faut l'une de deux compétences. L'expertise du procédé : ça paraît physiquement faux pour ce réacteur, ce produit, ce jour ; quelque chose dont un opérateur expérimenté peut sincèrement avoir plus que le data scientist. Ou l'expertise du modèle : le modèle se comporte mal, il extrapole, il attribue aux mauvaises variables. Et l'expertise du modèle n'existe pas dans l'équipe de nuit d'une exploitation en vingt-quatre heures sur vingt-quatre, sept jours sur sept.
21:04 Sarah Prends le cas un face à l'annexe vingt-deux, parce que le projet a déjà confié les vérifications de bornes au système. Trois point un : l'utilisation prévue devrait inclure une caractérisation complète de l'espace d'échantillonnage des entrées, et un expert du procédé en est responsable. Neuf point deux : le modèle devrait avoir un seuil, et si le score de confiance est très bas, il devrait signaler le résultat comme indéterminé plutôt que de faire une prédiction peu fiable. Dix point trois : la performance du système surveillée par rapport à ses métriques. Dix point quatre : surveiller si les données d'entrée sont toujours dans l'espace d'échantillonnage du modèle et l'utilisation prévue, avec des métriques définies pour la dérive. Le projet attribue l'enveloppe, la confiance et la dérive au système. Il ne les laisse pas à l'opérateur.
21:43 Sam Donc si le travail de l'opérateur, c'est le cas un, l'opérateur fait le travail du système, moins bien que le système ne le ferait, et il ajoute de la paperasse, pas du contrôle.
21:53 Sarah Et pour le cas deux, quelle compétence : aucun des six ne le dit. L'annexe vingt-deux dit opérateur, et personnel disposant d'une qualification et d'une formation adéquates. BioPhorum dit un humain qualifié. La FDA dit l'équipe humain-IA. Le paragraphe quatre du règlement sur l'IA, interpréter correctement la sortie et comprendre les capacités et les limites, et l'expertise de l'utilisateur et la compréhension des sorties et des limites du modèle dans les principes côté dispositifs, sont ce qui se rapproche le plus d'une désignation de l'expertise du modèle. Et l'intégration réciproque du document de réflexion est ce qui se rapproche le plus de dire à qui revient la tâche de faire exister cette expertise.
22:28 Sam Quatre questions, donc, pour chaque ligne HITL de chaque évaluation des risques. Quel humain. Quelle compétence. Évaluant quelles entrées. Mesuré comment. Si les réponses sont l'opérateur, qualifié, l'écran, et on ne mesure pas, la ligne est décorative.
22:46 Sarah Avant ta réponse, Sam, la partie qui ne change pas. Aucun de ces documents ne déplace la responsabilité. Les responsabilités de l'unité qualité selon la réglementation américaine, la partie deux cent onze, et selon le chapitre un des BPF de l'UE ne sont pas dans notre lecture de ce soir, et aucun texte sur l'IA que nous avons lu ne les modifie — le projet de la FDA dit en note de bas de page que les responsabilités de l'unité de contrôle qualité selon le point deux cent onze point vingt-deux demeurent. Le projet de la FDA dit en note de bas de page que les promoteurs restent responsables de la conformité aux exigences légales et réglementaires quelle que soit la technologie utilisée. L'EMA, comme on l'a entendu, la place chez le promoteur, le demandeur, le titulaire de l'autorisation de mise sur le marché ou le fabricant. BioPhorum ajoute deux choses : un propriétaire de l'IA, identifié pendant le développement, qui reste responsable de l'aptitude à l'emploi tout au long du cycle de vie ; et les systèmes d'IA ne doivent pas exécuter directement de signatures électroniques, et ne devraient pas être autorisés à exécuter des actions critiques ou réglementées sans l'intervention d'un humain qualifié.
23:43 Sam Donc le modèle ne signe jamais. Une personne signe. Et la question pratique, celle que l'investigateur aurait dû poser dans la scène d'ouverture, c'est : qui a signé, sur la foi de quoi, et cette personne aurait-elle pu savoir que le modèle se trompait. Si la réponse honnête à la troisième est non, l'évaluation des risques s'est appuyée sur un contrôle qui ne pouvait pas fonctionner, et la responsabilité revient à celui qui a approuvé cette évaluation, pas à l'opérateur qui a accepté une valeur qui était dans la plage.
24:13 Sam Ma position, donc. C'est la synthèse du personnage, proposée pour que vous la mettiez à l'épreuve, et les documents fournissent chaque prémisse et aucune des conclusions. Trois mouvements. Un : encoder chaque vérification qui peut être encodée. Bornes, vérifications de la distribution des entrées, détection des données hors distribution, seuils de confiance, métriques de dérive. L'annexe vingt-deux en demande déjà la plupart. L'humain n'est jamais le vérificateur de bornes.
24:43 Sarah Deux ?
24:44 Sam Deux : écrire dans l'utilisation prévue, ce que trois point trois exige déjà, le jugement précis que l'humain apporte, par compétence plutôt que par intitulé de poste. Pas l'opérateur revoit. Plutôt : une personne capable de reconnaître un comportement physiquement invraisemblable de ce procédé revoit ; ou, une personne capable de reconnaître un mauvais comportement du modèle revoit. Trois : si le jugement que vous avez écrit est l'expertise du modèle, et que l'usine ne la pourvoit pas aux heures où la décision est prise, le contrôle est une fiction, et le niveau de risque ne doit pas en être crédité. Soit vous construisez une voie d'escalade vers l'expertise du modèle, une compétence nommée d'astreinte et un état indéterminé qui retient la décision jusqu'à ce qu'elle réponde, soit vous acceptez le palier supérieur et la charge de preuve qui va avec.
25:36 Sarah Ce que les documents soutiennent là-dedans : le trois point trois de l'annexe vingt-deux exige la responsabilité dans l'utilisation prévue et la performance de l'opérateur surveillée ; BioPhorum exige que la gouvernance définisse quand le contrôle humain est un contrôle validé ; le paragraphe quatre du règlement sur l'IA décrit les capacités ; la FDA exige que l'équipe soit évaluée. Ce qu'aucun d'eux ne dit, c'est qu'un contrôle qu'on ne peut pas pourvoir en personnel ne mérite aucun crédit. C'est le pas que tu ajoutes.
26:03 Sam C'est le pas qu'une évaluation des risques selon Q9 ferait pour n'importe quel autre contrôle. Un verrouillage de pression qui n'est pas câblé ne réduit pas un score de risque. Une personne qui ne peut pas dire que le modèle se trompe n'est pas câblée.
26:17 Sam Deuxième point d'étape, puis les quatre systèmes. Jusqu'ici : trois sens ; ce que chaque document exige ; le paradoxe ; les quatre questions ; la responsabilité ne bouge pas ; et encoder, nommer, escalader. Maintenant nos vieux amis, chacun avec la revendication d'humain dans la boucle que son évaluation des risques fait probablement, et trois questions chacun : quel humain, quelle compétence, quelles entrées.
26:43 Sarah Le capteur logiciel, avec un opérateur qui revoit les recommandations. Quelles entrées ? Si l'opérateur compare la recommandation à une plage, c'est le trois point un et le neuf point deux de l'annexe vingt-deux, et le système devrait l'appliquer. Si l'on demande à l'opérateur si la recommandation a un sens physique pour cette culture, c'est l'expertise du procédé, et elle est réelle : un opérateur expérimenté peut savoir qu'une augmentation de l'alimentation à cette heure de cette phase est une erreur avant n'importe quel modèle. Ce jugement a sa place dans l'utilisation prévue, et trois point trois dit de le surveiller comme un procédé manuel : mesurer à quelle fréquence l'opérateur passe outre à raison.
27:15 Sam Et c'est mesurable. Glissez dans la revue des recommandations connues comme mauvaises et regardez ce qui est attrapé. Vous le feriez pour un inspecteur visuel ; faites-le ici. La compétence est celle du procédé, l'usine la pourvoit sur chaque équipe, et le crédit est mérité. C'est le bon cas.
27:33 Sarah Le modèle multivarié de lot, revu par un ingénieur le lendemain matin. C'est de l'humain sur la boucle au sens de BioPhorum, pas dans la boucle : le lot a avancé. La compétence de l'ingénieur peut très bien être l'expertise du modèle, la bonne personne, mais la revue vient après la décision. Sur la matrice de BioPhorum, un modèle statique avec un humain sur la boucle est d'influence modérée, pas faible.
27:52 Sam Nommez-le honnêtement et notez en conséquence. Sur la boucle, c'est très bien ; la plupart de la surveillance fonctionne comme ça. Ce qui n'est pas bien, c'est de revendiquer le niveau dans la boucle pour ça. Et si vous voulez le niveau dans la boucle, le modèle doit pouvoir retenir le lot, ce qui veut dire l'état indéterminé et quelqu'un d'astreinte.
28:11 Sarah Le système de vision pour le volume de remplissage, avec un opérateur qui confirme les rejets. Le mode de défaillance est celui que le règlement sur l'IA nomme : le biais d'automatisation. Après mille accords, l'opérateur est d'accord avec le mille-et-unième. Sous trois point trois, l'opérateur est désormais un procédé d'inspection manuelle, et les usines qualifient des inspecteurs manuels depuis des décennies : des défauts connus dans le flux, un taux de détection, une requalification. La compétence est celle du procédé. La mesure existe déjà.
28:38 Sam Deux choses. L'exemple de la FDA elle-même avait déjà le meilleur contrôle : le test du volume de remplissage sur échantillon à la libération, qui est orthogonal et ne se fatigue pas ; la liste des contrôles limitant la décision de BioPhorum dit la même chose. L'opérateur qui confirme les rejets achète moins de risque que le test sur échantillon. Et si l'opérateur ne peut pas réellement passer outre le rejet, il n'est pas du tout un contrôle ; le paragraphe quatre dit que la personne chargée du contrôle doit pouvoir ignorer, passer outre ou inverser.
29:10 Sarah Et l'assistant agentique : une investigation de déviation rédigée, des causes racines classées, une CAPA proposée, approuvées par l'assurance qualité. Sous la clause un de l'annexe vingt-deux, c'est un usage non critique uniquement, avec l'humain comme condition. Quelles entrées le relecteur évalue-t-il ? L'exactitude factuelle et l'exhaustivité par rapport aux enregistrements source : le dossier de lot disait-il ce que le brouillon dit qu'il dit ; le brouillon a-t-il manqué l'alarme de la quatorzième heure ; l'action proposée est-elle celle que les preuves soutiennent. Quelle compétence ? Lire les enregistrements, c'est le métier même de l'assurance qualité. Juger si le modèle a inventé une cause racine plausible est plus proche de l'expertise du modèle, et l'avertissement du document de réflexion sur les modèles génératifs qui produisent des sorties plausibles mais erronées ou incomplètes, écrit pour l'information sur le produit, s'applique mot pour mot.
29:55 Sam Et la question des entrées a une réponse physique : le relecteur a-t-il les enregistrements source ouverts, ou seulement le brouillon ? Si seulement le brouillon, le relecteur vérifie si l'histoire est cohérente, ce qui est exactement ce qu'un modèle de langage produit le mieux. Le contrôle mesure alors la fluidité. L'exemple de BioPhorum demande des exigences de citation et un test rétrospectif sur les déviations clôturées, et c'est la bonne forme : chaque affirmation du brouillon pointe vers un enregistrement, et le relecteur vérifie le pointeur, pas la prose.
30:30 Sarah La signature reste humaine ; BioPhorum dit que l'IA ne doit pas exécuter de signatures électroniques, et rien dans la réglementation ne le lui permet. Et le test de l'équipe de nuit, Sam.
30:39 Sam Qui, à trois heures du matin, peut dire que c'est le modèle plutôt que le procédé qui se trompe ? Pour le capteur logiciel : l'opérateur peut dire que le procédé se trompe, le système peut dire que les entrées ont dérivé, et personne de service ne peut dire que le modèle se comporte mal ; donc l'utilisation prévue dit que ce sont les propres vérifications du modèle qui portent ça, et là où elles ne le peuvent pas, la décision attend. Pour l'agent : personne de service ne peut distinguer une cause racine inventée d'une vraie sans les enregistrements ; donc l'agent ne propose pas d'actions pendant l'équipe de nuit, ou il les propose dans une file qu'un relecteur compétent ouvre à sept heures. Ce n'est pas une limite de la technologie. C'est une limite des effectifs, et l'écrire, c'est ça le contrôle.
31:26 Sam Et alors, pour la bioproduction. Opinion tranchée, et étiquetée comme la mienne. Réécrivez chaque ligne HITL de vos évaluations des risques en quatre champs : quel humain, quelle compétence, quelles entrées, mesuré comment. Puis triez. Là où la réponse est une vérification de bornes, automatisez-la et cessez d'en réclamer le crédit ; l'annexe fera de toute façon faire ça au système. Là où la réponse est l'expertise du procédé, gardez-la, écrivez-la dans l'utilisation prévue, et surveillez-la comme tout procédé manuel : erreurs glissées, taux de détection, requalification. Là où la réponse est une expertise du modèle que vous ne pourvoyez pas aux heures où la décision est prise, le crédit disparaît et le palier monte, ou vous construisez la voie d'escalade : un état indéterminé qui retient la décision, et une compétence nommée d'astreinte.
32:17 Sarah Qui doit être dans la pièce, d'après les documents : la liste du deux point un de l'annexe vingt-deux, experts du procédé, assurance qualité, data scientists et informatique, plus le propriétaire de l'IA de BioPhorum. Et l'endroit où l'humain se définit, c'est le document d'utilisation prévue ; trois point trois l'y place, et c'est le même document que la FDA appelle le contexte d'utilisation.
32:38 Sam Trois conséquences. Le MSAT et la science des procédés possèdent les jugements d'expertise du procédé, et peuvent en faire une qualification : que remarque un relecteur compétent, et comment sait-on qu'il l'a remarqué. L'assurance qualité possède la signature, donc la question aurais-je pu savoir est celle de l'assurance qualité, et le relecteur de l'agent a besoin des enregistrements ouverts et d'une procédure qui vérifie les pointeurs, pas la prose. Les affaires réglementaires CMC possèdent l'évaluer-l'équipe de la FDA : le plan de crédibilité doit nommer l'humain et le test, et si vous validez l'équipe avec le data scientist et que vous la déployez avec l'opérateur, vous avez validé une équipe que vous ne faites pas tourner.
33:24 Sarah Et le point sur les données qui court sous chaque épisode : les propres vérifications du modèle, les métriques de dérive, l'enveloppe des entrées, le drapeau indéterminé, sont calculées à partir des données dont parlait l'épisode précédent. Si le sous-sol n'est pas sec, le système ne peut pas attraper ce que vous venez de retirer à l'opérateur.
33:39 Sam Ce qui est la thèse, et elle est mienne : l'humain est un contrôle validé ou il n'est pas un contrôle. Les documents lui donnent chaque prémisse et aucune des conclusions.
33:50 Sam Trois choses. Sarah.
33:52 Sarah Premièrement, le contrôle humain veut dire trois choses différentes, dans la boucle, sur la boucle et aucun, et BioPhorum montre que la configuration vaut un niveau entier d'influence du modèle. Quand une évaluation des risques dit HITL, demandez lequel elle veut dire, et si la personne est devant la décision.
34:06 Sarah Deuxièmement, les documents convergent vers la même forme sans la nommer : les cinq capacités du règlement sur l'IA, l'expertise de l'utilisateur et la dépendance excessive des principes côté dispositifs, l'opérateur de l'annexe vingt-deux surveillé comme un procédé manuel, l'équipe humain-IA de la FDA. Aucun ne dit quelle compétence. Le document de réflexion dit que la construire est le travail de l'organisation, réciproquement.
34:28 Sam Troisièmement, la mienne : encoder chaque vérification qu'un ordinateur peut exécuter, nommer le jugement que l'humain apporte par la compétence, et si cette compétence n'est pas dans l'équipe de nuit, le contrôle est une fiction et le niveau ne doit pas en être crédité. Escalader, ou accepter le palier. Et la responsabilité n'a jamais bougé : la signature est humaine, et cette personne aurait-elle pu savoir, c'est la question.
34:54 Sam La prochaine fois : le changement. Que se passe-t-il quand le modèle, ou le procédé, change ? Les protocoles de gestion des changements post-approbation, les PACMP, les plans prédéterminés de contrôle des changements, les conditions établies, et la mise à jour du fournisseur que personne n'avait prévue ; le modèle de fondation sous l'agent qui a été remplacé un mardi. Y sommes-nous ? On sait qui signe. La prochaine fois, on demande ce qui se passe quand ce pour quoi ils ont signé change sous leurs pieds.