L'IA dans la production biopharmaceutique : on y est ?
This is the script the AI voices read, so it matches the audio word for word; times are from the render. Documenté, écrit et lu par des systèmes d'IA sous la direction de Jack Prior ; édition française traduite par l'IA à partir des épisodes anglais vérifiés. Sam et Sarah sont des personnages d'IA ; rien dans l'épisode n'est Jack qui parle, et rien n'engage ses opinions ni celles de son employeur. L'IA générative peut se tromper avec assurance — vérifiez les sources. Corrections : jack@jackprior.ai.
00:00 Narrator Voici On y est ? — un podcast sur l'évolution de l'IA dans la production biopharmaceutique, dirigé par Jack Prior. Un mot sur la façon dont il est fait. Cet épisode a été documenté, écrit et lu par des systèmes d'IA. Jack pose les questions et les cadres ; l'IA lit les documents et écrit la conversation que vous allez entendre, entre deux personnages d'IA : Sam, qui joue un praticien des sciences de la production, et Sarah, qui a lu les documents. Cette édition française est une traduction, par l'IA, des épisodes anglais. Rien de ce que vous entendez n'est Jack qui parle, et rien n'engage ses opinions ni celles de son employeur. Comme toute IA générative, elle peut se tromper — avec assurance, ou en manquant une nuance — ce qui est précisément le risque que cette industrie cherche à maîtriser, et précisément le sujet de cette saison. Vérifiez les sources avant de vous y fier. Les corrections sont les bienvenues à jackprior point A I. Place à l'épisode.
00:56 Sam Un site de biomédicaments, inspecté par la FDA et par une autorité européenne une année sur deux. Le fournisseur du capteur logiciel livre une nouvelle version, et la fonctionnalité phare, c'est le recalibrage adaptatif : chaque nuit, le modèle se réajuste sur les derniers lots. Le data scientist a sa diapositive prête ; erreur de prédiction en baisse d'un tiers. La personne qualifiée lit un paragraphe d'un projet d'annexe et pose une question que personne dans la salle n'attendait : est-ce que c'est maintenant un modèle dynamique ? Parce que si c'en est un, le projet dit qu'il ne devrait pas s'approcher d'une étape critique, quoi que disent les barres d'erreur. Au bout du couloir, l'équipe numérique pilote un assistant sur un modèle de langage qui rédige des brouillons d'investigations de déviation. Même paragraphe. Même problème. Et l'usine n'a pas changé un seul paramètre de procédé. Elle a changé un type de modèle.
01:50 Sarah C'est ça le basculement de ce soir, Sam. Pendant vingt ans, le type de modèle que vous construisiez était un choix d'ingénierie. Sous le projet européen, c'est une décision de conformité, prise avant la première ligne de code.
02:01 Sam Et la FDA ne le voit pas du tout comme ça. Lisons les deux.
02:04 Sam Sarah, la question.
02:06 Sarah Pourquoi le modèle que vous choisissez est-il désormais une décision de conformité, et sur quoi la FDA et l'UE sont-elles en désaccord ? Deux sous-questions la traversent. Le modèle peut-il continuer d'apprendre une fois en production ? Et peut-il être un grand modèle de langage ? L'épisode précédent nous a donné les quatre paliers et a dit que l'annexe vingt-deux est une barrière qu'on franchit après le palier. Ce soir, on lit la barrière.
02:27 Sam Pourquoi maintenant, en un souffle, parce que j'ai déjà dit ce que j'en pensais dans l'épisode un. Le capteur logiciel, le modèle de lot, la caméra : tous statiques, tous déterministes, tous acceptables sous n'importe quelle version de ce règlement. Les deux choses qui sont arrivées dans l'usine ces deux dernières années sont exactement les deux choses que le projet européen nomme et exclut : les modèles qui apprennent en cours d'utilisation, et les modèles génératifs. Le premier texte du règlement à vocation contraignante sur l'IA trace sa ligne précisément là où se tient la nouvelle technologie. Ce n'est pas un hasard, et c'est pour ça que cet épisode compte plus pour l'agent que pour tout le reste de la diapositive.
03:08 Sam Les documents.
03:10 Sarah Le point d'ancrage est le projet d'annexe vingt-deux au guide des BPF de l'UE, intitulé Intelligence artificielle. Couche un, loi et réglementation : une annexe au volume quatre d'EudraLex, donc quand elle sera finale, elle fera partie des règles BPF, pas d'une guidance à leur sujet. Maturité : projet, publié pour consultation le sept juillet deux mille vingt-cinq, consultation close le sept octobre. D'après le paysage, il a été préparé par le groupe de travail des inspecteurs BPF et BPD de l'EMA et consulté en parallèle avec le PIC/S, le Pharmaceutical Inspection Co-operation Scheme, le schéma de coopération des inspections pharmaceutiques, ce qui veut dire qu'il atteint des inspectorats bien au-delà de l'UE. Il fait six pages. On l'a lu en entier.
03:49 Sam Les voix.
03:50 Sarah Quatre. Le projet de la FDA de janvier deux mille vingt-cinq sur l'IA à l'appui des décisions réglementaires, guidance de régulateur, toujours un projet, pour son exclusion de périmètre et sa section sur la maintenance du cycle de vie. La guidance dispositifs de la FDA sur les plans de contrôle des changements prédéterminés pour les logiciels de dispositifs à base d'IA, finale en décembre deux mille vingt-quatre et rééditée en août deux mille vingt-cinq, parce que le côté dispositifs a déjà un instrument pour les modèles qui changent. Le document de réflexion de l'EMA sur l'IA dans le cycle de vie du médicament, final en septembre deux mille vingt-quatre, pour ce qu'il dit de l'apprentissage génératif et incrémental. Et le profil du NIST sur l'IA générative, AI six cents tiret un, de juillet deux mille vingt-quatre, couche des normes, parce que c'est le document qui nomme les risques génératifs en termes clairs.
04:35 Sam Commençons là où le projet commence. Le périmètre.
04:38 Sarah Section un, premier paragraphe. L'annexe s'applique aux systèmes informatisés utilisés dans la fabrication des médicaments et des substances actives, je cite, lorsque des modèles d'intelligence artificielle sont utilisés dans des applications critiques ayant un impact direct sur la sécurité des patients, la qualité du produit ou l'intégrité des données. Et dans le même souffle, elle dit qu'elle fournit des orientations complémentaires à l'annexe onze pour les systèmes informatisés dans lesquels des modèles d'IA sont intégrés. Donc deux choses à la fois : elle ne concerne que les applications critiques, et c'est un complément à l'annexe sur les systèmes informatisés, pas un règlement autonome.
05:12 Sam Et quel type de modèle ?
05:14 Sarah Deuxième paragraphe : les modèles d'apprentissage automatique, c'est-à-dire les modèles qui ont obtenu leur fonctionnalité par entraînement sur des données plutôt que par programmation explicite. Il ajoute qu'un modèle peut être constitué de plusieurs modèles individuels, chacun automatisant une étape de procédé spécifique. Puis viennent les trois paragraphes qui font l'épisode de ce soir. Statique. Déterministe. Et non génératif.
05:36 Sam Avant de les lire, le statut. Où en est ce projet dans sa vie ?
05:40 Sarah Projet pour consultation, de juillet à octobre deux mille vingt-cinq, et le paysage enregistre environ mille trois cents commentaires reçus. L'EMA a tenu un atelier de deux jours, le trente juin et le premier juillet deux mille vingt-six, qui s'est penché précisément sur les catégories exclues, les modèles adaptatifs et génératifs, et le texte du projet n'a pas été amendé ensuite. Si je comprends bien, le texte final devrait être transmis à la Commission vers la fin de deux mille vingt-six, avec une entrée en vigueur autour de deux mille vingt-sept. Traitez ces deux dernières dates comme des estimations. Ce qui n'est pas une estimation, c'est que le texte que vous pouvez lire aujourd'hui est celui qu'un inspecteur a lu.
06:18 Sam C'est la règle de la maison. C'est un projet ; c'est aussi la pensée actuelle des gens qui arpenteront vos ateliers. Maintenant, les trois paragraphes.
06:28 Sarah D'abord, statique. Le document s'applique aux modèles statiques, je cite, des modèles qui n'adaptent pas leur performance en cours d'utilisation en incorporant de nouvelles données. La phrase suivante : l'utilisation de modèles dynamiques qui apprennent et adaptent continuellement et automatiquement leur performance en cours d'utilisation n'est pas couverte par ce document, et, je cite la fin de la phrase, ne devrait pas avoir lieu dans les applications BPF critiques.
06:49 Sam Relis cette structure, parce que c'est tout l'enjeu. Pas couvert, et ne devrait pas être utilisé. Ce sont deux affirmations différentes.
06:57 Sarah Oui. Pas couvert voudrait dire que l'annexe se tait et que vous raisonnez à partir de l'annexe onze. Ne devrait pas être utilisé, c'est une position. Dans la rédaction BPF, devrait est le mot opérationnel du début à la fin ; l'annexe emploie devrait pour tout ce qu'elle attend. Donc un modèle dynamique dans une application critique n'est pas un vide dans les règles. C'est quelque chose que le projet vous dit de ne pas faire. Et le glossaire fixe le sens de statique : je cite, modèle figé : un modèle dont tous les paramètres ont été définitivement fixés, sans possibilité d'adaptation ultérieure à de nouvelles données.
07:27 Sam Donc mon capteur logiciel à recalibrage nocturne de l'ouverture.
07:31 Sarah Adapte sa performance en cours d'utilisation en incorporant de nouvelles données. Dynamique, selon la définition du projet, et si l'étape est critique, ne devrait pas être utilisé. L'amélioration de la précision n'est pas un facteur que le texte reconnaît.
07:43 Sam Deuxième paragraphe. Déterministe.
07:46 Sarah Le document s'applique aux modèles à sortie déterministe, je cite, qui, pour des entrées identiques, fournissent des sorties identiques. Les modèles à sortie probabiliste, qui pour des entrées identiques pourraient ne pas fournir des sorties identiques, ne sont pas couverts et, là encore, ne devraient pas être utilisés dans les applications BPF critiques. Notez que le test est comportemental : même entrée, même sortie. Un classifieur qui émet un score de probabilité reste déterministe en ce sens si le score est le même chaque fois que vous lui montrez la même image. Ce que le projet exclut, c'est un modèle qui échantillonne, de sorte que deux exécutions sur une même entrée peuvent diverger.
08:19 Sam Ce qui est ce qu'un modèle de langage fait par défaut. Alors voici l'esquive du praticien : mettre la température d'échantillonnage à zéro, figer les poids, et maintenant des entrées identiques donnent des sorties identiques. Est-ce que j'ai passé la barrière ?
08:33 Sarah Non, et le projet ferme cette porte délibérément. Le troisième paragraphe s'ouvre sur les mots Compte tenu de ce qui précède, puis, je cite, le document ne s'applique pas à l'IA générative ni aux grands modèles de langage, et de tels modèles ne devraient pas être utilisés dans les applications BPF critiques. Il les exclut nommément, en tant que catégorie, sans les faire passer par les tests statique et déterministe. Un modèle de langage figé, à température zéro, peut réussir les deux tests, il est quand même exclu par son nom.
09:01 Sam Donc la barrière a trois barres. Deux sont des propriétés qu'on peut tester, et une est un nom. Ça va compter quand on arrivera à l'agent.
09:10 Sarah Et le même paragraphe dit ce qui se passe hors usage critique. Si des modèles génératifs sont utilisés dans des applications BPF non critiques, définies comme celles qui n'ont pas d'impact direct sur la sécurité des patients, la qualité du produit ou l'intégrité des données, alors, je cite, un personnel doté d'une qualification et d'une formation adéquates devrait toujours être responsable de s'assurer que les sorties de tels modèles conviennent à l'utilisation prévue. Il appelle ça un humain dans la boucle, et ajoute que les principes du document peuvent être pris en compte le cas échéant.
09:38 Sam Toujours. Pas selon le risque, pas le cas échéant. Toujours une personne responsable de la sortie.
09:44 Sarah Toujours, pour les modèles génératifs en usage non critique. Et il y a une seconde clause d'humain dans la boucle plus loin, trois point trois, écrite pour les modèles dans le périmètre. Lorsqu'un modèle alimente une décision prise par un opérateur humain, et que l'effort de test du modèle a été réduit pour cette raison, l'utilisation prévue devrait inclure la responsabilité de l'opérateur, et la formation de l'opérateur et la constance de sa performance devraient être surveillées, je cite, comme tout autre procédé manuel. La clause dix point cinq ajoute que des enregistrements de cette revue devraient être conservés et que, selon la criticité et l'ampleur des tests du modèle, cela peut vouloir dire une revue de chaque sortie, selon une procédure.
10:19 Sam Laisse-moi mettre quelque chose de côté pour l'épisode sept, parce que ça commence exactement ici. Trois point trois suppose que l'opérateur attrape ce que le modèle rate. Si ce que fait l'opérateur, c'est vérifier la sortie par rapport à des bornes définies, c'est une règle, et le système devrait l'exécuter ; l'humain ajoute une signature, pas un contrôle. Si l'opérateur est censé arrêter quelque chose d'inattendu, il faut soit une expertise du procédé, ça a l'air physiquement faux pour ce bioréacteur, soit une expertise du modèle, le modèle se comporte mal. Le projet dit opérateur, et qualification adéquate, et s'arrête là. Quelle compétence, évaluant quelles entrées ? Mis de côté. Épisode sept.
11:03 Sarah Mis de côté. Et pour ce soir, notez ce que les deux clauses ensemble font à un système génératif : en usage critique, il est dehors ; en usage non critique, une personne qualifiée est toujours propriétaire de la sortie, et cette personne est un procédé manuel avec sa propre surveillance de performance. Le projet ne donne jamais à un modèle génératif de voie vers une étape critique, avec ou sans humain.
11:22 Sam Où on en est. L'annexe vingt-deux est un projet d'annexe aux BPF de l'UE, consulté avec le PIC/S, et tout son périmètre, c'est l'apprentissage automatique statique et déterministe dans les applications critiques. Les modèles dynamiques, les modèles probabilistes et les modèles génératifs sont priés de ne pas être utilisés dans les applications critiques, et les modèles génératifs en usage non critique ont toujours un humain qualifié propriétaire de la sortie. Mille trois cents commentaires et un atelier, et toujours pas de texte révisé, même si l'EMA dit qu'elle est en train de le réviser. Maintenant, l'autre côté de l'Atlantique, qui ne dit jamais rien de tout ça.
12:01 Sarah Le projet de la FDA de janvier deux mille vingt-cinq énonce sa position sur le type de modèle dans son introduction, en une phrase : je cite, cette guidance n'approuve l'utilisation d'aucune approche ni technique d'IA particulière. C'est tout. Le type de modèle n'apparaît jamais comme une barrière nulle part dans le document. Le cadre, comme on l'a lu dans l'épisode deux, gradue la décision, et l'étape quatre vous demande ensuite de décrire le modèle que vous avez choisi, quel qu'il soit.
12:25 Sam Et sur les modèles qui continuent d'apprendre ?
12:28 Sarah Section quatre B, maintenance du cycle de vie, qu'il définit comme la gestion des changements des modèles d'IA, qu'ils soient accidentels ou délibérés, pour que le modèle reste apte à l'usage tout au long du cycle de vie du produit. Il dit que la maintenance du cycle de vie est importante pour l'IA en phase de fabrication en particulier. Puis la phrase qui installe la divergence : les modèles fondés sur l'IA peuvent être très sensibles aux changements des entrées parce qu'ils sont pilotés par les données et peuvent être, je cite, auto-évolutifs, c'est-à-dire capables de s'adapter de façon autonome sans aucune intervention humaine. Les indicateurs de performance devraient être surveillés en continu, et, je cite encore, les demandeurs devraient anticiper les changements inhérents, dirigés par le modèle, et la nécessité d'identifier et d'évaluer ces changements.
13:10 Sam Donc la même chose que l'Europe dit de ne pas utiliser, la FDA dit de la planifier. Pas permettre ; planifier. C'est un autre verbe et une autre posture.
13:18 Sarah Et il dit où vit le plan. Les changements du modèle, ou les changements de fabrication susceptibles d'affecter le modèle, passent par le système de gestion des changements du fabricant au sein du système qualité pharmaceutique ; il donne comme exemples les nouvelles données de fabrication disponibles et les changements dirigés par le modèle. Si un changement affecte la performance, il devrait être déclaré à l'Agence conformément aux exigences réglementaires. Les plans détaillés de cycle de vie, avec des indicateurs de performance, une fréquence de surveillance fondée sur le risque et des déclencheurs de retest, vivent dans le système qualité du site, avec un résumé dans la demande d'autorisation de mise sur le marché pour les modèles propres à un produit ou à un procédé. Et il renvoie à ICH Q12 : les demandeurs peuvent proposer des éléments liés au modèle comme conditions établies, avec un plan pour gérer leurs changements, de sorte que certains changements n'exigeraient pas de soumission avant d'être faits.
14:08 Sam Ce qui est le territoire de l'épisode sur le changement, donc j'y laisse les instruments. Mais une chose encore dans le texte de la FDA qui parle du type de modèle.
14:18 Sarah L'étape sept. Si la crédibilité n'est pas suffisamment établie pour le risque du modèle, l'une des cinq issues que liste la FDA, c'est que le demandeur peut changer d'approche de modélisation. Donc dans le cadre de la FDA, le type de modèle est un levier que vous pouvez actionner une fois les preuves arrivées. Dans l'annexe vingt-deux, c'est une barrière que vous franchissez avant que les preuves soient réunies. C'est la divergence en une phrase : pour la FDA, le type de modèle est une réponse à un problème de crédibilité ; pour le projet européen, c'est une condition préalable.
14:45 Sam Et la FDA a déjà construit l'instrument pour un modèle qui change. Du côté des dispositifs.
14:50 Sarah Le plan de contrôle des changements prédéterminé, ou PCCP, dans la guidance sur les fonctions logicielles de dispositifs à base d'IA, publiée à l'origine le quatre décembre deux mille vingt-quatre et rééditée le dix-huit août deux mille vingt-cinq. C'est son énoncé de périmètre qui est intéressant ce soir. Il s'applique aux logiciels de dispositifs que le fabricant a l'intention de modifier au fil du temps, et cela inclut les modifications mises en œuvre automatiquement par le logiciel, ce qu'il dit être aussi connu sous le nom d'apprentissage continu, les modifications mises en œuvre manuellement avec revue et décision humaines, ou les deux.
15:21 Sam Donc un modèle en apprentissage continu n'est pas seulement envisagé, il a une voie de soumission.
15:28 Sarah Trois composantes : une description des modifications, c'est-à-dire les spécifications des caractéristiques et de la performance des changements prévus ; un protocole de modification, c'est-à-dire les activités de vérification et de validation avec des critères d'acceptation prédéfinis ; et une évaluation d'impact des bénéfices et des risques. Un plan autorisé devient une caractéristique technologique du dispositif autorisé, et les modifications faites dans son cadre ne déclenchent pas de nouvelle soumission de mise sur le marché. Deux limites pour ce qui nous concerne. C'est un instrument dispositifs ; la guidance dit qu'il s'applique au constituant dispositif d'un produit combiné et pas au constituant médicament ou produit biologique. Et le plan est autorisé avec le dispositif, donc il y a un régulateur de l'autre côté de la table avant la première mise à jour automatique.
16:09 Sam Donc le tableau transatlantique pour un modèle qui apprend en cours d'utilisation : l'Europe, ne devrait pas être utilisé en BPF critique ; la FDA côté médicaments, anticipez-le, surveillez-le, mettez le plan dans le système qualité et déclarez les changements qui affectent la performance ; la FDA côté dispositifs, pré-autorisez l'enveloppe. Trois postures pour un seul type de modèle. Un site mondial vit sous les trois.
16:36 Sam Je reformule. L'Europe filtre par type de modèle avant les preuves : statique, déterministe, non génératif. La FDA n'approuve ni n'exclut aucune technique, vous dit d'anticiper les modèles auto-évolutifs au titre de la maintenance du cycle de vie, et vous laisse changer d'approche de modélisation si la crédibilité fait défaut. Le monde des dispositifs a un plan pré-autorisé pour l'apprentissage continu qui n'atteint pas le CMC des médicaments. Maintenant la seconde sous-question. Peut-il être un modèle de langage ? La FDA d'abord, parce que la réponse de la FDA, c'est le silence.
17:10 Sarah Les mots génératif et modèle de langage n'apparaissent pas dans le projet de la FDA. La seule prise est l'exclusion de périmètre, lignes quarante-sept à cinquante et un. La guidance ne traite pas de l'IA utilisée, je cite, pour l'efficacité opérationnelle, et les exemples entre parenthèses sont les flux de travail internes, l'allocation des ressources, et la rédaction d'une soumission réglementaire. Mais l'exclusion est assortie d'une condition : ces usages ne sont hors périmètre que lorsqu'ils n'ont pas d'impact sur la sécurité des patients, la qualité du médicament ou la fiabilité des résultats d'une étude non clinique ou clinique. Et la FDA ajoute que les demandeurs qui ne savent pas si un usage est dans le périmètre devraient prendre contact tôt.
17:45 Sam Donc la rédaction est nommée comme exemple de ce qui est dehors. Et puis la condition le reprend dès l'instant où le brouillon compte.
17:54 Sarah C'est la structure. Un modèle de langage qui rédige une note interne est dehors. Un modèle de langage dont le brouillon d'investigation façonne une décision de libération de lot a un impact sur la qualité du médicament, et il est dedans. Une fois dedans, il n'y a aucun chapitre propre au génératif vers lequel se tourner ; les sept étapes s'appliquent comme à n'importe quel modèle. L'étape quatre demande bien deux choses qu'un modèle de fondation vous impose : préciser si un modèle pré-entraîné a été utilisé, et si oui, sur quel jeu de données il a été pré-entraîné et comment le modèle a été développé ou obtenu ; et si le contexte d'utilisation implique un humain dans la boucle, évaluer le tandem humain-IA, pas le modèle seul.
18:29 Sam Remarque que les deux tests de criticité sont presque la même phrase. FDA : sécurité des patients, qualité du médicament, fiabilité des résultats. Annexe vingt-deux : sécurité des patients, qualité du produit, intégrité des données. Deux régulateurs, une question, à savoir si la sortie du modèle touche la qualité. Et une conséquence différente quand la réponse est oui : la FDA dit maintenant faites l'évaluation de crédibilité ; l'Europe dit maintenant le modèle de langage ne devrait pas être là.
18:59 Sarah Le document de réflexion de l'EMA, lui, emploie les mots, à deux endroits. Dans sa section sur l'information produit, il dit que l'IA utilisée pour rédiger, compiler, éditer ou relire des documents d'information produit devrait être utilisée sous supervision humaine étroite, et en donne la raison : je cite, les modèles de langage génératifs ont tendance à inclure des sorties plausibles mais erronées ou incomplètes, donc les mécanismes de revue qualité doivent garantir que le texte généré par le modèle est factuellement et syntaxiquement correct. Et dans sa section sur l'intégrité, il dit que les grands modèles de langage, qui contiennent souvent des milliards de paramètres, présentent un risque particulier de mémorisation des données d'entraînement. Sur la fabrication, il dit que le développement des modèles et la gestion de leur cycle de vie devraient suivre les principes de gestion des risques qualité et ICH Q8, Q9 et Q10, je cite, dans l'attente de la révision des exigences réglementaires et des normes BPF actuelles. Cette attente, c'est l'annexe vingt-deux.
19:52 Sam Et l'EMA sur l'apprentissage en cours d'utilisation ?
19:55 Sarah Ça dépend du contexte, ce qui vaut la peine d'être su. Pour les essais cliniques pivots : je cite, les approches d'apprentissage incrémental ne sont pas acceptées, et toute modification du modèle pendant l'essai exige une interaction réglementaire. Pour la pharmacovigilance, il dit que l'inverse peut être permis : l'apprentissage incrémental peut améliorer en continu les modèles de classification des déclarations d'effets indésirables, le titulaire étant responsable de la validation et de la surveillance. Donc le propre document de l'EMA traite les modèles adaptatifs comme acceptables dans un cadre et inacceptables dans un autre, selon la conséquence. Et un petit point de filiation : son glossaire définit un modèle figé comme un modèle dont tous les paramètres ont été définitivement fixés, sans possibilité d'adaptation ultérieure à de nouvelles données. Le glossaire de l'annexe vingt-deux définit statique avec les mêmes mots.
20:39 Sam Maintenant le NIST, qui est le seul des documents de ce soir écrit exprès sur l'IA générative.
20:45 Sarah AI six cents tiret un est un profil du cadre de gestion des risques de l'IA du NIST pour l'IA générative, approuvé en juillet deux mille vingt-quatre, couche des normes, volontaire. La section deux liste douze risques propres à l'IA générative ou aggravés par elle. Quatre d'entre eux sont ceux de l'usine. La confabulation, qu'il définit comme, je cite, la production de contenu affirmé avec assurance mais erroné ou faux, familièrement les hallucinations, et il dit que la confabulation est particulièrement importante à surveiller quand l'IA générative est intégrée à des décisions à conséquences. La configuration humain-IA : biais d'automatisation et confiance excessive, des humains percevant le contenu généré comme de meilleure qualité qu'il ne l'est. L'intégrité de l'information : du contenu qui peut ne pas distinguer le fait de l'inférence ni reconnaître ses incertitudes. Et la chaîne de valeur et l'intégration de composants : des composants tiers, des modèles pré-entraînés et des jeux de données qui ne sont pas contrôlés de façon transparente, de sorte que les problèmes de comportement d'un système sont difficiles à attribuer à une source précise.
21:42 Sam Mets ces quatre-là à côté d'une investigation de déviation et ils n'ont plus rien d'abstrait. Un paragraphe assuré citant une entrée du dossier de lot qui n'existe pas. Un relecteur qui cesse de lire attentivement au quarantième brouillon. Une cause racine énoncée comme un fait alors que c'était une inférence. Et un fournisseur qui remplace le modèle sous vos pieds entre mardi et mercredi. Le NIST les nomme ; personne en BPF n'a encore dit quelles preuves y répondent.
22:10 Sarah Ce qui laisse la question que le paysage met au centre : savoir si un usage documentaire donné est critique. Sous l'annexe vingt-deux, c'est la seule question qui compte pour un modèle génératif, parce que la criticité est la propriété de l'application, pas du modèle, et qu'il n'y a pas de palier intermédiaire. Sous la FDA, c'est la même question en d'autres mots, et la réponse décide si vous devez une évaluation de crédibilité.
22:30 Sam Une chose encore sur le point d'ancrage avant les exemples. Il fait six pages. Ça ne peut pas être six pages par hasard.
22:37 Sarah Ce n'est pas le cas. L'annexe vingt-deux a été publiée dans la même consultation qu'une annexe onze révisée sur les systèmes informatisés, qui passe de quelques pages à dix-sept chapitres couvrant la surveillance des fournisseurs, la piste d'audit, la gestion des identités et des accès et la cybersécurité, et qu'un chapitre quatre révisé sur la documentation. L'annexe IA dit dans son premier paragraphe qu'elle fournit des orientations complémentaires à l'annexe onze. Sa clause de non-régression, quatre point trois, qui dit que les critères d'acceptation du modèle devraient être au moins aussi élevés que la performance du procédé qu'il remplace, cite l'annexe onze pour la façon dont vous connaissez cette performance. Et sa section sur l'exploitation, la dix, c'est du vocabulaire de l'annexe onze : gestion des changements sur le modèle, le système et l'ensemble du procédé qu'il automatise avant la mise en production ; gestion de configuration avec des mesures pour détecter les changements non autorisés ; surveillance de la performance par rapport aux indicateurs définis ; et surveillance de la présence des entrées dans l'espace d'échantillonnage du modèle, avec des indicateurs de dérive.
23:38 Sam Donc tu le lis comme le chapitre vingt-deux d'un livre dont les autres chapitres sont réécrits en même temps. L'intégrité des données, le contrôle des accès, la piste d'audit : ils ne sont pas dans les six pages parce qu'ils sont dans les dix-sept chapitres d'à côté. Les six pages, c'est seulement ce qui est nouveau à propos d'un modèle.
23:58 Sarah Et ce qui est nouveau à propos d'un modèle, dans la vision du projet, c'est l'utilisation prévue avec un espace d'échantillonnage des entrées, des critères d'acceptation fixés avant les tests, des données de test indépendantes, l'explicabilité, la confiance, et les clauses d'exploitation. L'épisode sur les preuves les lit en entier. Ce soir, ce qui compte, c'est que tout cela présuppose un modèle figé : vous ne pouvez pas mettre un modèle sous gestion de configuration et détecter les changements non autorisés si le modèle se change lui-même chaque nuit. L'exigence de statique n'est pas une règle de plus boulonnée à l'annexe. C'est l'hypothèse sur laquelle repose le reste de l'annexe.
24:32 Sam Ce qui nous amène aux quatre systèmes, et à l'ouverture. Le capteur logiciel d'abord, recalibrage nocturne activé.
24:39 Sarah Sous l'annexe vingt-deux : il adapte sa performance en cours d'utilisation en incorporant de nouvelles données, donc il est dynamique, et s'il alimente une étape critique, dans les paliers qu'on a posés l'épisode dernier un usage de palier deux ou de palier trois, il ne devrait pas être utilisé, quelle que soit sa précision. Sous le projet de la FDA : anticipé. C'est un modèle auto-évolutif ; vous surveillez ses indicateurs en continu, vous évaluez les changements dirigés par le modèle via la gestion des changements du système qualité, et vous déclarez ceux qui affectent la performance. Le même objet, le même jour, est prié de ne pas exister dans une juridiction et prié de tenir un plan de maintenance dans l'autre.
25:13 Sam Et la réponse pratique pour un site inspecté par les deux.
25:17 Sarah Les documents pointent vers une seule construction. Désactivez le recalibrage nocturne dans le modèle déployé. Figez-le, versionnez-le, mettez la version sous gestion de configuration selon la clause dix point deux. Faites tourner la boucle d'apprentissage ailleurs : un environnement de développement où le modèle candidat est entraîné sur les nouveaux lots, testé contre un jeu de test indépendant tenu sous les contrôles de la section six, et comparé aux critères d'acceptation fixés sous la section quatre. Quand il réussit, la nouvelle version est libérée par la gestion des changements selon dix point un, comme un changement délibéré et documenté. Le modèle déployé est statique entre deux versions ; l'amélioration arrive quand même, à un rythme que vous contrôlez, avec un enregistrement de test pour chaque version. Dans le vocabulaire de gestion des changements que cette saison emploie, vous avez transformé un changement dirigé par le modèle en un changement délibéré.
26:01 Sam Ce que la plupart des sites feront, et ça vous coûte la chose pour laquelle le modèle adaptatif était fait. Vous vouliez qu'il suive le procédé au fil de sa dérive ; maintenant il suit le procédé au rythme de vos versions. C'est une vraie perte et je le dirais dans l'analyse de risque plutôt que de faire semblant que la version figée est tout aussi bonne. Le modèle de suivi des lots.
26:22 Sarah Le modèle multivarié, c'est le cas facile, et ça vaut la peine de dire pourquoi. Il est ajusté une fois sur un ensemble de lots de référence, figé et versionné ; des entrées identiques donnent des scores identiques ; il n'est pas génératif. Statique, déterministe, dans le périmètre. L'annexe vingt-deux s'applique en entier, ce qui veut dire que les clauses sur les preuves s'appliquent en entier, mais la barrière est ouverte. Si un site le réajuste après une campagne, c'est une nouvelle version par la gestion des changements, exactement la construction qu'on vient de décrire. Il ne devient dynamique que si quelqu'un le construit pour mettre à jour lui-même son ensemble de référence au fur et à mesure que les lots se terminent, et le projet dirait alors la même chose qu'au capteur logiciel.
26:59 Sam La caméra de volume de remplissage.
27:01 Sarah Un classifieur d'images entraîné, figé : statique et déterministe, dans le périmètre et permis, et le propre exemple de la FDA d'un modèle de fabrication. Deux choses à surveiller. Les fournisseurs de vision proposent de plus en plus l'apprentissage en ligne, le modèle s'affinant sur le flux de production ; sous l'annexe vingt-deux, cette fonction reste désactivée dans une application critique. Et une mise à jour du modèle par le fournisseur est un changement du modèle selon dix point un, donc elle est évaluée pour retest avant sa mise en service, et une décision de ne pas retester doit être pleinement justifiée. C'est la même clause, que le fournisseur appelle ça un correctif ou une nouvelle version.
27:35 Sam Et l'agent. Prends ton temps.
27:37 Sarah Un assistant sur un grand modèle de langage qui lit les dossiers de lot et rédige des brouillons d'investigations de déviation. Sous l'annexe vingt-deux, il bute sur les trois barres à la fois. Il est génératif et c'est un modèle de langage, donc il est exclu nommément. Laissé aux réglages par défaut, il échantillonne, donc il est probabiliste. Et s'il est configuré pour apprendre des corrections de l'ingénieur, il est dynamique. Dans une application critique, ne devrait pas être utilisé, trois fois. Figer les poids et mettre la température à zéro en retire deux sur trois et laisse le nom.
28:03 Sam Donc la seule voie que le projet offre, c'est le non critique.
28:07 Sarah Non critique, avec une personne qualifiée toujours responsable de la sortie. Ça veut dire que le site doit pouvoir dire, et défendre, que rédiger le brouillon de l'investigation n'a pas d'impact direct sur la qualité du produit ni sur l'intégrité des données, parce que l'ingénieur rétablit les faits à partir des enregistrements sources et que la décision de la Qualité ne repose pas sur le brouillon. La table de correspondance de l'épisode dernier appelle exactement cet argument la question ouverte. Sous la FDA, la même conception décide si vous êtes dans l'exclusion pour efficacité opérationnelle ou dans les sept étapes ; et si vous êtes dedans, l'étape quatre veut savoir quel modèle de fondation, pré-entraîné sur quoi, obtenu comment, et elle veut que le tandem humain-IA soit évalué, pas le modèle. Le NIST vous dit comment s'appellent les modes de défaillance. Aucun document ne vous dit quel test est réussi.
28:50 Sam Voici ma seule opinion sur la barrière elle-même, étiquetée, et ensuite je la laisse. Le projet a raison sur la pratique et tort sur l'outil. Figer et versionner, c'est la bonne pratique : un modèle figé est la seule chose pour laquelle je peux remettre un enregistrement de test à un inspecteur. Mais écrire l'exclusion comme un nom plutôt que comme une propriété veut dire qu'un modèle de langage figé, déterministe, avec un jeu de test indépendant complet, est dehors, tandis qu'une forêt aléatoire mal testée est dedans. Les huit entreprises derrière la guidance BioPhorum ont dit à peu près la même chose en juin. C'est ma seule opinion. Le reste ce soir, c'est ce que dit le texte.
29:32 Sarah Et ce que dit le texte est stable. Mille trois cents commentaires et un atelier qui a regardé en face les modèles adaptatifs et génératifs n'ont produit aucun changement du projet. Si le texte final bouge là-dessus, la liste de veille du paysage l'enregistrera. D'ici là, la barrière est ce qu'un inspecteur européen lit.
29:48 Sam Et alors, pour la bioproduction. Opinions étiquetées. Premièrement, pour tout site qu'un inspectorat de l'UE ou du PIC/S visite, le type de modèle est désormais une décision de conformité et il a sa place dans l'analyse de risque avant que l'architecture soit choisie. Trois questions, dans les propres mots du projet : s'adapte-t-il en cours d'utilisation, donne-t-il des sorties identiques pour des entrées identiques, et est-il génératif. Écrivez les réponses. Si l'application est critique et qu'une seule réponse est la mauvaise, le modèle n'y va pas, et aucun chiffre de précision n'y change rien.
30:24 Sarah Le projet appuie cet ordre. Sa clause sur le personnel réunit les experts du procédé, la qualité, les data scientists et l'informatique pendant la sélection de l'algorithme, avant l'entraînement, la validation et les tests. La sélection de l'algorithme, c'est là que les trois questions trouvent leur réponse, donc le projet vous a déjà dit qui est dans la salle quand le type de modèle est choisi.
30:42 Sam Deuxièmement : figez, versionnez, et mettez la boucle d'apprentissage hors du périmètre BPF. Chaque modèle qui compte reçoit un numéro de version, un enregistrement de configuration et un résultat de test indépendant par version. Le réentraînement est un projet, pas un procédé ; il se passe dans un environnement de développement et revient en production par la gestion des changements. Cette construction satisfait le projet européen et c'est aussi ce que le plan de cycle de vie de la FDA veut voir documenté, donc c'est la seule conception qui marche des deux côtés de l'océan. Le coût, c'est que vous renoncez à suivre le procédé en temps réel, et une analyse de risque honnête le dit.
31:24 Sam Troisièmement, pour l'agent : décidez maintenant quels usages documentaires vous défendrez comme non critiques, et concevez-les pour que l'affirmation reste vraie. L'ingénieur rétablit chaque fait à partir de l'enregistrement source. L'agent propose et n'exécute jamais. La signature est humaine, et la décision aussi. Gardez une piste d'audit de ce que l'agent a lu et de ce qu'il a écrit, parce qu'un brouillon qu'on ne peut pas tracer est une question d'intégrité des données, et l'intégrité des données est l'un des trois mots du test de criticité. Et figez la version du modèle, parce qu'une mise à jour du fournisseur est un changement de modèle selon la clause dix point un, que le fournisseur vous l'ait dit ou non.
32:05 Sarah Là où les équipes le ressentent. MSAT et la science des procédés sont propriétaires de l'utilisation prévue et de la décision de criticité pour chaque application ; le projet rend un expert du procédé responsable de cette description. La data science est propriétaire des trois réponses sur le type de modèle et de la discipline de la version figée. La Qualité est propriétaire de la gestion des changements et de la gestion de configuration qui rendent le gel réel, et de la surveillance de tout humain dans la boucle comme procédé manuel. Les affaires réglementaires CMC doivent porter la divergence : le même modèle peut exiger un résumé de plan de cycle de vie dans une demande américaine et une déclaration de modèle statique pour une inspection européenne.
32:40 Sam Et quatrièmement, l'habitude du registre de consultation de l'épisode un s'applique ici avec force. La barrière est un projet. L'atelier a eu lieu. Si votre site a un modèle adaptatif qui fait vraiment du bien dans une étape critique, avec des preuves, l'endroit pour le dire, c'est la consultation sur le texte final et les groupes industriels qui l'alimentent, pas l'inspection.
33:02 Sam Trois choses. Sarah.
33:04 Sarah Le projet d'annexe vingt-deux est le premier texte BPF à vocation contraignante sur l'IA, six pages, et son périmètre est délibérément étroit : l'apprentissage automatique statique et déterministe dans les applications critiques. Les modèles dynamiques, les modèles probabilistes et l'IA générative ne sont pas simplement non couverts ; le projet dit qu'ils ne devraient pas être utilisés dans les applications BPF critiques, et les modèles génératifs en usage non critique ont toujours un humain qualifié propriétaire de la sortie. Mille trois cents commentaires et un atelier ; le texte publié est inchangé, et l'EMA dit qu'une révision est en cours.
33:36 Sam Deuxièmement, la mienne : la FDA et l'UE divergent exactement sur le modèle qui est nouveau. La FDA n'approuve ni n'exclut aucune technique, vous dit d'anticiper les modèles auto-évolutifs dans un plan de cycle de vie, et vous laisse changer d'approche si la crédibilité fait défaut ; le côté dispositifs pré-autorise l'apprentissage continu. L'Europe filtre avant les preuves. Un site mondial résout ça de la même façon à chaque fois : figer, versionner, et garder la boucle d'apprentissage hors du périmètre, et admettre ce que ça coûte.
34:07 Sarah Troisièmement : sur l'IA générative, la FDA est silencieuse et la seule prise est l'exclusion pour efficacité opérationnelle, qui tient jusqu'à ce que la sortie touche la qualité. L'EMA dit que le texte génératif est plausible mais erroné et veut une supervision humaine étroite. Le NIST nomme la confabulation, le biais d'automatisation, l'intégrité de l'information et la chaîne de valeur. Savoir si un usage documentaire est critique, c'est la question que chacun d'eux renvoie au site.
34:32 Sam La prochaine fois : les preuves. Qu'est-ce que je dois montrer ? À quoi ressemble la crédibilité sur le papier, et comment la validation est devenue de l'assurance. L'étape quatre de la FDA et les clauses trois à dix de l'annexe vingt-deux, lues clause par clause, et le dossier de preuves de la caméra de volume de remplissage construit sous vos yeux. Are we there yet? On sait ce qu'on a le droit de construire. Maintenant, on va découvrir ce qu'on doit prouver.