L'IA dans la production biopharmaceutique : on y est ?

Transcript — Classement : quelle importance a ce modèle ?

This is the script the AI voices read, so it matches the audio word for word; times are from the render. Documenté, écrit et lu par des systèmes d'IA sous la direction de Jack Prior ; édition française traduite par l'IA à partir des épisodes anglais vérifiés. Sam et Sarah sont des personnages d'IA ; rien dans l'épisode n'est Jack qui parle, et rien n'engage ses opinions ni celles de son employeur. L'IA générative peut se tromper avec assurance — vérifiez les sources. Corrections : jack@jackprior.ai.

00:00 Narrator Voici On y est ? — un podcast sur l'évolution de l'IA dans la production biopharmaceutique, dirigé par Jack Prior. Un mot sur la façon dont il est fait. Cet épisode a été documenté, écrit et lu par des systèmes d'IA. Jack pose les questions et les cadres ; l'IA lit les documents et écrit la conversation que vous allez entendre, entre deux personnages d'IA : Sam, qui joue un praticien des sciences de la production, et Sarah, qui a lu les documents. Cette édition française est une traduction, par l'IA, des épisodes anglais. Rien de ce que vous entendez n'est Jack qui parle, et rien n'engage ses opinions ni celles de son employeur. Comme toute IA générative, elle peut se tromper — avec assurance, ou en manquant une nuance — ce qui est précisément le risque que cette industrie cherche à maîtriser, et précisément le sujet de cette saison. Vérifiez les sources avant de vous y fier. Les corrections sont les bienvenues à jackprior point A I. Place à l'épisode.

00:56 Sam Un site mondial fait l'évaluation des risques pour un modèle de suivi de lot. Un modèle, un tableur, une colonne intitulée risque. Le responsable validation, formé à l'ICH, écrit impact moyen. Le responsable qualité européen écrit application critique. L'équipe réglementaire, qui a lu le projet de la FDA, écrit risque du modèle moyen. Et l'équipe du numérique, avec un gabarit bâti sur la nouvelle guidance de l'industrie, écrit influence du modèle faible. Quatre étiquettes, toutes défendables, et le comité de gouvernance du site pose la seule question raisonnable : cette chose est-elle risquée ou pas ? Pendant ce temps, le juridique a envoyé une note disant que l'agent qui rédige les déviations n'est pas à haut risque au sens de l'AI Act, et la moitié de la salle pense que ça règle la question.

01:44 Sarah Sept documents classent les modèles, Sam, et ils ne classent pas la même chose : le modèle, la décision, l'application, le produit ou la fonctionnalité. Aucune des quatre étiquettes n'est fausse. Elles ne répondent simplement pas à la même question.

01:56 Sam Alors ce soir, on construit la table de correspondance.

Orientation : sept classements

02:00 Sam Sarah, la question.

02:01 Sarah Sept documents classent les modèles de sept façons. Comment se correspondent-ils ? L'épisode précédent nous a donné le risque du modèle comme influence fois conséquence, d'après le projet de la FDA et l'ICH M15. Ce soir, on met ça à côté du classement plus ancien de l'ICH, du test critique-ou-pas de l'Europe, des niveaux de l'AI Act et du cadre industriel de BioPhorum, et on termine avec quatre paliers que cette saison utilisera désormais.

02:26 Sam Et pourquoi ça compte maintenant, brièvement, parce que j'ai dit ce que j'avais à dire dans l'épisode un. Pour les modèles classiques, le classement, c'est de l'intendance. Pour l'agent, c'est tout le combat. Le projet européen n'a pas de niveau intermédiaire : une application est critique ou elle ne l'est pas, et si elle est critique, un modèle de langage ne devrait pas s'y trouver, si petite que soit son influence. Donc l'endroit où vous placez l'agent dans le classement décide s'il existe, tout court, sur un site inspecté par l'UE. Ce n'est pas de l'intendance.

02:58 Sam Les documents.

03:00 Sarah Le point d'ancrage, ce sont les Points to Consider, les points à considérer, du Quality Implementation Working Group de l'ICH pour Q8, Q9 et Q10, de deux mille onze. Couche trois, l'harmonisation. C'est un guide de mise en œuvre approuvé par l'ICH, en version finale, et il a une section sur les modèles avec un classement faible, moyen, élevé qui précède l'IA en usine d'une décennie. Soyons clairs sur une chose : il porte sur les modèles en général, pas sur l'IA. C'est justement l'intérêt de le lire. À côté, on lit le fichier de correspondance sur lequel cette saison est construite, qui met les sept classements côte à côte.

03:30 Sam Et les voix.

03:31 Sarah Quatre. L'ICH Q9 révision un sur la gestion des risques qualité, finalisée en janvier deux mille vingt-trois, pour le principe que la formalité est proportionnée au risque. Le projet d'annexe vingt-deux, de juillet deux mille vingt-cinq, pour le test de l'application critique et le verrou sur le type de modèle. L'AI Act, le règlement (UE) deux mille vingt-quatre barre seize cent quatre-vingt-neuf, en vigueur depuis août deux mille vingt-quatre, pour l'article six et l'annexe trois. Et la guidance de BioPhorum sur les risques de l'IA, datée de mai et publiée en juin deux mille vingt-six, pour le cadre industriel qui redéfinit l'un des termes de la FDA.

ICH 2011 : impact faible, moyen, élevé

04:03 Sam Commençons par le plus ancien. Que disait l'ICH des modèles en deux mille onze ?

04:08 Sarah La section cinq des Points to Consider s'ouvre en définissant un modèle comme une représentation simplifiée d'un système en termes mathématiques, et dit que les modèles peuvent être utilisés à chaque étape du développement et de la production. Puis la section cinq point un les classe. La phrase clé : pour les soumissions réglementaires, un facteur important est la contribution du modèle à l'assurance de la qualité du produit, et le niveau de supervision devrait être proportionné au niveau de risque associé à l'utilisation du modèle en question.

04:33 Sam Et les niveaux.

04:34 Sarah Trois. Les modèles à faible impact soutiennent le développement ; l'optimisation d'une formulation est l'exemple. Les modèles à impact moyen, je cite, peuvent être utiles pour assurer la qualité du produit mais ne sont pas les indicateurs uniques de la qualité du produit ; la plupart des modèles d'espace de conception et beaucoup de contrôles en cours de fabrication. Les modèles à impact élevé, où la prédiction est un indicateur significatif de la qualité du produit ; un modèle chimiométrique pour le dosage du produit, un modèle substitutif pour la dissolution.

05:01 Sam Indicateur unique. C'est notre phrase de périmètre de l'épisode précédent, quatorze ans plus tôt.

05:07 Sarah Et les exemples du document lui-même font le même mouvement que la FDA avec la caméra de volume de remplissage. Il dit qu'un modèle de maîtrise statistique multivariée des procédés utilisé pour la vérification continue du procédé, avec une méthode traditionnelle pour les essais de libération, serait probablement à impact moyen. Continue au sens de Q huit, valider le procédé en le surveillant, à ne pas confondre avec la vérification permanente du procédé, continued process verification chez la FDA, que tout procédé commercial doit de toute façon. Le même modèle utilisé pour soutenir un substitut aux essais de libération, dans une approche de libération en temps réel, serait probablement à impact élevé. Même modèle, rôle différent, niveau différent. Un modèle d'étalonnage derrière une méthode proche infrarouge est à impact élevé si la méthode sert à la libération. Un modèle d'anticipation qui ajuste les paramètres de compression à partir des attributs des matières entrantes est donné comme moyen.

05:57 Sam Donc l'essai de libération traditionnel qui reste à côté du modèle, c'est ce qui le maintient à moyen. C'est le contrôle orthogonal, dans les mots de l'ICH, en deux mille onze.

06:09 Sarah Dans ses mots : avec une méthode traditionnelle pour les essais de libération. Et le niveau pilote le travail. La section cinq point trois liste des éléments de validation et de vérification qu'elle dit appropriés pour les modèles à impact élevé : des critères d'acceptation liés à la finalité du modèle, la comparaison de l'exactitude des prédictions avec la méthode de référence, la validation sur un jeu de données externe issu de lots non utilisés pour construire le modèle, des essais en parallèle avec la méthode de référence à la mise en œuvre puis répétés tout au long du cycle de vie, et la vérification à l'échelle commerciale. Pour les modèles à impact moyen et faible, elle dit que l'applicabilité de ces éléments peut être considérée au cas par cas.

06:45 Sam Et la documentation ?

06:47 Sarah Elle est proportionnée de la même façon. La section cinq point deux liste neuf étapes de développement, et la première mérite qu'on la remarque : définir la finalité du modèle, avant de choisir l'approche de modélisation ou les variables. C'est la question d'intérêt, en deux mille onze. L'étape huit consiste à évaluer l'effet de l'incertitude des prédictions sur la qualité du produit et à réduire le risque résiduel par la stratégie de contrôle, ce qui s'applique, dit-elle, aux modèles à impact élevé et moyen. Et l'étape neuf, c'est documenter le modèle et planifier sa vérification et sa mise à jour tout au long du cycle de vie, le niveau de documentation dépendant de l'impact du modèle.

Q9 : la formalité proportionnée au risque

07:20 Sam Ce qui est le principe de Q9 appliqué aux modèles.

07:24 Sarah Q9 révision un l'énonce deux fois. Comme principe premier : le niveau d'effort, de formalité et de documentation du processus de gestion des risques qualité devrait être proportionné au niveau de risque. Et dans sa section sur la formalité : la formalité n'est pas binaire mais un continuum, et la dose à appliquer dépend de l'incertitude, de l'importance et de la complexité. Une ligne à retenir : les contraintes de ressources ne devraient pas servir à justifier des niveaux de formalité moindres.

07:46 Sam Mon avis : c'est la colonne vertébrale. Si un site veut un seul classement sur lequel accrocher un argument de validation, ce devrait être celui-là. Il est approuvé par l'ICH, il est adopté depuis quatorze ans, et aucun inspecteur ne le contestera. Tout le reste de ce qu'on lit ce soir soit en descend, soit doit être réconcilié avec lui.

Impact n'est pas impact

08:06 Sam Maintenant le piège. Impact.

08:08 Sarah Deux documents de l'ICH utilisent le mot pour des choses différentes. Dans les Points to Consider, un modèle à impact élevé est un modèle dont la prédiction est un indicateur significatif de la qualité du produit. Dans l'ICH M15, de janvier deux mille vingt-six, l'impact du modèle désigne la mesure dans laquelle la stratégie de modélisation proposée s'écarte des normes réglementaires, ou des attentes lorsqu'il n'existe pas de norme. Il s'agit de la nouveauté de l'approche, pas du poids dans la décision. L'équivalent dans M15 de l'idée de deux mille onze, c'est le risque du modèle, influence fois conséquence, qu'on a lu l'épisode précédent. Donc un pharmacologue clinique qui dit impact élevé du modèle parle d'une stratégie de modélisation inhabituelle. Un scientifique de production qui dit modèle à impact élevé parle d'un substitut de libération.

08:49 Sam Règle pratique : quiconque fait le pont entre CMC et pharmacologie clinique précise de quel sens il parle, à chaque fois. Et dans un document de production, si vous voulez le concept de M15, dites risque du modèle.

09:02 Sam Où on en est. L'ICH a classé les modèles en deux mille onze selon leur rôle dans l'assurance de la qualité : faible, moyen, élevé, indicateur unique ou pas, avec l'essai de libération à côté du modèle comme ce qui le maintient à moyen. La rigueur est proportionnée au niveau, selon Q9. Et impact dans M15 est un autre mot. Maintenant l'Europe, qui ne classe pas du tout le modèle.

L'annexe 22 classe l'application

09:28 Sarah Le projet d'annexe vingt-deux classe l'application. Son périmètre, section un : il s'applique aux systèmes informatisés en production où des modèles d'IA sont utilisés dans, je cite, des applications critiques ayant un impact direct sur la sécurité des patients, la qualité du produit ou l'intégrité des données. Critique ou pas ; c'est toute l'échelle.

09:46 Sam Et ensuite le verrou.

09:48 Sarah Un verrou sur le type de modèle, par-dessus. Modèles statiques uniquement, c'est-à-dire des modèles qui ne s'adaptent pas pendant l'utilisation. Déterministes uniquement, c'est-à-dire que des entrées identiques donnent des sorties identiques. Les modèles dynamiques et les modèles probabilistes ne sont pas couverts et, dit-il, ne devraient pas être utilisés dans des applications BPF critiques. Et puis, je cite, le document ne s'applique pas à l'IA générative ni aux grands modèles de langage, et de tels modèles ne devraient pas être utilisés dans des applications BPF critiques.

10:16 Sam Donc il n'y a pas d'axe d'influence. Un modèle qui donne un indice à un opérateur dans une étape critique est classé comme un modèle qui libère le lot.

10:26 Sarah Exact, et c'est la lacune que la table de correspondance appelle G un : pas de niveau intermédiaire. Tous les autres cadres ont un gradient. L'annexe vingt-deux, c'est binaire plus une interdiction. Il n'y a pas de niveau pour application critique, influence du modèle faible, contrôles intermédiaires solides, ce qui décrit la plupart des déploiements consultatifs réels ; ce qui s'en rapproche le plus dans le projet, c'est sa clause sur l'humain dans la boucle. Un modèle de langage consultatif à faible influence dans une étape critique reste un ne devrait pas être utilisé dans le projet actuel.

10:54 Sam Est-ce qu'il dit quoi que ce soit de l'humain ?

10:57 Sarah Une clause, section trois point trois, sur l'humain dans la boucle : lorsqu'un modèle fournit une entrée à une décision prise par un opérateur humain, et que l'effort de test du modèle a été réduit pour cette raison, l'utilisation prévue doit décrire la responsabilité de l'opérateur, et la formation et la performance de l'opérateur devraient être surveillées, je cite, comme tout autre processus manuel.

11:17 Sam Cette clause est plus maligne qu'elle n'en a l'air. Si vous vous appuyez sur l'humain pour alléger la charge de test, l'humain devient une partie du système validé. Même idée que l'équipe humain-IA de la FDA.

11:29 Sarah Et le classement du projet part d'une utilisation prévue décrite, pas du modèle. La section trois point un dit que l'utilisation prévue et les tâches spécifiques que le modèle assiste ou automatise devraient être décrites en détail, y compris une caractérisation complète des données d'entrée et de leurs variations courantes et rares, ce qu'il appelle l'espace d'échantillonnage des entrées, avec un expert métier du procédé responsable de cette description et des critères d'acceptation. Donc la personne qui classe l'application au titre de l'annexe vingt-deux, c'est l'expert du procédé, pas le data scientist.

11:59 Sarah Et encore une ligne de l'annexe vingt-deux qui classe par comparaison plutôt que par niveau : section quatre point trois, pas de diminution. Les critères d'acceptation d'un modèle devraient être au moins aussi élevés que la performance du processus qu'il remplace, ce qui veut dire qu'il faut d'abord connaître la performance du processus manuel.

12:15 Sam Ce que la plupart des sites ne connaissent pas. Ma lecture pour un site mondial : l'annexe vingt-deux n'est pas un classement qu'on met en correspondance avec les autres ; c'est un verrou qu'on franchit après eux. Classez le modèle sur l'influence et la conséquence, puis posez deux questions européennes : l'application est-elle critique, et le modèle est-il statique et déterministe. Si oui et non, stop.

L'AI Act en un point à retenir

12:38 Sam L'AI Act. La note du juridique. Un point à retenir, tu as promis.

12:42 Sarah Un seul. L'article six définit le haut risque de deux façons. D'abord, un système d'IA qui est un composant de sécurité d'un produit, ou qui est lui-même un produit, couvert par la législation d'harmonisation de l'Union de l'annexe un et soumis à une évaluation de la conformité par un tiers. Les dispositifs médicaux sont sur cette liste, donc l'IA à l'intérieur d'un dispositif réglementé peut être à haut risque. Ensuite, les cas d'usage de l'annexe trois, qui sont huit domaines : la biométrie, les infrastructures critiques, l'éducation, l'emploi, les services essentiels, les activités répressives, la migration et le contrôle des frontières, et la justice. La production pharmaceutique n'est sur aucune des deux listes. Donc presque aucune IA de production n'est à haut risque au sens du règlement, à moins d'être un composant de sécurité d'un dispositif réglementé.

13:24 Sam Et donc.

13:25 Sarah Donc la note est correcte et sans rapport avec la question BPF. Les niveaux du règlement classent un système d'IA en tant que produit sur le marché de l'UE. Ils ne disent rien sur le fait qu'une application soit critique au titre de l'annexe vingt-deux, ni sur l'influence d'un modèle sur une décision qualité. Pas à haut risque au sens de l'AI Act et ne devrait pas être utilisé au titre de l'annexe vingt-deux peuvent être vrais tous les deux du même agent le même jour.

13:48 Sam C'est tout le segment AI Act. On passe à la suite, comme promis.

BioPhorum redéfinit l'influence du modèle

13:52 Sam BioPhorum. C'est celui qui réutilise les mots de la FDA.

13:56 Sarah La guidance de BioPhorum de juin deux mille vingt-six, écrite par huit entreprises membres avec six autres contributrices, propose un cadre harmonisé unique de risque de l'IA en GxP. La section huit point trois évalue le risque en trois éléments : le périmètre, c'est-à-dire au niveau du système ou de la fonctionnalité individuelle ; la source et les caractéristiques, c'est-à-dire d'où vient le risque et comment il se manifeste ; et l'analyse, c'est-à-dire la conséquence et la vraisemblance. La conséquence de la décision est notée faible pour l'efficacité interne, modérée pour un impact sur l'intégrité des données, le procédé ou la conformité, et élevée pour un impact sur la sécurité des patients, la qualité du produit ou le réglementaire. Jusque-là, c'est le terme de conséquence de la FDA avec une échelle attachée.

14:37 Sam Et l'influence ?

14:39 Sarah C'est là qu'il s'en écarte. La section huit point cinq dit, je cite, l'influence du modèle est directement déterminée par la maturité du modèle et sert d'indicateur indirect de la vraisemblance. La maturité, c'est deux choses : l'autonomie, à quel point le système agit de façon indépendante, de l'humain dans la boucle à l'humain sur la boucle jusqu'à l'absence de supervision ; et l'adaptativité, de fondé sur des règles à statique puis dynamique. Une matrice trois par trois donne la note d'influence. Modèle statique avec un humain dans la boucle : faible. Statique sans supervision humaine : élevée. Dynamique sans supervision : élevée. Puis influence fois conséquence donne un risque composite, à nouveau en trois par trois.

15:15 Sam Donc l'influence de la FDA, c'est à quel point la décision s'appuie sur le modèle. L'influence de BioPhorum, c'est la probabilité que le modèle se trompe. Même mot.

15:24 Sarah Même mot, quantité différente. La FDA et M15 définissent l'influence comme le poids des preuves du modèle par rapport aux autres preuves. BioPhorum la définit comme la propension à s'écarter du comportement prévu, et l'utilise là où une AMDEC mettrait la vraisemblance. Ils se recouvrent dans les cas faciles : un modèle avec un vrai humain dans la boucle est noté faible sous les deux. Ils divergent dans d'autres. Un système fondé sur des règles sans supervision humaine est à influence modérée dans la matrice de BioPhorum, parce qu'il ne peut pas dériver. Pour la FDA, c'est le seul déterminant de la décision, donc l'influence est élevée.

15:57 Sam Ce qui veut dire qu'un nombre appelé influence du modèle ne peut pas être transporté d'une évaluation BioPhorum vers un plan de crédibilité FDA. On le recalcule.

16:06 Sarah Oui. Deux autres points de BioPhorum se rattachent à ce soir. Il dit que des contrôles indépendants limitant la décision, en nommant les essais de libération indépendants, la vérification orthogonale, l'échantillonnage redondant en cours de fabrication et les verrouillages de procédé, peuvent contraindre l'autonomie et donc abaisser la note d'influence, à condition qu'ils fonctionnent indépendamment de la sortie de l'IA. C'est la logique du volume de remplissage qui atteint le cadre industriel. Et la section huit point quatre prend position contre l'annexe vingt-deux : le type de modèle, probabiliste ou déterministe, n'est délibérément pas une dimension de risque indépendante, parce que ces risques sont, je cite, déjà capturés par les dimensions d'autonomie et d'adaptativité qui définissent l'influence du modèle. Il qualifie cette position de cohérente avec le GAMP et la guidance de la FDA, et dit que le type de modèle devrait plutôt relever les preuves de validation exigées.

16:54 Sam Donc huit entreprises ont mis par écrit que le verrou européen n'a pas la bonne forme. C'est l'argument du prochain épisode. Ce soir, notons que la propre matrice de BioPhorum place toujours un modèle dynamique sans supervision à élevé, donc le désaccord porte sur interdiction contre contrôle proportionné, pas sur le niveau.

17:12 Sam Reformulons. Cinq classements sur la table. L'ICH deux mille onze classe le modèle par son rôle dans la qualité. La FDA et M15 classent la décision par influence fois conséquence. L'annexe vingt-deux classe l'application, critique ou pas, puis verrouille par type de modèle. L'AI Act classe le produit et n'a rien à dire sur les BPF. BioPhorum classe chaque fonctionnalité par conséquence fois maturité et appelle la maturité influence. Maintenant, la table de correspondance qui permet à un site d'utiliser un seul langage.

Quatre paliers pour la saison

17:46 Sarah La table de correspondance définit quatre paliers sur les deux facteurs vers lesquels presque tous les cadres convergent : l'influence du modèle sur la décision, et la conséquence si la décision est fausse, avec la criticité de l'annexe vingt-deux comme ancrage BPF. Palier zéro, exploratoire : la sortie n'éclaire que des décisions de développement ou d'affaires ; pas de décision GxP, pas de preuve réglementaire. Palier un, consultatif en GxP : la sortie est une entrée parmi plusieurs ; des humains ou d'autres contrôles décident ; une sortie erronée est rattrapée en aval.

18:15 Sam Et les deux du haut.

18:17 Sarah Palier deux, contrôle contributif : la sortie façonne matériellement une décision qualité mais n'en est pas le seul déterminant ; modèles d'espace de conception, la plupart des contrôles en cours de fabrication, ajustements par anticipation, alertes d'anomalie sur lesquelles un opérateur agit. Palier trois, déterminant : la sortie est l'indicateur significatif ou unique de la qualité, ou la seule base d'une décision BPF ; un substitut de libération, un dosage chimiométrique, une régulation autonome, la disposition du lot. Les paliers deux et trois sont tous deux critiques au titre de l'annexe vingt-deux ; la ligne entre eux, c'est la ligne de l'indicateur unique de l'ICH.

18:51 Sam Et les autres cadres, ils y atterrissent comment ?

18:54 Sarah ICH deux mille onze : impact faible aux paliers zéro et un, moyen au palier deux, élevé au palier trois. Risque du modèle FDA et M15 : faible, faible à moyen, moyen à élevé, élevé. Les axes de l'EMA : le risque patient monte avec le palier quand le modèle touche le procédé ; l'impact réglementaire dépend de savoir si la sortie atteint une soumission.

19:15 Sam Et les deux qui ne classent pas le modèle.

19:18 Sarah L'annexe vingt-deux : non critique aux paliers zéro et un, critique à deux et trois, et à trois, si le modèle est dynamique, probabiliste ou un modèle de langage, ne devrait pas être utilisé. L'AI Act : risque minimal à tous les paliers, sauf si le modèle est un composant de sécurité d'un dispositif. BioPhorum se lit à travers la conséquence : faible au palier zéro, modéré avec un humain dans la boucle au palier un, élevé avec un humain dans ou sur la boucle au palier deux, élevé sans supervision au palier trois. Notez que BioPhorum note au niveau de la fonctionnalité après un filtrage AI Act, donc un même système peut contenir des fonctionnalités à plusieurs paliers.

19:51 Sam Une chose que les paliers ne portent pas. Le second axe de l'EMA.

19:56 Sarah Exact. L'impact réglementaire, c'est-à-dire si la sortie devient une preuve dans une soumission, est absent du classement de deux mille onze et de l'annexe vingt-deux, et la table de correspondance le liste comme une lacune. Un modèle d'espace de conception ou un modèle de stabilité peut se situer au palier un pour le risque patient et rester à impact réglementaire élevé parce que la décision d'un évaluateur repose dessus. Les paliers sont une échelle BPF. Quand la sortie d'un modèle voyage jusque dans un dossier, la seconde question de l'EMA doit encore être posée séparément.

Quatre systèmes, placés puis déplacés

20:23 Sam Bien. Maintenant nos quatre systèmes, placés puis déplacés. Le capteur logiciel d'abord, comme alerte opérateur.

20:31 Sarah Comme alerte, le capteur logiciel prédit une densité cellulaire et montre une tendance à l'opérateur ; l'opérateur décide par rapport aux limites, et l'échantillon hors ligne confirme. Palier un. L'ICH deux mille onze dirait impact faible à moyen ; la FDA, influence faible, donc risque du modèle faible à moyen ; l'annexe vingt-deux, critique si l'étape affecte la qualité du produit, et le projet ne donne aucun crédit pour la faible influence ; BioPhorum, modèle statique avec un humain dans la boucle, influence faible, conséquence élevée, composite moyen.

20:59 Sam Maintenant, fais-en le substitut de libération. La prédiction du titre par le capteur remplace la mesure hors ligne.

21:06 Sarah Palier trois. ICH deux mille onze : impact élevé, exactement son exemple de substitut, avec des essais en parallèle contre la méthode de référence tout au long du cycle de vie. FDA : seul déterminant, influence élevée, conséquence élevée, risque du modèle élevé. Annexe vingt-deux : critique, et le modèle doit être statique et déterministe pour être utilisé, tout court. BioPhorum : statique sans supervision humaine, influence élevée, conséquence élevée, composite élevé. Tous les cadres sont d'accord au sommet.

21:35 Sam Modèle de suivi de lot. C'est l'exemple même de l'ICH, donc ça devrait être facile.

21:41 Sarah Ça l'est. Utilisé pour la vérification continue du procédé à côté des essais de libération traditionnels, palier deux : l'ICH deux mille onze dit impact moyen en toutes lettres ; la FDA, influence moyenne, conséquence moyenne à élevée, risque moyen ; l'annexe vingt-deux, critique, parce qu'il touche la qualité du produit et l'intégrité des données ; BioPhorum, statique avec un humain sur la boucle, influence modérée, composite élevé. Déplacez-le vers le soutien d'un substitut de libération en temps réel et c'est le palier trois : l'ICH dit impact élevé, là encore en toutes lettres, et tout le reste suit le chemin du capteur logiciel.

22:12 Sam Caméra de volume de remplissage.

22:14 Sarah Palier deux avec l'essai sur échantillon, palier trois sans, exactement comme la FDA l'a classée : moyen, puis élevé. L'ICH deux mille onze dirait moyen, puis élevé. Annexe vingt-deux : critique dans les deux cas, et un classifieur de vision est statique et déterministe, donc dans le périmètre et permis. BioPhorum : l'essai de libération est l'un de ses contrôles nommés limitant la décision, donc il abaisse la note d'autonomie ; retirez-le et la caméra est statique sans supervision, élevé.

Le palier de l'agent

22:40 Sam Et l'agent. Place-le honnêtement.

22:42 Sarah Rédiger une investigation de déviation pour un ingénieur qui la relit et la refait vraiment : palier un, consultatif en GxP. L'ICH deux mille onze n'a pas de catégorie pour lui ; ce n'est pas un modèle de procédé. La FDA, d'après l'épisode précédent : influence faible si la relecture est réelle, conséquence élevée, risque du modèle moyen. L'AI Act : pas à haut risque. BioPhorum : un modèle de fondation figé est statique ; avec un humain dans la boucle, influence faible ; conséquence élevée, parce que le résultat est une décision qualité ; composite moyen. Quatre cadres, à peu près une seule réponse.

23:14 Sam Et le cinquième.

23:15 Sarah L'annexe vingt-deux. Si la gestion des déviations est une application BPF critique, et elle a un impact direct sur la qualité du produit et l'intégrité des données, alors un modèle de langage ne devrait pas y être utilisé, et le palier n'a pas d'importance. Si un site soutient que l'étape de rédaction est non critique parce que c'est l'humain qui décide, le projet le permet avec un humain dans la boucle, et la table de correspondance nomme cet argument comme la question ouverte.

23:39 Sam Maintenant, déplace-le.

23:41 Sarah Laissez-le proposer des actions correctives qui sont exécutées sans être refaites de façon indépendante, ou laissez-le clôturer des enregistrements. Palier deux en route vers trois. La matrice de BioPhorum le fait passer à humain sur la boucle, influence modérée, composite élevé ; et sa section gouvernance dit que les systèmes d'IA ne devraient pas exécuter d'actions critiques ou réglementées sans un humain qualifié, et, je cite, ne doivent pas exécuter directement des signatures électroniques. L'influence FDA passe à élevée. L'annexe vingt-deux l'avait déjà exclu.

24:09 Sam Donc pour trois de nos quatre, le palier est un niveau qu'on défend. Pour l'agent, le palier est un argument sur la criticité qu'il faut d'abord gagner, et la façon de le gagner, c'est la façon dont vous concevez la relecture humaine. Mon avis : construisez l'agent de sorte qu'il ne puisse pas changer de palier par accident. Pas d'exécution, pas de signature, une relecture qui laisse une trace. Alors vous débattez du palier un, ce qui est un débat qu'on peut avoir.

Et alors, pour la bioproduction

24:37 Sam Et alors, pour la bioproduction. Des opinions, étiquetées comme telles. Premièrement : fixez le palier avant d'ouvrir la moindre guidance. Le palier vous dit quels documents s'appliquent et combien de preuves rassembler. Une alerte de palier un a besoin d'une liste de lecture différente d'un substitut de palier trois, et la plupart des efforts de validation gaspillés que j'ai vus venaient de ce qu'on traitait tout comme du palier trois parce que personne n'avait dit lequel c'était.

25:05 Sarah Les documents soutiennent cet ordre. L'ICH deux mille onze proportionne les éléments de validation et la documentation au niveau d'impact. Q9 proportionne la formalité à l'incertitude, à l'importance et à la complexité. La FDA proportionne le plan de crédibilité au risque du modèle. BioPhorum proportionne la profondeur des contrôles au risque composite, et dit que l'axe qui l'a déterminé devrait décider des contrôles à ajouter : surveillance et contraintes d'autonomie si c'est l'influence, gouvernance et preuves de validation si c'est la conséquence.

25:34 Sam Deuxièmement : utilisez le classement de deux mille onze comme colonne vertébrale de chaque argument de validation. Il est approuvé par l'ICH, il précède le battage médiatique, et ses exemples sont nos exemples : le modèle de lot à moyen avec les essais de libération, élevé comme substitut. Écrivez les termes FDA et BioPhorum comme des colonnes à côté, pas à sa place. Troisièmement : pour un site européen, le palier est nécessaire et pas suffisant. Après le palier, posez les deux questions de l'annexe vingt-deux, critique et type de modèle, et attendez-vous à ce que la réponse soit un verrou, pas un gradient.

26:11 Sam Quatrièmement : quand un nombre appelé influence du modèle passe d'un document à l'autre, recalculez-le. Une note d'influence BioPhorum est une vraisemblance ; une note d'influence FDA est un poids de preuve. Mettez les deux dans l'évaluation et étiquetez-les. Cinquièmement, pour l'agent : l'exercice de classement, c'est l'argument de criticité. Décidez quels usages vous défendrez comme non critiques, concevez la relecture pour que l'affirmation reste vraie, et écrivez ce qui ferait monter l'agent d'un palier pour que personne ne le fasse par accident. Et sixièmement, la ligne de Q9, que je formulerais ainsi : les contraintes de ressources ne sont pas une raison pour moins de formalité. Si le palier dit élevé, le palier dit élevé.

26:59 Sarah Qui les documents mettent dans la salle pour le classement : le principe de l'annexe vingt-deux sur le personnel nomme les experts métier du procédé, la qualité, les data scientists, l'informatique et les consultants, et rend un expert du procédé responsable de l'utilisation prévue et des critères d'acceptation. Les Points to Consider mettent le niveau dans la soumission réglementaire, donc le CMC réglementaire le signe aussi.

Récapitulatif et prochain épisode

27:20 Sam Trois choses. Sarah.

27:22 Sarah L'ICH a classé les modèles en deux mille onze : faible, moyen, élevé selon leur rôle dans l'assurance de la qualité, avec l'indicateur unique comme ligne de partage et l'essai de libération traditionnel à côté du modèle comme ce qui le maintient sous cette ligne. La validation et la documentation sont proportionnées au niveau. Ça porte sur les modèles en général, et c'est pour ça que ça tient toujours.

27:41 Sam Deuxièmement, la mienne : les sept classements ne classent pas la même chose. Le modèle, la décision, l'application, le produit, la fonctionnalité. Impact dans M15 n'est pas impact dans le guide de mise en œuvre, et influence chez BioPhorum n'est pas influence chez la FDA. Triez selon ce qui est classé avant de comparer les nombres.

28:03 Sarah Troisièmement : quatre paliers pour le reste de la saison. Exploratoire, consultatif, contrôle contributif, déterminant, définis par l'influence et la conséquence, avec le critique-ou-pas de l'annexe vingt-deux comme verrou BPF par-dessus. Les trois systèmes classiques montent les paliers à mesure qu'on retire leurs contrôles orthogonaux. Le palier de l'agent est un argument sur la criticité qu'il faut d'abord gagner.

28:24 Sam La prochaine fois : le type de modèle. Peut-il apprendre après le déploiement, et peut-il être un modèle de langage ? Pourquoi le modèle que vous choisissez est désormais une décision de conformité, et où la FDA et l'UE sont en désaccord. L'annexe vingt-deux en entier, six pages. Are we there yet ? On sait combien ça compte. Maintenant on va voir ce qu'on a le droit de construire.