Anexo 22: qué exige a la inteligencia artificial en GMP
El borrador del nuevo Anexo 22 de las normas de correcta fabricación europeas fija cómo se valida un modelo de IA que interviene en un proceso crítico. Esta guía lo resume apartado por apartado, a partir del texto oficial, y muestra dónde queda cada requisito en la documentación de validación.
Sigue siendo un borrador
Comprobado en la fuente oficial.
A 8 de octubre de 2026, el Anexo 22 no figura entre los anexos vigentes de EudraLex volumen 4, que recoge los anexos 1 a 21. El texto de referencia es el borrador publicado por la Comisión Europea para consulta, junto con la revisión del Anexo 11 y del capítulo 4.
Un borrador no obliga, pero indica qué van a preguntar los inspectores. Diseñar hoy conforme a él evita rehacer la validación cuando se publique el texto final. Actualizaremos esta guía cuando eso ocurra.
Hacia dónde va el texto
Lo que se ha discutido después de la consulta.
La consulta pública de 2025 mostró apoyo a permitir los LLM y la IA generativa en aplicaciones GMP. Por eso, el grupo de redacción del Anexo 22 ha discutido ampliar el alcance a modelos dinámicos o adaptativos, probabilísticos y de IA generativa, siempre que cumplan el anexo y se apoyen en una estrategia de control basada en el riesgo y completamente documentada.
Para concretar esa estrategia, la Agencia Europea del Medicamento reunió a expertos de la industria el 30 de junio de 2026 y publicó el informe del taller el 2 de octubre. Sus conclusiones apuntan a un anexo neutral respecto a la tecnología: lo que decide si un uso es aceptable es el uso previsto, el riesgo y la eficacia de los controles, no el tipo de modelo.
Es una dirección, no un texto nuevo: hasta que se publique el anexo definitivo, la referencia sigue siendo el borrador.
Qué modelos cubre y cuáles quedan fuera
- Aplicaciones críticas
- Sistemas informatizados de fabricación de medicamentos y principios activos donde un modelo de IA tiene impacto directo sobre la seguridad del paciente, la calidad del producto o la integridad de los datos, por ejemplo al predecir o clasificar datos.
- Aprendizaje automático
- Modelos que obtienen su función entrenándose con datos, no programados de forma explícita. Un sistema puede combinar varios, cada uno automatizando un paso.
- Solo modelos estáticos
- Los que no cambian su comportamiento con datos nuevos durante el uso. Los modelos dinámicos, que aprenden de forma continua, no deben usarse en aplicaciones críticas.
- Solo salida determinista
- Con la misma entrada, el mismo resultado. Los modelos de salida probabilística no deben usarse en aplicaciones críticas.
- IA generativa y LLM
- Excluidos de las aplicaciones críticas en el borrador publicado. En usos no críticos, una persona cualificada se responsabiliza de que cada resultado sea adecuado, y los principios del anexo pueden aplicarse donde proceda.
- Relación con el Anexo 11
- Es guía adicional al Anexo 11 para sistemas con modelos de IA integrados. No lo sustituye.
Qué pide cada apartado y dónde queda en la documentación
Resumen de los apartados 2 a 10 del borrador. La tercera columna indica el documento de validación donde se deja la evidencia.
| Apartado | Qué pide el borrador | Dónde queda la evidencia |
|---|---|---|
| 2. Principios | Cooperación entre expertos del proceso, garantía de calidad, científicos de datos e IT. La documentación la revisa el usuario regulado aunque el modelo venga de un proveedor, y el esfuerzo se gradúa según el riesgo. | Análisis de riesgos (AR) |
| 3. Uso previsto | Descripción detallada de la tarea y de los datos de entrada, con sus variaciones comunes y raras, sus límites y posibles sesgos, dividida en subgrupos cuando aplique. Si decide una persona, incluye su responsabilidad. La aprueba el experto del proceso antes de las pruebas. | Documentación del modelo: uso previsto |
| 4. Criterios de aceptación | Métricas adecuadas al uso y criterios de aceptación aprobados antes de probar. Nunca por debajo del rendimiento del proceso que el modelo sustituye. | Documentación del modelo: plan de pruebas |
| 5. Datos de prueba | Representativos y estratificados, de tamaño suficiente para una confianza estadística adecuada y con el etiquetado verificado. El preprocesado y las exclusiones se justifican. Generarlos con IA generativa no se recomienda. | Documentación del modelo: datos de prueba |
| 6. Independencia | Los datos de prueba no se usan en desarrollo, entrenamiento ni validación. Acceso controlado con traza de auditoría, registro de qué datos se usaron, cuándo y cuántas veces, y separación del personal o principio de cuatro ojos. | Documentación del modelo: registro de acceso a los datos de prueba |
| 7. Ejecución de las pruebas | Plan de pruebas aprobado antes de empezar. Cualquier desviación o criterio no alcanzado se documenta, se investiga y se justifica. La documentación se conserva como cualquier registro GMP. | Documentación del modelo: plan e informe de pruebas |
| 8. Explicabilidad | Durante las pruebas, el sistema registra qué características del dato llevaron a cada decisión, con técnicas como SHAP, LIME o mapas de calor, y se revisan al aprobar los resultados. | Documentación del modelo: informe de pruebas |
| 9. Confianza | Se registra la puntuación de confianza de cada predicción y se fija un umbral. Por debajo, el modelo puede marcar el resultado como «indeciso» en lugar de arriesgar una respuesta. | Especificación técnica (ET) |
| 10. Operación | Control de cambios y de configuración antes de entrar en producción, seguimiento periódico del rendimiento y de la deriva de los datos de entrada, y registros de la revisión humana. | Plan de seguimiento del modelo y plan de mantenimiento del estado validado |
Lista de comprobación para un modelo en un proceso GMP crítico
Antes de llevar un modelo a producción.
Lista de comprobación para un modelo en un proceso GMP crítico
Las marcas se guardan solo en este navegador.
Anexo 22: preguntas frecuentes
Sobre el borrador del Anexo 22.
No. A 8 de octubre de 2026 sigue siendo un borrador: no figura entre los anexos de EudraLex volumen 4, que llegan hasta el Anexo 21. Mientras tanto, sirve como referencia de lo que esperan los inspectores.
Según el borrador publicado, no en aplicaciones críticas: excluye la IA generativa y los LLM, igual que los modelos dinámicos y los de salida probabilística. En usos no críticos se pueden emplear si una persona cualificada se responsabiliza de que cada resultado sea adecuado para el uso previsto, con una persona en el bucle. Tras la consulta, el grupo de redacción estudia permitirlos en aplicaciones GMP con una estrategia de control basada en el riesgo; hasta que se publique el texto definitivo, el borrador sigue siendo la referencia.
No. El borrador se presenta como guía adicional al Anexo 11 para los sistemas informatizados que llevan modelos de IA integrados. El sistema sigue validándose conforme al Anexo 11, y el modelo añade los requisitos del Anexo 22.
Métricas adecuadas al uso previsto. Para un modelo que clasifica, cita como ejemplos la matriz de confusión, la sensibilidad, la especificidad, la exactitud, la precisión y el valor F1. Los criterios de aceptación se aprueban antes de probar y deben ser al menos tan altos como el rendimiento del proceso que el modelo sustituye.
Que los datos con los que se prueba el modelo no se han usado para desarrollarlo, entrenarlo ni validarlo. El borrador pide controlar el acceso a esos datos con traza de auditoría, registrar cuándo y cuántas veces se usan y evitar que quien los ha visto entrene el mismo modelo, o que lo haga solo en pareja con alguien que no los ha visto.
¿Tiene un modelo que debería cumplir el Anexo 22?
Lo revisamos contra el borrador y le decimos qué evidencia falta antes de la próxima inspección.