En la administración, la IA tiene sentido como herramienta de apoyo al empleado público, no como sustituta de su criterio. La IA busca y redacta; la persona contrasta, corrige y decide. Es la posición razonable, y es la que defienden casi todas las guías públicas que se han escrito, empezando por los criterios de uso de la IA generativa que aprobó la Generalitat de Catalunya en abril de 2025: la IA no puede tomar ni sustituir la decisión, sólo darle apoyo.
El problema de las posiciones razonables es que no dicen dónde empezar ni cómo saber si funcionan. Para eso hay datos. Desde finales de 2023, las administraciones francesa, británica y australiana han publicado resultados de sus pilotos con IA generativa, y leídos juntos cuentan una historia más interesante que «apoyo sí, sustitución no». Cuentan dónde se ahorra tiempo de verdad, y por qué la supervisión humana no se declara: se diseña.
Dos tipos de evidencia que no dicen lo mismo
Empecemos por los números, con una columna que casi nunca se enseña: cómo se midió cada cosa.
| Experiencia | Resultado | Cómo se midió |
|---|---|---|
| Francia · respuestas a las reseñas ciudadanas de Services Publics+ (desde finales de 2023) | Plazo medio de respuesta de 19 a 3 días. El 70% de las propuestas de la IA se reutilizan. Un 11% más de satisfacción con la respuesta | Datos de la propia plataforma y valoraciones de usuarios. Sin metodología ni grupo de control publicados |
| Reino Unido · Copilot en 12 organismos, 20.000 personas (finales de 2024) | 26 minutos diarios ahorrados de media | Encuesta con 7.115 respuestas. El propio informe advierte de que el ahorro es autodeclarado |
| Reino Unido · Copilot en el Department for Business and Trade, 1.000 licencias | Sin pruebas de que el ahorro de tiempo se tradujera en más productividad. Resúmenes de informes, mucho más rápidos y mejores; análisis en hoja de cálculo, más lento y menos preciso | Diario de uso, entrevistas, grupo de control y tareas observadas puntuadas a ciegas (muestras pequeñas) |
| Australia · Copilot en el Tesoro, 218 personas (2024) | Uso más bajo de lo esperado, poco apto para tareas complejas, sin pruebas claras de mejores resultados de trabajo | Evaluación del centro de evaluación del Gobierno australiano |
| Francia · «L'Assistant», asistente para empleados públicos (2025-2026) | Un 12% menos de tiempo en redacción y hasta un 16% en síntesis de documentos | Grupos focales experimentales con calidad evaluada a ciegas, además de encuestas |
Resultados publicados por las propias administraciones. Cuanto más exigente es el método, más modesto es el número
El pie de la tabla es la primera lección. Cuanto más exigente es el método, más modesto es el número. Los 26 minutos diarios salen de preguntar a la gente; cuando el mismo tipo de herramienta se evalúa con grupo de control y tareas observadas, el efecto sobre la productividad no aparece de forma clara. Es el mismo patrón que vemos en las empresas y que contamos en por qué el ROI de Copilot se mide donde no está: la percepción de ahorro es real, pero no es una medida.
Y un detalle de la evaluación británica que merece más atención que el titular: el 22% de quienes respondieron al diario había detectado alucinaciones, un 11% no sabía si las había visto y otro 22% prefirió no contestar. Cuando una parte relevante del personal no puede decir si la herramienta se ha equivocado, el ahorro de tiempo que declara incluye trabajo que alguien tendrá que rehacer después.
Por qué no se contradicen: una cola no es una licencia
El caso francés de las reseñas ciudadanas y las evaluaciones de Copilot no están midiendo la misma cosa, y la diferencia es la lección más útil de todo esto.
Services Publics+ aplicó la IA a una cola: miles de mensajes de ciudadanos que había que contestar, con un plazo que se podía medir antes y después, un tipo de texto repetible y unas fuentes conocidas —las fichas oficiales de información administrativa—. El sistema propone un borrador; el agente lo usa o no, lo modifica, lo reescribe o lo descarta, y valida la respuesta final. Cuando el cuello de botella es precisamente redactar, y la IA redacta, el plazo baja. Y como el plazo se medía antes, se puede decir cuánto.
Las pruebas de Copilot aplicaron la IA a una licencia: una herramienta generalista para que cada persona la use en lo que le parezca. El ahorro existe, pero se reparte en minutos sueltos, en tareas que no eran el cuello de botella de nada, y se lo come en parte la revisión. No hay un plazo que baje, porque no se eligió ningún plazo.
Hay candidatas evidentes en cualquier administración: respuestas a consultas y quejas, requerimientos de subsanación, informes de trámite, resúmenes de expedientes para quien tiene que resolver, contestaciones a alegaciones repetitivas. Todas comparten tres rasgos: mucho volumen, un texto que se parece de un caso a otro y unas fuentes que existen y se pueden cerrar. Es el mismo criterio con el que en empresa recomendamos elegir y medir el primer caso de uso.
Albert: lo que pasa cuando se empieza por el caso más difícil
Francia ofrece también el contraejemplo, y conviene contarlo porque aparece citado a menudo como prueba de lo contrario. Albert, la IA generativa desarrollada por la propia administración francesa, se probó en 48 oficinas de atención al ciudadano. En enero de 2026, según informó la agencia AFP, la dirección digital del Estado decidió no generalizarla «en su forma actual», después de que el personal señalara fallos técnicos y respuestas incorrectas.
No fue un abandono: la infraestructura siguió, y el asistente para empleados públicos se rehízo con otra base tecnológica. En junio de 2026 se extendió a todo el personal del Estado después de una evaluación que, esta vez, midió tiempos y calidad a ciegas. Pero la secuencia deja una lección clara. Un asistente generalista que responde a preguntas abiertas en el mostrador es el caso más difícil, no el primero: no hay una cola acotada, las preguntas no se parecen entre sí, las fuentes no están cerradas y el error llega directamente al ciudadano.
Hay además un porqué técnico. Un sistema que busca en documentos oficiales antes de redactar reduce las invenciones, pero no las elimina: el buscador puede dejar fuera una excepción relevante o traer una norma derogada, y el modelo puede combinar mal dos fragmentos correctos. En la administración ese riesgo tiene nombre propio: la vigencia. Un corpus de normativa que no sabe qué versión está en vigor es peor que no tener corpus, porque produce respuestas bien argumentadas sobre reglas que ya no existen. Por eso el valor está en los documentos, no en el modelo, y la primera inversión es tenerlos ordenados, versionados y con fecha.
El 70%: el número que hay que vigilar
De todos los datos franceses, el más interesante no es el de los plazos. Es que el 70% de las propuestas de la IA se reutilizan. Es una buena noticia —la herramienta acierta lo bastante como para ser útil— y a la vez el número que hay que vigilar, porque si con el tiempo sube hacia el 98%, puede significar dos cosas muy distintas: que la herramienta ha mejorado, o que el personal ha dejado de mirar.
La investigación aporta aquí un matiz que conviene conocer. En tres experimentos en los Países Bajos —dos con ciudadanos y uno con 1.345 funcionarios—, Saar Alon-Barkat y Madalina Busuioc no encontraron la confianza ciega en la máquina que cabría esperar. Encontraron algo más incómodo: en los dos primeros, la gente seguía la recomendación sobre todo cuando confirmaba un estereotipo. En el tercero, con funcionarios y después del escándalo de las ayudas por cuidado de hijos, el patrón desaparecía: el escándalo los había vuelto más cautos. La supervisión no falla sólo porque las personas se fíen demasiado de la IA; falla también porque se fían de ella de forma selectiva, y el contexto de la organización pesa.
Y el diseño del proceso empuja en una dirección o en otra. Según documentos obtenidos por Privacy International, en una herramienta de recomendación del Ministerio del Interior británico el personal tenía que justificar por escrito cuándo rechazaba la propuesta, pero no cuándo la aceptaba. Nadie tiene que decidir aprobar sin mirar: basta con que mirar cueste más que aprobar.
De ahí salen tres reglas de diseño que no dependen del modelo:
- El motivo se escribe siempre, al aceptar y al rechazar. Aunque sea una línea. Si aceptar no cuesta nada y rechazar cuesta un párrafo, el sistema está diseñado para aprobar.
- Se mide la tasa de enmienda: qué parte de las propuestas se cambia, por quién y en qué tipo de caso. Una tasa que baja sin que haya cambiado la herramienta es una alarma, no un éxito.
- Quien valida tiene autoridad para cambiar la decisión y todos los datos del caso delante, no sólo el borrador. Es lo que el Reglamento Europeo de IA pide para los casos de alto riesgo, y lo que ya contamos al hablar de la ruta de excepción: una revisión que aprueba el cien por cien en veinte segundos no es supervisión.
La frontera entre redactar y decidir, en la ley
Todo esto tiene además un marco legal, y conviene tenerlo claro porque cambió en julio. La frontera que importa es la de siempre: no es igual que la IA redacte un borrador que alguien revisa que que intervenga en una decisión sobre los derechos de una persona.
| Uso | Qué exige | Desde cuándo |
|---|---|---|
| Redactar borradores internos, resumir expedientes | En principio, no es alto riesgo. Sí aplican las medidas de alfabetización en IA del personal y la protección de datos | Ya |
| Publicar texto generado para informar al público sobre asuntos de interés público | Advertir de que lo ha generado una IA, salvo que haya pasado por revisión humana y alguien asuma la responsabilidad editorial | Desde agosto de 2026 |
| Evaluar si una persona tiene derecho a una prestación o servicio público esencial | Alto riesgo: supervisión humana por personas con competencia, formación y autoridad; conciencia del sesgo de automatización; evaluación de impacto en derechos fundamentales antes de desplegar; registro. Una tarea meramente preparatoria puede quedar fuera, salvo que haya elaboración de perfiles | 2 de diciembre de 2027 (aplazado en julio de 2026) |
| Actuación administrativa automatizada, sin intervención directa de un empleado | Ley 40/2015, art. 41: fijar antes qué órgano define, supervisa y controla la calidad del sistema, y cuál es responsable a efectos de impugnación | Vigente desde 2016 |
Resumen orientativo del Reglamento Europeo de IA tras su modificación de julio de 2026 y de la Ley 40/2015. No sustituye un análisis jurídico de cada caso
Tres observaciones sobre la tabla. La primera: el aplazamiento a diciembre de 2027 no es un permiso para esperar. La evaluación de impacto hay que hacerla antes de desplegar, y un sistema que empiece a funcionar en 2027 sin haberla previsto llegará tarde. La segunda: la excepción de la «tarea preparatoria» es estrecha y se va a discutir mucho. Un resumen de expediente que omite sistemáticamente un tipo de circunstancia está condicionando la decisión, se llame como se llame. La tercera: la transparencia ya tiene jurisprudencia en España. En septiembre de 2025, el Tribunal Supremo reconoció a la fundación Civio el derecho a acceder al código fuente de BOSCO, la aplicación que decide quién puede recibir el bono social eléctrico, con un argumento que vale para cualquier sistema que participe en el reconocimiento de derechos sociales: cuanto más decide, más tiene que poder explicarse.
Hay además una razón menos jurídica para tomarse en serio la frontera. Los dos grandes fracasos europeo y australiano de la decisión automatizada —las ayudas por cuidado de hijos en los Países Bajos, que acabaron con la dimisión del Gobierno en enero de 2021, y Robodebt en Australia— no fueron casos de IA generativa. Fueron sistemas de reglas y cruces de datos que marcaban a familias como sospechosas de fraude o generaban deudas que no existían. Pero dejaron la misma lección: cuando el sistema propone y nadie con autoridad y tiempo revisa, el error se multiplica por el volumen. La IA generativa no cambia esa lección; sólo hace más fácil producir volumen.
Por dónde empezaríamos
Con todo lo anterior, así planteamos un primer proyecto con una administración, sea un ayuntamiento, un consorcio o un departamento:
Primero, una cola, no una licencia. Un proceso concreto con volumen, un plazo que se mide hoy y un texto que redacta una persona. Si no hay plazo medido, lo primero es medirlo: sin él no habrá forma de decir si el proyecto sirvió.
Segundo, fuentes cerradas y con fecha. Qué normativa, qué fichas, qué modelos de respuesta, en qué versión y quién los mantiene. El sistema cita la fuente de cada afirmación y quien valida la comprueba. Si el corpus no está al día, el proyecto empieza por ahí.
Tercero, la validación diseñada antes que el modelo. Motivo al aceptar y al rechazar, tasa de enmienda en un panel, y una persona con autoridad real sobre el resultado. Es la parte que casi nunca se presupuesta y la que decide si la supervisión es efectiva o un simple trámite formal.
Cuarto, medir como el Tesoro australiano, no como una encuesta. Un grupo que trabaja con la herramienta y otro que no, el mismo tipo de casos, y la calidad revisada por alguien que no sabe cuál es cuál. Cuesta unas semanas más y es lo único que se puede defender ante un órgano de control.
Quinto, decidir dónde vive el sistema. Francia acabó construyendo su asistente sobre infraestructura propia y certificada, y el Gobierno español ha anunciado una plataforma de IA soberana en su nube. No hace falta esperar a ninguna de las dos para empezar, pero sí saber desde el principio qué datos salen, a dónde, y qué pasa si mañana hay que cambiar de proveedor. Lo tratamos en el reparto de control en ocho ejes.
El criterio humano no se declara
La posición de partida es correcta: eficiencia operativa y criterio humano no se oponen, y una administración que las combine bien atenderá mejor. Lo que añaden los datos es que el criterio humano no aparece por escribirlo en una guía. Aparece cuando alguien elige una cola concreta, cierra las fuentes, diseña una validación que cuesta lo mismo en las dos direcciones y mide cuántas veces el funcionario dice que no. Si ese número existe y se mira, hay supervisión. Si no existe, hay un trámite con un botón de aprobar.
La buena noticia es que todo esto cabe en un primer proyecto de pocas semanas, con una sola cola y sin cambiar de plataforma. La mala es que no hay atajo: el ahorro que se puede defender es el que se ha medido.
Preguntas frecuentes
¿La IA generativa ahorra tiempo de verdad en la administración pública?
Depende de dónde se aplique, y la evidencia publicada lo muestra con bastante claridad. Donde ataca una cola concreta con un retraso medido —como las respuestas a las reseñas ciudadanas en Francia, que pasaron de 19 a 3 días de plazo medio—, el efecto es grande y visible. Donde se reparte como licencias para todo el personal, las evaluaciones más rigurosas no encuentran una mejora clara de la productividad: el ahorro autodeclarado existe, pero se diluye o se lo come la revisión de lo que produce la herramienta.
¿Qué diferencia hay entre una prueba autodeclarada y una evaluación rigurosa?
La primera pregunta a las personas cuánto tiempo creen que ahorran; la segunda mide tareas, compara con un grupo que no usa la herramienta y evalúa la calidad sin saber quién hizo qué. En el Reino Unido conviven las dos: la prueba de doce organismos habla de 26 minutos diarios ahorrados, según una encuesta, y la evaluación del Department for Business and Trade, con tareas observadas y grupo de control, no encontró pruebas de que ese ahorro se tradujera en más productividad. No se contradicen: miden cosas distintas.
¿Qué dice el Reglamento Europeo de IA sobre estos usos en la administración?
Distingue según el uso. Evaluar si una persona tiene derecho a una prestación o servicio público esencial es de alto riesgo, con obligaciones de supervisión humana, personal con competencia y autoridad y evaluación de impacto en derechos fundamentales para los organismos públicos. Esas obligaciones se aplazaron: para estos sistemas se aplican desde el 2 de diciembre de 2027. Redactar respuestas o resumir documentos no es, en principio, alto riesgo. Y las obligaciones de transparencia sobre texto generado ya se aplican desde agosto de 2026.
¿Basta con que un funcionario valide lo que propone la IA?
No, si la validación no está diseñada. Una validación que exige justificar el rechazo pero no la aceptación empuja hacia aprobar. Los experimentos hechos en los Países Bajos encontraron algo más sutil que la confianza ciega: la gente seguía la recomendación sobre todo cuando confirmaba un estereotipo. La supervisión funciona cuando quien valida tiene autoridad para cambiar la decisión, todos los datos delante, un motivo que escribir tanto si acepta como si rechaza, y alguien que mide cuántas veces enmienda.
¿Qué pasó con Albert, la IA del Estado francés?
Se probó en 48 oficinas de atención al ciudadano y en enero de 2026 la administración francesa decidió no generalizarla en su forma de entonces, tras fallos técnicos y respuestas incorrectas señalados por el personal. El proyecto no desapareció: su infraestructura sigue, y el asistente para empleados públicos, rehecho con otra base tecnológica, se extendió en junio de 2026 a todo el personal del Estado tras una evaluación con calidad medida a ciegas. La lección es que un asistente generalista delante del ciudadano es el caso más difícil, no el primero.
¿Por dónde debería empezar una administración?
Por una cola, no por una licencia: un proceso con volumen, un retraso medido y un texto que hoy redacta una persona, como respuestas a consultas, requerimientos de subsanación o informes de trámite. Con fuentes cerradas y vigentes, un empleado que valida con motivo tanto al aceptar como al rechazar, y una medición con grupo de comparación y calidad revisada a ciegas. Si eso funciona en una cola, se sabe cuánto vale y cuánto cuesta supervisarlo; entonces se decide la siguiente.

Jordi García es Tech Lead en onext. Trabaja en llevar la IA a producción gobernada en equipos de desarrollo y de producto —con Spec-Driven Development, ingeniería de contexto y verificación humana en cada paso— y firma los insights técnicos de onext sobre método, calidad y coste de la IA aplicada.
LinkedIn →