A l'Administració, la IA té sentit com a eina de suport a l'empleat públic, no com a substituta del seu criteri. La IA cerca i redacta; la persona contrasta, corregeix i decideix. És la posició raonable, i és la que defensen gairebé totes les guies públiques que s'han escrit, començant pels criteris d'ús de la IA generativa que va aprovar la Generalitat de Catalunya l'abril de 2025: la IA no pot prendre ni substituir la decisió, només donar-hi suport.
El problema de les posicions raonables és que no diuen per on començar ni com saber si funcionen. Per a això hi ha dades. Des de finals de 2023, les administracions francesa, britànica i australiana han publicat resultats dels seus pilots amb IA generativa, i llegits junts expliquen una història més interessant que «suport sí, substitució no». Expliquen on s'estalvia temps de debò, i per què la supervisió humana no es declara: es dissenya.
Dos tipus d'evidència que no diuen el mateix
Comencem pels números, amb una columna que gairebé mai no s'ensenya: com es va mesurar cada cosa.
| Experiència | Resultat | Com es va mesurar |
|---|---|---|
| França · respostes a les ressenyes ciutadanes de Services Publics+ (des de finals de 2023) | Termini mitjà de resposta de 19 a 3 dies. El 70% de les propostes de la IA es reutilitzen. Un 11% més de satisfacció amb la resposta | Dades de la mateixa plataforma i valoracions d'usuaris. Sense metodologia ni grup de control publicats |
| Regne Unit · Copilot en 12 organismes, 20.000 persones (finals de 2024) | 26 minuts diaris estalviats de mitjana | Enquesta amb 7.115 respostes. El mateix informe adverteix que l'estalvi és autodeclarat |
| Regne Unit · Copilot al Department for Business and Trade, 1.000 llicències | Sense proves que l'estalvi de temps es traduís en més productivitat. Resums d'informes, molt més ràpids i millors; anàlisi en full de càlcul, més lenta i menys precisa | Diari d'ús, entrevistes, grup de control i tasques observades puntuades a cegues (mostres petites) |
| Austràlia · Copilot al Tresor, 218 persones (2024) | Ús més baix del que s'esperava, poc apte per a tasques complexes, sense proves clares de millors resultats de feina | Avaluació del centre d'avaluació del Govern australià |
| França · «L'Assistant», assistent per als empleats públics (2025-2026) | Un 12% menys de temps en redacció i fins a un 16% en síntesi de documents | Grups focals experimentals amb qualitat avaluada a cegues, a més d'enquestes |
Resultats publicats per les mateixes administracions. Com més exigent és el mètode, més modest és el número
El peu de la taula és la primera lliçó. Com més exigent és el mètode, més modest és el número. Els 26 minuts diaris surten de preguntar a la gent; quan el mateix tipus d'eina s'avalua amb grup de control i tasques observades, l'efecte sobre la productivitat no apareix de manera clara. És el mateix patró que veiem a les empreses i que vam explicar a per què el ROI de Copilot es mesura on no és: la percepció d'estalvi és real, però no és una mesura.
I un detall de l'avaluació britànica que mereix més atenció que el titular: el 22% dels qui van respondre el diari havia detectat al·lucinacions, un 11% no sabia si les havia vistes i un altre 22% va preferir no contestar. Quan una part rellevant del personal no pot dir si l'eina s'ha equivocat, l'estalvi de temps que declara inclou feina que algú haurà de refer després.
Per què no es contradiuen: una cua no és una llicència
El cas francès de les ressenyes ciutadanes i les avaluacions de Copilot no mesuren el mateix, i la diferència és la lliçó més útil de tot plegat.
Services Publics+ va aplicar la IA a una cua: milers de missatges de ciutadans que calia contestar, amb un termini que es podia mesurar abans i després, un tipus de text repetible i unes fonts conegudes —les fitxes oficials d'informació administrativa—. El sistema proposa un esborrany; l'agent el fa servir o no, el modifica, el reescriu o el descarta, i valida la resposta final. Quan el coll d'ampolla és precisament redactar, i la IA redacta, el termini baixa. I com que el termini es mesurava abans, es pot dir quant.
Les proves de Copilot van aplicar la IA a una llicència: una eina generalista perquè cada persona la faci servir en el que li sembli. L'estalvi existeix, però es reparteix en minuts solts, en tasques que no eren el coll d'ampolla de res, i se'l menja en part la revisió. No hi ha cap termini que baixi, perquè no es va triar cap termini.
Hi ha candidates evidents a qualsevol administració: respostes a consultes i queixes, requeriments d'esmena, informes de tràmit, resums d'expedients per a qui ha de resoldre, contestacions a al·legacions repetitives. Totes comparteixen tres trets: molt de volum, un text que s'assembla d'un cas a l'altre i unes fonts que existeixen i es poden tancar. És el mateix criteri amb què a l'empresa recomanem triar i mesurar el primer cas d'ús.
Albert: el que passa quan es comença pel cas més difícil
França ofereix també el contraexemple, i convé explicar-lo perquè sovint es cita com a prova del contrari. Albert, la IA generativa desenvolupada per la mateixa Administració francesa, es va provar en 48 oficines d'atenció a la ciutadania. El gener de 2026, segons va informar l'agència AFP, la direcció digital de l'Estat va decidir no generalitzar-la «en la seva forma actual», després que el personal assenyalés fallades tècniques i respostes incorrectes.
No va ser un abandonament: la infraestructura va continuar, i l'assistent per als empleats públics es va refer amb una altra base tecnològica. El juny de 2026 es va estendre a tot el personal de l'Estat després d'una avaluació que, aquesta vegada, va mesurar temps i qualitat a cegues. Però la seqüència deixa una lliçó clara. Un assistent generalista que respon preguntes obertes al taulell és el cas més difícil, no el primer: no hi ha una cua acotada, les preguntes no s'assemblen entre si, les fonts no estan tancades i l'error arriba directament a la ciutadania.
Hi ha a més un perquè tècnic. Un sistema que cerca en documents oficials abans de redactar redueix les invencions, però no les elimina: el cercador pot deixar fora una excepció rellevant o portar una norma derogada, i el model pot combinar malament dos fragments correctes. A l'Administració aquest risc té nom propi: la vigència. Un corpus de normativa que no sap quina versió és vigent és pitjor que no tenir corpus, perquè produeix respostes ben argumentades sobre regles que ja no existeixen. Per això el valor és als documents, no al model, i la primera inversió és tenir-los ordenats, versionats i amb data.
El 70%: el número que cal vigilar
De totes les dades franceses, la més interessant no és la dels terminis. És que el 70% de les propostes de la IA es reutilitzen. És una bona notícia —l'eina encerta prou per ser útil— i alhora el número que cal vigilar, perquè si amb el temps puja cap al 98% pot voler dir dues coses molt diferents: que l'eina ha millorat, o que el personal ha deixat de mirar.
La recerca aporta aquí un matís que convé conèixer. En tres experiments als Països Baixos —dos amb ciutadans i un amb 1.345 funcionaris—, Saar Alon-Barkat i Madalina Busuioc no van trobar la confiança cega en la màquina que caldria esperar. Van trobar una cosa més incòmoda: en els dos primers, la gent seguia la recomanació sobretot quan confirmava un estereotip. En el tercer, amb funcionaris i després de l'escàndol dels ajuts per a la cura d'infants, el patró desapareixia: l'escàndol els havia fet més prudents. La supervisió no falla només perquè les persones es fiïn massa de la IA; falla també perquè se'n fien de manera selectiva, i el context de l'organització hi pesa.
I el disseny del procés empeny en una direcció o en una altra. Segons documents obtinguts per Privacy International, en una eina de recomanació del Ministeri de l'Interior britànic el personal havia de justificar per escrit quan rebutjava la proposta, però no quan l'acceptava. Ningú no ha de decidir aprovar sense mirar: n'hi ha prou que mirar costi més que aprovar.
D'aquí surten tres regles de disseny que no depenen del model:
- El motiu s'escriu sempre, en acceptar i en rebutjar. Encara que sigui una línia. Si acceptar no costa res i rebutjar costa un paràgraf, el sistema està dissenyat per aprovar.
- Es mesura la taxa d'esmena: quina part de les propostes es canvia, per qui i en quin tipus de cas. Una taxa que baixa sense que hagi canviat l'eina és una alarma, no un èxit.
- Qui valida té autoritat per canviar la decisió i totes les dades del cas al davant, no només l'esborrany. És el que el Reglament europeu d'IA demana per als casos d'alt risc, i el que ja vam explicar en parlar de la ruta d'excepció: una revisió que aprova el cent per cent en vint segons no és supervisió.
La frontera entre redactar i decidir, a la llei
Tot això té a més un marc legal, i convé tenir-lo clar perquè va canviar al juliol. La frontera que importa és la de sempre: no és el mateix que la IA redacti un esborrany que algú revisa que no pas que intervingui en una decisió sobre els drets d'una persona.
| Ús | Què exigeix | Des de quan |
|---|---|---|
| Redactar esborranys interns, resumir expedients | En principi, no és d'alt risc. Sí que s'hi apliquen les mesures d'alfabetització en IA del personal i la protecció de dades | Ja |
| Publicar text generat per informar el públic sobre assumptes d'interès públic | Advertir que l'ha generat una IA, llevat que hagi passat per revisió humana i algú n'assumeixi la responsabilitat editorial | Des de l'agost de 2026 |
| Avaluar si una persona té dret a una prestació o a un servei públic essencial | Alt risc: supervisió humana per persones amb competència, formació i autoritat; consciència del biaix d'automatització; avaluació d'impacte en drets fonamentals abans de desplegar; registre. Una tasca merament preparatòria pot quedar-ne fora, llevat que hi hagi elaboració de perfils | 2 de desembre de 2027 (ajornat el juliol de 2026) |
| Actuació administrativa automatitzada, sense intervenció directa d'un empleat | Llei 40/2015, art. 41: fixar abans quin òrgan defineix, supervisa i controla la qualitat del sistema, i quin n'és responsable a efectes d'impugnació | Vigent des del 2016 |
Resum orientatiu del Reglament europeu d'IA després de la modificació de juliol de 2026 i de la Llei 40/2015. No substitueix una anàlisi jurídica de cada cas
Tres observacions sobre la taula. La primera: l'ajornament a desembre de 2027 no és un permís per esperar. L'avaluació d'impacte s'ha de fer abans de desplegar, i un sistema que comenci a funcionar el 2027 sense haver-la prevista arribarà tard. La segona: l'excepció de la «tasca preparatòria» és estreta i es discutirà molt. Un resum d'expedient que omet sistemàticament un tipus de circumstància està condicionant la decisió, se'n digui com se'n digui. La tercera: la transparència ja té jurisprudència a Espanya. El setembre de 2025, el Tribunal Suprem va reconèixer a la fundació Civio el dret d'accedir al codi font de BOSCO, l'aplicació que decideix qui pot rebre el bo social elèctric, amb un argument que val per a qualsevol sistema que participi en el reconeixement de drets socials: com més decideix, més s'ha de poder explicar.
Hi ha a més una raó menys jurídica per prendre's seriosament la frontera. Els dos grans fracassos europeu i australià de la decisió automatitzada —els ajuts per a la cura d'infants als Països Baixos, que van acabar amb la dimissió del Govern el gener de 2021, i Robodebt a Austràlia— no van ser casos d'IA generativa. Van ser sistemes de regles i encreuaments de dades que marcaven famílies com a sospitoses de frau o generaven deutes que no existien. Però van deixar la mateixa lliçó: quan el sistema proposa i ningú amb autoritat i temps no revisa, l'error es multiplica pel volum. La IA generativa no canvia aquesta lliçó; només fa més fàcil produir volum.
Per on començaríem
Amb tot l'anterior, així plantegem un primer projecte amb una administració, sigui un ajuntament, un consorci o un departament:
Primer, una cua, no una llicència. Un procés concret amb volum, un termini que avui es mesura i un text que redacta una persona. Si no hi ha termini mesurat, el primer és mesurar-lo: sense aquesta dada no hi haurà manera de dir si el projecte ha servit.
Segon, fonts tancades i amb data. Quina normativa, quines fitxes, quins models de resposta, en quina versió i qui els manté. El sistema cita la font de cada afirmació i qui valida la comprova. Si el corpus no està al dia, el projecte comença per aquí.
Tercer, la validació dissenyada abans que el model. Motiu en acceptar i en rebutjar, taxa d'esmena en un tauler, i una persona amb autoritat real sobre el resultat. És la part que gairebé mai no es pressuposta i la que decideix si la supervisió és efectiva o un simple tràmit formal.
Quart, mesurar com el Tresor australià, no com una enquesta. Un grup que treballa amb l'eina i un altre que no, el mateix tipus de casos, i la qualitat revisada per algú que no sap quin és quin. Costa unes setmanes més i és l'únic que es pot defensar davant d'un òrgan de control.
Cinquè, decidir on viu el sistema. França va acabar construint el seu assistent sobre infraestructura pròpia i certificada, i el Govern espanyol ha anunciat una plataforma d'IA sobirana al seu núvol. No cal esperar cap de les dues per començar, però sí saber des del principi quines dades surten, cap a on, i què passa si demà cal canviar de proveïdor. Ho tractem a el repartiment de control en vuit eixos.
El criteri humà no es declara
La posició de partida és correcta: eficiència operativa i criteri humà no s'oposen, i una administració que les combini bé atendrà millor. El que hi afegeixen les dades és que el criteri humà no apareix per escriure'l en una guia. Apareix quan algú tria una cua concreta, tanca les fonts, dissenya una validació que costa el mateix en les dues direccions i mesura quantes vegades el funcionari diu que no. Si aquest número existeix i es mira, hi ha supervisió. Si no existeix, hi ha un tràmit amb un botó d'aprovar.
La bona notícia és que tot això cap en un primer projecte de poques setmanes, amb una sola cua i sense canviar de plataforma. La dolenta és que no hi ha drecera: l'estalvi que es pot defensar és el que s'ha mesurat.
Preguntes freqüents
La IA generativa estalvia temps de debò a l'Administració pública?
Depèn d'on s'apliqui, i l'evidència publicada ho mostra força clarament. On ataca una cua concreta amb un retard mesurat —com les respostes a les ressenyes ciutadanes a França, que van passar de 19 a 3 dies de termini mitjà—, l'efecte és gran i visible. On es reparteix com a llicències per a tot el personal, les avaluacions més rigoroses no troben una millora clara de la productivitat: l'estalvi autodeclarat existeix, però es dilueix o se'l menja la revisió del que produeix l'eina.
Quina diferència hi ha entre una prova autodeclarada i una avaluació rigorosa?
La primera pregunta a les persones quant de temps creuen que estalvien; la segona mesura tasques, compara amb un grup que no fa servir l'eina i avalua la qualitat sense saber qui ha fet què. Al Regne Unit hi conviuen totes dues: la prova de dotze organismes parla de 26 minuts diaris estalviats, segons una enquesta, i l'avaluació del Department for Business and Trade, amb tasques observades i grup de control, no va trobar proves que aquest estalvi es traduís en més productivitat. No es contradiuen: mesuren coses diferents.
Què diu el Reglament europeu d'IA sobre aquests usos a l'Administració?
Distingeix segons l'ús. Avaluar si una persona té dret a una prestació o a un servei públic essencial és d'alt risc, amb obligacions de supervisió humana, personal amb competència i autoritat i avaluació d'impacte en drets fonamentals per als organismes públics. Aquestes obligacions es van ajornar: per a aquests sistemes s'apliquen a partir del 2 de desembre de 2027. Redactar respostes o resumir documents no és, en principi, d'alt risc. I les obligacions de transparència sobre text generat ja s'apliquen des de l'agost de 2026.
N'hi ha prou que un funcionari validi el que proposa la IA?
No, si la validació no està dissenyada. Una validació que exigeix justificar el rebuig però no l'acceptació empeny cap a aprovar. Els experiments fets als Països Baixos van trobar una cosa més subtil que la confiança cega: la gent seguia la recomanació sobretot quan confirmava un estereotip. La supervisió funciona quan qui valida té autoritat per canviar la decisió, totes les dades al davant, un motiu per escriure tant si accepta com si rebutja, i algú que mesura quantes vegades esmena.
Què va passar amb Albert, la IA de l'Estat francès?
Es va provar en 48 oficines d'atenció a la ciutadania i el gener de 2026 l'Administració francesa va decidir no generalitzar-la en la forma que tenia aleshores, després de fallades tècniques i respostes incorrectes assenyalades pel personal. El projecte no va desaparèixer: la seva infraestructura continua, i l'assistent per als empleats públics, refet amb una altra base tecnològica, es va estendre el juny de 2026 a tot el personal de l'Estat després d'una avaluació amb qualitat mesurada a cegues. La lliçó és que un assistent generalista davant de la ciutadania és el cas més difícil, no el primer.
Per on hauria de començar una administració?
Per una cua, no per una llicència: un procés amb volum, un retard mesurat i un text que avui redacta una persona, com respostes a consultes, requeriments d'esmena o informes de tràmit. Amb fonts tancades i vigents, un empleat que valida amb motiu tant en acceptar com en rebutjar, i una mesura amb grup de comparació i qualitat revisada a cegues. Si això funciona en una cua, se sap quant val i quant costa supervisar-ho; aleshores es decideix la següent.

Jordi García és Tech Lead a onext. Treballa a portar la IA a producció governada en equips de desenvolupament i de producte —amb Spec-Driven Development, enginyeria de context i verificació humana a cada pas— i signa els insights tècnics d'onext sobre mètode, qualitat i cost de la IA aplicada.
LinkedIn →