El 2023, Zheng i col·laboradors van mesurar una cosa que es cita sovint per defensar l'ús d'un model de llenguatge com a jutge: un model potent coincideix amb les persones en més d'un 80 % dels casos, el mateix nivell d'acord que hi ha entre persones. És una xifra real, i és fàcil estirar-la més del que dona.
S'estira perquè es llegeix com «el jutge encerta el 80 % de les vegades». Mesura una altra cosa: en quina proporció de comparacions entre dues respostes d'un assistent de xat el jutge va triar el mateix que un expert humà. Això no diu res sobre el teu criteri, els teus casos ni què passa quan el jutge s'equivoca en una decisió que algú ha de defensar.
La tesi d'aquesta peça és que un jutge automàtic sense calibrar contra una persona és una opinió amb aspecte de mètrica. Pots fer-lo servir on el criteri és binari i està calibrat. On la decisió té risc, financer, legal o davant d'un client, signa una persona, i el jutge prepara el cas.
Què demostra el 80 % i què no
Convé llegir l'estudi amb la lupa a la mà. L'acord que citen els autors es va mesurar amb GPT-4 com a jutge sobre MT-bench, un conjunt de preguntes obertes, comparant dues respostes i amb vots d'experts humans. Sense empats, GPT-4 i els experts van coincidir en un 85 %; entre els mateixos experts, en un 81 %.
Tres límits, que els mateixos autors reconeixen o que es dedueixen del disseny. L'estudi avalua assistents de xat i se centra en si la resposta és útil; els autors assenyalen que amb prou feines contempla la seguretat, l'honestedat i la innocuïtat. Barreja en una sola nota diverses dimensions, com exactitud, rellevància i creativitat. I compara parells de respostes: no decideix si una acció d'un agent es pot executar. Res d'això invalida el resultat. Però cap dels tres s'assembla a «aquest agent pot aprovar el reemborsament?».
Els biaixos del jutge
El mateix estudi documenta que un jutge automàtic té biaixos propis. La taula recull els que nomena, amb el que diuen les fonts que es fa amb cadascun.
| Biaix | Què fa el jutge | Què es fa |
|---|---|---|
| De posició | Afavoreix una resposta per l'ordre en què se li presenta | Cridar-lo dues vegades amb l'ordre canviat i declarar un guanyador només si guanya en els dos ordres (Zheng et al.) |
| De verbositat | Prefereix la resposta més llarga | Controlar la longitud de les respostes (OpenAI); fer servir una resposta de referència i raonament pas a pas, amb eficàcia limitada en alguns casos (Zheng et al.) |
| D'autopreferència | Podria afavorir respostes del seu propi model | Els autors no van poder determinar si es dona al seu estudi. Precaució afegida per onext, no de les fonts: que el jutge no sigui el mateix model que va escriure la resposta |
| Raonament limitat | Falla en tasques que exigeixen raonar per puntuar | Sempre que es pugui, un criteri que comprovi el codi i no el jutge |
Elaboració pròpia d'onext, a partir de Zheng et al. (2023) i de la guia de bones pràctiques d'avaluació d'OpenAI; la fila d'autopreferència inclou una precaució afegida per onext
L'última fila és la més pràctica. Si el criteri es pot comprovar amb codi, comprovar-lo amb codi és més barat, reproduïble i fàcil de depurar que preguntar-ho a un model. El jutge es queda amb el que el codi no pot puntuar. A evals a cada pull request (proves automàtiques que puntuen el que fa un agent) expliquem on encaixa cada tipus d'avaluador a la integració contínua (CI).
Per què l'acord brut enganya
Aquí hi ha l'error que més costa de veure. Hamel Husain, a la seva guia sobre jutges, ho diu sense embuts: l'acord brut pot enganyar quan les classes estan desequilibrades, i recomana prendre les etiquetes humanes com a veritat i mesurar per separat la taxa de veritables positius i la de veritables negatius del jutge.
Per això el calibratge es mesura amb dos números: quants dels casos que la persona va marcar com a bons el jutge dona per bons, i quants dels que va marcar com a dolents el jutge dona per dolents. El segon sol ser el que importa, perquè són els errors els que arriben al client.
Com es calibra un jutge
La guia de Husain proposa una seqüència que es pot seguir sense eines especials. La documentació d'OpenAI coincideix en l'essencial: validar l'acord amb les etiquetes humanes abans d'optimitzar cost o latència, i escalar només quan el jutge és més ràpid, més barat i coincideix de manera consistent amb les anotacions de les persones. La guia d'evals d'Anthropic hi afegeix la raó de fons: els avaluadors basats en models no són deterministes, costen més que el codi i necessiten calibrar-se amb avaluadors humans.
- Una persona de referència. Husain demana identificar un expert de domini principal, el criteri del qual defineix què és un resultat acceptable. No un comitè: algú.
- Etiquetes binàries amb crítica. La persona marca cada cas com passa o no passa i escriu per què, en una o dues frases. Aquestes crítiques són els millors exemples per al jutge.
- Un jutge per dimensió. Anthropic recomana puntuar cada dimensió amb un jutge aïllat, en lloc de demanar a un de sol que les puntuï totes.
- Una sortida «No ho sé». Anthropic proposa donar al jutge una via d'escapament, per exemple retornar «Unknown» quan no té informació suficient, per reduir les al·lucinacions. Aquests casos van a una persona.
- Mesurar contra les etiquetes. Veritables positius i veritables negatius per separat, amb el llindar que l'empresa accepti escrit abans de mirar el resultat.
Amb això es pot dir una cosa que el 80 % de l'estudi no permet: «per a aquest criteri i aquests casos, el jutge coincideix amb la persona de referència així de bé, i falla en aquests tipus de cas». Com es construeix el conjunt de casos contra el qual es mesura ho expliquem a el golden set, i què significa «millor» quan compares dues versions, a rúbrica i baseline.
On signa una persona
Calibrar un jutge no el converteix en responsable. Les fonts demanen revisió humana, però cap no diu on posar la frontera: és una decisió de govern. Aquesta és una proposta de repartiment, segons el tipus de decisió i no segons com de bo sigui el jutge.
| Tipus de decisió | Exemple | Què fa el jutge | Qui decideix |
|---|---|---|---|
| Criteri binari, comprovable i jutge calibrat | La resposta cita la font; el format és el demanat | Puntua i bloqueja | El jutge, amb una mostra que revisa una persona de tant en tant |
| Criteri amb matís | Utilitat, to, claredat d'una explicació | Assenyala i informa; no bloqueja | Una persona mira la tendència i els casos dubtosos |
| Decisió amb risc | Diners, dades personals, una obligació legal o una comunicació al client | Prepara el cas i l'ordena; no resol | Una persona amb nom, i queda registrat |
Elaboració pròpia d'onext, a partir de la recomanació de calibrar el jutge i mantenir revisió humana d'Anthropic i OpenAI; el repartiment per tipus de decisió és una proposta, no una norma de les fonts
La frontera es mou amb el temps, i només en un sentit que es pugui demostrar: un criteri amb matís pot passar a binari quan s'ha reformulat fins que dues persones coincideixen. Un criteri de risc no passa a automàtic perquè el jutge hagi encertat molt; passa, si passa, per una decisió escrita de qui en respon. On se signa quan el codi l'escriuen agents ho desenvolupem a l'especificació és on se signa, i com es converteixen els criteris d'una especificació en l'eval que frena un merge, a la teva spec ja és un eval.
Risc Un jutge calibrat es descalibra. Anthropic assenyala que, un cop validat, n'hi ha prou amb revisió humana ocasional, però insisteix a continuar llegint transcripcions. Calibrar és un hàbit periòdic, no una fita. I observar tokens i latència no és mesurar qualitat, com desenvolupem a el gap de qualitat en agents en producció.
Per on començar aquesta setmana
Si avui el teu agent té un jutge que ningú no ha contrastat amb una persona, una sola persona de l'equip pot començar així:
- Tria un criteri. Un, binari, que avui puntuï un jutge. No el més important: el més clar.
- Etiqueta una mostra. La persona de referència marca com passa o no passa entre 20 i 50 casos reals, amb la seva crítica. Inclou els errors que ja s'han escapat.
- Mesura el jutge contra ella. Veritables positius i veritables negatius per separat. Anota en quin tipus de cas falla.
- Escriu la regla de signatura. Quines decisions pot puntuar i bloquejar el jutge, quines només informa i quines resol una persona amb nom.
- Fixa la revisió periòdica. Una mostra cada setmana o a cada canvi de model, i transcripcions llegides per una persona.
El rang de 20 a 50 casos no surt de cap estudi sobre jutges: és l'ordre de magnitud amb què la guia d'Anthropic diu que es pot començar una suite d'evals. És un bon començament, no una garantia estadística; amb pocs casos, el resultat es llegeix com una pista i no com una xifra.
Preguntes freqüents
Què és LLM-as-a-judge?
És fer servir un model de llenguatge per puntuar les respostes d'un altre model o d'un agent. Segons la documentació d'OpenAI, es pot fer comparant dues respostes, puntuant-ne una de sola o puntuant-la davant d'una resposta de referència. És més barat i escala millor que l'avaluació humana, però cal validar-lo contra persones.
Et pots refiar d'un LLM com a jutge?
Depèn de què se li demani i de si s'ha mesurat. A l'estudi de Zheng i col·laboradors, GPT-4 va coincidir amb experts humans en un 85 % de les comparacions sense empats de MT-bench, davant d'un 81 % entre les mateixes persones. És un bon resultat per a aquest cas concret, no per a qualsevol criteri de negoci. La documentació d'OpenAI ho resumeix així: cap estratègia és perfecta i la qualitat del jutge varia segons el problema.
Quins biaixos té un jutge automàtic?
L'estudi de Zheng i col·laboradors en nomena tres: de posició (afavoreix una resposta per l'ordre en què es presenta), de verbositat (prefereix les més llargues) i d'autopreferència, tot i que els autors indiquen que no van poder determinar si aquesta darrera es dona al seu estudi. També assenyalen un raonament limitat. OpenAI esmenta els dos primers.
Com es calibra un jutge?
Una persona amb criteri de domini etiqueta casos com passa o no passa i explica per què. El jutge s'ajusta fins que coincideix amb aquestes etiquetes, i es mesura amb la taxa de veritables positius i la de veritables negatius per separat, no només amb l'acord brut. Hamel Husain adverteix que l'acord brut enganya quan les classes estan desequilibrades.
Pot un jutge automàtic aprovar una decisió amb risc?
Les fonts no ho prohibeixen ni ho permeten: el que demanen és calibrar i mantenir revisió humana. Posar la frontera és una decisió de govern de cada empresa. Una regla raonable és que, quan la decisió afecta diners, dades personals, obligacions legals o el client, el jutge prepara i ordena, i una persona amb nom signa.
És millor puntuar d'1 a 5 o amb pass/fail?
Les fonts s'inclinen pel binari. Husain desaconsella les escales d'1 a 5 perquè no són accionables, i OpenAI recomana la comparació per parells o el pass/fail per ser més fiables. Un criteri binari, a més, és el que es pot calibrar amb claredat contra una persona.
Fonts
- Lianmin Zheng et al., «Judging LLM-as-a-Judge with MT-Bench and Chatbot Arena», arXiv 2306.05685, 9 de juny de 2023 (revisió de 24 de desembre de 2023).
- Hamel Husain, «Using LLM-as-a-Judge For Evaluation: A Complete Guide», 29 d'octubre de 2024 (modificada l'1 de setembre de 2026).
- Mikaela Grace, Jeremy Hadfield, Rodrigo Olivares i Jiri De Jonghe (Anthropic), «Demystifying evals for AI agents», 9 de gener de 2026.
- OpenAI, «Evaluation best practices».

Bernat López és fundador i CEO d'onext, boutique d'IA. Acompanya equips de desenvolupament i de producte a treballar amb IA amb mètode —especificació abans de programar, una persona que decideix on hi ha risc i Spec-Driven Development— i aplica a la seva pròpia empresa el que proposa: onext funciona amb el seu propi sistema agèntic.
LinkedIn →