Salta al contingut principal
onext technology
IA 7 octubre 2026 - 9 min de lectura

LLM-as-judge: quan refiar-te del jutge i on ha de signar una persona

Un jutge automàtic sense calibrar contra una persona és una opinió amb aspecte de mètrica. Serveix on el criteri és binari i està calibrat; en les decisions amb risc, signa una persona.

Bernat López
Fundador i CEO d'onext
Diagrama d'un jutge automàtic: una quadrícula de casos entra en una barra marina; per un carril surten comprovacions automàtiques i per l'altre una casella marcada al costat d'una persona que signa, en blau i marí sobre blanc

El 2023, Zheng i col·laboradors van mesurar una cosa que es cita sovint per defensar l'ús d'un model de llenguatge com a jutge: un model potent coincideix amb les persones en més d'un 80 % dels casos, el mateix nivell d'acord que hi ha entre persones. És una xifra real, i és fàcil estirar-la més del que dona.

S'estira perquè es llegeix com «el jutge encerta el 80 % de les vegades». Mesura una altra cosa: en quina proporció de comparacions entre dues respostes d'un assistent de xat el jutge va triar el mateix que un expert humà. Això no diu res sobre el teu criteri, els teus casos ni què passa quan el jutge s'equivoca en una decisió que algú ha de defensar.

La tesi d'aquesta peça és que un jutge automàtic sense calibrar contra una persona és una opinió amb aspecte de mètrica. Pots fer-lo servir on el criteri és binari i està calibrat. On la decisió té risc, financer, legal o davant d'un client, signa una persona, i el jutge prepara el cas.

Què demostra el 80 % i què no

Convé llegir l'estudi amb la lupa a la mà. L'acord que citen els autors es va mesurar amb GPT-4 com a jutge sobre MT-bench, un conjunt de preguntes obertes, comparant dues respostes i amb vots d'experts humans. Sense empats, GPT-4 i els experts van coincidir en un 85 %; entre els mateixos experts, en un 81 %.

85 % acord entre GPT-4 i experts humans a MT-bench, sense empats (Zheng et al., 2023)
81 % acord entre els mateixos experts humans al mateix conjunt

Tres límits, que els mateixos autors reconeixen o que es dedueixen del disseny. L'estudi avalua assistents de xat i se centra en si la resposta és útil; els autors assenyalen que amb prou feines contempla la seguretat, l'honestedat i la innocuïtat. Barreja en una sola nota diverses dimensions, com exactitud, rellevància i creativitat. I compara parells de respostes: no decideix si una acció d'un agent es pot executar. Res d'això invalida el resultat. Però cap dels tres s'assembla a «aquest agent pot aprovar el reemborsament?».

Els biaixos del jutge

El mateix estudi documenta que un jutge automàtic té biaixos propis. La taula recull els que nomena, amb el que diuen les fonts que es fa amb cadascun.

Biaix Què fa el jutge Què es fa
De posició Afavoreix una resposta per l'ordre en què se li presenta Cridar-lo dues vegades amb l'ordre canviat i declarar un guanyador només si guanya en els dos ordres (Zheng et al.)
De verbositat Prefereix la resposta més llarga Controlar la longitud de les respostes (OpenAI); fer servir una resposta de referència i raonament pas a pas, amb eficàcia limitada en alguns casos (Zheng et al.)
D'autopreferència Podria afavorir respostes del seu propi model Els autors no van poder determinar si es dona al seu estudi. Precaució afegida per onext, no de les fonts: que el jutge no sigui el mateix model que va escriure la resposta
Raonament limitat Falla en tasques que exigeixen raonar per puntuar Sempre que es pugui, un criteri que comprovi el codi i no el jutge

Elaboració pròpia d'onext, a partir de Zheng et al. (2023) i de la guia de bones pràctiques d'avaluació d'OpenAI; la fila d'autopreferència inclou una precaució afegida per onext

L'última fila és la més pràctica. Si el criteri es pot comprovar amb codi, comprovar-lo amb codi és més barat, reproduïble i fàcil de depurar que preguntar-ho a un model. El jutge es queda amb el que el codi no pot puntuar. A evals a cada pull request (proves automàtiques que puntuen el que fa un agent) expliquem on encaixa cada tipus d'avaluador a la integració contínua (CI).

Per què l'acord brut enganya

Aquí hi ha l'error que més costa de veure. Hamel Husain, a la seva guia sobre jutges, ho diu sense embuts: l'acord brut pot enganyar quan les classes estan desequilibrades, i recomana prendre les etiquetes humanes com a veritat i mesurar per separat la taxa de veritables positius i la de veritables negatius del jutge.

El compte (aritmètica pròpia) Si 95 de cada 100 respostes del teu agent són correctes, un jutge que digui «correcte» sempre coincideix amb la persona en el 95 % dels casos i no detecta ni un sol error. Un 95 % d'acord sona a calibrat. Només amb aquesta xifra, no saps si el jutge veu els errors.

Per això el calibratge es mesura amb dos números: quants dels casos que la persona va marcar com a bons el jutge dona per bons, i quants dels que va marcar com a dolents el jutge dona per dolents. El segon sol ser el que importa, perquè són els errors els que arriben al client.

Com es calibra un jutge

La guia de Husain proposa una seqüència que es pot seguir sense eines especials. La documentació d'OpenAI coincideix en l'essencial: validar l'acord amb les etiquetes humanes abans d'optimitzar cost o latència, i escalar només quan el jutge és més ràpid, més barat i coincideix de manera consistent amb les anotacions de les persones. La guia d'evals d'Anthropic hi afegeix la raó de fons: els avaluadors basats en models no són deterministes, costen més que el codi i necessiten calibrar-se amb avaluadors humans.

  1. Una persona de referència. Husain demana identificar un expert de domini principal, el criteri del qual defineix què és un resultat acceptable. No un comitè: algú.
  2. Etiquetes binàries amb crítica. La persona marca cada cas com passa o no passa i escriu per què, en una o dues frases. Aquestes crítiques són els millors exemples per al jutge.
  3. Un jutge per dimensió. Anthropic recomana puntuar cada dimensió amb un jutge aïllat, en lloc de demanar a un de sol que les puntuï totes.
  4. Una sortida «No ho sé». Anthropic proposa donar al jutge una via d'escapament, per exemple retornar «Unknown» quan no té informació suficient, per reduir les al·lucinacions. Aquests casos van a una persona.
  5. Mesurar contra les etiquetes. Veritables positius i veritables negatius per separat, amb el llindar que l'empresa accepti escrit abans de mirar el resultat.

Amb això es pot dir una cosa que el 80 % de l'estudi no permet: «per a aquest criteri i aquests casos, el jutge coincideix amb la persona de referència així de bé, i falla en aquests tipus de cas». Com es construeix el conjunt de casos contra el qual es mesura ho expliquem a el golden set, i què significa «millor» quan compares dues versions, a rúbrica i baseline.

On signa una persona

Calibrar un jutge no el converteix en responsable. Les fonts demanen revisió humana, però cap no diu on posar la frontera: és una decisió de govern. Aquesta és una proposta de repartiment, segons el tipus de decisió i no segons com de bo sigui el jutge.

Tipus de decisió Exemple Què fa el jutge Qui decideix
Criteri binari, comprovable i jutge calibrat La resposta cita la font; el format és el demanat Puntua i bloqueja El jutge, amb una mostra que revisa una persona de tant en tant
Criteri amb matís Utilitat, to, claredat d'una explicació Assenyala i informa; no bloqueja Una persona mira la tendència i els casos dubtosos
Decisió amb risc Diners, dades personals, una obligació legal o una comunicació al client Prepara el cas i l'ordena; no resol Una persona amb nom, i queda registrat

Elaboració pròpia d'onext, a partir de la recomanació de calibrar el jutge i mantenir revisió humana d'Anthropic i OpenAI; el repartiment per tipus de decisió és una proposta, no una norma de les fonts

La frontera es mou amb el temps, i només en un sentit que es pugui demostrar: un criteri amb matís pot passar a binari quan s'ha reformulat fins que dues persones coincideixen. Un criteri de risc no passa a automàtic perquè el jutge hagi encertat molt; passa, si passa, per una decisió escrita de qui en respon. On se signa quan el codi l'escriuen agents ho desenvolupem a l'especificació és on se signa, i com es converteixen els criteris d'una especificació en l'eval que frena un merge, a la teva spec ja és un eval.

Risc Un jutge calibrat es descalibra. Anthropic assenyala que, un cop validat, n'hi ha prou amb revisió humana ocasional, però insisteix a continuar llegint transcripcions. Calibrar és un hàbit periòdic, no una fita. I observar tokens i latència no és mesurar qualitat, com desenvolupem a el gap de qualitat en agents en producció.

Per on començar aquesta setmana

Si avui el teu agent té un jutge que ningú no ha contrastat amb una persona, una sola persona de l'equip pot començar així:

  1. Tria un criteri. Un, binari, que avui puntuï un jutge. No el més important: el més clar.
  2. Etiqueta una mostra. La persona de referència marca com passa o no passa entre 20 i 50 casos reals, amb la seva crítica. Inclou els errors que ja s'han escapat.
  3. Mesura el jutge contra ella. Veritables positius i veritables negatius per separat. Anota en quin tipus de cas falla.
  4. Escriu la regla de signatura. Quines decisions pot puntuar i bloquejar el jutge, quines només informa i quines resol una persona amb nom.
  5. Fixa la revisió periòdica. Una mostra cada setmana o a cada canvi de model, i transcripcions llegides per una persona.

El rang de 20 a 50 casos no surt de cap estudi sobre jutges: és l'ordre de magnitud amb què la guia d'Anthropic diu que es pot començar una suite d'evals. És un bon començament, no una garantia estadística; amb pocs casos, el resultat es llegeix com una pista i no com una xifra.

Preguntes freqüents

Què és LLM-as-a-judge?

És fer servir un model de llenguatge per puntuar les respostes d'un altre model o d'un agent. Segons la documentació d'OpenAI, es pot fer comparant dues respostes, puntuant-ne una de sola o puntuant-la davant d'una resposta de referència. És més barat i escala millor que l'avaluació humana, però cal validar-lo contra persones.

Et pots refiar d'un LLM com a jutge?

Depèn de què se li demani i de si s'ha mesurat. A l'estudi de Zheng i col·laboradors, GPT-4 va coincidir amb experts humans en un 85 % de les comparacions sense empats de MT-bench, davant d'un 81 % entre les mateixes persones. És un bon resultat per a aquest cas concret, no per a qualsevol criteri de negoci. La documentació d'OpenAI ho resumeix així: cap estratègia és perfecta i la qualitat del jutge varia segons el problema.

Quins biaixos té un jutge automàtic?

L'estudi de Zheng i col·laboradors en nomena tres: de posició (afavoreix una resposta per l'ordre en què es presenta), de verbositat (prefereix les més llargues) i d'autopreferència, tot i que els autors indiquen que no van poder determinar si aquesta darrera es dona al seu estudi. També assenyalen un raonament limitat. OpenAI esmenta els dos primers.

Com es calibra un jutge?

Una persona amb criteri de domini etiqueta casos com passa o no passa i explica per què. El jutge s'ajusta fins que coincideix amb aquestes etiquetes, i es mesura amb la taxa de veritables positius i la de veritables negatius per separat, no només amb l'acord brut. Hamel Husain adverteix que l'acord brut enganya quan les classes estan desequilibrades.

Pot un jutge automàtic aprovar una decisió amb risc?

Les fonts no ho prohibeixen ni ho permeten: el que demanen és calibrar i mantenir revisió humana. Posar la frontera és una decisió de govern de cada empresa. Una regla raonable és que, quan la decisió afecta diners, dades personals, obligacions legals o el client, el jutge prepara i ordena, i una persona amb nom signa.

És millor puntuar d'1 a 5 o amb pass/fail?

Les fonts s'inclinen pel binari. Husain desaconsella les escales d'1 a 5 perquè no són accionables, i OpenAI recomana la comparació per parells o el pass/fail per ser més fiables. Un criteri binari, a més, és el que es pot calibrar amb claredat contra una persona.

Fonts

Bernat López
Escrit per
Bernat López
Fundador i CEO d'onext

Bernat López és fundador i CEO d'onext, boutique d'IA. Acompanya equips de desenvolupament i de producte a treballar amb IA amb mètode —especificació abans de programar, una persona que decideix on hi ha risc i Spec-Driven Development— i aplica a la seva pròpia empresa el que proposa: onext funciona amb el seu propi sistema agèntic.

LinkedIn →

Qui signa avui el que decideix el teu agent?

A Enterprise AI, en els processos amb risc, l'assistent proposa i una persona resol des d'una safata de tasques pendents. Queda registre d'auditoria.

Veure com treballem