En 2023, Zheng y colaboradores midieron algo que se cita a menudo para defender el uso de un modelo de lenguaje como juez: un modelo potente coincide con las personas en más de un 80 % de los casos, el mismo nivel de acuerdo que hay entre personas. Es una cifra real, y es fácil estirarla más de lo que da.
Se estira porque se lee como «el juez acierta el 80 % de las veces». Mide otra cosa: en qué proporción de comparaciones entre dos respuestas de un asistente de chat el juez eligió lo mismo que un experto humano. Eso no dice nada sobre tu criterio, tus casos ni lo que pasa cuando el juez se equivoca en una decisión que alguien tiene que defender.
La tesis de esta pieza es que un juez automático sin calibrar contra una persona es una opinión con aspecto de métrica. Puedes usarlo donde el criterio es binario y está calibrado. Donde la decisión tiene riesgo, financiero, legal o ante un cliente, firma una persona, y el juez prepara el caso.
Qué demuestra el 80 % y qué no
Conviene leer el estudio con la lupa puesta. El acuerdo que citan los autores se midió con GPT-4 como juez sobre MT-bench, un conjunto de preguntas abiertas, comparando dos respuestas y con votos de expertos humanos. Sin empates, GPT-4 y los expertos coincidieron en un 85 %; entre los propios expertos, en un 81 %.
Tres límites, que los propios autores reconocen o que se deducen del diseño. El estudio evalúa asistentes de chat y se centra en que la respuesta sea útil; los autores señalan que apenas contempla la seguridad, la honestidad y la inocuidad. Mezcla en una sola nota varias dimensiones, como exactitud, relevancia y creatividad. Y compara pares de respuestas: no decide si una acción de un agente se puede ejecutar. Nada de esto invalida el resultado. Pero ninguno de los tres se parece a «¿este agente puede aprobar el reembolso?».
Los sesgos del juez
El mismo estudio documenta que un juez automático tiene sesgos propios. La tabla recoge los que nombra, con lo que dicen las fuentes que se hace con cada uno.
| Sesgo | Qué hace el juez | Qué se hace |
|---|---|---|
| De posición | Favorece una respuesta por el orden en que se le presenta | Llamarlo dos veces con el orden cambiado y declarar un ganador solo si gana en los dos órdenes (Zheng et al.) |
| De verbosidad | Prefiere la respuesta más larga | Controlar la longitud de las respuestas (OpenAI); usar una respuesta de referencia y razonamiento paso a paso, con eficacia limitada en algunos casos (Zheng et al.) |
| De autopreferencia | Podría favorecer respuestas de su propio modelo | Los autores no pudieron determinar si se da en su estudio. Precaución añadida por onext, no de las fuentes: que el juez no sea el mismo modelo que escribió la respuesta |
| Razonamiento limitado | Falla en tareas que exigen razonar para puntuar | Siempre que se pueda, un criterio que compruebe el código y no el juez |
Elaboración propia de onext, a partir de Zheng et al. (2023) y de la guía de buenas prácticas de evaluación de OpenAI; la fila de autopreferencia incluye una precaución añadida por onext
La última fila es la más práctica. Si el criterio se puede comprobar con código, comprobarlo con código es más barato, reproducible y fácil de depurar que preguntarle a un modelo. El juez se queda con lo que el código no puede puntuar. En evals en cada pull request (pruebas automáticas que puntúan lo que hace un agente) contamos dónde encaja cada tipo de evaluador en la integración continua (CI).
Por qué el acuerdo bruto engaña
Aquí está el error que más cuesta ver. Hamel Husain, en su guía sobre jueces, lo dice sin rodeos: el acuerdo bruto puede engañar cuando las clases están desequilibradas, y recomienda tomar las etiquetas humanas como verdad y medir por separado la tasa de verdaderos positivos y la de verdaderos negativos del juez.
Por eso la calibración se mide con dos números: cuántos de los casos que la persona marcó como buenos el juez da por buenos, y cuántos de los que marcó como malos el juez da por malos. El segundo suele ser el que importa, porque son los fallos los que llegan al cliente.
Cómo se calibra un juez
La guía de Husain propone una secuencia que se puede seguir sin herramientas especiales. La documentación de OpenAI coincide en lo esencial: validar el acuerdo con las etiquetas humanas antes de optimizar coste o latencia, y escalar solo cuando el juez es más rápido, más barato y coincide de forma consistente con las anotaciones de las personas. La guía de evals de Anthropic añade la razón de fondo: los evaluadores basados en modelos no son deterministas, cuestan más que el código y necesitan calibrarse con evaluadores humanos.
- Una persona de referencia. Husain pide identificar a un experto de dominio principal, cuyo criterio define qué es un resultado aceptable. No un comité: alguien.
- Etiquetas binarias con crítica. La persona marca cada caso como pasa o no pasa y escribe por qué, en una o dos frases. Esas críticas son los mejores ejemplos para el juez.
- Un juez por dimensión. Anthropic recomienda puntuar cada dimensión con un juez aislado, en lugar de pedirle a uno solo que puntúe todas.
- Una salida «No lo sé». Anthropic propone dar al juez una vía de escape, por ejemplo devolver «Unknown» cuando no tiene información suficiente, para reducir las alucinaciones. Esos casos van a una persona.
- Medir contra las etiquetas. Verdaderos positivos y verdaderos negativos por separado, con el umbral que la empresa acepte escrito antes de mirar el resultado.
Con eso se puede decir algo que el 80 % del estudio no permite: «para este criterio y estos casos, el juez coincide con la persona de referencia así de bien, y falla en estos tipos de caso». Cómo se construye el conjunto de casos contra el que se mide lo contamos en el golden set, y qué significa «mejor» cuando comparas dos versiones, en rúbrica y baseline.
Dónde firma una persona
Calibrar un juez no lo convierte en responsable. Las fuentes piden revisión humana, pero ninguna dice dónde poner la frontera: es una decisión de gobierno. Esta es una propuesta de reparto, según el tipo de decisión y no según lo bueno que sea el juez.
| Tipo de decisión | Ejemplo | Qué hace el juez | Quién decide |
|---|---|---|---|
| Criterio binario, comprobable y juez calibrado | La respuesta cita la fuente; el formato es el pedido | Puntúa y bloquea | El juez, con una muestra que revisa una persona cada cierto tiempo |
| Criterio con matiz | Utilidad, tono, claridad de una explicación | Señala e informa; no bloquea | Una persona mira la tendencia y los casos dudosos |
| Decisión con riesgo | Dinero, datos personales, una obligación legal o una comunicación al cliente | Prepara el caso y lo ordena; no resuelve | Una persona con nombre, y queda registrado |
Elaboración propia de onext, a partir de la recomendación de calibrar el juez y mantener revisión humana de Anthropic y OpenAI; el reparto por tipo de decisión es una propuesta, no una norma de las fuentes
La frontera se mueve con el tiempo, y solo en un sentido que se pueda demostrar: un criterio con matiz puede pasar a binario cuando se ha reformulado hasta que dos personas coinciden. Un criterio de riesgo no pasa a automático porque el juez haya acertado mucho; pasa, si pasa, por una decisión escrita de quien responde por él. Dónde se firma cuando el código lo escriben agentes lo desarrollamos en la especificación es donde se firma, y cómo se convierten los criterios de una especificación en el eval que frena un merge, en tu spec ya es un eval.
Riesgo Un juez calibrado se descalibra. Anthropic señala que, una vez validado, basta con revisión humana ocasional, pero insiste en seguir leyendo transcripciones. Calibrar es un hábito periódico, no un hito. Y observar tokens y latencia no es medir calidad, como desarrollamos en el gap de calidad en agentes en producción.
Por dónde empezar esta semana
Si hoy tu agente tiene un juez que nadie ha contrastado con una persona, una sola persona del equipo puede empezar así:
- Elige un criterio. Uno, binario, que hoy puntúe un juez. No el más importante: el más claro.
- Etiqueta una muestra. La persona de referencia marca como pasa o no pasa entre 20 y 50 casos reales, con su crítica. Incluye los fallos que ya se escaparon.
- Mide el juez contra ella. Verdaderos positivos y verdaderos negativos por separado. Anota en qué tipo de caso falla.
- Escribe la regla de firma. Qué decisiones puede puntuar y bloquear el juez, cuáles solo informa y cuáles resuelve una persona con nombre.
- Fija la revisión periódica. Una muestra cada semana o cada cambio de modelo, y transcripciones leídas por una persona.
El rango de 20 a 50 casos no sale de ningún estudio sobre jueces: es el orden de magnitud con el que la guía de Anthropic dice que se puede empezar una suite de evals. Es un buen comienzo, no una garantía estadística; con pocos casos, el resultado se lee como una pista y no como una cifra.
Preguntas frecuentes
¿Qué es LLM-as-a-judge?
Es usar un modelo de lenguaje para puntuar las respuestas de otro modelo o de un agente. Según la documentación de OpenAI, puede hacerse comparando dos respuestas, puntuando una sola o puntuándola frente a una respuesta de referencia. Es más barato y escala mejor que la evaluación humana, pero necesita validarse contra personas.
¿Se puede fiar de un LLM como juez?
Depende de qué se le pida y de si se ha medido. En el estudio de Zheng y colaboradores, GPT-4 coincidió con expertos humanos en un 85 % de las comparaciones sin empates de MT-bench, frente a un 81 % entre las propias personas. Es un buen resultado para ese caso concreto, no para cualquier criterio de negocio. La documentación de OpenAI lo resume así: ninguna estrategia es perfecta y la calidad del juez varía según el problema.
¿Qué sesgos tiene un juez automático?
El estudio de Zheng y colaboradores nombra tres: de posición (favorece una respuesta por el orden en que se presenta), de verbosidad (prefiere las más largas) y de autopreferencia, aunque sus autores indican que no pudieron determinar si esta última se da en su estudio. También señalan un razonamiento limitado. OpenAI menciona los dos primeros.
¿Cómo se calibra un juez?
Una persona con criterio de dominio etiqueta casos como pasa o no pasa y explica por qué. El juez se ajusta hasta que coincide con esas etiquetas, y se mide con la tasa de verdaderos positivos y la de verdaderos negativos por separado, no solo con el acuerdo bruto. Hamel Husain advierte de que el acuerdo bruto engaña cuando las clases están desequilibradas.
¿Puede un juez automático aprobar una decisión con riesgo?
Las fuentes no lo prohíben ni lo permiten: lo que piden es calibrar y mantener revisión humana. Poner la frontera es una decisión de gobierno de cada empresa. Una regla razonable es que, cuando la decisión afecta a dinero, datos personales, obligaciones legales o al cliente, el juez prepara y ordena, y una persona con nombre firma.
¿Es mejor puntuar de 1 a 5 o con pass/fail?
Las fuentes se inclinan por lo binario. Husain desaconseja las escalas de 1 a 5 porque no son accionables, y OpenAI recomienda la comparación por pares o el pass/fail por ser más fiables. Un criterio binario, además, es el que se puede calibrar con claridad contra una persona.
Fuentes
- Lianmin Zheng et al., «Judging LLM-as-a-Judge with MT-Bench and Chatbot Arena», arXiv 2306.05685, 9 de junio de 2023 (revisión de 24 de diciembre de 2023).
- Hamel Husain, «Using LLM-as-a-Judge For Evaluation: A Complete Guide», 29 de octubre de 2024 (modificada el 1 de septiembre de 2026).
- Mikaela Grace, Jeremy Hadfield, Rodrigo Olivares y Jiri De Jonghe (Anthropic), «Demystifying evals for AI agents», 9 de enero de 2026.
- OpenAI, «Evaluation best practices».

Bernat López es fundador y CEO de onext, boutique de IA. Acompaña a equipos de desarrollo y de producto a trabajar con IA con método —especificación antes de programar, una persona que decide donde hay riesgo y Spec-Driven Development— y aplica a su propia empresa lo que propone: onext funciona con su propio sistema agéntico.
LinkedIn →