Metodología
Este procedimiento se publica antes de tener resultados. Es la única defensa real contra la acusación de partidismo: el método se declara primero y cualquiera puede comprobarlo.
1. Fuente
Diario de Sesiones del Congreso de los Diputados, XV Legislatura, del 17 de agosto de 2023 al 23 de septiembre de 2026: 824 sesiones y 76.421 intervenciones. Se parte del parseo abierto del proyecto escano-abierto (licencia MIT), y cada frase del juego enlaza al PDF oficial de su sesión.
2. Grupos: solo cuatro, y por qué
PP y Vox forman el bloque de la derecha; PSOE y Sumar, el de la izquierda. Junts, PNV, ERC, EH Bildu y el Grupo Mixto quedan fuera por diseño, no por ideología: su posición en el eje izquierda-derecha es discutible, y una respuesta correcta discutible invalida el instrumento. Como efecto lateral, los cuatro grupos incluidos intervienen en castellano.
3. Selección: ninguna frase la elige una persona
Cada paso es automático y está en el código. Si una exclusión no cabe en un filtro, no se aplica.
- Segmentación. Cada intervención se parte en frases.
- Saneamiento. Se quitan las acotaciones del taquígrafo. Las frases con palabras pegadas por el parseo del PDF se descartan en vez de reconstruirse.
- Longitud. Entre 80 y 180 caracteres.
- Tema. Una lista de palabras por tema. Es un punto de sesgo y
se declara: sanidad (
sanidad, sanitari-, lista de espera, atención primaria, hospital), vivienda (vivienda, alquiler, inquilin-, desahucio, okupa, hipotec-) y pensiones (pensión, jubilaci-, cotizaci-). - Autodelación. Fuera toda frase que revele al emisor sin razonar: nombres y siglas de partido, "nuestro grupo", "usted", "señor ministro", el aparato de la sesión.
- Citas de terceros. Fuera todo lo que va entre comillas o tras un verbo de cita. Sin este filtro, un diputado citando a su rival produciría una atribución falsa con datos correctos.
- Lengua. Solo castellano. No se traduce: una traducción deja de ser cita.
- Fecha. Sin fecha no hay fuente citable.
- Clasificación con un modelo de lenguaje (sección 4).
- Muestreo aleatorio con semilla fija, con el mismo número de frases por tema y bloque aunque el corpus no esté equilibrado.
- Cotejo con el PDF oficial (sección 5).
- Criba por dificultad medida. Una frase sale del catálogo cuando acumula al menos 15 respuestas y el 85% o más son aciertos. La regla se fijó el 4 de octubre de 2026, antes de tener ninguna respuesta, y no se cambia a la vista de los datos. Se publicará la lista de frases retiradas con sus cifras. Pendiente: requiere jugadores.
Los filtros de los pasos 1 a 8 dejan 3.878 frases candidatas (3.936 combinaciones de frase y tema: una frase puede tocar dos temas). La lista de exclusión por autodelación incluye también nombres de líderes políticos, siglas de otros grupos y términos institucionales catalanes; se descartan las frases con palabras pegadas por el parseo del PDF y las que empiezan remitiendo a lo dicho antes ("Eso es...", "Fueron esas políticas..."), que no se entienden solas. Cada ampliación de un filtro se hizo con una regla escrita y un test, nunca quitando frases sueltas.
4. El clasificador y su validación a ciegas
Un modelo de lenguaje de pesos abiertos (qwen3-32b, ejecutado en
local) lee cada frase candidata y responde dos preguntas: si trata de verdad del
tema y si afirma algo que se pueda defender o atacar en un debate, frente al
trámite y el relleno. El modelo nunca ve el partido ni el orador: decide si la frase
sirve, no de qué lado es.
El modelo se eligió comparando tres candidatos con una revisión humana a ciegas de 50 frases tomadas al azar: la persona que revisó solo veía el tema y el texto, sin partido, sin orador y sin la respuesta de ningún modelo. La primera ronda reveló que el criterio de "postura" era ambiguo (acuerdo de entre el 42% y el 50%); se reescribió la definición, se repitió la revisión y se eligió el modelo con mejor resultado:
| Pregunta | Acuerdo con la revisión humana | Kappa de Cohen |
|---|---|---|
| ¿Trata del tema? | 90% | no informativo* |
| ¿Afirma una postura? | 86% | 0,41 |
* La revisión humana marcó como "del tema" 47 de 50 frases; con una proporción tan alta la kappa es inestable y no se interpreta.
De las candidatas, 3.362 superan el clasificador. Las del catálogo se confirmaron después una a una (sin mezclarlas en lotes, que alteran levemente el veredicto) con el mismo modelo, parte en local y parte a través de un proveedor externo; donde se hicieron por las dos vías, coincidieron en el 95% de los casos.
El modelo no descartó ninguna frase que la revisión considerara válida, pero solo detectó 3 de cada 10 frases de relleno. El relleno que pase lo elimina el paso 12: una frase vacía no la coloca nadie con seguridad. Las instrucciones del modelo se publican íntegras. Pendiente: una segunda revisión humana independiente sobre las mismas 50 frases, para medir cuánto coinciden dos personas entre sí.
5. Cotejo con la fuente oficial
Cada frase se busca en el PDF oficial del Diario de Sesiones, palabra por palabra, y se comprueba que aparece en el turno de palabra del orador al que se atribuye. Se hace con dos métodos independientes: el texto extraído del PDF y el texto con la maquetación de la página. Entra en el catálogo si al menos uno la confirma y ninguno la sitúa en el turno de otra persona. De 222 candidatas, 211 las confirmaron los dos métodos, 10 uno solo y 1 ninguno (retirada). Ningún método atribuyó ninguna frase a otra persona. Las 150 frases del catálogo están cotejadas.
6. Límites declarados
- Gobierno y oposición. Todas las frases son de una legislatura en la que gobierna la izquierda. Una frase que delata a quien gobierna o a quien está en la oposición se puede acertar sin pasar por el eje izquierda-derecha. No se filtra, porque ni la revisión humana ni el modelo lo distinguen de forma fiable. Cada frase lleva una etiqueta de rol y los resultados se publicarán por separado para las frases que lo delatan y las que no.
- Diferencias del clasificador entre bloques. En pensiones descarta más frases de la derecha (19% frente a 11%), casi todas porque la palabra "cotización" aparecía hablando de impuestos y no de pensiones. En sanidad descarta más de la izquierda (24% frente a 18%), sobre todo frases en las que el Gobierno describe su gestión.
- Una sola legislatura. El juego mide el eje en un momento concreto, no su evolución.
- Las palabras de cada tema deciden qué frases entran en el punto de partida, y otra lista habría dado otro conjunto.
7. La métrica
No es la tasa de acierto, sino el acierto condicionado a la confianza. Una frase que nadie sabe colocar y una que todos colocan mal dan el mismo 50% de acierto y significan lo contrario. Por eso cada respuesta es una apuesta: "creo que" suma 1 punto si aciertas y 0 si fallas; "seguro" suma 2 o resta 2. Así, marcar "seguro" sin estarlo tiene un coste. El marcador se ve durante la partida; para que eso no contamine la medida de la confianza (quien va perdiendo podría apostar "seguro" por estrategia), cada respuesta guarda los puntos que se llevaban y el análisis lo tiene en cuenta.
Retratos
Los retratos que aparecen al girar cada ficha son las fotografías oficiales del Congreso de los Diputados (congreso.es), reproducidas sin ninguna modificación según sus condiciones de reutilización, consultadas el 5 de octubre de 2026. Las diputadas y diputados que dejaron el escaño durante la legislatura aparecen sin foto: solo se muestra un retrato cuando la identificación es inequívoca.
Reto diario
Cada día hay un reto con las mismas diez frases para todo el mundo (cinco de cada bloque), elegidas al azar a partir de la fecha y del catálogo, sin intervención de nadie. El percentil del reto compara solo con quienes han jugado ese reto. Repetirlo en la misma pestaña cuenta como partida libre.
Qué se comparte
Al terminar se puede compartir una imagen con el resultado, sin ninguna frase, que incluye el percentil cuando ya hay al menos 20 partidas completas con las que comparar. El percentil cuenta partidas, no personas: una misma persona puede jugar varias y no hay forma de saberlo. En partida libre se puede compartir además "tu sorpresa": una sola frase, la que fallaste con "seguro" (o, si no hubo ninguna, la que fallaste más deprisa). La elige tu propio fallo, no el proyecto, y va siempre con su autor, su grupo, la fecha y la referencia del Diario de Sesiones. En el reto del día no se ofrece, para no desvelar las respuestas a quien aún no lo ha jugado. Nada de esto sale del navegador: la imagen se dibuja en tu dispositivo y no se guarda en ningún servidor.
8. Datos que se guardan
Cada ronda de diez frases es una partida con su propio identificador. Una misma persona puede jugar varias rondas y no hay forma de saberlo: los resultados se publican por respuesta y por partida, nunca por persona.
Por cada respuesta: la frase, el lado elegido, si acertó, la confianza y el tiempo de reacción, junto a un identificador de partida aleatorio que vive solo en la pestaña mientras juegas. No se guarda la IP, el navegador ni ningún dato que te identifique, y no se usan cookies ni almacenamiento en tu dispositivo. Aparte, un contador de visitas sin cookies (Umami) registra páginas vistas y acciones generales, sin cruzarlas con las respuestas; el detalle está en Datos y condiciones.
9. Análisis y publicación
- Se descartarán las partidas con tiempos de reacción imposibles (por debajo de unos 400 ms es un reflejo, no un juicio) y las de acierto perfecto en tiradas largas, y se publicará cuántas y por qué.
- Los resultados se describen, no se interpretan: "el N% de las frases se atribuye al bloque equivocado", nunca "los partidos dicen lo mismo".
- Se publican completos, con el desglose por tema y por grupo, incluidos los que no favorezcan ninguna lectura.
10. Correcciones
Una frase señalada como mal atribuida se corrige o se retira, y el registro de correcciones se publica. Además del aviso anónimo de cada ficha, se puede escribir a [email protected].