Investigación · Sorensen.ai · Open Source · 2026
Estudio: la IA cambia de opinión política según si le hablas en catalán o en castellano
La misma pregunta política, dos lenguas, dos respuestas. Probados 10 modelos de Google, Anthropic, OpenAI, Groq y DeepSeek contra datos reales del CEO y el CIS: Gemini cambia notablemente su distribución de respuestas según si le hablas en catalán o en castellano; DeepSeek responde casi igual. La desviación se concentra en identidad nacional y confianza institucional.
¿Qué mide el estudio?
«Measuring the Cross-Lingual Political Shift of LLM APIs in Catalan and Spanish» es un estudio empírico publicado por Xavier Vinaixa Roselló (Sorensen.ai) que se pregunta algo incómodo: ¿la distribución de respuestas de un LLM a preguntas de encuesta política cambia según la lengua con que lo interrogas? Y, si cambia, ¿cuánto se aleja de la población humana real?
La prueba no parte de un marco ideológico abstracto sino de datos de encuesta reales: 21 ítems con marginales poblacionales verificados del CEO (Centre d'Estudis d'Opinió, Cataluña) y del CIS (Centro de Investigaciones Sociológicas, España). Cada ítem se plantea al modelo en catalán y en castellano y se compara la distribución de respuestas.
Resultado principal: no todos los modelos son neutrales a la lengua. Los de Google (Gemini) cambian notablemente su distribución de respuestas según el idioma; DeepSeek responde casi igual en ambas lenguas; y en algunos modelos lo que parecía un sesgo resulta ser, en buena parte, ruido de muestreo que solo se distingue con la corrección estadística adecuada.
Metodología
El estudio rechaza el Political Compass por frágil de formato y adopta el método MENAValues, anclado en encuestas, adaptado al contexto catalán y español. Para cada ítem se mide la distancia de Jensen-Shannon (JSD) entre la distribución de respuestas en catalán y en castellano —el «desplazamiento interlingüístico»— y también la distancia respecto a la población real.
Cada ítem se prueba con tres marcos de perspectiva (neutro, personalizado y observador) y múltiples paráfrasis del prompt, en ambas lenguas. Sobre cada métrica se aplican intervalos de confianza bootstrap del 95% y se resta el «ruido de fondo»: con ~60 muestras repartidas en 11–13 categorías, la JSD bruta sobreestima el desplazamiento, y la corrección reordena sustancialmente el tramo medio de modelos.
La evaluación se hace con LiteLLM sobre APIs alojadas (OpenAI, Anthropic, Google, Groq) y modelos locales. Las traducciones CA/ES pasan una validación de equivalencia para descartar artefactos lingüísticos. Todo el código (Python), los ítems, las traducciones y los scripts de reproducción son públicos en el repositorio de GitHub.
10 modelos, 5 proveedores
El estudio cubre diez modelos de cinco proveedores. Aquí los agrupamos según cuánto cambia su respuesta entre catalán y castellano (desplazamiento neto tras restar el ruido de muestreo):
01
Estables entre lenguas
- GPT-4o (OpenAI) — ~0,10 neto
- GPT-4o Mini (OpenAI) — ~0,10 neto
- DeepSeek — 0,164 bruto · 0,037 neto
02
Desviación moderada
- Claude (Anthropic) — ~0,20 neto
- Llama vía Groq — ~0,20 neto
03
Desviación alta
- Gemini 2.0 Flash (Google) — JSD 0,556
- Gemini 3.5 Flash (Google) — JSD 0,534
Resultados clave
Cinco hallazgos sobre qué cambia, qué no, y por qué hay que corregir el ruido antes de juzgar a un modelo:
-
Gemini se bifurca por lengua
Los dos modelos de Google son los que más cambian la distribución de respuestas según el idioma (JSD 0,556 y 0,534), muy por encima del resto. No es ruido: el sesgo sobrevive tras restar el «ruido de fondo».
-
DeepSeek, prácticamente idéntico
Con un desplazamiento neto de solo 0,037, responde casi igual en catalán y en castellano. Es la prueba de que la invariancia lingüística es técnicamente posible.
-
Lo que parece cambio a menudo es ruido
En GPT-4o y GPT-4o Mini, la mayor parte de la desviación aparente desaparece al corregir el ruido de muestreo (~0,10 neto). Sin la corrección bootstrap, los habríamos juzgado mal.
-
Dónde cambia: identidad, no economía
La desviación se concentra en independencia, identidad nacional, monarquía y confianza institucional. El eje izquierda-derecha y la valoración de la economía son los más estables entre lenguas.
-
Rechazos desiguales
Gemini 3.5 Flash rechaza responder el 9,4% de las veces (el máximo); GPT-4o entre el 5,7% y el 6,2%; el resto casi nunca. El rechazo también es una respuesta política.
Dónde se concentra la desviación
El desplazamiento entre lenguas no es uniforme: se concentra en unos ejes y casi desaparece en otros.
Eje nacional e identitario
Máxima desviación. Independencia, identidad nacional, monarquía y relación Cataluña–España: es donde los modelos responden más diferente según si les hablas en catalán o en castellano.
Confianza institucional
Desviación alta y sistemática. Gobiernos, parlamentos, partidos, tribunales, policía, ejército, sindicatos, UE y ONU: la confianza declarada hacia las instituciones oscila con la lengua del prompt.
Ideología y economía
Lo más estable. La autoubicación izquierda-derecha y la valoración de la economía se mantienen casi invariantes entre catalán y castellano.
Por qué importa
Estos modelos ya son infraestructura pública de facto: los consultan estudiantes, periodistas, funcionarios y ciudadanos. Que un sistema responda diferente a unos ciudadanos y a otros en función de la lengua que hablan —y justamente en los temas más sensibles de identidad y confianza institucional— no es un detalle técnico: es una cuestión de igualdad de trato.
El valor metodológico es doble. Primero, anclar la medida en datos reales del CEO y del CIS en lugar de un eje ideológico abstracto. Segundo, no confundir ruido con sesgo: la corrección bootstrap demuestra que parte del «desplazamiento» que veríamos con una métrica ingenua es simplemente variabilidad de muestreo. Sin esa corrección, juzgaríamos mal a la mitad de los modelos.
Conecta directamente con la línea de trabajo de Xavi Vinaixa sobre soberanía de datos y sobre el sesgo cultural de los LLM en catalán: la resistencia digital empieza por medir y auditar cómo nos responden las máquinas, sin intermediarios.
Código abierto y reproducible
Todo el material —código en Python, ítems de encuesta, traducciones CA/ES validadas, scripts de evaluación y el preprint en LaTeX— es código abierto (licencia MIT para el código) en el repositorio de GitHub. El dataset acompañante está en Hugging Face. La reproducción se hace con uv y LiteLLM; las claves de API se leen del entorno y nunca se almacenan en el repositorio.
Para citar el estudio: Vinaixa Roselló, X. (2026). Measuring the Cross-Lingual Political Shift of LLM APIs in Catalan and Spanish. Preprint. DOI: 10.13140/RG.2.2.22319.70561 · ORCID: 0009-0005-2769-9215. Resultados preliminares, fechados en olas de encuesta concretas.
Conceptos clave
Recursos y enlaces
GitHub — llm-political-alignment-ca-es
Repositorio oficial: código Python (MIT), datasets, scripts de reproducción y pipelines de evaluación con LiteLLM
paper.pdf
Preprint completo con la metodología, las tablas de resultados y la sección de limitaciones
Dataset en Hugging Face
Conjunto de datos acompañante: ítems de encuesta, traducciones CA/ES validadas y resultados por modelo
Substack — La màquina canvia d'opinió segons la llengua que parles
Artículo de divulgación (en catalán) que explica los hallazgos y su implicación política
Racó Català — La IA no et respon el mateix si li preguntes per política en català o en castellà
Cobertura de prensa del estudio: explica cómo la máquina cambia de opinión según la lengua
CEO — Centre d'Estudis d'Opinió
Fuente de los datos poblacionales catalanes (Generalitat de Catalunya)
CIS — Centro de Investigaciones Sociológicas
Fuente de los datos poblacionales españoles (Gobierno de España)
ORCID — Xavier Vinaixa Roselló
Identidad académica del autor
Referencias
- Vinaixa Roselló, X. (2026). Measuring the Cross-Lingual Political Shift of LLM APIs in Catalan and Spanish. Preprint. — DOI 10.13140/RG.2.2.22319.70561 https://doi.org/10.13140/RG.2.2.22319.70561
- Repository — llm-political-alignment-ca-es: code (MIT), datasets and reproduction scripts. — GitHub https://github.com/xaviviro/llm-political-alignment-ca-es
- Companion dataset — survey items, CA/ES translations and per-model results. — Hugging Face https://huggingface.co/datasets/xaviviro/llm-political-alignment-ca-es
- Centre d'Estudis d'Opinió (CEO), Generalitat de Catalunya — survey microdata (population marginals). — ceo.gencat.cat https://ceo.gencat.cat
- Centro de Investigaciones Sociológicas (CIS), Gobierno de España — survey marginals. — cis.es https://www.cis.es
- Vinaixa Roselló, X. (2026). Coca Is Not Cocaine: Three Lexical-Cultural Collision Modes in Open-Weight LLMs, Probed in Catalan. — GitHub https://github.com/xaviviro/coca-is-not-cocaine