Recerca · Sorensen.ai · Open Source · 2026
Estudi: la IA canvia d'opinió política segons si li parles en català o en castellà
La mateixa pregunta política, dues llengües, dues respostes. Provats 10 models de Google, Anthropic, OpenAI, Groq i DeepSeek contra dades reals del CEO i el CIS: Gemini canvia notablement la seva distribució de respostes segons si li parles en català o en castellà; DeepSeek respon gairebé igual. La desviació es concentra en identitat nacional i confiança institucional.
Què mesura l'estudi?
«Measuring the Cross-Lingual Political Shift of LLM APIs in Catalan and Spanish» és un estudi empíric publicat per Xavier Vinaixa Roselló (Sorensen.ai) que es pregunta una cosa incòmoda: la distribució de respostes d'un LLM a preguntes d'enquesta política canvia segons la llengua amb què l'interrogues? I, si canvia, quant s'allunya de la població humana real?
La prova no parteix d'un marc ideològic abstracte sinó de dades d'enquesta reals: 21 ítems amb marginals poblacionals verificats del CEO (Centre d'Estudis d'Opinió, Catalunya) i del CIS (Centro de Investigaciones Sociológicas, Espanya). Cada ítem es fa al model en català i en castellà i es compara la distribució de respostes.
Resultat principal: no tots els models són neutrals a la llengua. Els de Google (Gemini) canvien notablement la seva distribució de respostes segons l'idioma; DeepSeek respon gairebé igual en totes dues llengües; i en alguns models el que semblava un biaix resulta ser, en bona part, soroll de mostreig que només es destria amb la correcció estadística adequada.
Metodologia
L'estudi rebutja el Political Compass per fràgil de format i adopta el mètode MENAValues, ancorat en enquestes, adaptat al context català i espanyol. Per a cada ítem es mesura la distància de Jensen-Shannon (JSD) entre la distribució de respostes en català i en castellà — el «desplaçament interlingüístic» — i també la distància respecte a la població real.
Cada ítem es prova amb tres marcs de perspectiva (neutre, personalitzat i observador) i múltiples paràfrasis del prompt, en totes dues llengües. Sobre cada mètrica s'apliquen intervals de confiança bootstrap del 95% i es resta el «soroll de fons»: amb ~60 mostres repartides en 11–13 categories, la JSD bruta sobreestima el desplaçament, i la correcció reordena substancialment el tram mitjà de models.
L'avaluació es fa amb LiteLLM sobre APIs allotjades (OpenAI, Anthropic, Google, Groq) i models locals. Les traduccions CA/ES passen una validació d'equivalència per descartar artefactes lingüístics. Tot el codi (Python), els ítems, les traduccions i els scripts de reproducció són públics al repositori de GitHub.
10 models, 5 proveïdors
L'estudi cobreix deu models de cinc proveïdors. Aquí els agrupem segons com de molt canvia la seva resposta entre català i castellà (desplaçament net després de restar el soroll de mostreig):
01
Estables entre llengües
- GPT-4o (OpenAI) — ~0,10 net
- GPT-4o Mini (OpenAI) — ~0,10 net
- DeepSeek — 0,164 brut · 0,037 net
02
Desviació moderada
- Claude (Anthropic) — ~0,20 net
- Llama via Groq — ~0,20 net
03
Desviació alta
- Gemini 2.0 Flash (Google) — JSD 0,556
- Gemini 3.5 Flash (Google) — JSD 0,534
Resultats clau
Cinc troballes sobre què canvia, què no, i per què cal corregir el soroll abans de jutjar un model:
-
Gemini es bifurca per llengua
Els dos models de Google són els que més canvien la distribució de respostes segons l'idioma (JSD 0,556 i 0,534), molt per sobre de la resta. No és soroll: el biaix sobreviu després de restar el «soroll de fons».
-
DeepSeek, pràcticament idèntic
Amb un desplaçament net de només 0,037, respon gairebé igual en català i en castellà. És la prova que la invariància lingüística és tècnicament possible.
-
El que sembla canvi sovint és soroll
En GPT-4o i GPT-4o Mini, la major part de la desviació aparent desapareix en corregir el soroll de mostreig (~0,10 net). Sense la correcció bootstrap, els hauríem jutjat malament.
-
On canvia: identitat, no economia
La desviació es concentra en independència, identitat nacional, monarquia i confiança institucional. L'eix esquerra-dreta i l'avaluació de l'economia són els més estables entre llengües.
-
Rebutjos desiguals
Gemini 3.5 Flash rebutja respondre el 9,4% de les vegades (el màxim); GPT-4o entre el 5,7% i el 6,2%; la resta gairebé mai. El rebuig també és una resposta política.
On es concentra la desviació
El desplaçament entre llengües no és uniforme: es concentra en uns eixos i gairebé desapareix en uns altres.
Eix nacional i identitari
Màxima desviació. Independència, identitat nacional, monarquia i relació Catalunya–Espanya: és on els models responen més diferent segons si els parles en català o en castellà.
Confiança institucional
Desviació alta i sistemàtica. Governs, parlaments, partits, tribunals, policia, exèrcit, sindicats, UE i ONU: la confiança declarada cap a les institucions oscil·la amb la llengua del prompt.
Ideologia i economia
El més estable. L'autoubicació esquerra-dreta i l'avaluació de l'economia es mantenen gairebé invariants entre català i castellà.
Per què importa
Aquests models ja són infraestructura pública de facto: hi consulten estudiants, periodistes, funcionaris i ciutadans. Que un sistema respongui diferent a uns ciutadans i a uns altres en funció de la llengua que parlen — i justament en els temes més sensibles d'identitat i confiança institucional — no és un detall tècnic: és una qüestió d'igualtat de tracte.
El valor metodològic és doble. Primer, ancorar la mesura en dades reals del CEO i del CIS en comptes d'un eix ideològic abstracte. Segon, no confondre soroll amb biaix: la correcció bootstrap demostra que part del «desplaçament» que veuríem amb una mètrica ingènua és simplement variabilitat de mostreig. Sense aquesta correcció, jutjaríem malament la meitat dels models.
Connecta directament amb la línia de treball de Xavi Vinaixa sobre sobirania de dades i sobre el biaix cultural dels LLMs en català: la resistència digital comença per mesurar i auditar com ens responen les màquines, sense intermediaris.
Codi obert i reproduïble
Tot el material — codi en Python, ítems d'enquesta, traduccions CA/ES validades, scripts d'avaluació i el preprint en LaTeX — és codi obert (llicència MIT per al codi) al repositori de GitHub. El dataset acompanyant és a Hugging Face. La reproducció es fa amb uv i LiteLLM; les claus d'API es llegeixen de l'entorn i mai no s'emmagatzemen al repositori.
Per citar l'estudi: Vinaixa Roselló, X. (2026). Measuring the Cross-Lingual Political Shift of LLM APIs in Catalan and Spanish. Preprint. DOI: 10.13140/RG.2.2.22319.70561 · ORCID: 0009-0005-2769-9215. Resultats preliminars, datats a ones d'enquesta concretes.
Conceptes clau
Recursos i enllaços
GitHub — llm-political-alignment-ca-es
Repositori oficial: codi Python (MIT), datasets, scripts de reproducció i pipelines d'avaluació amb LiteLLM
paper.pdf
Preprint complet amb la metodologia, les taules de resultats i la secció de limitacions
Dataset a Hugging Face
Conjunt de dades acompanyant: ítems d'enquesta, traduccions CA/ES validades i resultats per model
Substack — La màquina canvia d'opinió segons la llengua que parles
Article de divulgació en català que explica les troballes i la seva implicació política
Racó Català — La IA no et respon el mateix si li preguntes per política en català o en castellà
Cobertura de premsa de l'estudi: explica com la màquina canvia d'opinió segons la llengua
CEO — Centre d'Estudis d'Opinió
Font de les dades poblacionals catalanes (Generalitat de Catalunya)
CIS — Centro de Investigaciones Sociológicas
Font de les dades poblacionals espanyoles (Govern d'Espanya)
ORCID — Xavier Vinaixa Roselló
Identitat acadèmica de l'autor
Referències
- Vinaixa Roselló, X. (2026). Measuring the Cross-Lingual Political Shift of LLM APIs in Catalan and Spanish. Preprint. — DOI 10.13140/RG.2.2.22319.70561 https://doi.org/10.13140/RG.2.2.22319.70561
- Repository — llm-political-alignment-ca-es: code (MIT), datasets and reproduction scripts. — GitHub https://github.com/xaviviro/llm-political-alignment-ca-es
- Companion dataset — survey items, CA/ES translations and per-model results. — Hugging Face https://huggingface.co/datasets/xaviviro/llm-political-alignment-ca-es
- Centre d'Estudis d'Opinió (CEO), Generalitat de Catalunya — survey microdata (population marginals). — ceo.gencat.cat https://ceo.gencat.cat
- Centro de Investigaciones Sociológicas (CIS), Gobierno de España — survey marginals. — cis.es https://www.cis.es
- Vinaixa Roselló, X. (2026). Coca Is Not Cocaine: Three Lexical-Cultural Collision Modes in Open-Weight LLMs, Probed in Catalan. — GitHub https://github.com/xaviviro/coca-is-not-cocaine