Salta al contingut principal

Recerca · Sorensen.ai · Open Source · 2026

Estudi: la IA canvia d'opinió política segons si li parles en català o en castellà

La mateixa pregunta política, dues llengües, dues respostes. Provats 10 models de Google, Anthropic, OpenAI, Groq i DeepSeek contra dades reals del CEO i el CIS: Gemini canvia notablement la seva distribució de respostes segons si li parles en català o en castellà; DeepSeek respon gairebé igual. La desviació es concentra en identitat nacional i confiança institucional.

Què mesura l'estudi?

«Measuring the Cross-Lingual Political Shift of LLM APIs in Catalan and Spanish» és un estudi empíric publicat per Xavier Vinaixa Roselló (Sorensen.ai) que es pregunta una cosa incòmoda: la distribució de respostes d'un LLM a preguntes d'enquesta política canvia segons la llengua amb què l'interrogues? I, si canvia, quant s'allunya de la població humana real?

La prova no parteix d'un marc ideològic abstracte sinó de dades d'enquesta reals: 21 ítems amb marginals poblacionals verificats del CEO (Centre d'Estudis d'Opinió, Catalunya) i del CIS (Centro de Investigaciones Sociológicas, Espanya). Cada ítem es fa al model en català i en castellà i es compara la distribució de respostes.

Resultat principal: no tots els models són neutrals a la llengua. Els de Google (Gemini) canvien notablement la seva distribució de respostes segons l'idioma; DeepSeek respon gairebé igual en totes dues llengües; i en alguns models el que semblava un biaix resulta ser, en bona part, soroll de mostreig que només es destria amb la correcció estadística adequada.

Metodologia

L'estudi rebutja el Political Compass per fràgil de format i adopta el mètode MENAValues, ancorat en enquestes, adaptat al context català i espanyol. Per a cada ítem es mesura la distància de Jensen-Shannon (JSD) entre la distribució de respostes en català i en castellà — el «desplaçament interlingüístic» — i també la distància respecte a la població real.

Cada ítem es prova amb tres marcs de perspectiva (neutre, personalitzat i observador) i múltiples paràfrasis del prompt, en totes dues llengües. Sobre cada mètrica s'apliquen intervals de confiança bootstrap del 95% i es resta el «soroll de fons»: amb ~60 mostres repartides en 11–13 categories, la JSD bruta sobreestima el desplaçament, i la correcció reordena substancialment el tram mitjà de models.

L'avaluació es fa amb LiteLLM sobre APIs allotjades (OpenAI, Anthropic, Google, Groq) i models locals. Les traduccions CA/ES passen una validació d'equivalència per descartar artefactes lingüístics. Tot el codi (Python), els ítems, les traduccions i els scripts de reproducció són públics al repositori de GitHub.

10 models, 5 proveïdors

L'estudi cobreix deu models de cinc proveïdors. Aquí els agrupem segons com de molt canvia la seva resposta entre català i castellà (desplaçament net després de restar el soroll de mostreig):

01

Estables entre llengües

  • GPT-4o (OpenAI) — ~0,10 net
  • GPT-4o Mini (OpenAI) — ~0,10 net
  • DeepSeek — 0,164 brut · 0,037 net

02

Desviació moderada

  • Claude (Anthropic) — ~0,20 net
  • Llama via Groq — ~0,20 net

03

Desviació alta

  • Gemini 2.0 Flash (Google) — JSD 0,556
  • Gemini 3.5 Flash (Google) — JSD 0,534

Resultats clau

Cinc troballes sobre què canvia, què no, i per què cal corregir el soroll abans de jutjar un model:

  • Gemini es bifurca per llengua

    Els dos models de Google són els que més canvien la distribució de respostes segons l'idioma (JSD 0,556 i 0,534), molt per sobre de la resta. No és soroll: el biaix sobreviu després de restar el «soroll de fons».

  • DeepSeek, pràcticament idèntic

    Amb un desplaçament net de només 0,037, respon gairebé igual en català i en castellà. És la prova que la invariància lingüística és tècnicament possible.

  • El que sembla canvi sovint és soroll

    En GPT-4o i GPT-4o Mini, la major part de la desviació aparent desapareix en corregir el soroll de mostreig (~0,10 net). Sense la correcció bootstrap, els hauríem jutjat malament.

  • On canvia: identitat, no economia

    La desviació es concentra en independència, identitat nacional, monarquia i confiança institucional. L'eix esquerra-dreta i l'avaluació de l'economia són els més estables entre llengües.

  • Rebutjos desiguals

    Gemini 3.5 Flash rebutja respondre el 9,4% de les vegades (el màxim); GPT-4o entre el 5,7% i el 6,2%; la resta gairebé mai. El rebuig també és una resposta política.

On es concentra la desviació

El desplaçament entre llengües no és uniforme: es concentra en uns eixos i gairebé desapareix en uns altres.

Eix nacional i identitari

Màxima desviació. Independència, identitat nacional, monarquia i relació Catalunya–Espanya: és on els models responen més diferent segons si els parles en català o en castellà.

Confiança institucional

Desviació alta i sistemàtica. Governs, parlaments, partits, tribunals, policia, exèrcit, sindicats, UE i ONU: la confiança declarada cap a les institucions oscil·la amb la llengua del prompt.

Ideologia i economia

El més estable. L'autoubicació esquerra-dreta i l'avaluació de l'economia es mantenen gairebé invariants entre català i castellà.

Per què importa

Aquests models ja són infraestructura pública de facto: hi consulten estudiants, periodistes, funcionaris i ciutadans. Que un sistema respongui diferent a uns ciutadans i a uns altres en funció de la llengua que parlen — i justament en els temes més sensibles d'identitat i confiança institucional — no és un detall tècnic: és una qüestió d'igualtat de tracte.

El valor metodològic és doble. Primer, ancorar la mesura en dades reals del CEO i del CIS en comptes d'un eix ideològic abstracte. Segon, no confondre soroll amb biaix: la correcció bootstrap demostra que part del «desplaçament» que veuríem amb una mètrica ingènua és simplement variabilitat de mostreig. Sense aquesta correcció, jutjaríem malament la meitat dels models.

Connecta directament amb la línia de treball de Xavi Vinaixa sobre sobirania de dades i sobre el biaix cultural dels LLMs en català: la resistència digital comença per mesurar i auditar com ens responen les màquines, sense intermediaris.

Codi obert i reproduïble

Tot el material — codi en Python, ítems d'enquesta, traduccions CA/ES validades, scripts d'avaluació i el preprint en LaTeX — és codi obert (llicència MIT per al codi) al repositori de GitHub. El dataset acompanyant és a Hugging Face. La reproducció es fa amb uv i LiteLLM; les claus d'API es llegeixen de l'entorn i mai no s'emmagatzemen al repositori.

Per citar l'estudi: Vinaixa Roselló, X. (2026). Measuring the Cross-Lingual Political Shift of LLM APIs in Catalan and Spanish. Preprint. DOI: 10.13140/RG.2.2.22319.70561 · ORCID: 0009-0005-2769-9215. Resultats preliminars, datats a ones d'enquesta concretes.

Conceptes clau

LLM Biaix polític Jensen-Shannon Bootstrap Català Castellà CEO CIS Gemini DeepSeek MENAValues LiteLLM Sobirania lingüística Open Source

Referències

  1. Vinaixa Roselló, X. (2026). Measuring the Cross-Lingual Political Shift of LLM APIs in Catalan and Spanish. Preprint. — DOI 10.13140/RG.2.2.22319.70561 https://doi.org/10.13140/RG.2.2.22319.70561
  2. Repository — llm-political-alignment-ca-es: code (MIT), datasets and reproduction scripts. — GitHub https://github.com/xaviviro/llm-political-alignment-ca-es
  3. Companion dataset — survey items, CA/ES translations and per-model results. — Hugging Face https://huggingface.co/datasets/xaviviro/llm-political-alignment-ca-es
  4. Centre d'Estudis d'Opinió (CEO), Generalitat de Catalunya — survey microdata (population marginals). — ceo.gencat.cat https://ceo.gencat.cat
  5. Centro de Investigaciones Sociológicas (CIS), Gobierno de España — survey marginals. — cis.es https://www.cis.es
  6. Vinaixa Roselló, X. (2026). Coca Is Not Cocaine: Three Lexical-Cultural Collision Modes in Open-Weight LLMs, Probed in Catalan. — GitHub https://github.com/xaviviro/coca-is-not-cocaine