LLACA: La iniciativa franco-chilena que evalúa y mejora los conocimientos socioculturales de los grandes modelos de lenguaje

Date :
Changed on 30/09/2026
El proyecto LLACA (LLM Assimilation of Cultural Aspects) nace en el marco del Centro Binacional Franco-Chileno de Inteligencia Artificial como colaboración estratégica entre Inria Chile, el equipo ALMAnaCH del Centro Inria de París y la Universidad de Chile con el objetivo de desarrollar metodologías para medir y corregir limitaciones de sesgos culturales en los modelos de inteligencia artificial generativa.
DSC08839

 

Los Grandes Modelos de Lenguaje (LLMs) que impulsan asistentes de IA presentan un desafío fundamental: tienden a reflejar valores y conocimientos de regiones culturalmente dominantes, resultando en interpretaciones sesgadas que reflejan prejuicios y falta de diversidad. Esta limitación no es meramente técnica, sino que tiene implicaciones profundas para el desarrollo de tecnologías digitales globales.

El desafío del sesgo cultural en la IA

La proliferación de Modelos de Lenguaje de gran escala ha subrayado una problemática crítica: la transferencia involuntaria de sesgos culturales desde el hemisferio norte, y en particular de Estados Unidos y de China, hacia el resto del mundo. Según la Organización de las Naciones Unidas para la Educación, la Ciencia y la Cultura (UNESCO), a través de su Recomendación sobre la Ética de la Inteligencia Artificial, los sistemas de IA corren el riesgo de perpetuar desigualdades históricas y estereotipos si no se implementan marcos de gobernanza que garanticen la diversidad y la inclusión desde el diseño.

En América Latina, sus consecuencias no solo repercuten en la limitación de la precisión técnica de la IA, sino también en la invisibilización de los matices lingüísticos y las realidades socioeconómicas del continente. 

En este escenario, instituciones de investigación han identificado que el desequilibrio en los datos de entrenamiento genera modelos que tienden a reflejar exclusivamente las perspectivas lingüísticas y sociales de las regiones con mayor representación digital. En América Latina, el impacto es mayor debido a que los algoritmos suelen no captar las diferencias culturales y variantes del lenguaje de la región.

Colaboración franco-chilena para una metodología innovadora

En noviembre de 2025, se dio inicio a la iniciativa LLACA (LLM Assimilation of Cultural Aspects), un proyecto de investigación binacional que aborda este desafío mediante el desarrollo de metodologías para medir y mejorar la asimilación de aspectos culturales en modelos de lenguaje, con especial énfasis en América Latina. 

El proyecto se consolida como un ecosistema de colaboración científica franco-chileno de alto nivel, integrando las capacidades estratégicas de los investigadores de Inria Chile, de la Universidad de Chile; y del equipo-proyecto ALMAnaCH del Centro Inria de París en Francia. Se ideó en el marco del Centro Binacional Franco-Chileno de Inteligencia Artificial, Centro creado por el Ministerio de Ciencia, Tecnología, Conocimiento e Innovación de Chile e Inria a finales de 2024 y operado por Inria Chile. 

El objetivo de LLACA es desarrollar y validar metodologías sistemáticas para evaluar e integrar aspectos culturales en grandes modelos de lenguaje, con énfasis en la representación de conocimientos y valores latinoamericanos, de manera que siente las bases para:

  • Reducir sesgos culturales en modelos de lenguaje de uso global ; 

  • Mejorar la representación de perspectivas latinoamericanas en tecnologías de IA ;

  • Desarrollar estándares de evaluación cultural para sistemas de IA ;

  • Fomentar el desarrollo de tecnologías de IA que respeten la diversidad cultural.

Desconocimiento de las culturas latinoamericanas en los grandes modelos de lenguaje: los primeros hallazgos del proyecto

El equipo de científicos de LLACA busca establecer estándares reproducibles que permitan medir la asimilación cultural en sistemas de IA y desarrollar técnicas de integración de conocimiento cultural que puedan ser aplicadas a escala global.

En sus primeros meses de ejecución, el proyecto ha obtenido resultados en estas áreas:

  • Construcción de la base de conocimiento: Selección de regiones de interés y recopilación masiva de artículos mediante análisis de categorías y enciclopedias digitales.
  • Curaduría y filtrado especializado: Validación manual por expertos y diseño de un modelo automatizado.
  • Generación controlada de datos: Creación de conjuntos de preguntas y respuestas utilizando los artículos seleccionados como contexto exclusivo.
  • Integración de enfoques teóricos: Experimentación con diversas definiciones de cultura (antropológica, sociológica, simbólica) para guiar la generación de información.
  • Mitigación de alucinaciones: Implementación de instrucciones técnicas y criterios estrictos para evitar la invención de datos.

En el marco de LLACA, equipo ha publicado sus primeros resultados en “Leveraging Wikidata for Geographically Informed Sociocultural Bias Dataset Creation: Application to Latin America”, de Yannis Karmim (Inria, Inria Chile) como principal autor, junto con investigadores de Inria, Inria Chile, la Universidad de Chile, la Pontificia Universidad Católica y el CENIA. La publicación fue  presentada por Valentin Barriere de la Universidad de Chile en la 19th Conference of the European Chapter of the Association for Computational Linguistics (EACL 2026), realizada del 24 al 29 de marzo de 2026 en Rabat, Marruecos. 

El estudio revela que los grandes modelos de lenguaje (LLM) presentan un sesgo cultural, lo que provoca un desconocimiento de las culturas latinoamericanas en comparación, por ejemplo, con la de España. Para medir esta brecha, los autores crearon LatamQA, un conjunto de 26,000 preguntas basadas en Wikipedia y Wikidata sobre diversos países de la región, demostrando que la IA tiene dificultades para comprender contextos locales de Latinoamérica.  

El equipo de LLACA logró cuantificar el grado de conocimiento de varios modelos de lenguaje grande y descubrió: 

  • una discrepancia en el rendimiento entre los países de América Latina, siendo algunos más fáciles que otros para la mayoría de los modelos; 
  • que los modelos rinden mejor en su idioma original; y 
  • que la cultura hispánica peninsular es más conocida que las latinoamericanas.

Hacia una IA con identidad

La iniciativa LLACA se consolida como un ecosistema de colaboración internacional que integra capacidades en tecnología, lenguaje y ciencias sociales. Sus resultados impulsarán sistemas de inteligencia artificial más equitativos, sentando las bases para mejorar la representación de perspectivas regionales en tecnologías globales y desarrollar estándares de evaluación cultural para sistemas de IA.

Más allá de los resultados técnicos inmediatos, el proyecto busca establecer estándares replicables y una base de conocimiento estructurada que empodere a las regiones subrepresentadas. Al fomentar el desarrollo de tecnologías que respeten e integren la diversidad, se busca transitar hacia una innovación con identidad propia que responda de manera efectiva a las demandas de nuestras sociedades.

Para saber más:

Yannis Karmim, Renato Pino, Hernán Contreras, Hernán Lira, Sebastián Cifuentes, et al.. Leveraging Wikidata for Geographically Informed Sociocultural Bias Dataset Creation: Application to Latin America. Workshop on Multilingual and Multicultural Evaluation (MME) of the 19th Conference of the European Chapter of the Association for Computational Linguistics (EACL), Pinzhen Chen; Vilém Zouhar; Hanxu Hu; Simran Khanuja; Wenhao Zhu; Barry Haddow; Alexandra Birch; Alham Fikri Aji; Rico Sennrich; Sara Hooker, Mar 2026, Rabat, Morocco. ⟨hal-05510068v3⟩ https://inria.hal.science/hal-05510068/document