البيانات تحدد نقطة البداية
تعتمد النماذج اللغوية الكبيرة على كميات ضخمة من النصوص خلال مرحلة التدريب، لكن هذه البيانات ليست موزعة بالتساوي بين اللغات، فالإنجليزية واللغات ذات الحضور الرقمي الكبير تمتلك عادة موارد نصية أكثر، بينما تعاني لغات أخرى من نقص في البيانات عالية الجودة.
وتشير دراسة منشورة في دورية ساينتفيك ريبورتس (Scientific Reports)، اختبرت قدرات 3 نماذج عبر 12 لغة، إلى أن أداء النماذج يختلف باختلاف اللغة، وأن حجم بيانات التدريب ومصدرها، إلى جانب المسافة اللغوية وطريقة تقسيم النصوص، كلها عوامل يمكن أن تؤثر في الأداء، والمثير أن الإنجليزية لم تكن دائما اللغة الأفضل أداء في الاختبارات، إذ تفوقت عليها بعض اللغات في مهام معينة.
قصص مقترحة
وتدعم دراسات أخرى هذه الصورة، فقد وجدت دراسة بحثت أكثر من 250 لغة أن إضافة بيانات متعددة اللغات يمكن أن تحسن أداء اللغات منخفضة الموارد، لكن الفائدة تعتمد على حجم البيانات والتشابه اللغوي بين اللغات، كما أن التوسع المفرط في عدد اللغات قد يفرض قيودا على قدرات النموذج.
حتى طريقة تقطيع الكلمات مهمة
قبل أن يعالج النموذج السؤال، تُحوَّل الكلمات عادة إلى وحدات أصغر تُسمَّى الرموز أو التوكنات (Tokens)، وهذه العملية ليست متطابقة بين اللغات.
وأظهرت أبحاث حديثة أن اختيار أداة تقسيم النص إلى رموز يمكن أن يؤثر في أداء النموذج وتكلفة تدريبه، وأن استخدام أدوات مصممة بصورة تتمحور حول الإنجليزية قد يؤدي إلى تراجع كبير في الأداء عند التعامل مع لغات أخرى، بسبب عدم كفاءة تمثيل النص.
كما وجدت دراسة في مؤتمر جمعية اللغويات الحاسوبية لعام 2025 أن طريقة تقسيم النص تتأثر بالتنوع اللغوي، وأن هذه الاختلافات يمكن أن تنعكس على أداء نماذج اللغة في مهام مختلفة. وهذا يعني أن السؤالين المتطابقين في المعنى قد لا يصلان إلى النموذج في صورة متطابقة من الناحية الحسابية.

اللغة لا تنفصل عن الثقافة
المشكلة لا تتعلق بالبيانات والبنية اللغوية فقط، فبعض الأسئلة تحمل معها سياقا ثقافيا حتى عندما تكون صياغتها بسيطة، ووجدت دراسة قدمت في مؤتمر إيه سي إل 2025 (ACL 2025) ما وصفه الباحثون بالتآزر اللغوي الثقافي، إذ كان أداء النماذج أفضل عندما كان السؤال متوافقا ثقافيا مع اللغة المستخدمة، وتشير الدراسة إلى أن تقييم النموذج لا ينبغي أن يفصل اللغة عن السياق الثقافي المرتبط بها.
وتوصل بحث آخر إلى أن النماذج قد تمتلك معرفة ثقافية محلية، لكنها لا تستحضرها دائما تلقائيا عند الإجابة بلغة معينة، وقد يؤدي إدخال السياق الثقافي صراحة في السؤال إلى تحسين الطابع المحلي للإجابة.
وهنا يمكن أن يظهر اختلاف واضح، فسؤال عن عادة اجتماعية، أو مثل شعبي، أو نظام قانوني، قد يستدعي إجابة مختلفة عندما تتغير اللغة، لأن اللغة نفسها قد توفر للنموذج إشارات ضمنية إلى البلد أو الثقافة المقصودة.
ماذا عن العربية واللغات الأقل تمثيلا؟
تظهر المشكلة بصورة أوضح في اللغات واللهجات التي تملك موارد رقمية أقل، وفي حالة العربية، لا يتعلق الأمر باللغة الفصحى وحدها، بل بالتنوع الكبير في اللهجات والسياقات المحلية.
وتشير ورقة مؤشر نضج تقنيات الذكاء الاصطناعي للغة العربية بلسم (BALSAM) المنشورة ضمن أعمال مؤتمر معالجة اللغة العربية 2025 إلى أن أداء النماذج بالعربية يتأثر بندرة البيانات، والتنوع اللغوي واللهجات، والتعقيد الصرفي، إضافة إلى محدودية أدوات القياس والاختبارات المتخصصة.
كما طورت دراسة أخرى معيار أراديس (AraDiCE) لاختبار قدرات النماذج في اللهجات العربية والوعي الثقافي في مناطق الخليج ومصر وبلاد الشام، في محاولة لمعالجة الفجوة بين العربية الفصحى واللهجات والسياقات الثقافية المختلفة.
وتشير منظمة اليونسكو بدورها إلى أن تقنيات الذكاء الاصطناعي المدربة أساسا على اللغات المهيمنة قد تكون أقل فعالية في بعض اللغات الأفريقية، مؤكدة أن نقص البيانات المحلية لا يؤثر في جودة اللغة فحسب، بل يمكن أن يحد من قدرة الأنظمة على التعامل مع المفاهيم الثقافية المحلية.

هل اختلاف الإجابة يعني وجود تحيز؟
من ناحية أخرى، فإن اختلاف الإجابة بين لغتين لا يعني بالضرورة وجود تحيز، إذ إنه يمكن أن ينتج عن تفاوت البيانات، أو طريقة تقسيم النص، أو الاختلاف في السياق الثقافي، أو حتى طريقة صياغة السؤال. لذلك لا يمكن اعتبار كل اختلاف دليلا مباشرا على تحيز متعمد.
لكن هذه الفوارق قد تنتج تحيزا لغويا فعليا في المخرجات، خصوصا عندما تكون لغة ما ممثلة ببيانات أقل، أو عندما تكون الاختبارات المستخدمة لقياس النموذج مركزة على اللغات الأكثر انتشارا.
ولهذا تتجه أبحاث حديثة إلى اختبار النماذج في لغات وثقافات متعددة، بدل الاكتفاء بقياس أدائها باللغة الإنجليزية، فالمشكلة لم تعد فقط في هل يفهم النموذج اللغة؟، وإنما أيضا في هل يفهم السؤال ضمن السياق الثقافي واللغوي الذي نشأ فيه؟
وفي النهاية، يقول الخبراء إن اختلاف الإجابات بين اللغات يكشف أن النموذج لا يستخرج معلومة ثابتة من قاعدة بيانات واحدة، بل يبني إجابته اعتمادا على تمثيلات لغوية وثقافية تشكلت خلال التدريب. وكلما اختلفت اللغة والسياق والبيانات المتاحة، تغيرت الطريقة التي يمكن أن يصل بها النموذج إلى الإجابة.


