تجريبي هذا الموقع في نسخة تجريبية. لا نزال نضيف المعلومات ونراجعها.
نظرة عامة على ورشة العمل
نظرة معمّقة. مكمّلة لصفحة كيف يعمل الذكاء الاصطناعي.

أي نموذج ذكاء اصطناعي تستخدمه

روبوت الدردشة الذي أمامك على الشاشة هو نموذج واحد بعينه، ومعظم الأدوات الآن تتيح لك عدة نماذج. القائمة التي تقول سريع، أو تفكير، أو رقم إصدار، تُغيّر ما تُتقنه الأداة، والوقت الذي تستغرقه، وتكلفتها، ومقدار الثقة التي تستحقها إجابتها. أربعة فروق تُغطّي تقريبًا كل ما يحتاجه الممارس. الأسماء في تلك القائمة ستستمر في التغيّر كل بضعة أشهر. هذه الفروق الأربعة لن تتغيّر.

نشاط البداية

دقّقوا في الأداة الموجودة أمامكم الآن

  1. افتحوا أداة الذكاء الاصطناعي التي تستخدمونها فعلا. ابحثوا عن قائمة النماذج ودوّنوا اسم النموذج ورقم إصداره بدقة.
  2. تأكدوا من الخطة التي أنتم مشتركون فيها، وهل هي النسخة المجانية.
  3. تحققوا من إعداد البيانات: هل تذكر الشركة أن محادثاتكم تُستخدم لتدريب النموذج؟ املأوا سطرا واحدا لكل شخص واحتفظوا بالجدول.

قبل اليوم، هل كنتم قادرين على الإجابة عن هذه الأسئلة الثلاثة عن الأداة التي تستخدمونها كل يوم؟

الفرق الأول

النماذج السريعة ونماذج التفكير

كل نموذج يكتب بالطريقة نفسها، كلمة أو جزءًا من كلمة في كل مرة. ما يختلف هو ما إذا كان يقوم بأي عمل قبل أن يبدأ بالكتابة.

طريقتان للإجابة

ما الذي يحدث بعد أن تضغط إرسال

النموذج السريع
? A

يبدأ الكتابة فورًا. مناسب للمسودات، والنبرة، والنصوص التي زوّدته بها بنفسك.

نموذج التفكير
? A

يكتب خطوات وسيطة مخفية أولاً، ثم يُجيب. أبطأ، وأفضل في القواعد والمقارنات.

نموذج التفكير يقضي وقته الإضافي قبل ظهور أول كلمة. الخطوات التي يُظهرها لك بعد ذلك هي روايته الخاصة عن الإجابة، وهذه الرواية قد تُغفل ما دفعه فعليًا إلى إجابته.
الافتراضي هو النموذج السريع

ما لم تختر غير ذلك، تمنحك الأداة نموذجًا صغيرًا وسريعًا ومنخفض التكلفة، لأن معظم الأسئلة لا تحتاج إلى أكثر من ذلك. يبدأ بالكتابة فورًا. عند إعادة صياغة بريد إلكتروني، أو تقصير فقرة، أو تلخيص مستند لصقته في الأداة، تستحق هذه السرعة أن تُستخدم والجودة تكون كافية.

نموذج التفكير (reasoning model) يحل المسألة أولاً

النماذج التي تحمل تصنيف الاستدلال أو التفكير تكتب سلسلة من الخطوات الوسيطة قبل أن تُظهر لك أي شيء. العمل خطوة بخطوة يحسّن الدقة بشكل ملحوظ في المسائل التي تتطلب عدة خطوات (Wei وزملاؤه، 2022)، وهذا بالضبط ما تكون عليه قاعدة أهلية تتضمن ثلاثة شروط، أو مقارنة بين مستندين. هذه النماذج أبطأ، أحيانًا بمقدار دقيقة كاملة، وتكلفة تشغيلها أعلى.

التفكير ليس تحققًا

الخطوات التي يُظهرها لك النموذج ليست سجلاً حقيقيًا لكيفية وصوله إلى الإجابة. زرع باحثون تلميحًا داخل الطلب غيّر إجابة النموذج، فكتب النموذج بعدها تفسيرًا واثقًا خطوة بخطوة لم يذكر التلميح إطلاقًا (Turpin وزملاؤه، 2023). نموذج التفكير يرتكب أخطاء غير مقصودة أقل. لكنه ما زال قادرًا على أن يكون واثقًا ومخطئًا في آن واحد، وعليك دائمًا التحقق من أي شيء ستتصرف بناءً عليه.

متى يستحق الانتظار

استخدم نموذج التفكير حين يكون الخطأ مكلفًا لعميلك، أو حين يتضمن السؤال أكثر من شرط واحد، أو حين تريد من الأداة أن تراجع عملاً بدلاً من أن تُنتجه. النموذج السريع يكفي للنبرة، وللمسودات، وللنصوص التي كنت ستقرأها بعناية على أي حال.

انتبه إلى أي وضع أنت فيه قبل أن تطرح سؤالاً مهمًا. تسليم سؤال صعب إلى النموذج السريع هو الطريقة التي ينتهي بها معظم الممارسين بإجابة واثقة لكنها سطحية.

الفرق الثاني

حجم النموذج ومعاملاته

تُوصف النماذج بحجمها، وعادة بعدد المعاملات (parameters) مثل 8B أو 70B أو 400B. هذا الرقم يستحق أن تفهمه، ويستحق أيضًا أن تفهم ما لا يخبرك به.

ما الذي يُحدد القدرة

ثلاثة مدخلات، نموذج واحد

بيانات التدريب الحوسبة المعاملات مدى قدرة النموذج
رفع واحد منها وحده يُهدر الاثنين الآخرين
القدرة تنبع من الثلاثة معًا. المختبرات المغلقة لا تنشر أيًا منها، لذا فإن الادعاء بأن نموذجًا أكبر أو أفضل تدريبًا من آخر يبقى في معظم الأحيان غير قابل للتحقق من الخارج.
أين يعمل

مركز بيانات، أو حاسوب محمول، أو هاتف

كبير، في مركز بياناتالأقوى، والأوسع تغطيةً للغات. نصّك يسافر إلى الشركة التي تُشغّله.
متوسط الحجم، الافتراضي اليوميما تمنحك إياه معظم روبوتات الدردشة أولاً. سريع، وكافٍ للمسودات.
صغير، على جهازك الخاصيعمل دون اتصال بالإنترنت، والنص يبقى على الجهاز، وهو الأضعف في لغات عملائك.
الحجم يحدد أين يمكن للنموذج أن يعمل، وبالتالي إلى أي مدى يسافر نصّك. أقوى النماذج هي تلك التي لا تستطيع استضافتها بنفسك، والنماذج التي تستطيع استضافتها بنفسك هي الأضعف في اللغات التي يتحدثها عملاؤك.
المعامل مؤشر داخلي

يضبط التدريب مليارات الأرقام الداخلية إلى أن يتطابق تخمين النموذج للكلمة التالية مع النص الذي يتعلم منه. هذه الأرقام هي المعاملات، وهي كل ما يحتفظ به النموذج. عدّها، 8 مليار أو 400 مليار، يقيس مقدار النمط الذي يستطيع النموذج استيعابه. إنه ليس عددًا للحقائق، لأن النموذج لا يخزّن أي حقائق.

البيانات والحوسبة والحجم تعمل معًا

ثلاثة مدخلات تُحدد مدى قدرة النموذج: كمية النص الذي تعلّم منه، وكمية الحوسبة التي استُخدمت في تدريبه، وعدد معاملاته. تتحسن الجودة تدريجيًا مع الثلاثة معًا، ورفع واحد منها وحده يُهدر الاثنين الآخرين (Kaplan وزملاؤه، 2020). درِّب نموذجًا كبيرًا على نص قليل جدًا وسيتفوق عليه نموذج أصغر دُرِّب على نص أكثر (Hoffmann وزملاؤه، 2022). الشركات التي تبيع نماذج مغلقة لا تنشر أيًا من هذه المدخلات الثلاثة، لذا حتى الادعاء بأن نموذجًا أكبر من آخر لا يمكن عادة التحقق منه من الخارج.

النماذج الكبيرة والنماذج الصغيرة

النموذج اللغوي الكبير (large language model)، بمئات المليارات من المعاملات، يعمل في مركز بيانات (data center) ويصلك عبر الإنترنت. النموذج اللغوي الصغير (small language model)، ببضعة مليارات من المعاملات، يعمل على حاسوب محمول أو هاتف دون أي اتصال بالإنترنت إطلاقًا. النماذج الصغيرة رخيصة وسريعة وخاصة، وهي في المقابل محدودة بشكل ملحوظ. كلا النوعين يُبنى اليوم عن قصد، لمهام مختلفة.

النموذج الصغير يمكن أن يتخصص

النموذج الصغير لن يكون جيدًا في كل شيء. لكن إذا دُرِّب أكثر على مهمة واحدة ضيقة، فبإمكانه أن يُضاهي نموذجًا عامًا أكبر بكثير في تلك المهمة تحديدًا، ويمكن استخدام نموذج كبير لتعليم نموذج صغير، بأسلوب يُسمى التقطير (distillation) (Hinton وزملاؤه، 2015). لن يُعمِّم هذا النموذج قدراته خارج نطاقه. لكن داخل ذلك النطاق، يُنجز العمل غالبًا بجزء يسير من الحوسبة والكهرباء، وهو أمر مهم للتكلفة وللأثر البيئي.

الحجم يظهر أولاً في لغات عملائك

الأدوات التي تُقطّع النص إلى وحدات (tokenizers) تقسّم الإنجليزية إلى عدد قليل من القطع، بينما تُقسّم كثيرًا من اللغات الأخرى إلى قطع أكثر بكثير، حتى خمسة أضعاف لنفس المحتوى، فيصبح الطلب نفسه أعلى تكلفة، وأبطأ تشغيلاً، ويملأ ذاكرة عمل النموذج بسرعة أكبر في لغات عملائك (Ahia وزملاؤه، 2023). قلّص حجم النموذج وستكون اللغات التي رآها أقل هي أول من يتأثر. النموذج الصغير الذي يقرأ الإنجليزية جيدًا غالبًا ما يكون أضعف بوضوح في الفيتنامية أو الأمهرية أو الكريولية الهايتية.

الحجم يخبرك بما يستطيع النموذج استيعابه وأين يمكنه العمل. لكنه لا يخبرك بشيء عن صحة إجابة بعينها.

الفرق الثالث

النماذج المفتوحة والنماذج المغلقة

هذا الفرق يتعلق بمن يملك النموذج وما إذا كان بإمكان أي شخص خارج الشركة تشغيله.

ترتيبان

السحابة المغلقة والأوزان المفتوحة

نموذج مغلق، في سحابة الشركة

نصّك يذهب إلى الشركة وتعود منها إجابة. عادة ما تكون هذه أقوى النماذج وأوسعها تغطيةً للغات. الشركة هي من تضع الشروط، وتحتفظ بالنموذج، ويمكنها تغييره دون إخبارك.

أوزان مفتوحة، على أجهزة تتحكم بها أنت

تُنزّل النموذج وتشغّله بنفسك. يمكن للنص أن يبقى على الجهاز. هذا يكلّف أجهزة وإعدادًا ووقت موظفين، والنماذج التي يمكنك تشغيلها فعليًا أصغر وأضعف.

الترتيب الذي يحمي نص العميل أكثر من غيره هو نفسه الذي يُجيب بأسوأ شكل في لغات عملائك. معظم المؤسسات تنتهي إلى استخدام أداة مغلقة مع قاعدة مكتوبة عمّا يمكن كتابته فيها.
النموذج المغلق (closed model) وصول مستأجر

أشهر المساعدين هي نماذج مغلقة. تحتفظ الشركة بالمعاملات المدرَّبة، وتصل أنت إلى النموذج عبر تطبيقها أو واجهتها البرمجية (API). لا يمكنك فحصه، ولا تشغيله بنفسك، ولا الاحتفاظ به حين تُغيّره الشركة أو تُوقفه. كما أن الشركة غير ملزمة بإخبارك بما دُرِّب عليه النموذج، أو بحجمه، أو بما تغيّر في آخر تحديث، وهي في الغالب لا تفعل. نصّك يذهب إلى خوادمها ليُجاب عليه هناك.

النموذج مفتوح الأوزان (open weights) يمكن تنزيله

تنشر شركات أخرى المعاملات المدرَّبة، فيستطيع أي شخص تنزيل النموذج وتشغيله على حاسوبه الخاص أو على خادم مؤسسته. هذا هو السبب في أن حاسوبًا محمولاً بلا اتصال بالإنترنت يستطيع أن يُجيبك، والسبب في أن مزوّدًا صغيرًا يستطيع بناء منتج دون استئجار نموذج من أحد.

الأوزان المفتوحة ليست مصدرًا مفتوحًا (open source)

الأوزان المنشورة هي الأرقام النهائية فقط. بيانات التدريب (training data) والشفرة البرمجية التي أنتجتها تبقى عادة خاصة، فلا يستطيع أحد من الخارج دراسة النموذج أو إعادة بنائه، ومبادرة المصدر المفتوح (Open Source Initiative) تحصر مصطلح مصدر مفتوح في النماذج التي تنشر ما يكفي للقيام بذلك (Open Source Initiative, 2024). التراخيص تختلف أيضًا. بعض النماذج مفتوحة الأوزان تحمل تراخيص تساهلية معيارية، وأخرى تحمل شروطًا خاصة تُقيّد من يستطيع استخدامها ولأي غرض. اقرأ الترخيص قبل أن تبني مؤسستك على أحدها.

أين يصل هذا إلى عملائك

النموذج الذي يعمل على أجهزة تتحكم بها مؤسستك هو الترتيب الوحيد الذي لا يغادر فيه نص العميل المبنى إطلاقًا، وهذا سبب حقيقي للاهتمام بالأوزان المفتوحة. لكن من السهل أيضًا المبالغة في هذا الأمر. يمكن بناء تطبيق على نموذج مفتوح ومع ذلك يُرسل كل كلمة إلى خادم سحابي. اسأل إلى أين يذهب النص، واحصل على الإجابة كتابةً.

الانفتاح والانغلاق ليسا ترتيبًا للجودة، وليسا ترتيبًا للأمان. إنهما يحددان من يستطيع تشغيل النموذج وإلى أي مدى يسافر نصك، وهذا سؤال عن عملائك قبل أن يكون سؤالاً عن التقنية.

الفرق الرابع

بيانات التدريب وتواريخ التوقف

نموذجان بالحجم نفسه يمكن أن يتصرفا بشكل مختلف تمامًا. النموذج يتكوّن من النص الذي عُرض عليه ومن الضبط (fine-tuning) الذي أُجري له لاحقًا.

بيانات تدريب لا تستطيع رؤيتها

تعلّمت هذه النماذج من كمية هائلة من نصوص الإنترنت، إلى جانب مواد مرخّصة ومُشتراة. معظم النماذج المغلقة لا تنشر تلك القائمة إطلاقًا، فلا تستطيع التحقق مما إذا كان النموذج قد اطّلع على شيء جيد بشأن القاعدة التي تسأل عنها. نصوص الإنترنت إنجليزية بشكل كثيف وشحيحة في معظم لغات عملائك، ومن هناك تبدأ فجوة اللغة.

تاريخ توقف (cutoff)، وبحث مُضاف إليه

يتوقف التدريب عند تاريخ معين، وتتوقف ذاكرة النموذج المدرَّبة عنده. كثير من الأدوات الآن تُجري بحثًا مباشرًا على الإنترنت لتجاوز ذلك التاريخ، وهذا يساعد وينقل السؤال إلى مكان آخر. الإجابة عندها لا تكون أفضل من الصفحات التي صادف أن جلبتها الأداة، لذا اسأل ما المصادر التي استخدمتها وافتحها بنفسك.

المستند الطويل لا يُقرأ بالتساوي

الحقيقة الموضوعة في بداية نص طويل أو نهايته تُعثر عليها الأداة بموثوقية أكبر بكثير من الحقيقة نفسها المدفونة في المنتصف، وتنخفض الدقة كلما طال النص (Liu وزملاؤه، 2024). الصق سياسة من أربعين صفحة، واطرح سؤالاً ضيقًا واحدًا، وقد تفوت الإجابة فقرة قرأها النموذج تقنيًا. اقتبس القسم الذي يهمّك بدلاً من تسليم الملف كاملاً.

الضبط الذي يأتي لاحقًا

بمجرد أن يصبح النموذج قادرًا على التنبؤ بالنص، يقوم أشخاص بضبطه عبر تغذية راجعة بشرية كي يتّبع التعليمات، ويُجيب بنبرة معينة، ويرفض طلبات معينة (Ouyang وزملاؤه، 2022). هذه المرحلة، لا الحجم، هي سبب اختلاف نموذجين في أثناء المحادثة. وهي أيضًا تُكافئ الموافقة. المساعدات المدرَّبة بهذه الطريقة تميل إلى مجاراة الرأي الذي يطرحه المستخدم، وتتخلى عن إجابة صحيحة حين يعترض المستخدم عليها (Sharma وزملاؤه، 2024). زوّد النموذج بفرضية خاطئة وتوقّع منه أن يبني عليها.

الإصدارات تتغيّر من تحتك

يُعاد تدريب النماذج وتحديثها، أحيانًا بصمت، والاسم نفسه في القائمة قد يشير إلى آلية مختلفة عمّا كان عليه الشهر الماضي. أعد اختبار أي طلب محفوظ بعد كل تحديث، وأعد النظر أيضًا في الحكم الذي كوّنته حول ما تُتقنه هذه الأداة.

التدريب هو الجزء الذي لا تستطيع فحصه ولا إصلاحه، وهو ما يحدد كيف يتصرف النموذج في الفيتنامية، وفي قاعدة محلية، وفي تغيير سياسي حدث الشهر الماضي. افترض أنه شحيح تحديدًا في المكان الذي يقع فيه عملك.

قاعدة عملية

أي نموذج لأي مهمة

ما الذي تفعله ما الذي تستخدمه إعادة صياغة بريد إلكتروني، تقصير فقرة، تنقيح ملاحظات كتبتها بنفسك النموذج السريع الافتراضي. السرعة هي ما تحتاجه هنا، وأنت قادر على رؤية المُدخل بنفسك. فك قاعدة أهلية معقدة، مقارنة مستندين، التحقق من نموذج بحثًا عن تناقضات نموذج تفكير، ثم التحقق من التفاصيل بمقارنتها بالمصدر الرسمي. مكتب محلي، موعد نهائي، رسم مالي، تغيير حديث في سياسة ما أي نموذج، مع تفعيل البحث على الإنترنت، ثم افتح المصادر التي يستشهد بها. الذاكرة المدرَّبة وحدها لا تكفي. أي شيء بلغة العميل له عواقب فعلية مترجم فوري أو تحريري مؤهل. لا يوجد نموذج، مفتوحًا كان أو مغلقًا، كبيرًا أو صغيرًا، يحل محل ذلك. أي شيء يحمل معلومات تحدد هوية العميل لا أداة سحابية إطلاقًا ما لم توافق عليها مؤسستك كتابةً. أزل معرّفات الهوية أولاً.
صفّان من هذه الصفوف لا يتعلقان بالنماذج إطلاقًا، وهما الصفّان الأكثر خطورة.
من المفيد معرفته
  • الفئة المجانية من أي أداة عادة ما تكون أخف نماذجها. إذا كان السؤال ذا أهمية، تحقق من النموذج الذي تستخدمه فعليًا.
  • النموذج المصنّف بأنه نموذج تفكير ليس نموذجًا يتحقق من الحقائق.
  • منتجان يمكن أن يعملا على النموذج الأساسي نفسه، ومع ذلك يتصرفان بشكل مختلف، لأن الشركة التي تُغلّفه تضيف تعليماتها الخاصة.
  • درجات الاختبارات المعيارية (benchmarks) في إعلانات الإطلاق تُقاس على مهام ليست مهامك، وبلغة ليست على الأرجح لغة عميلك.
  • النموذج المفتوح لا يحمي بيانات العميل بمفرده. الحماية تأتي فقط من تشغيله على أجهزة تتحكم بها أنت، ومعظم التطبيقات المبنية على نماذج مفتوحة لا تفعل ذلك.
جرّب هذا

اكتشف أي نموذج تستخدمه

خذوا خمس دقائق، واطلب من الجميع فتح قائمة النماذج في أداة الذكاء الاصطناعي التي يستخدمونها فعلاً، ثم كتابة الاسم والإصدار بالضبط. الآن اطرح على المجموعة سؤالاً واحدًا يتضمن قاعدة، مثل شيء له حد دخل وموعد نهائي. نصف الحاضرين يسأل النموذج السريع، والنصف الآخر يسأل نموذج التفكير. اقرأوا بضع إجابات بصوت عالٍ. الفرق في مستوى العناية واضح، وواضح أيضًا أن كلا النموذجين ما زالا بحاجة إلى تحقق.

مصادر هذه الصفحة
  1. Ahia, O., Kumar, S., Gonen, H., Kasai, J., Mortensen, D. R., Smith, N. A., & Tsvetkov, Y. (2023). Do all languages cost the same? Tokenization in the era of commercial language models. Proceedings of EMNLP 2023, 9904-9923. https://doi.org/10.18653/v1/2023.emnlp-main.614
  2. Hinton, G., Vinyals, O., & Dean, J. (2015). Distilling the knowledge in a neural network. arXiv:1503.02531. https://arxiv.org/abs/1503.02531
  3. Hoffmann, J., Borgeaud, S., Mensch, A., et al. (2022). Training compute-optimal large language models. Advances in Neural Information Processing Systems 35. https://arxiv.org/abs/2203.15556
  4. Kaplan, J., McCandlish, S., Henighan, T., et al. (2020). Scaling laws for neural language models. arXiv:2001.08361. https://arxiv.org/abs/2001.08361
  5. Liu, N. F., Lin, K., Hewitt, J., Paranjape, A., Bevilacqua, M., Petroni, F., & Liang, P. (2024). Lost in the middle: How language models use long contexts. Transactions of the Association for Computational Linguistics, 12, 157-173. https://doi.org/10.1162/tacl_a_00638
  6. Open Source Initiative. (2024). The Open Source AI Definition 1.0. https://opensource.org/ai/open-source-ai-definition
  7. Ouyang, L., Wu, J., Jiang, X., et al. (2022). Training language models to follow instructions with human feedback. Advances in Neural Information Processing Systems 35. https://arxiv.org/abs/2203.02155
  8. Sharma, M., Tong, M., Korbak, T., et al. (2024). Towards understanding sycophancy in language models. International Conference on Learning Representations (ICLR) 2024. https://arxiv.org/abs/2310.13548
  9. Turpin, M., Michael, J., Perez, E., & Bowman, S. R. (2023). Language models don't always say what they think: Unfaithful explanations in chain-of-thought prompting. Advances in Neural Information Processing Systems 36. https://arxiv.org/abs/2305.04388
  10. Vaswani, A., Shazeer, N., Parmar, N., et al. (2017). Attention is all you need. Advances in Neural Information Processing Systems 30. https://arxiv.org/abs/1706.03762
  11. Wei, J., Wang, X., Schuurmans, D., et al. (2022). Chain-of-thought prompting elicits reasoning in large language models. Advances in Neural Information Processing Systems 35. https://arxiv.org/abs/2201.11903