ينبغي تقييم نظام التوليد المعزز بالاسترجاع بوصفه مفاضلة: إذ تُظهر الأدلة البحثية أن الاسترجاع يمكن أن يحسن الدقة واكتمال البيانات الوصفية، مع تقليص الشمول. يشرح هذا الدرس التقني كيفية تحويل هذه النتيجة إلى خطة قابلة للدفاع عنها لتقييم قاعدة المعرفة.
لماذا يعد هذا درسًا تقنيًا حول التقييم، وليس دليلًا لإعداد منتج مورّد
غالبًا ما يوصف التوليد المعزز بالاسترجاع، الذي يُختصر عادةً إلى RAG، بوصفه وصفة مباشرة: استرجع المقاطع ذات الصلة، وأضفها إلى موجّه نموذج اللغة، ثم توقّع إجابات أكثر موثوقية. لكن هذا الوصف غير مكتمل. فالأدلة الموثقة المتاحة لا تدعم الادعاء بأن RAG يحسن كل بُعد من أبعاد الجودة، أو كل مهمة، أو كل نموذج.
تقارن ورقة بحثية صدرت في يونيو ٢٠٢٥ بعنوان Reasoning with RAGged events: RAG-Enhanced Event Knowledge Base Construction and reasoning with proof-assistants بين التوليد المباشر، وتعزيز الرسم البياني المعرفي، وRAG لاستخراج أحداث تاريخية منظمة من نصوص سردية. وتستخدم دراستها التطبيقية الفصول العشرة الأولى من ثوسيديديس، وتقيّم عدة نماذج لغوية كبيرة، بما فيها GPT-٤ وClaude وLlama ٣.٢.
والدرس المهم للفرق التي تخطط لقاعدة معرفة ليس أن بنية واحدة تفوقت عالميًا. إذ تبيّن الورقة أن استراتيجيات التعزيز تحسن أبعاد أداء مختلفة. فقد رجّح التوليد المباشر التغطية والشمول التاريخي مع Claude وGPT-٤. وحسّن RAG الدقة ودقة الإحداثيات واكتمال البيانات الوصفية، لكنه قلّص الشمول. وبعبارة أخرى، قد يساعد الاسترجاع النظام على تقديم تفاصيل أدق وأفضل إسنادًا، لكنه قد يتسبب أيضًا في إغفال أحداث أو حقائق ذات صلة قد يكشفها نهج أكثر شمولًا.
هذه نتيجة عملية على مستوى الهندسة. لا ينبغي لفريق قاعدة المعرفة أن يبدأ بالسؤال: «أي حزمة RAG ينبغي أن ننشر؟» بل السؤال الأول الأفضل هو: «أي إخفاق هو الأهم في حالة الاستخدام هذه: عدم الدقة، أم نقص التغطية، أم البيانات الوصفية غير المكتملة، أم السلوك غير المتسق؟» وينبغي أن تشكل إجابتك التقييم وسياسة الاسترجاع والمفاضلات المقبولة.
ما الذي تثبته الأبحاث الموثقة
تبحث الدراسة المهمة الصعبة المتمثلة في استخراج تمثيلات منظمة للأحداث التاريخية من المصادر السردية. فالإنشاء اليدوي مكلف، ويقارن المؤلفون ثلاثة نهوج: التوليد الأساسي الخالص أو المباشر، وتعزيز الرسم البياني المعرفي، والتوليد المعزز بالاسترجاع. كما يتناول العمل قيود الاستدلال في RDF/OWL عبر تحويل مخرجات RDF إلى مواصفات مساعد الإثبات Coq لإجراء تحليل زمني ودلالي أعمق.
بالنسبة إلى قاعدة معرفة إنتاجية، تتعلق الأدلة الأكثر قابلية للنقل بانضباط التقييم. إذ تبيّن الدراسة أن RAG ليس بديلًا شاملًا للتوليد المباشر للنموذج. وتعتمد قيمته على ما يقيسه الفريق. فعندما تكون الدقة ودقة الإحداثيات واكتمال البيانات الوصفية مهمة بوجه خاص، يمكن أن يكون الاسترجاع مفيدًا. وعندما يكون الاستخراج الشامل والاتساع أكثر أهمية، فقد يتمتع نهج التوليد المباشر بميزة.
وتحدد الورقة أيضًا سلوكًا يعتمد على النموذج. فقد أظهرت النماذج الأكبر أداءً أساسيًا متينًا مع فوائد تدريجية من RAG. في حين أظهر Llama ٣.٢ تباينًا أكبر بكثير، تراوح بين نتائج تنافسية وأخرى كارثية. وهذا يعني أنه لا يمكن فصل قرار البنية بأمان عن تقييم النموذج. فقد يتصرف مسار استرجاع يبدو فعالًا مع نموذج ما بطريقة مختلفة جدًا مع نموذج آخر.
ينبغي أن تغيّر هذه النتائج طريقة تأطير المؤسسة لمفهوم «الإسناد إلى المصادر». إذ يمكن للمادة المسترجعة أن تحسن دقة النظام، لكن الاسترجاع يقيّد أيضًا ما يراه النموذج. فإذا كانت الأدلة المسترجعة ضيقة أو غير مكتملة أو سيئة المواءمة مع المهمة، فقد تصبح المخرجات النهائية ضيقة كذلك. وقد يفوّت النظام الذي يقيس فقط ما إذا كانت الإجابة تتضمن استشهادًا هذا الإشكال بالكامل.
الخطوة ١: عرّف مهمة المعرفة قبل اختيار البنية
ابدأ بكتابة تعريف للمهمة في صفحة واحدة. حدّد المادة المدخلة والمخرجات المطلوبة والمستخدمين وتكلفة الأخطاء. يختلف سير عمل استخراج الأحداث التاريخية عن مساعد للسياسات الداخلية، لكن كليهما يحتاج إلى تعريف صريح للنجاح.
- المدخلات: ما المادة المصدرية التي سيستخدمها النظام؟ عرّف مجموعة الوثائق وحدودها.
- المخرجات: هل النتيجة المتوقعة إجابة موجزة، أم سجلًا منظمًا، أم مجموعة من الحقائق المستخرجة، أم مجموعة مرتبة من المقاطع؟
- التغطية: هل يجب على النظام تحديد جميع الحقائق ذات الصلة، أم فقط الحقائق الأكثر دعمًا بالأدلة؟
- الدقة: ما تكلفة حقيقة خاطئة، أو تاريخ خاطئ، أو كيان خاطئ، أو سمة خاطئة؟
- البيانات الوصفية: ما الحقول التي يجب أن تكون مكتملة وصحيحة لكي تكون النتيجة مفيدة؟
- المراجعة البشرية: ما المخرجات التي تتطلب تحققًا من خبير قبل اتخاذ إجراء بناءً عليها؟
تمنع هذه الخطوة خطأً يمكن تجنبه: تقييم النظام وفق المقياس الأسهل جمعًا بدلًا من المقياس الذي يعكس قيمة المستخدم. فقد تعطي قاعدة معرفة موجهة للامتثال الأولوية للأدلة الدقيقة وإسناد المصدر الكامل. أما مساعد البحث الاستكشافي فقد يقيّم الشمول بدلًا من ذلك، لأن تفويت مصدر ذي صلة قد يكون أكثر ضررًا من إرجاع عدة مرشحين للمراجعة البشرية.
دوّن المفاضلة صراحةً. على سبيل المثال: «نقبل عددًا أقل من العناصر المعادة إذا كان كل عنصر دقيقًا ويحمل بيانات وصفية مكتملة»، أو «نقبل دقة أقل في المرحلة الأولى لأن المراجعين يحتاجون إلى اكتشاف واسع للمرشحين». يصبح هذا البيان المعيار الذي تُقارن على أساسه حلول RAG والتوليد المباشر والنهوج الأخرى.
الخطوة ٢: أنشئ مجموعة تقييم تمثل العمل الفعلي
لا تقيّم قاعدة معرفة باستخدام حفنة من الأسئلة المنتقاة يدويًا التي تصادف أنها تنتج إجابات مثيرة للإعجاب. ابنِ مجموعة تقييم ثابتة من مادة مصدرية ممثلة واحتياجات مستخدمين ممثلة. ويوضح استخدام الدراسة لمتن محدد، هو الفصول العشرة الأولى من ثوسيديديس، أهمية ضبط قاعدة الأدلة قبل مقارنة الاستراتيجيات.
ينبغي أن يتضمن كل مثال تقييم مدخلًا مصدريًا ومخرجًا متوقعًا أو مرجعًا خضع للمراجعة، والأبعاد التي سيُحكم عليه وفقًا لها. وفي مهمة استخراج، يمكن أن يحتوي السجل على وصف حدث وكيانات ومعلومات زمنية ومواقع أو إحداثيات عند الاقتضاء، والبيانات الوصفية المطلوبة. وفي مهمة سؤال وجواب، يمكن أن يتضمن السؤال والأدلة التي تدعم إجابة صحيحة والحقائق الأساسية التي يجب أن تظهر والحقائق التي يجب عدم اختلاقها.
افصل الأمثلة إلى فئات ذات معنى. ضمّن حالات مباشرة ذات أدلة واضحة، وحالات صعبة ذات أدلة متفرقة، وحالات ملتبسة، وأمثلة لا يحتوي فيها المصدر على معلومات كافية. يمنع ذلك النظام من الظهور بمظهر الموثوق لمجرد أن التقييم يتضمن مادة سهلة على نحو غير معتاد.
استخدم مجموعة التقييم نفسها في جميع النهوج المقارنة. فإذا استخدم مرشح التوليد المباشر واستخدم آخر RAG، فيجب أن يتلقيا مدخلات المهمة نفسها وأن يُحكم عليهما بالمعايير ذاتها. وإلا فقد تكون المكاسب الظاهرية للبنية في الواقع فروقًا في صياغة الموجّه أو اختيار المصدر أو توقعات المقيّم.
الخطوة ٣: قِس الدقة والشمول على نحو منفصل
تجعل الأبحاث الموثقة هذا الفصل ضروريًا. فالدقة والشمول ليسا مقياسين قابلين للتبادل للنجاح؛ إذ يمكن للنظام أن يحسن أحدهما مع الإضرار بالآخر.
الدقة تسأل عما إذا كانت الحقائق المعادة صحيحة. وفي استخراج الأحداث المنظم، يمكن أن يشمل ذلك ما إذا كان الحدث أو الكيان أو التاريخ أو الإحداثي أو العلاقة يطابق المصدر والمرجع المراجع. وبالنسبة إلى مساعد المعرفة، يمكن أن يشمل ذلك ما إذا كانت الإجابة لا تقدم إلا ادعاءات تدعمها المادة المتاحة.
الشمول يسأل عما إذا كان النظام يلتقط النطاق ذي الصلة من المعلومات. ففي الورقة، رجّح التوليد المباشر التغطية والشمول التاريخي، بينما حسّن RAG الدقة لكنه قلّص الشمول. وبالنسبة إلى قاعدة معرفة للأعمال، قد يعني إخفاق الشمول إغفال استثناء ذي صلة، أو بند سياسة ثانٍ قابل للتطبيق، أو حدث مرتبط يغير فهم المستخدم.
اكتمال البيانات الوصفية يقيس ما إذا كانت الحقول اللازمة لاستخدام مخرج أو تصفيته أو مراجعته أو التحقق من صحته موجودة. وتفيد الدراسة بوجود ميزة لـ RAG في اكتمال البيانات الوصفية. ويمكن أن يكون ذلك مهمًا بقدر أهمية النص نفسه عندما تعتمد الأنظمة اللاحقة على سجلات منظمة.
اعرض هذه الأبعاد جنبًا إلى جنب. وتجنب اختزالها في درجة رئيسية واحدة ما لم يفهم أصحاب المصلحة بدقة كيفية وزن تلك الدرجة للإيجابيات الكاذبة وحالات الإغفال والسجلات غير المكتملة. إذ يمكن لرقم واحد أن يخفي مشكلة تشغيلية خطيرة: فقد يكون النظام دقيقًا لأنه يعيد القليل جدًا، أو شاملًا لأنه يعيد كثيرًا من المرشحين ضعيفي الدعم بالأدلة.
الخطوة ٤: نفّذ تجارب قابلة للمقارنة للتوليد المباشر والمعزز بالاسترجاع والمعزز بالرسم البياني
يقارن البحث ثلاث استراتيجيات: التوليد المباشر، وتعزيز الرسم البياني المعرفي، وRAG. وقد لا تحتاج إلى الاستراتيجيات الثلاث كلها في كل مشروع، لكن منطق المقارنة ذو قيمة. حافظ على استقرار تعريف المهمة ومجموعة التقييم، مع تغيير استراتيجية واحدة في كل مرة.
في تجربة التوليد المباشر، يعمل النموذج انطلاقًا من مدخل المهمة دون خطوة الاسترجاع المضافة. وقد يكشف هذا النهج مقدار التغطية والاستخراج الواسع الذي يستطيع النموذج تحقيقه بمفرده. وفي تجربة RAG، يتلقى النموذج مادة مسترجعة يُفترض أن تدعم المهمة. قيّم ما إذا كانت الدقة واكتمال البيانات الوصفية يتحسنان، وافحص ما إذا كان الشمول ينخفض. وفي تجربة معززة بالرسم البياني المعرفي، قيّم ما إذا كانت العلاقات المنظمة تحسن الخصائص المهمة لمهمتك.
سجّل الإخفاقات، لا الدرجات الإجمالية فقط. فعندما يفوّت RAG معلومات، حدّد ما إذا كانت المشكلة نشأت لأن المادة لم تُسترجع، أو لأن السياق المسترجع أزاح مقطعًا آخر ذا صلة، أو لأن النموذج أخفق في استخدام الأدلة المتاحة. وعندما ينتج التوليد المباشر حقيقة غير صحيحة، حدّد ما إذا كان ذلك تجاوزًا مدفوعًا بالتغطية، أو التباسًا في المصدر، أو إخفاقًا في اتباع مخطط الاستخراج.
تحوّل هذه المراجعة التقييم من مسابقة بين تسميات إلى مصدر لقرارات التصميم. فإذا حسّن الاسترجاع دقة التواريخ والبيانات الوصفية لكنه فوّت أحداثًا كثيرة جدًا، فقد يكون مناسبًا بوصفه طبقة تحقق بدلًا من كونه مسار التوليد الوحيد. وإذا كان التوليد المباشر واسعًا لكنه غير دقيق بالقدر الكافي، فقد يكون مفيدًا لاكتشاف المرشحين يتبعه تحقق بشري أو منظم.
الخطوة ٥: اختبر أكثر من نموذج واحد
تمثل نتائج الورقة بشأن النماذج تحذيرًا من افتراضات البنية. فقد أظهرت النماذج الأكبر في الدراسة أداءً أساسيًا مستقرًا مع مكاسب تدريجية من RAG، بينما أظهر Llama ٣.٢ تباينًا شديدًا. والدلالة واضحة: لا تدّعِ أن استراتيجية استرجاع متينة بعد اختبارها باستخدام نموذج واحد فقط.
لكل نموذج مرشح، شغّل مجموعة التقييم الثابتة نفسها، وقارن الدقة والشمول واكتمال البيانات الوصفية وأنماط الإخفاق. واحتفظ بسجلات للموجّهات والمواد المسترجعة وتنسيق المخرجات وقرارات المقيّمين حتى يمكن التحقيق في الفروق. فقد يبدو النموذج ممتازًا في المتوسط، لكنه قد يظل لديه نمط إخفاق غير مقبول في فئة عالية المخاطر.
لذلك، ينبغي أن يتبع اختيار النموذج الأدلة المستمدة من مهمتك، لا الافتراضات حول اسم النموذج أو شعبية إطار استرجاع ما. تشمل الدراسة الموثقة GPT-٤ وClaude وLlama ٣.٢، لكنها لا تثبت ترتيبًا عالميًا بينها لكل أعباء عمل قواعد المعرفة. بل تثبت أن الحساسية للتعزيز تختلف باختلاف النموذج، وأن النتائج يجب قياسها.
الخطوة ٦: اتخذ قرار النشر انطلاقًا من المفاضلة
بعد التقييم، وثّق القرار بلغة تشغيلية. فإذا كان المطلب هو دقة عالية وبيانات وصفية مكتملة، تشير الأدلة إلى أن RAG قد يكون مرشحًا قويًا، بشرط أن يقبل الفريق احتمال تقليص الشمول ويراقبه. وإذا كان المطلب هو استخراج واسع من مادة سردية، فقد يستحق التوليد المباشر دراسة جادة، ولا سيما في الحالات التي وجدت فيها الدراسة أنه مناسب للتغطية مع Claude وGPT-٤.
يمكن لعملية نشر ناضجة أن تستخدم أيضًا سير عمل مرحليًا. إذ يمكن لمرور أول واسع أن يحدد المرشحين، بينما تستطيع مرحلة مدعومة بالاسترجاع التحقق من الحقول الدقيقة واستكمال البيانات الوصفية المطلوبة. وليس هذا ادعاءً بأن كل نظام مرحلي سيتفوق على نهج واحد؛ بل هو فرضية تقييم يجب اختبارها بالصرامة نفسها المطبقة على البدائل الأصلية.
حدّد معايير الإصدار قبل الإطلاق. وتشمل الأمثلة حدًا أدنى لمستوى الدقة بعد المراجعة، ومعدل إغفال أقصى مقبول للمعلومات الحرجة، ومعدلًا مطلوبًا لاكتمال البيانات الوصفية. وأعد تشغيل التقييم كلما تغير متن المصادر، أو النموذج، أو طريقة الاسترجاع، أو الموجّه، أو مخطط المخرجات. فنتيجة البحث ليست معيارًا مرجعيًا لمرة واحدة؛ بل تذكير بأن الجودة تعتمد على التفاعل بين المهمة والاستراتيجية والنموذج.
الخلاصة الرئيسية
لا ينبغي تسويق RAG أو تقييمه بوصفه ترقية تلقائية. فالأدلة الموثقة تُظهر مفاضلة ذات معنى: يمكن لـ RAG تحسين الدقة ودقة الإحداثيات واكتمال البيانات الوصفية، لكنه قد يقلص الشمول. ويمكن للتوليد المباشر أن يرجّح التغطية، بينما قد تؤثر بنية النموذج تأثيرًا كبيرًا في النتيجة.
ابنِ برنامج قاعدة المعرفة لديك حول هذه الحقيقة. عرّف المهمة، وأنشئ مجموعة تقييم ممثلة، وقِس الدقة والشمول على نحو منفصل، وقارن الاستراتيجيات بإنصاف، واختبر حساسية النموذج، واختر النهج الذي يتوافق مع تكلفة الخطأ في سير عملك الفعلي. فهذا مسار أكثر موثوقية من التعامل مع الاسترجاع بوصفه إجابة شاملة.
المصدر: Chatzikyriakidis, S. (٢٠٢٥)، “Reasoning with RAGged events: RAG-Enhanced Event Knowledge Base Construction and reasoning with proof-assistants,” arXiv:٢٥٠٦.٠٧٠٤٢.