تخطّ إلى المحتوى
جديد: اسأل وكيل المحلّل من Rexfin عن نموذجك، وكل رقم يعود مدعومًا بمصدره.
· 7 دقائق قراءة

كيف تقيس Rexfin جودة الإجابات (بدلًا من مجرد الادّعاء بها)

تُشغِّل Rexfin كل إجابة ذكاء اصطناعي عبر مجموعة اختبارات مُقيَّمة تقيس دقّة الاستشهاد وسلوك الرفض، وتوقف أي إصدار يتراجع فيها.

بقلم The Rexfin team

كل مزوّد ذكاء اصطناعي مالي يقول نسخة من «يمكنك الوثوق بإجاباتنا». لكن قلّة قليلة منهم تستطيع أن تخبرك كيف تعرف ذلك، بخلاف عرض توضيحي سار على ما يرام مرة واحدة. وهذه هي الفجوة التي يتناولها هذا المقال: الفرق بين ادّعاء الموثوقية وقياسها، باستمرار، بطريقة لا يستطيع تحديث سيّئ أن يتسلّل من خلالها بصمت.

الوعد الجوهري لإجابات الذكاء الاصطناعي في Rexfin بسيط في صياغته وصعب في تزييفه: كل ادّعاء رقمي إما مدعوم باستشهاد يثبته فعلًا، أو يرفض الذكاء الاصطناعي الإجابة. ونحن لا نأخذ هذا الوعد على الثقة داخليًا أيضًا. نُشغِّله كاختبار مُقيَّم، تمامًا كما تختبر أي برمجية أخرى يجب أن تتصرّف بشكل صحيح تحت الضغط.

ما الذي يُقيَّم فعلًا

مجموعة الاختبار مكتبة من أسئلة حقيقية طُرحت على قوائم مالية حقيقية ومُدرَجة عمدًا، من النوع الذي قد يطرحه مدير مالي أو محلّل فعلًا، مقسّمة إلى فئات مثل أرقام الميزانية العمومية، والتدفقات النقدية، والنسب، وعمليات البحث في الإفصاحات، وفئة مقصودة من الأسئلة التي لا يجيب عنها البيان فعليًا. وكل سؤال يحمل إجابة صحيحة مُلتقَطة يدويًا: القيمة الصحيحة، والصفحة الدقيقة التي جاءت منها، وبالنسبة للأسئلة التي لا يغطّيها البيان، تأكيد أن الرقم غائب فعلًا، لا صعب الإيجاد فحسب.

كل إجابة ينتجها الذكاء الاصطناعي تُفحَص على أكثر من محور في آنٍ واحد. هل الرقم صحيح؟ هل هو مُستشهَد به، وهل يشير ذلك الاستشهاد فعلًا إلى الدليل الذي يدعمه؟ فرقم صحيح دون استشهاد قابل للتتبّع يُحتسَب فشلًا لا نجاحًا، لأن رقمًا غير مدعوم هو بالضبط نمط الفشل الذي وُجد هذا النظام كله لمنعه. وبالنسبة للأسئلة التي لا إجابة حقيقية لها في البيان، هل رفض الذكاء الاصطناعي بشكل صحيح، أم اخترع رقمًا بثقة؟ وتلك الحالة الأخيرة، رقم مُلفَّق على سؤال كان ينبغي رفضه، تُعامَل كأسوأ نتيجة يمكن أن تكتشفها منظومة الاختبار، لأن ذاك هو الرقم الذي ينتهي به المطاف خاطئًا في حزمة تقارير مجلس الإدارة.

لماذا تُخفي الدرجة المُجمَّعة المشكلة

رقم إجمالي واحد من نوع «دقّة 92%» يمكن أن يُخفي الكثير. فمن الممكن تمامًا أن تحمل عمليات البحث في قائمة الدخل مجموعة الاختبار بأكملها إلى متوسط يبدو مُرضيًا، بينما تؤدي أسئلة التدفقات النقدية، التي تتطلّب جمع عدة أرقام بشكل صحيح، أداءً أسوأ بكثير تحت السطح دون أن يُلاحَظ. لذلك تُعرَض النتائج مُفصَّلة حسب الفئة، لا كرقم واحد فقط، وتُذكَر الفئة الأضعف صراحة بدلًا من إخفائها في متوسط. وهذا مهم عمليًا: فريق عناية واجبة يسأل تحديدًا عن أرقام التدفقات النقدية يحصل على إجابة بخصوص أرقام التدفقات النقدية، لا رقمًا ممزوجًا بأسئلة أسهل.

كما تفحص منظومة الاختبار طبقة أبعد من الأرقام الدقيقة: هل التعليق المحيط بالذكاء الاصطناعي، أي الجمل السردية حول رقم ما لا الرقم نفسه فقط، ينبع فعلًا من الأدلة التي استشهد بها، بدلًا من إضافة ادّعاء غير مدعوم بلغة واثقة. وهذا نمط الفشل الأكثر عرضة له ميزات «رؤى الذكاء الاصطناعي» عند المنافسين، لأن ادّعاءً سرديًا لا يفشل بصوت عالٍ كما يفشل رقم خاطئ.

يعمل مع كل تغيير، لا مرة واحدة فقط

الهدف من قياس هذا ليس تقريرًا لمرة واحدة يوضع في عرض تقديمي. إنه مدمج في العملية نفسها التي تُصدِر تغييرات المنتج: أي تعديل على الاسترجاع، أو المحفّزات، أو النموذج الأساسي، يجب أن يُشغَّل مقابل مجموعة الاختبار هذه قبل أن يُدمَج، وإن انخفضت دقّة الاستشهاد أو صحّة الرفض عن حدّ مُتَّفق عليه، لا يُصدَر ذلك التغيير. وأي إعادة كتابة تجعل الذكاء الاصطناعي بصمت أقل استعدادًا للرفض، مستبدلة «لا أملك ذلك» الآمنة بتخمين واثق، تُكتشَف هنا قبل أن تصل إلى حزمة تقارير أي شخص، لا بعد ذلك.

الحدود الصادقة

هذا لا يعني أن الذكاء الاصطناعي لا يخطئ أبدًا؛ إنه يعني أن الأخطاء تُقاس، وتُتابَع حسب الفئة، وأي تراجع يُكتشَف قبل الإصدار بدلًا من أن يكتشفه عميل. كما يعتمد الأمر على بقاء مجموعة الاختبار مؤسَّسة على بيانات حقيقية وأرقام غائبة فعليًا، وهو انضباط قائم بذاته؛ راجع مخزن الذرّات المرجعي لمعرفة كيف تبقى الحقائق الأساسية مرتبطة بالمستندات المصدرية من الأساس، والمعايرة وضبط الثقة لمعرفة كيف يحكم النهج نفسه القائم على القياس والأدلة موعد السماح لفحص ما بإيقاف تصدير.

الخلاصة

«ثِق بذكائنا الاصطناعي» مجرد جملة. أما منظومة اختبار تقيس دقّة الاستشهاد وسلوك الرفض مع كل تغيير، وتوقف إصدارًا يتراجع في أي منهما، فهي دليل. وإن أردت أن ترى ما يحدث حين تُحفَظ أدلة إجابة وحكمها لوقت لاحق، اقرأ سجلّ تدقيق الإجابات، أو توجَّه إلى مركز داخل منصّة Rexfin لمعرفة كيف يتناسق كل ذلك.

جزء من داخل منصّة Rexfin: كيف تعمل آلية الثقة

تابع القراءة

احجز عرضًا توضيحيًا

شاهد أرقامك وهي تتوازن.

احجز عرضًا توضيحيًا مدته 30 دقيقة. أحضر سؤالًا يصعب عليك الإجابة عنه بسرعة، وسننمذجه مباشرةً على بيانات مالية حقيقية.