تخطّ إلى المحتوى
جديد: اسأل وكيل المحلّل من Rexfin عن نموذجك، وكل رقم يعود مدعومًا بمصدره.
· 8 دقائق قراءة

كيف تختبر أداة الذكاء الاصطناعي المالية تحت الضغط قبل أن تثق بها

ادّعاءات المورّد عن الدقة لا تعني شيئاً ما لم تصمد أمام أرقامك أنت. إليك كيف تبني مجموعة بيانات مرجعية، وتحدّد عتبة نجاح صارمة، وتعيد الاختبار لرصد الانحراف.

ادّعاءات المورّد عن الدقة لا تعني شيئاً ما لم تصمد أمام أرقامك أنت. إليك كيف تبني مجموعة بيانات مرجعية، وتحدّد عتبة نجاح صارمة، وتعيد الاختبار لرصد الانحراف.

بقلم The Rexfin team

يجلس المورّد أمامك ويقول إن ذكاءه الاصطناعي “دقيق بنسبة 98% على البيانات المالية”. اطرح عليه سؤالاً واحداً: 98% من ماذا، ومقيسة مقابل إجابات مَن؟ في معظم العروض التوضيحية، تكون الإجابة الصادقة أن الرقم جاء من معيار عام، أُجري على بيانات شركة أخرى، وقُيِّم بأسلوب لا يمكنك الاطلاع عليه. وهو لا يخبرك بأي شيء تقريباً عن سلوك الأداة مع قيود الإقفال لديك، أو عمليات الاستبعاد بين الشركات، أو دليل الحسابات المتشعّب لديك.

والأبحاث المنشورة ليست مطمئنة هي الأخرى. ففي FinanceBench، وهو معيار يضم أكثر من 10,000 زوج من الأسئلة والأجوبة مستمدة من بيانات الشركات العامة الأمريكية، أجاب اختبار مبكر لنموذج GPT-4-Turbo مقروناً بنظام استرجاع إجابةً خاطئة أو رفض الإجابة في نحو 81% من عيّنة مكوّنة من 150 سؤالاً. هذا نموذج متقدّم، مزوّد بالاسترجاع، يعمل على وثائق SEC نظيفة. أما بياناتك فأصعب.

لذا توقّف عن الثقة بأرقام الدقة المعلنة. ابنِ اختبارك الخاص. إن بناء مجموعة بيانات مرجعية هو أنفع ما يمكن لفريق مالي أن يقضي فيه فترة بعد الظهر قبل توقيع أي عقد، وهو الدليل الوحيد الذي يصمد لاحقاً أمام سؤال من لجنة التدقيق.

ما هي مجموعة البيانات المرجعية فعلاً

مجموعة البيانات المرجعية هي مجموعة ثابتة من الأسئلة عن بياناتك المالية تعرف إجابتها الصحيحة سلفاً، إجابة صادق عليها إنسان قادر على الدفاع عنها. لا إجابة نموذج، بل إجابة مراقب مالي، مرتبطة بدفتر الأستاذ.

كل عنصر يتكوّن من أربعة أجزاء: السؤال بالصيغة التي يطرحها بها المستخدم فعلاً، والإجابة الصحيحة بوحدتها وإشارتها، والمصدر الذي تُنسب إليه (أي حساب، وأي فترة، وأي قائمة)، والحساب الذي يُنتجها. “كم كان التدفّق النقدي الحر في الربع الثالث؟” سؤال. أما “4.18M$، تدفّق نقدي تشغيلي قدره 6.02M$ ناقص نفقات رأسمالية قدرها 1.84M$، بحسب قائمة التدفقات النقدية” فهي إجابة مرجعية. الحساب وسلسلة المصدر جزء من السجل، لا فكرة لاحقة.

لست بحاجة إلى آلاف منها. أنت بحاجة إلى تلك التي تهمّ، وتلك التي تكشف الأعطال.

ما الذي تضعه فيها

استمدّ من أربع سلال، بقصد متعمّد.

حالات الاسترجاع. عمليات بحث بسيطة. “كم كان إجمالي الإيرادات في السنة المالية الماضية؟” هذه تتحقق مما إذا كانت الأداة تجد الرقم الصحيح في الفترة الصحيحة. تبدو تافهة، لكنها حيث تختبئ أخطاء البيانات القديمة، لأن النموذج سيقتبس رقم العام الماضي بكل ثقة دون تردد.

حالات الحساب. أي شيء يتطلب رياضيات: هامش الربح الإجمالي، النمو السنوي، فترة تحصيل المبيعات المستحقة، أو جسر EBITDA من ثلاثة سطور. هنا تفشل معظم أدوات الذكاء الاصطناعي المالية بصمت. فقد يسترجع النموذج رقمين صحيحين ثم يقلب النسبة، أو يخلط بين التغيّر المطلق والتغيّر النسبي، أو يعكس إشارة تدفّق نقدي خارج. الإجابة تبدو معقولة. وهي خاطئة. هذا هو نمط الفشل الذي نتناوله في الذكاء الاصطناعي أصاب في الأرقام وأخطأ في الحساب، وهو السبب الأكبر الوحيد لاختبار الحساب بمعزل عن الاسترجاع.

الحالات الخصمية. أسئلة مصمّمة لاستفزاز إجابة خاطئة واثقة. اطلب مقياساً لا ترفع عنه تقارير. اسأل عن فترة لم تأتِ بعد. اطرح سؤالاً مبنياً على فرضية كاذبة (“لماذا انخفض الهامش في الربع الثاني؟” بينما هو ارتفع). الأداة الجديرة بالثقة تقول إنها لا تستطيع الإجابة أو تصحّح الفرضية. أما الضعيفة فتختلق. وأنت تريد أن تعرف أيّهما اشتريت.

حالات متعددة المصادر. أسئلة تُجبر الأداة على المطابقة عبر الأنظمة: رقم يظهر في كل من دفتر الأستاذ العام ومنصة الفوترة، أو رقم موحّد يمتد عبر كيانين. فإن سحبت الأداة من مصدر واحد وتجاهلت التعارض، فسترى ذلك هنا.

استهدف بضع عشرات إلى بضع مئات من العناصر. وزّعها بحيث تكون حالات الحساب والحالات الخصمية ممثَّلة تمثيلاً جيداً، لأنها هي التي تحرّك معدل النجاح.

حدّد عتبة، واجعلها موجعة

اختر رقماً قبل إجراء الاختبار، كتابةً. نحن نستخدم 95% كحدّ أدنى مبدئي لأي رقم يصل إلى تقرير أو عرض لمجلس الإدارة، والعتبات الأدنى لا تشتري لك إلا القليل جداً. عند 90%، تكون إجابة من كل عشرٍ خاطئة، ولا يمكنك التنبؤ بأيّها، ما يعني أن على إنسان أن يعيد فحصها جميعاً. وعندها يتبخّر الغرض كله من الأداة.

ثم عرّف معنى “الصحيح” بدقة. تطابق تام للرقم. إشارة صحيحة. وحدات صحيحة. فترة صحيحة. الأداة التي تُرجع المقدار الصحيح بالإشارة الخاطئة ليست صحيحة بنسبة 90% في ذلك العنصر؛ بل هي خاطئة. صحّح تقييمك على هذا الأساس. كن أكثر صرامة في حالات الحساب وحالات المصادر المتعددة منك في الاسترجاع البسيط، لأنها تلك التي يعجز المراقب المالي عن تقديرها بنظرة عابرة.

ثمة قاعدة أخرى تستحق الاقتباس من قائمة التحقق من أرقام عرض مجلس الإدارة: الإجابة بلا مصدر يمكن تتبّعه تُحتسب إخفاقاً، حتى لو صادف أن الرقم صحيح. الرقم الصحيح الذي لا يمكنك إثباته ليس أصلاً في التدقيق. بل هو التزام ينتظر سؤالاً.

أعد الاختبار لرصد الانحراف، وفق جدول زمني

هنا الجزء الذي تتجاوزه معظم الفرق. تجتاز الاختبار في فبراير وتفترض أن الأداة آمنة في يوليو. وقد لا تكون. فالنموذج خلفها يُحدَّث. وبياناتك تتغيّر شكلاً. والتوجيهات تُعدَّل. الدقة التي كانت 96% يمكن أن تنزلق بصمت إلى 88% دون أي إعلان، لأن شيئاً لم يتعطّل ظاهرياً.

شغّل مجموعة البيانات المرجعية شهرياً، أو بعد أي تغيير في النموذج أو التكامل، أيهما أسبق. تتبّع معدل النجاح عبر الزمن. تراجع بنقطتين إشارة تستحق التحري؛ وتراجع بخمس نقاط سبب لتعليق الاعتماد عليها حتى تفهم ما حدث. هذا هو الفرق بين الثقة بأداة مرة واحدة وحوكمتها باستمرار.

ما الذي يقيسه الاختبار حقاً

جرّده إلى جوهره، فتجد أن مجموعة البيانات المرجعية تطرح سؤالين على أي أداة ذكاء اصطناعي مالية. هل وجدت الرقم الصحيح؟ وهل أجرت الحساب الصحيح؟ معظم الأدوات التي تسجّل نتيجة جيدة في الأول تفشل في الثاني، لأن الحساب يجريه نموذج لغوي يتنبأ بالشكل الذي ينبغي أن يبدو عليه الرقم بدلاً من احتسابه.

تلك هي النقطة المعمارية الكامنة تحت كل هذا. إن جرى الحساب داخل الـ LLM، فسيظل معدل نجاحك مجرد احتمال، وسينحرف. والإصلاح الدائم الوحيد هو نزع الحساب عن النموذج كلياً.

هكذا بُنيت Rexfin. نربط منصات المحاسبة لديك أو القوائم المرفوعة، ونطابقها في نموذج واحد يتوافق مع دفتر الأستاذ، ثم ندع الذكاء الاصطناعي يسترجع الأرقام ويجري كل حساب عبر محرّك حتمي، لا عبر النموذج اللغوي. مدخلات واحدة، إجابة واحدة، في كل مرة، مع خط رجوع إلى المصدر. شغّل مجموعة بياناتك المرجعية مقابل نظام مصمَّم على هذا النحو، فتتوقف حالات الحساب عن أن تكون هي التي تفشل.

ابنِ مجموعة البيانات قبل أن تشتري أي شيء. ثم احجز عرضاً توضيحياً ووجّه أصعب أسئلتك إلينا مباشرة. فإن لم تتوافق الأرقام مع دفتر أستاذك، فعليك أن تنسحب. نفضّل أن تختبرنا على أن تثق بنا.

جزء من هلوسات الذكاء الاصطناعي في البيانات المالية: أوقِف اختلاق الأرقام

تابع القراءة

احجز عرضًا توضيحيًا

شاهد أرقامك وهي تتوازن.

احجز عرضًا توضيحيًا مدته 30 دقيقة. أحضر سؤالًا يصعب عليك الإجابة عنه بسرعة، وسننمذجه مباشرةً على بيانات مالية حقيقية.