تخطّ إلى المحتوى
جديد: اسأل وكيل المحلّل من Rexfin عن نموذجك، وكل رقم يعود مدعومًا بمصدره.
· 9 دقائق قراءة

قراءة معايير الأداء بصدق: لماذا تُعدّ دقة 82% في نماذج اللغة درجة راسبة في عالم المالية

أفضل النماذج لا تتجاوز 82% على جداول البيانات المالية و90% على أسئلة المالية. يبدو الرقم مبهراً حتى تحسب كلفة الأخطاء.

أفضل النماذج لا تتجاوز 82% على جداول البيانات المالية و90% على أسئلة المالية. يبدو الرقم مبهراً حتى تحسب كلفة الأخطاء.

بقلم The Rexfin team

تعرض شريحة من أحد المورّدين أن نموذجهم يحقق دقة 90% في الإجابة عن الأسئلة المالية. تومئ القاعة موافِقةً. يبدو الرقم وكأنه تقدير “جيد جداً”. في المدرسة، كانت الـ90% تعني لائحة الشرف.

لكن مرّر الرقم نفسه عبر عدسة المالية، ولن يبدو بعدها تقديراً ممتازاً. دقة 90% تعني أن رقماً من كل عشرة أرقام خاطئ. ضع ذلك في عرض مجلس الإدارة يحوي أربعين رقماً، وستجد في المتوسط أربعة منها مغلوطة. أنت لا تعرف أيّ أربعة. والنموذج لا يعرف أيضاً، وسيدافع عن الأربعين جميعها بالطلاقة والثقة ذاتها. هذه ليست لائحة شرف. في وظيفة مهمتها بأكملها أن تكون مُحقّةً في الأرقام، فهي درجة راسبة.

تستحق معايير الأداء قراءة أعمق من الرقم العنوان، لأنك كلما دقّقت النظر، ازدادت الحجة قوةً لانتزاع الحساب من النموذج اللغوي كلياً.

ما الذي تقيسه معايير الأداء فعلاً

لنبدأ بـ FinanceBench، مجموعة الاختبارات المفتوحة للأسئلة المالية المبنية على إفصاحات شركات مدرجة. الإعداد سخيٌّ تجاه النموذج: تُقرَن الأسئلة بالوثائق الدقيقة التي تحتوي الإجابات، مستمدّةً من إفصاحات 40 شركة أمريكية كبرى مدرجة في البورصة. هذه هي النسخة السهلة من المهمة الحقيقية. لا أحد يُخفي تقرير الـ10-K.

لكن النتائج لم تكن سخيّةً بالمقابل. في العمل الأصلي، أخطأ GPT-4-Turbo المقترن بنظام استرجاع في الإجابة أو امتنع عنها في نحو 81% من الأسئلة ضمن التهيئات الأصعب. وعبر مختلف الإعدادات، تراوحت إجابات GPT-4 الصحيحة بين نحو 19% و89%، وهذا التفاوت الواسع هو الجزء الذي يستحق التوقّف عنده. النموذج نفسه، والمهمة من العائلة نفسها، والدقة تتأرجح بعشرات النقاط تبعاً لكيفية ترتيب السياق. وجدت إحدى الدراسات أن مجرد نقل السياق إلى ما قبل السؤال بدلاً من بعده نقل GPT-4-Turbo من نحو 25% إلى نحو 78%. لم يكن النموذج يستدلّ نحو إجابة مستقرّة، بل كان يتفاعل مع شكل الموجِّه (prompt).

والآن إلى جانب جداول البيانات، وهو الأقرب إلى الطريقة التي تعمل بها الفرق المالية فعلاً. يُقيّم FinSheet-Bench النماذج على مهام جداول البيانات المالية المبنية على هياكل صناديق ملكية خاصة واقعية (من عمليات البحث البسيطة في طرفها الأدنى، إلى الاستدلال الرقمي متعدّد الخطوات في طرفها الأصعب). أفضل تهيئة جرى اختبارها، وهي Gemini 3.1 Pro، بلغت نحو 82.4% دقة عبر ملفات التقييم. وخلفها، تجمّع كلٌّ من GPT-5.2 وClaude Opus 4.6 مع تفعيل الاستدلال حول 80%.

اقرأ ذلك بوصفه أعلى درجة في الصف، وسيبقى مع ذلك خطأً واحداً تقريباً في كل ستة أسئلة. خلاصة البحث نفسها صريحة: عبر التهيئات التي جرى اختبارها من OpenAI وGoogle وAnthropic، لم يبلغ أيّ نموذج مستقل معدّلات خطأ منخفضةً بما يكفي للاستخدام دون إشراف في المالية الاحترافية. هذه ليست حجةً ترويجيةً من Rexfin، بل هي الاستنتاج ذاته.

لماذا لا يُغلق “استخدم نموذجاً أفضل” الفجوة

الغريزة، في كل مرة، أن ننتظر الإصدار التالي. فالدرجات ترتفع عاماً بعد عام، فلا بدّ إذن أن يعبر الخط يوماً ما إلى المنطقة الآمنة.

أمران يجعلان هذا التفاؤل باهظ الثمن.

أولاً، الأخطاء ليست ضجيجاً عشوائياً يتلاشى بالمتوسط. فالنموذج الذي يقلب نسبةً، أو يقرأ رقماً بالآلاف على أنه بالملايين، أو يعكس إشارة تدفّق نقدي صادر، لا يرتكب خطأً صغيراً، بل يرتكب خطأً بنيوياً واثقاً، ويرتكبه في الموضع ذاته الذي يقلّ فيه احتمال أن يُعيد المراجع البشري التحقّق منه، لأن السرد المحيط يبدو نظيفاً. درجة 90% بأخطاء “حسنة السلوك” شيء، ودرجة 90% تحوي الـ10% فيها انحرافاتٍ بمقدار رتبة عشرية كاملة شيءٌ لا يستطيع المراقب المالي التوقيع عليه.

ثانياً، تُقاس دقة معايير الأداء على بيانات أنيقة ومنسّقة. بياناتك ليست أنيقة. فهي موزّعة بين QuickBooks، ونسخة من NetSuite جاءت مع عملية استحواذ، وثلاثة مستودعات بيانات، ومجلّد ملفات PDF مسحها أحدهم بشكل مائل. الدقة على الإفصاحات النظيفة هي السقف، لا الأرضية. الرقم الذي ستحصل عليه فعلاً على بياناتك المالية الفوضوية متعدّدة المصادر أدنى من أي لوحة تصدّر، ولا يوجد معيار أداء يَنشره لأن أيّاً منها لا يملك دفاترك.

إذن، التأطير الصادق ليس “النماذج سيئة”. فالنماذج الحدودية قوية بحقّ في القراءة والتلخيص والشرح. التأطير الصادق أضيق وأكثر فائدة: هي ليست محرّكات حسابية موثوقة، ولم تُبنَ لتكون كذلك قط. أن تطلب من نموذج لغوي أن يحسب تغيّراً سنوياً هو أن تطلب من نظام دُرِّب على توقّع نص معقول أن يُنتج بدلاً من ذلك رقماً دقيقاً قابلاً للدفاع. أحياناً يكون الرمز المعقول هو الصحيح أيضاً. وفي 18% من الحالات الصعبة، لا يكون كذلك.

الرقم الذي ينبغي أن يُغيّر البنية المعمارية، لا المورّد

إليك الخطوة التي تشير إليها معايير الأداء. إذا كان ضعف النموذج اللغوي في الحساب الدقيق على أرقام حقيقية، فتوقّف عن مطالبته بالحساب.

دع النموذج يفعل ما يُجيده (فهم السؤال، والعثور على الأرقام الصحيحة، وكتابة الشرح) ووجّه كل عملية حسابية فعلية عبر محرّك حتمي يعمل على نموذج مُسوّى من دفاترك. النموذج اللغوي يسترجع ويستدلّ. والحساب يجري بوصفه شيفرة (code)، بالطريقة ذاتها التي يجري بها داخل صيغة. المدخلات نفسها، والمخرجات نفسها، في كل مرة، مع مسار يعود إلى السطر المصدر في دفتر الأستاذ.

هذا الفصل الواحد يغيّر معنى أرقام معايير الأداء بالنسبة إليك. فمعدّل الخطأ في جداول البيانات البالغ 18% والتفاوت الواسع في FinanceBench كلاهما يقيس النموذج وهو يجري الحساب. انزع الحساب من مهامه، وتتوقّف أنماط الخطأ تلك (النسبة المقلوبة، والمقدار الخاطئ، والإشارة المعكوسة) عن كونها احتمالية. تتحوّل إلى دالّة تختبرها مرة واحدة ثم تثق بها. لا يزال بإمكان النموذج أن يُسيء قراءة سؤال، ولا يزال البشري يراجع التأطير. لكنه لم يعد قادراً على أن يسلّمك بهدوء رقماً منحرفاً بمقدار عشرة أضعاف وجملةً أنيقةً ترافقه.

هذا هو الأساس الذي يقوم تحته كل شيء آخر. وهو السبب في أن جدول البيانات هو المكان الخاطئ لترك الذكاء الاصطناعي يكتب الأرقام، فأنت تَرِث كل خطأ صامت بدلاً من إزالة فئة الخطأ من جذورها. وهو السبب في أن رقم الذكاء الاصطناعي ينبغي أن يكون قابلاً لإعادة التشغيل بالطريقة ذاتها التي تكون عليها الصيغة: مدخلات متطابقة تُنتج رقماً متطابقاً، مع مسار قابل للتتبّع، هو بالضبط ما تمنحه إياه طبقة حتمية ولا يستطيع نموذج مستقل تقديمه. وتجد الحجة الأوسع في الركيزة حول طبقة النمذجة المالية الموثوقة للذكاء الاصطناعي.

الصياغة المباشِرة

في المرة القادمة التي يهبط فيها رقم معيار أداء في اجتماع، أجرِ الترجمة بصوت عالٍ. تسعون في المئة تعني رقماً خاطئاً واحداً من كل عشرة. اثنان وثمانون في المئة تعني إجابةً خاطئةً واحدةً من كل ست. ثم اسأل: أيّ ستة أرقام في العرض يرتاح الفريق لعدم التحقّق منها؟ لأن هذا هو ما يعنيه فعلاً الوثوق بمخرجات النموذج الخام.

معايير الأداء ليست حجةً لانتظار نموذج أفضل. هي حجة لبنية معمارية مختلفة: الاستدلال في النموذج، والحساب في طبقة لا يمكنها أن تهلوس. وهذه هي التهيئة الوحيدة التي يُسمح فيها للدرجة على الشريحة وللرقم في تقريرك بأن يكونا الشيء نفسه.

إن أردت أن ترى الحساب وقد انتُزع من النموذج وأُجري على مصدر حقيقة مُسوّى، احجز عرضاً توضيحياً وأحضر أعقد عملية تسوية لديك. هذا هو الاختبار الذي يُعتدّ به.

جزء من طبقة الموثوقية التي يحتاجها الذكاء الاصطناعي قبل أن يقترب من أرقامك

تابع القراءة

احجز عرضًا توضيحيًا

شاهد أرقامك وهي تتوازن.

احجز عرضًا توضيحيًا مدته 30 دقيقة. أحضر سؤالًا يصعب عليك الإجابة عنه بسرعة، وسننمذجه مباشرةً على بيانات مالية حقيقية.