من ترقيات التصنيف إلى المدفوعات: وهم الطلب في دمج النماذج

chaincatcherchaincatcher

أولاً: ما هو دمج النماذج؟

في يونيو 2026، شهد سوق الذكاء الاصطناعي ظهور منتجين باسم "فيوجن" في أقل من ثلاثة أسابيع.

في الثاني عشر من يونيو، أطلقت شركة OpenRouter برنامج Fusion Router، بعنوان " تجاوز الأداء المتميز مع Fusion ". في تقييمها المعمق باستخدام منصة DRACO، حققت مجموعة النماذج المكونة من Fable 5 وGPT-5.5 درجة 69.0 نقطة، متجاوزةً بذلك درجة 65.3 نقطة التي حققها نموذج Fable 5 وحده. تكمن ميزة OpenRouter التسويقية في بساطتها: عندما لا يكون نموذج واحد كافيًا، تُقدم نماذج متعددة إجاباتٍ للسؤال نفسه، ثم يقوم أحد المراجعين بمقارنة هذه النماذج وتحليلها.

من تحسين النتائج إلى الخدمات المدفوعة: وهم الطلب الناتج عن دمج النماذج

في 29 يونيو، أصدرت شركة Cognition برنامج Devin Fusion، ولكن كان عنوانه " أداء رائد بتكلفة أقل بنسبة 35٪ ". بدلاً من أن تقوم نماذج متعددة بإكمال المهمة بأكملها بشكل متكرر، فإنه يسمح لنموذج الواجهة الأمامية بالتعامل مع التخطيط والحكم، تاركًا الاختبار والتعديلات الميكانيكية والمهام الأخرى للنموذج المساعد الأرخص، مع تبديل النماذج ديناميكيًا أثناء التنفيذ.

من تحسين النتائج إلى الخدمات المدفوعة: وهم الطلب الناتج عن دمج النماذج

يشير المصطلح نفسه إلى منطقين اقتصاديين متناقضين. يستخدم OpenRouter قدرة حسابية أكبر لشراء رؤوس أموال أعلى؛ بينما يسعى Cognition إلى تقليل الحسابات المكلفة مع الحفاظ على جودته الأصلية. هذا التباين أكثر دلالة من أي تصنيف لأفضل النماذج. صحيح أن الفرضية التقنية لدمج النماذج صحيحة: فمحاولات متعددة لديها فرصة لتجاوز محاولة واحدة. لكن ما يكافئه السوق حقًا ليس "عدد استدعاءات النماذج"، بل من يستطيع إنفاق أقل وتقديم أداء أسرع بعد استيفاء معايير الجودة.

من تحسين النتائج إلى الخدمات المدفوعة: وهم الطلب الناتج عن دمج النماذج ▲ الشكل 1: نوعان من دمج النماذج في نفس الشهر. تُعرّف هذه المقالة دمج النماذج بأنه بنية أضيق: حيث تُجيب نماذج متعددة على نفس المهمة بالتوازي، ثم تُراجع هذه النماذج وتُقارن نتائجها، وفي النهاية يُخرج نموذج واحد الإجابة. لا يندرج دمج النماذج من ديفين تحت هذا التعريف؛ فهو أقرب إلى التوجيه الديناميكي وتفويض المهام. وقد وُضع في البداية لأن السوق يستخدم مصطلح "دمج النماذج" كمصطلح عام لجميع عمليات تنسيق النماذج المتعددة، بينما تتجه المنتجات الفعّالة حقًا غالبًا إلى الابتعاد عن التعريف الضيق لدمج النماذج.

تقييمنا متشائم: دمج النماذج أشبه ببوليصة تأمين جودة باهظة الثمن. صحيح أنه يُحسّن الأداء المطلق لبعض المهام، لكنه نادرًا ما يُحقق نقلة نوعية حقيقية في كفاءة التكلفة والجودة وزمن الاستجابة. قليلٌ جدًا من المهام تستحق حقًا شراء هذا التأمين. سيبقى هذا الخيار متاحًا، لكن من المرجح أن يكون ميزة تُفعّل عند الحاجة بدلًا من أن يكون البنية الافتراضية، ومن غير المرجح أن يصبح فئة مستقلة.

 

ثانيًا: ما هي خيارات الطراز المتاحة حاليًا؟

سرعان ما تنحرف النقاشات حول برنامج Fusion إلى قوائم تصنيف الدقة، لكن الشركات لا تشتري تصنيفات هذه القوائم. إنما تشتري نتائج مقبولة لمهمة معينة، مع مراعاة السعر، وزمن الاستجابة، والخصوصية، والاستقرار. طالما أن هناك نموذجًا رخيصًا بالفعل...

بمجرد تجاوز عتبة قبول الأعمال، قد لا يكون الاستمرار في دفع ثمن الميزات "الأكثر ذكاءً" مجديًا اقتصاديًا. إن كفاءة التكلفة هي المحرك الحقيقي في سوق النماذج.

من تحسين النتائج إلى الخدمات المدفوعة: وهم الطلب الناتج عن دمج النماذج ▲ الشكل 2: ذكاء النموذج وتكلفة المهمة الواحدة. لا تكمن أهم النقاط على المقياس اللوغاريتمي في أعلى الدرجات في الزاوية اليمنى، بل في النقاط التي تنحرف عن اتجاه العلاقة بين السعر والقدرة: فهذه النقاط توفر قدرة كافية بسعر أقل، وتُعدّ حالات استثنائية من حيث الكفاءة لأحمال عمل محددة. مع أن المؤشر المركب لا يُجيب بشكل مباشر عن أيّ نموذج هو الأنسب لمراجعة التعليمات البرمجية، أو البحث الصيني، أو النشر الخاضع للتنظيم، إلا أنه يكشف عن اتجاه عام: إذ أصبح توفير النماذج سلعة أساسية، ويتباعد "النموذج الأقوى" عن "الخيار الأمثل".

توجد حاليًا أربع استراتيجيات شراء رئيسية في السوق لمعالجة نفس فجوة الجودة.

يتمثل النهج الأول في الترقية المباشرة إلى نموذج واحد أقوى. يُعد هذا النهج الأبسط والأسهل في التدقيق، وهو الخيار المفضل عمومًا طالما أن الزيادة الطفيفة في تكلفة النموذج عالي الأداء أقل من تكلفة الأخطاء أو إعادة العمل. أما النهج الثاني، فيتمثل في زيادة حسابات وقت الاختبار على النموذج نفسه، مثل توسيع الاستدلال، أو الاتساق الذاتي، أو أخذ عينات متعددة. ويتمثل النهج الثالث في التوجيه والتسلسل وتفويض المهام: حيث يُستخدم أولًا نموذج أقل تكلفة للتعامل مع الأجزاء القابلة للتحقق أو الميكانيكية، ولا تتم الترقية إلا عند مواجهة صعوبات. أما النهج الرابع، بمعناه الأضيق، فهو دمج النماذج: حيث تقوم نماذج متعددة بالإجابة على السؤال نفسه بشكل متكرر، ثم يتم تكوين الإجابة النهائية من خلال مراجعة النماذج وتوليفها.

تُتيح الطرق الأربع جميعها إمكانية "الموازنة بين زيادة القدرة الحسابية والجودة"، لكن الفرق يكمن في كيفية توجيه هذه القدرة. فاستخدام نموذج واحد يُتيح استدلالًا أعمق، بينما يُتيح التوجيه تخصيصًا أدق للموارد، أما دمج النماذج فيُتيح عددًا أكبر من الإجابات المُحتملة. تُركز الطرق الثلاث الأولى ميزانياتها على المراحل التي يُرجح أن تُغير النتيجة؛ أما دمج النماذج، فيُركز أولًا على الآراء المُكررة، ثم يراهن على قدرة نموذج المراجعة على تحديد الاختلافات الصحيحة. يجب أن تُوفر النماذج المُحتملة معلومات مُستقلة كافية، ويجب أن يكون المُراجعون قادرين على تمييز هذه المعلومات.

يُعدّ الاندماج الخيار الوحيد الذي يمكنه التفوق على الخيارات الثلاثة الأخرى.

أثبتت تقنيات التوجيه أن الاختلافات في القدرات بين النماذج تُتيح في المقام الأول فرصةً لتحسين الجدولة. فقد خفّض نموذج RouteLLM التكاليف بأكثر من الضعف في بعض التقييمات دون المساس بالجودة؛ بينما حقق نموذج Switchcraft خفضًا في التكاليف بنسبة 84% مع دقة بلغت 82.9%، وهو ما يُترجم، وفقًا للدراسة، إلى توفير يزيد عن 3600 دولار لكل مليون طلب. لا تزال هذه النتائج بحاجة إلى إعادة إنتاجها على حركة مرور المؤسسة نفسها، لكن المنطق الاقتصادي واضح: بدلًا من وجود نماذج متعددة في نفس المجموعة، يكفي ببساطة إسناد كل مهمة إلى النموذج الأقل تكلفة والأكثر كفاءة.

وهذا يعني أن السوق سيعالج أولاً فجوة الجودة من خلال الترقيات والتوجيه والتحقق؛ فقط عندما لا تزال هذه الأساليب غير كافية سيكون هناك سبب لشراء المزيد من الإجابات المرشحة لـ Fusion.

 

ثالثًا: لماذا لا يعني تحسين الدرجات بالضرورة امتلاك قيمة؟

لأن برنامج Fusion يجب أن يتغلب على ثلاثة تحديات في آن واحد: يجب أن تغطي الجودة المحسّنة التكلفة الإضافية وزمن الاستجابة، ويجب أن توفر النماذج المرشحة معلومات مستقلة، ويجب على المراجعين تحديد إجابات أفضل باستمرار. إذا فشل أي من هذه التحديات، فلن يُترجم تحسين النتيجة إلى قيمة إنتاجية. التكلفة الحسابية: ما مقدار الميزانية الإضافية وزمن الاستجابة المطلوب؟ يُعد تحسين نتيجة Fusion في المقام الأول تكلفة حسابية مؤكدة. يستدعي OpenRouter نماذج لوحات متعددة بالتوازي، ثم يقوم المراجعون والنموذج المُدمج بتوليد الإجابة. أظهرت جميع مجموعات التحكم الثلاث في DRACO تحسينات في النتائج: ارتفع Fable 5 + GPT-5.5 من 65.3 إلى 69.0؛ وارتفع Opus 4.8 self-fusion من 58.8 إلى 65.5؛ وارتفعت مجموعة النماذج الثلاثة منخفضة التكلفة من 60.3 إلى 64.7.

مع ذلك، فإن تحسين دمج البيانات الذاتي في أوبوس أكبر، مما يشير إلى أن المكاسب قد تنجم عن عمليات بحث ومعاينة إضافية بدلاً من تكامل المعرفة بين النماذج . ينبغي إجراء مقارنة عادلة بين الاتساق الذاتي، والاستدلال المطوّل، ونماذج العامل الواحد القوية في ظل نفس ميزانية الرموز. تُظهر الأبحاث الحالية أيضًا أن نماذج العوامل المتعددة يمكنها تحسين الأداء بما يصل إلى 7.1 نقطة مئوية بتكلفة حسابية تزيد حوالي 20 ضعفًا؛ ومع نفس الميزانية، فإن نماذج النقاش ونماذج مزيج العوامل أعلى بنسبة 1.3 و2.7 نقطة مئوية فقط من الاتساق الذاتي، على التوالي، بينما وجدت دراسة أخرى باستخدام رموز استدلال متساوية أن نماذج العامل الواحد تُضاهي أو تتفوق على نماذج الاتساق الذاتي. تختفي العديد من "مكاسب التعاون" بعد محاذاة دفتر الأستاذ الحسابي.

من تحسين النتائج إلى الخدمات المدفوعة: وهم الطلب الناتج عن دمج النماذج ▲ الشكل 3: تحسين أداء OpenRouter وتكلفة المنتج. تكلف لوحة OpenRouter الافتراضية ذات النماذج الثلاثة ما يقارب 4-5 أضعاف تكلفة لوحة قياسية مُولّدة، وهي أبطأ بمقدار 2-3 مرات . مع ذلك، لا تكشف عن جميع الرموز والتكاليف وزمن الاستجابة لكل تكوين DRACO، مما يجعل من المستحيل تحديد ما إذا كان التحسين البالغ 3.7 نقطة يستحق العناء. شمل التقييم 100 مهمة نصية باللغة الإنجليزية فقط، مع إكمال 93 تكوينًا فقط من التكوينات المتعلقة بـ Fable. يمكن أن يؤدي تغيير نموذج المراجعة إلى تغيير النتيجة المطلقة بنسبة 10-25 نقطة مئوية. يثبت هذا أن Fusion يمكنه تحسين النتائج، ولكنه لا يثبت أن Fusion يحسن عائد الاستثمار في الإنتاج.

لا يُمكن للاستدعاء الانتقائي إلا أن يُقلل التكاليف. ووفقًا للتقديرات التي كشفت عنها شركة OpenRouter، فإن التكلفة الإجمالية تبلغ حوالي 1.03-1.04 ضعفًا عندما يكون معدل التشغيل 1%؛ و1.30-1.40 ضعفًا عندما يكون 10%؛ و1.75-2.00 ضعفًا عندما يكون 25%.

من تحسين النتائج إلى الخدمات المدفوعة: وهم الطلب الناتج عن دمج النماذج ▲ الشكل 4: الجدوى الاقتصادية العامة لاستدعاء الدمج الانتقائي. من المرجح أن تؤدي الطلبات الأكثر صعوبة إلى تفعيل الدمج، ولكن يجب على النظام انتظار أبطأ أعضاء اللجنة قبل إكمال المراجعة والتوليد بشكل متسلسل. لذلك، يتركز زمن الاستجابة المتأخر على المهام الأكثر قيمة. كما يؤدي استدعاء الدمج من عدة موردين إلى توسيع نطاق الأعطال، وزيادة تعقيد التدقيق، ومخاطر انتهاك الخصوصية. لا تقتصر تكلفة الدمج على سعر واجهة برمجة التطبيقات فحسب، بل تشمل أيضًا وقت الانتظار والمخاطر الإضافية التي يتعرض لها النظام. تكامل المعلومات: هل توفر النماذج المتعددة معلومات مختلفة حقًا؟ تعتمد قيمة الدمج على ما إذا كانت النماذج المرشحة تقدم معلومات مستقلة، ولكن غالبًا ما تشترك النماذج المختلفة في مجموعات بيانات التدريب، ومصادر صفحات الويب، والفرضيات الخاطئة. في المهام البحثية، يؤدي هذا إلى "تبييض الاستشهادات" : حيث تعود نماذج متعددة إلى نفس المصدر ولكنها تُقدم على أنها أدلة مستقلة متعددة. إذا لم يحتفظ النظام بأصل الادعاءات ومسارات البحث، فإن تكلفة واجهة برمجة التطبيقات تزداد بشكل خطي تقريبًا مع عدد النماذج، ولكن تنوع الأدلة لا يزداد بالضرورة.

في بحثه المنشور عام 2026 بعنوان "متى يُفيد دمج نماذج اللغة؟" ، درس جوزيف تشين، المؤسس المشارك والرئيس التنفيذي لشركة KAIKAKU.AI، 67 نموذجًا من 21 مزود خدمة. في مهام الرياضيات المفتوحة، بلغت احتمالية إجابة جميع النماذج بشكل خاطئ في آنٍ واحد 2.3%، بينما وصلت الاحتمالية الفعلية إلى 5.2%، أي ما يقارب 2.3 ضعف القيمة المتوقعة . وارتفع معدل الفشل المشترك إلى 7.9% و12.7% في مهمة تقييم الكود ونسخة الإجابة الحرة من GPQA-Diamond، على التوالي. مع 100 سؤال في GPQA-Diamond، من المتوقع أن تؤدي 13 سؤالًا تقريبًا إلى إجابة جميع النماذج المرشحة بشكل خاطئ، مما لا يترك أي إجابة صحيحة للتصويت أو المراجعة أو التركيب. يُعزز تباين النماذج في الأسئلة السهلة القيمة المُجمعة، بينما قد تفشل جميعها في الأسئلة الأكثر أهمية. تقييم الموثوقية: هل يستطيع النظام تحديد وتوليف إجابات أفضل؟ حتى مع وجود إجابات متكاملة من المرشحين، تظل القيمة معتمدة على المراجعة. فعندما تكون إجابات المرشحين متسقة، قد يُسيء المراجعون تفسير الأخطاء ذات الصلة على أنها ثقة عالية؛ وعندما تختلف إجابات المرشحين، يلزم وجود خبرة كافية لاختيار الإجابة الصحيحة. وقد يُؤدي النموذج المركب أيضًا إلى تجاهل آراء الأقلية الرئيسية أو إعادة صياغة الخلافات الحقيقية في استنتاجات نهائية.

في مهام البرمجة، غالبًا ما تكون المترجمات والاختبارات والتحليل الثابت أكثر موثوقية من رأي نموذج آخر؛ أما في المهام الإبداعية، فيمكن للمراجعة والتركيب بسهولة دمج الاختلافات في إجابة متوسطة. حتى أقوى نموذج مراجعة جاهز في LitBench لا تتجاوز نسبة توافقه مع تفضيلات الكتابة الإبداعية البشرية 73%. عندما تتوفر جهات تحقق خارجية غير مكلفة للمهمة، أو عندما يعتمد مفهوم "الجودة" نفسه على التقييم الذاتي، يصعب ترجمة تحسينات نتائج Fusion إلى قيمة مدفوعة.

 

رابعاً: من سيدفع تكاليف شركة فيوجن؟

يعتمد الطلب على Fusion على عقبتين رئيسيتين: الأولى، إمكانية استفادة المهمة من نماذج متعددة، والثانية، كفاية هذه الفائدة لتحقيق إيرادات مستدامة. الأولى مسألة تقنية، بينما الثانية مسألة سوقية. فمن الناحية التقنية، ومن حيث الجدوى الاقتصادية، يتطلب Fusion أن تفوق احتمالية تصحيح الخطأ مضروبة في الخسارة التي يمكن تجنبها نتيجة خطأ واحد، تكلفة إضافة واجهات برمجة تطبيقات جديدة، وزمن الاستجابة، والتعقيد التشغيلي، ومخاطر الخصوصية.

لا تستطيع نتائج الاختبارات المعيارية الإجابة على سؤال الربح والخسارة هذا. لا يكون دمج البيانات مجديًا إلا عندما تكون تكلفة الخطأ مرتفعة، وتوفر النماذج المرشحة مسارات بحث تكميلية، ويفتقر الأمر إلى جهات تحقق خارجية أرخص، ويمكن للشركة قبول تأخير إضافي ومخاطر من جانب الموردين؛ ومع ذلك، يجب تأكيد النتيجة النهائية من خلال أدلة بشرية أو خارجية.

من تحسين النتائج إلى الخدمات المدفوعة: وهم الطلب الناتج عن دمج النماذج ▲ الشكل 5: من التطبيق التكنولوجي إلى الاحتياجات المستدامة. تشمل الجهات التي تستوفي هذه المعايير بشكل أساسي البحوث عالية القيمة، والتدقيق اللازم، ومراجعات البنية والأمن، و"الآراء الثانية" قبل اتخاذ القرارات النهائية. وتشترك هذه الجهات في سمات مشتركة، منها: القيود غير المكتملة، والتكاليف الباهظة للإغفالات، والقيمة الجوهرية للنهج المستقل. في المقابل، لا تتطلب عادةً عمليات الدمج البرمجيات العادية، وتطبيقات الاستهلاك الفوري، وسير العمل عالي الإنتاجية ومنخفض الهامش، والمهام التي يمكن التحقق منها مباشرةً عن طريق الاختبار أو القواعد. وقد ترفض الهيئات التنظيمية أيضًا قوائم الموردين المتعددين بسبب حدود البيانات ومتطلبات التدقيق. من الاستعداد للدفع إلى الاحتياجات المستدامة. يمكن أن تولد الفائدة التكنولوجية استعدادًا كبيرًا للدفع، لكنها لا تعادل طلبًا قابلاً للتوسع. لكي يتحقق الطلب المستدام، يجب أن تكون خسائر الأخطاء قابلة للقياس الكمي، وأن تكون المهام متكررة، وأن تكون هناك مسؤوليات ميزانية محددة بوضوح داخل المؤسسة، وأن يتفوق الدمج باستمرار على الخبراء البشريين، ونماذج الكيان الواحد القوية، والتحقق الخارجي. ومع ذلك، فإن ميزانيات العناية الواجبة غالباً ما تذهب إلى المحللين والمصادر الموثوقة، وميزانيات الأمن تذهب إلى عمليات التدقيق المهنية، والقرارات التي لا رجعة فيها تحدث بشكل غير متكرر.

لذا، لسنا متفائلين بشأن الشركات التي توفر فقط أغلفة نماذج متعددة، أو تشغل لوحات افتراضيًا، أو تتعامل مع خوارزميات اختيار النماذج الثابتة كحاجز وقائي. من السهل تكرار ربط واجهات برمجة التطبيقات، وسرعان ما تفقد الاستراتيجيات الثابتة فعاليتها مع تغير إمكانيات النماذج وأسعارها؛ وبدون معرفة معدل الخطأ وعدد مرات تصحيح Fusion للأخطاء فعليًا، يستحيل تسعير هذا التأمين. أولئك الذين يتحكمون في النتائج الحقيقية هم الأكثر ترجيحًا لتحقيق القيمة: منصات البوابات والوكلاء، والتطبيقات المتخصصة، ومالكو سير العمل، ومنتجات التقييم والمراقبة. إنهم يعرفون تكلفة الأخطاء، ويمكنهم مراقبة النتائج، ويمكنهم تحسين استراتيجيات التشغيل. ما يصعب تكراره حقًا ليس قائمة اللوحات، بل تحديد متى لا يتم استدعاء Fusion. التحقق من صحة السوق: الأسواق العامة غير كافية لتحديد حجم الطلب على Fusion، لكنها تُظهر بالفعل كيفية استخدامه. مجلس نموذج الحيرة متاح فقط لمستخدمي Max وEnterprise Max الذين يدفعون 200 دولار شهريًا. يختار المستخدمون يدويًا ثلاثة نماذج على الويب لأبحاث الاستثمار، واتخاذ القرارات المعقدة، والتحقق من صحة المعلومات؛ تشمل حالات الاستخدام العامة دمج نموذج المجلس في سير عمل أبحاث الأسهم من خلال أتمتة المتصفح. يقدم برنامج "مزيج الوكلاء" من هيرميس نموذج Fusion كنموذج افتراضي قابل للتحديد داخل الوكيل: يمكن للمستخدمين الترقية إلى مشكلة واحدة معقدة عبر /moa، أو تفعيله باستمرار في جلسات معقدة، مع توفير التحليل بواسطة نماذج مرجعية متعددة، واستدعاء أدوات التجميع لإكمال المهمة. قللت هيرميس لاحقًا من تردد التفرع الافتراضي وأعادت استخدام التعليقات من النماذج السابقة للتحكم في التكاليف. توضح هذه الأمثلة أن الطلب الحقيقي على Fusion يتركز في المهام الصعبة منخفضة التردد مثل البحث وتصحيح الأخطاء والمراجعة واتخاذ القرارات الحاسمة. يتمثل الاستخدام النموذجي في ترقيات استباقية بعد أن يواجه نموذج واحد اختناقًا، بدلاً من عملية مؤتمتة عالية التردد مفعلة افتراضيًا. تثبت الأدلة الحالية وجود هذا الطلب، لكن المعلومات المتاحة للجمهور لا تزال غير كافية لتحديد ما إذا كان يمكن أن يشكل سوقًا مدفوعًا مستقلاً واسع النطاق.

 

خامساً: مستقبل الاندماج النووي

رغم أن انخفاض تكاليف الاستدلال يبدو أنه يُفيد Fusion، إلا أنه يُقلل في الوقت نفسه من تكاليف النماذج الفردية القوية، والتوجيه، والتحقق الخارجي. لا تُنافس Fusion على استدعاءات النماذج القديمة، بل على التحسين المستمر للجيل التالي من النماذج الفردية وأسس التنسيق.

يُظهر نظام Devin Fusion من Cognition اتجاه هذه المنافسة: ترك النماذج المكلفة لمرحلة اتخاذ القرار، وتفويض المهام الميكانيكية القابلة للتحقق إلى نماذج أقل تكلفة. في اختبارات البائع الذاتية، ارتفع إجمالي نقاط Fusion + Fable 5 ارتفاعًا طفيفًا من 57.0 إلى 57.6، مع انخفاض متوسط التكلفة من 5.12 دولارًا إلى 3.00 دولارات؛ ومع ذلك، في دراسات الحالة الخمس المنشورة، بينما انخفضت التكاليف بنسبة تتراوح بين 25% و62%، تراوحت نقاط المهام بين +12 و-27. ارتفعت نقاط عمليات إعادة هيكلة ES6 المُحددة جيدًا والمُختبرة بدقة من 98 إلى 100 نقطة؛ بينما انخفضت نقاط وظائف React/Redux التي تعتمد على فهم التفاعل والمتطلبات الضمنية، عند تفويضها بشكل خاطئ، من 54 إلى 27 نقطة.

من تحسين النتائج إلى الخدمات المدفوعة: وهم الطلب الناتج عن دمج النماذج ▲ الشكل 6: نتائج وتكاليف مهام دمج ديفين. هذه أمثلة مختارة من قبل الموردين ولا تمثل التوزيع الكلي، لكنها تشير بوضوح إلى ما يلي: القدرة الأساسية لأنظمة النماذج المتعددة المستقبلية ليست استدعاء المزيد من النماذج، بل تحديد حدود التدهور الصحيحة. يمكن إسناد المهام الميكانيكية القابلة للتحقق إلى نماذج أقل تكلفة، بينما يجب ترك المهام التي تتطلب قدرًا كبيرًا من التقدير للنماذج المتطورة. يبيع OpenRouter "ذكاءً أكبر"، بينما يبيع Cognition "ذكاءً مكافئًا بتكلفة أقل"؛ والاقتراح الثاني أقرب إلى التوجه طويل الأجل. كلما اقترب النظام من اقتصاديات الإنتاج، قلّ تشابهه مع دمج النماذج بالمعنى الضيق، وازداد تشابهه مع التوجيه والتفويض والتحقق.

في أواخر يوليو، أشارت تقارير إعلامية إلى أن شركة Stripe كانت تجري محادثات للاستحواذ على OpenRouter مقابل حوالي 10 مليارات دولار، على الرغم من أن الصفقة لم تُؤكد رسميًا بعد. لا ينبغي تفسير هذه الإشارة على أنها دليل على حصول Fusion على مصداقية السوق: فالقيمة الأساسية لـ OpenRouter لا تكمن في أي منصة محددة، بل في طبقة الاتصال المحايدة التي تربط أكثر من 5 ملايين مطور بأكثر من 400 نموذج. توفر Stripe بالفعل خدمات الفوترة والضرائب وإدارة المخاطر لـ OpenRouter، وتتيح للمطورين إنشاء حسابات والحصول على مفاتيح API والاتصال بالمدفوعات مباشرةً عبر Stripe Projects. ما تستحوذ عليه Stripe على الأرجح هو بوابة المعاملات لاستنتاج الذكاء الاصطناعي: تتحكم OpenRouter في اختيار النموذج واستخدام الرموز والتكاليف، بينما تتولى Stripe التسعير والفوترة والمدفوعات. يوفر هذا إشارة سوقية للتقييم المذكور سابقًا: من المرجح أن تظل القيمة في عصر النماذج المتعددة في طبقة التنسيق، التي يمكنها مراقبة المهام وتخصيص المكالمات وإتمام التسويات؛ أما Fusion فهي مجرد استراتيجية ترقية عالية التكلفة تُضاف إلى ذلك.

لن تستدعي أنظمة النماذج المتعددة المستقبلية اللجان تلقائيًا؛ بل ستقوم أولًا بتقدير صعوبة المهمة، وتكاليف التحقق، وعقوبات الخطأ. ولن يبدأ البحث عن تباعد النماذج المتعددة إلا عندما تكون النماذج الفردية الأقوى، والاستدلال الموسع، والأدوات الخارجية غير كافية. ويُعد معدل التشغيل، ومعدل النجاح التراكمي، والتكلفة المُتحقق منها لكل وحدة نتيجة، هي المقاييس الوحيدة ذات الدلالة للمنتج. وسيظل الدمج ميزة نادرة الاستخدام، بدلًا من أن يصبح البنية الافتراضية أو فئة مستقلة.

 

سادساً: المصادر

أوبن راوتر: تجاوز أداء فرونتير مع فيوجن

وثائق جهاز التوجيه OpenRouter Fusion

الإدراك: ديفين فيوجن --- أداء رائد بتكلفة أقل بنسبة 35%

بحث مايكروسوفت: سويتشكرافت --- موجه نماذج الذكاء الاصطناعي لاستدعاء الأدوات الآلية

متى يكون دمج نماذج اللغة مفيداً؟

تحسين كفاءة الحوسبة من خلال الاستدلال متعدد العوامل

تتفوق أنظمة التعلم الآلي أحادية الوكيل على أنظمة متعددة الوكلاء في الاستدلال متعدد القفزات في ظل ميزانيات متساوية من الرموز المميزة للتفكير

يعزز نموذج الوكلاء المختلطين قدرات نماذج اللغة الكبيرة

RouteLLM: تعلم توجيه نماذج التعلم الآلي باستخدام بيانات التفضيل

ليت بنش: معيار لتقييم الكتابة الإبداعية

مقارنة نماذج التحليل الاصطناعي

ثمن التقدم: أداء السعر ومستقبل الذكاء الاصطناعي

الحيرة: ما هو المجلس النموذجي؟

مثال مستخدم لـ Perplexity: مجلس نموذجي للبحوث المالية

وثائق برنامج Hermes Agent: Mixture of Agents

تُتيح Stripe الوصول العالمي إلى نماذج الذكاء الاصطناعي لـ OpenRouter

أكسيوس: ما الذي يقف وراء انتقال سترايب المزعوم إلى أوبن راوتر؟

هذا المحتوى لأغراض معلوماتية وتعليمية فقط، ولا يمثل نصيحة استثمارية تتعلق بـ BTCC. تبذل BTCC قصارى جهدها ولكنها لا تضمن صحة أو دقة أو أصالة المحتوى المذكور أعلاه.