إرهاق النماذج يضرب صناعة الذكاء الاصطناعي والمختبرات تطلق أسرع مما يتحمل العملاء
دخلت صناعة الذكاء الاصطناعي مرحلة غريبة من الإفراط في الابتكار.
في أسبوع واحد فقط من هذا الشهر، أطلقت Anthropic وOpenAI وميتا وجوجل نماذج رئيسية.
أصبح لدى المشترين من الشركات اسم لهذه التجربة: إرهاق النماذج.
الشركات تقضي وقتاً أطول في مقارنة النماذج بدلاً من استخدامها.
الجدول الزمني للإصدارات أصبح مزدحماً لدرجة أن فرق الهندسة لا تستطيع تقييم كل نظام جديد قبل وصول النظام التالي.
المشكلة ليست مجرد إزعاج، بل تعقيد ملف السلامة.
كل إصدار يحمل قدرات جديدة ومخاطر جديدة، ويُترك للعملاء مهمة معرفة أي نموذج آمن بما يكفي لسير العمل.
هناك قوتان تدفعان هذه الوتيرة.
الأولى هي المنافسة.
OpenAI وAnthropic تتجهان إلى الأسواق المالية، وكل منهما تريد أن تُظهر للمستثمرين تدفقاً مستمراً من المنتجات الجديدة.
الثانية هي تكلفة التأخر.
النموذج الذي يبدو ثورياً اليوم قد يبدو قديماً بعد أسابيع.
تعلمت المختبرات أن الإطلاق السريع أسهل من الدفاع عن خارطة طريق بطيئة.
النتيجة سوق لا يريد أحد أن يرمش فيه أولاً.
الوتيرة المحمومة تذكر بمرحلة الهواتف الذكية عندما كانت الشركات تطلق أجهزة جديدة كل بضعة أشهر.
لكن الفرق أن تغيير النموذج اللغوي يعني إعادة بناء جزء من البنية التحتية للشركة.
بعض العملاء يختارون الآن الانتظار حتى يستقر السوق.
آخرون يبنون طبقات برمجية تسمح لهم بتبديل النماذج بسرعة.
هذه الطبقات نفسها أصبحت صناعة مزدهرة.
الشركات الناشئة التي تقدم بوابات موحدة للنماذج تحقق نمواً سريعاً لأنها تحل مشكلة الإرهاق.
في المقابل، المختبرات الكبرى تحاول ربط العملاء بنماذجها الخاصة عبر أدوات وواجهات برمجية.
المعركة القادمة ليست حول من يملك أفضل نموذج، بل من يستطيع إقناع العملاء بالتوقف عن البحث.
من المتأثر؟
فرق المؤسسات في البنوك والرعاية الصحية والتجزئة والحكومة.
يحتاجون إلى الاستقرار، لكن بائعي الذكاء الاصطناعي يواصلون تحريك الأرضية.
مطورو البرمجيات يتأثرون أيضاً لأن كل نموذج جديد يغير سلوك تطبيقاتهم.
المشهد التنافسي منقسم بين مختبرات تطلق نماذج عامة وشركات ناشئة تبني أدوات متخصصة فوقها.
ماذا سيحدث بعد ذلك؟
إرهاق النماذج قد يدفع المؤسسات إلى توحيد استخدامها مع عدد قليل من البائعين.
وقد يخلق طلباً على خدمات تقييم مستقلة.
المختبرات قد لا تبطئ، لكن عملاءها بدأوا يطلبون مساحة للتنفس.
Anthropic تفكر في نموذج جديد بعد أن طلب رئيسها التنفيذي إبطاء السباق
تجد شركة Anthropic نفسها محاصرة بين تحذيراتها المتعلقة بالسلامة وضغوط المنافسة.
بعد أسبوع واحد فقط من دعوة الرئيس التنفيذي داريو أمودي إلى إبطاء وتيرة تطوير الذكاء الاصطناعي، تشير تقارير إلى أن الشركة تفكر في إطلاق نموذج جديد لمواجهة GPT 6 Astra من OpenAI.
وكالة رويترز نقلت عن ثلاثة أشخاص مطلعين على الأمر أن النقاشات جارية داخل الشركة.
الخطوة تضع Anthropic في موقف محرج.
أمودي كان قد حذر من أن الصناعة تتحرك بسرعة كبيرة وأن المختبرات بحاجة إلى تنسيق جهودها في مجال السلامة.
لكن نموذج OpenAI الجديد يحقق انتشاراً متزايداً بين عملاء المؤسسات، ولا تستطيع Anthropic أن تبقى مكتوفة الأيدي.
التوتر داخل Anthropic يعكس الصراع الأوسع في صناعة الذكاء الاصطناعي.
الشركات تريد أن تكون مسؤولة، لكنها تريد أيضاً أن تفوز.
المستثمرون يراقبون عن كثب.
الاكتتاب العام أصبح قريباً، ونمو الإيرادات يعتمد على إطلاق نماذج تشتريها المؤسسات فعلياً.
GPT 6 Astra وُصف بأنه نموذج قادر على تشغيل الكمبيوتر، وهي قدرة تلقى صدى لدى المشترين الذين يبحثون عن الأتمتة.
إذا لم تستجب Anthropic، فإنها تخاطر بفقدان الحصة السوقية والاهتمام العام.
التقارير تشير أيضاً إلى أن النموذج الجديد قد يكون مصمماً خصيصاً للمهام الوكيلية، بما في ذلك كتابة البرمجيات واستخدام الكمبيوتر.
هذا سيعني منافسة مباشرة مع ميزات OpenAI الوكيلية.
أداة Claude Code من Anthropic أصبحت شائعة بين المطورين، ونموذج جديد قد يوسع هذه الميزة.
Anthropic تطلق نموذج Mythos لمستخدمين معتمدين وواشنطن تلتفت
وضعت شركة Anthropic نفسها في قلب النقاش الأميركي حول الذكاء الاصطناعي بعد إطلاقها نموذج Mythos، الذي تصفه بأنه الأكثر قدرة حتى الآن.
لم يكن الإطلاق عاماً، بل اقتصر على مستخدمين معتمدين في القطاعين العام والخاص، في خطوة تقول الشركة إنها الطريقة الأكثر أماناً لتقديم نظام بهذا المستوى من القوة.
علم وزير الخزانة سكوت بيسنت بالأمر في الليلة السابقة للإطلاق، وسرعان ما وصل الخبر إلى أعلى مستويات إدارة ترامب.
Mythos ليس مجرد نموذج جديد، بل إشارة إلى أن الذكاء الاصطناعي المتقدم انتقل من مختبرات الأبحاث إلى آليات عمل الحكومة والمال.
تأسست Anthropic على يد مديرين سابقين في OpenAI من بينهم داريو أمودي، وحصلت على مليارات الدولارات من أمازون وجوجل.
نماذجها تنافس مباشرة نموذج GPT 6 Astra من OpenAI.
إطلاق Mythos لمستخدمين معتمدين يشير إلى أن الشركة تفضل النشر المتحكم فيه على الوصول الاستهلاكي الواسع.
هذا النهج يجذب الجهات التنظيمية والمشترين من المؤسسات الذين يخشون فقدان السيطرة.
كما يخلق ديناميكية جديدة في سباق الذكاء الاصطناعي، حيث تصبح السلامة ميزة تنافسية.
الخطوة تثير أسئلة حول العلاقة بين شركات الذكاء الاصطناعي والحكومة الأميركية.
لأول مرة، يبدو أن مسؤولي الإدارة يتابعون إصدار نموذج معين بنفس الاهتمام الذي يتابعون به التقارير الاستخباراتية.
التقارير تشير إلى أن بيسنت اعتبر القدرات المتزايدة للذكاء الاصطناعي تهديداً فريداً للاقتصاد الأميركي.
هذا يفسر لماذا طلب اجتماعاً مع كبار المصرفيين في صباح اليوم التالي للإطلاق.
إطار جديد يريد منع وكلاء الذكاء الاصطناعي من الفشل في بيئات العمل
أنفقت الشركات مبالغ ضخمة على وكلاء الذكاء الاصطناعي، لكن الكثير من هؤلاء الوكلاء يفشلون في بيئات الإنتاج.
ورقة بحثية نُشرت على arXiv في 17 سبتمبر تقدم طريقة جديدة لفهم السبب.
الباحثون شاينا رضا وأحمد ي.
رضوان وعمران لياقت وكاثرين هيوم يرون أن نتائج المعايير المفردة مضللة.
يقترحون إطار تقييم موحداً يقيس أداء الوكلاء عبر ثمانية أبعاد: القدرة، والمتانة، والسلامة، والإنصاف، والشفافية، والحوكمة، والإشراف، والكفاءة.
الهدف هو إعطاء المؤسسات أداة عملية لاختبار الوكلاء قبل النشر ومراقبتهم بعده.
الورقة تصل في لحظة حاسمة.
وكلاء الذكاء الاصطناعي يُستخدمون الآن في كتابة البرمجيات، ودعم العملاء، وتحليل البيانات، واتخاذ القرارات المستقلة.
لكن حالات الفشل شائعة.
الوكلاء قد يقدمون إجابات واثقة لكنها خاطئة، أو يتجاهلون التعليمات، أو يتصرفون بشكل غير متوقع عندما يُمنحون حرية زائدة.
المعايير الحالية غالباً ما تقيس شريحة ضيقة من الأداء وتفشل في رؤية الواقع الفوضوي لبيئات الإنتاج.
إطار الأبعاد الثمانية يحاول معالجة ذلك بإجبار المقيّمين على النظر في المفاضلات.
وكيل قادر لكنه غير آمن لا يمكن نشره.
وكيل شفاف لكنه غير كفؤ قد لا يكون عملياً.
المؤلفون يشدّدون على أن معايير القياس الحالية لا تعكس المخاطر الحقيقية في الاستخدام اليومي.
الذكاء الاصطناعي يبدو واثقاً من نفسه وقادة الأعمال يدفعون الثمن
أنظمة الذكاء الاصطناعي تعاني من مشكلة ثقة زائدة.
إنها تقدم إجابات بقناعة مطلقة، دون تحفظات، ودون أي إشارة إلى عدم اليقين.
قادة الأعمال يقرؤون هذه المخرجات ويتخذون قرارات بناءً عليها.
النمط ليس جديداً، لكنه يصبح أكثر خطورة مع دمج الشركات للنماذج اللغوية الكبيرة في حلقات اتخاذ القرار وخدمة العملاء والوكلاء المستقلين.
النموذج لا يتحفظ.
لا يقول إن توصيته مبنية على افتراضات هشة.
إنه يقدم الإجابة الأكثر احتمالاً كحقيقة مؤكدة.
جذر المشكلة يعود إلى طريقة تدريب النماذج اللغوية.
هذه النماذج مُحسّنة للتنبؤ بالكلمة التالية، وليس لقياس درجة يقينها.
عندما لا يملك النموذج معلومات كافية، فإنه ما زال ينتج إجابة سلسة.
عندما تكون البيانات غامضة، فإنه يختار مساراً واحداً.
هذا يخلق إحساساً زائفاً بالموثوقية.
المدير التنفيذي الذي يطلب من الذكاء الاصطناعي تحليلاً للسوق قد يحصل على ملخص مصقول يخفي فجوات في البيانات الأساسية.
النتيجة فجوة متزايدة بين الدقة المدركة والأداء الفعلي.
من المتأثر؟
كل مؤسسة تعتمد على الذكاء الاصطناعي في قرارات حساسة.
البنوك والمستشفيات ومكاتب المحاماة والوكالات الحكومية.