اختبرت ChatGPT-6 مقابل Claude Opus 5.5 بـ 5 مطالبات يومية: الفارق كان شاسعًا

اكتشف الفائز: مقارنة حاسمة بين ChatGPT-6 و Claude Opus 5.5 في 5 مهام يومية. أحدهما تفوق بوضوح، والآخر لم يقترب!

أهم ما تحتاج إلى معرفته

  • يتفوق Claude في فهم المطالبات المعقدة بعمق، حيث يتوقع الاحتياجات غير المصرح بها (مثل التلوث المتبادل في تخطيط الحفلات) ويقدم حلولاً متكاملة وذكية.
  • أظهر Claude قدرة فائقة على إعادة صياغة المشكلات للتركيز على الفوائد البشرية الملموسة وفهم الدوافع الأساسية، مما يعكس نهجًا استراتيجيًا أعمق.
  • على الرغم من تفوق Claude في العمق، كان نهج ChatGPT المباشر والمبسط خطوة بخطوة أكثر فعالية في توفير حلول عملية وفورية للمواقف المربكة، مثل تنظيم الحياة اليومية المزدحمة.

أصدرت كل من OpenAI و Anthropic هذا الشهر نماذج ذكاء اصطناعي رائدة جديدة، وهما ChatGPT-6 و Claude Opus 5.5. يتمتع كلاهما بقدرات هائلة لدرجة أنهما يقدمان أكثر بكثير مما يطلبه معظم المستخدمين منهما.

تعتمد عائلة GPT-6 من OpenAI على GPT-6 Astra، وهو النموذج الأكثر إثارة للإعجاب للشركة حتى الآن، مع تحقيق مكاسب كبيرة في مجالات مثل الاستدلال، العمل الاحترافي، البرمجة، التصفح، واستخدام الحاسوب. يجلب GPT-6 Sol الأحدث الكثير من هذا الذكاء إلى الإصدار المصمم للعمل اليومي، حيث تضعه OpenAI كنموذج استدلال أسرع وأقل تكلفة.

يتناول Claude Opus 5.5 المشكلة من زاوية مختلفة قليلاً. تصفه Anthropic بأنه نموذج مصمم للعمل الوكيل والمعرفي طويل الأمد، مع تفكير تكيفي يحدد مقدار الجهد الذي يتطلبه الطلب. يتميز بنافذة سياق تصل إلى مليون رمز (token)، ويمكنه إنتاج ما يصل إلى 128,000 رمز إخراج، ووفقًا لـ Anthropic، فإنه يحقق أداءً مماثلاً تقريبًا لنموذجها الأعلى Claude Fable 5.1 في معظم المهام، بينما يكلف تشغيله أقل بنسبة 40% من إصدار Opus السابق. كما سلطت Anthropic الضوء بشكل خاص على التحسينات في مدى طبيعية تواصل النموذج واتباعه لتعليمات الكتابة.

تبدو هذه الاختلافات مثيرة للإعجاب، لكنها لا تخبرك بالضرورة أي روبوت محادثة تفضل أن يساعدك في حياتك اليومية. لمزيد من المقارنات العملية، يمكنك الاطلاع على مقالنا: اختبرت Claude 4 Sonnet ضد ChatGPT-4o بـ 7 مهام: أحدهما تفوق بشكل ساحق.

لذلك، قدمت لـ ChatGPT-6 و Claude Opus 5.5 نفس المطالبات الخمسة بالضبط. لم تكن النتيجة انتصارًا ساحقًا كما توقعت. إليك ما حدث عندما أخضعتهما لمطالبات الحياة اليومية.

1. تخطيط واقعي معقد — قيود + تقدير

لقطة شاشة

المطالبة: لدي 150 دولارًا لتخطيط حفلة عيد ميلاد لـ 10 أطفال تتراوح أعمارهم بين 8 و 11 عامًا. يجب أن تستمر ثلاث ساعات، وتكون داخلية في حال هطول الأمطار، وتشمل الطعام، وتقلل من وقت الشاشات قدر الإمكان. اثنان من الأطفال نباتيون وواحد لديه حساسية من الفول السوداني. أنشئ خطة كاملة، بما في ذلك الميزانية والجدول الزمني والأنشطة وخطة احتياطية. لا تتجاوز 150 دولارًا.

قدم ChatGPT تأطيرًا مفاهيميًا واضحًا من خلال إعطاء الحدث هوية وتوجيهًا فوريًا. إن تخصيص 36 دولارًا لثلاث بيتزا جبن جاهزة للتوصيل أسهل عمليًا على الوالد الذي يستضيف 10 أطفال من إدارة إعداد البيتزا المصغرة بنفسه في مطبخ منزلي عادي. كما أدرك الحاجة إلى “احتياطي طوارئ/سعر” في النهاية.

كان Claude ذكيًا في استباقه لمسائل الحساسية والبروتوكولات الغذائية. كما تناول مشكلة التلوث المتبادل بين كعك المخابز والخلطات الجاهزة. وأظهر براعة في الميزانية، حيث خصص 14 دولارًا لحقائب قماشية و12 دولارًا لأقلام تحديد الأقمشة، لتكون بمثابة نشاط حرفي عند الوصول وهدية تذكارية للحفل في نفس الوقت، مما وفر المال وقلل من النفايات البلاستيكية الرخيصة. وقدم أيضًا جدولًا زمنيًا عمليًا ومحددًا، وحلولًا لمشاكل التشغيل. هذه القدرة على تقديم خطة متكاملة وذكية تجعل Claude خيارًا مفضلاً للكثيرين، كما هو موضح في مقال “6 أسباب لاستخدامي لـ Claude بدلاً من ChatGPT”.

الفائز: Claude يفوز لأنه قدم خطة جاهزة ومتكاملة للمضيف، مع اهتمام حقيقي بالسلامة، بينما قدم ChatGPT قائمة تسوق مجزأة.

2. الكتابة — اجعل الذكاء الاصطناعي يبدو بشريًا

لقطة شاشة

المُطالبة: أعد صياغة هذا الإعلان الممل ليصبح شيئًا يرغب شخص حقيقي في قراءته. حافظ على كل التفاصيل الواقعية، لا تستخدم الشرطات الطويلة (em dashes)، تجنب الكليشيهات، ولا تستخدم الكلمات “مثير”، “ثوري”، “مغير للعبة” أو “سلس”.

“تقدم شركتنا ميزة تقويم جديدة مدعومة بالذكاء الاصطناعي تحدد تلقائيًا تعارضات الجدولة، وتوصي بأوقات الاجتماعات، وتنشئ ملخصات بعد الاجتماعات. سيتم إطلاق الميزة في 15 أكتوبر وستكون متاحة لجميع العملاء دون أي تكلفة إضافية.”

قدم ChatGPT جملة افتتاحية قوية تجذب القارئ، كما تجنب الأساليب النمطية للذكاء الاصطناعي وحافظ على كل التفاصيل الواقعية. فواصل الفقرات جعلت النص سهل المسح السريع.

أعاد Claude صياغة النقاط الرئيسية إلى فوائد بشرية ملموسة، وأعاد تأطير التفاصيل لتركز على التخفيف الفعلي لأعباء العمل.

الفائز: يفوز Claude لأنه أدرك أن إعادة الصياغة “البشرية” تتطلب إعادة التفكير في كيفية شرح قيمة الميزات، بدلاً من مجرد تغيير بعض الأفعال في النص الأصلي. هذا يتماشى مع المطالبة الواحدة التي تُحدث فرقًا كبيرًا عند استخدام Claude يوميًا.

3. الاستدلال — الإجابة ليست واضحة

لقطة شاشة

المطالبة: تفاضل عائلة بين خيارين لاستئجار منزل لقضاء العطلة. يكلف المنزل الأول 1,850 دولارًا ويقع على بُعد 10 دقائق سيرًا على الأقدام من الشاطئ. أما المنزل الثاني فيكلف 1,500 دولار، لكنه يتطلب قيادة السيارة لمدة 25 دقيقة للوصول إلى الشاطئ، بالإضافة إلى 35 دولارًا يوميًا لمواقف السيارات. ستقضي العائلة سبعة أيام وتتوقع زيارة الشاطئ مرتين يوميًا. لديهم ثلاثة أطفال. أي الخيارين يجب أن يختاروا؟ لا تكتفِ بحساب التكلفة. حدد العوامل التي قد تغير توصيتك وأخبرني ما هي المعلومات الإضافية الأكثر أهمية.

قدم ChatGPT أفضل منظور مضاد منفرد بشأن أعمار الأطفال. كما أشار بذكاء إلى أن “المشي لمدة 10 دقائق” يختلف بشكل كبير حسب البنية التحتية المحيطة (هل هو ممشى خشبي أم يتطلب عبور طريق سريع بأربعة مسارات أو اجتياز كثبان رملية؟). وقد أشار الروبوت الدردشة تحديدًا إلى أن المنزل الأول يتيح للوالدين تقسيم المهام (على سبيل المثال، يمكن لأحد الوالدين اصطحاب طفل متعب للعودة بينما يبقى الآخر على الشاطئ مع الطفلين الآخرين).

أجرى Claude حسابات المسافة بدقة، مبرهنًا أن التوفير المالي من المنزل الثاني لا يتجاوز فعليًا مبلغًا ضئيلًا يتراوح بين 55 و 65 دولارًا إجماليًا للأسبوع بأكمله. كما قدم Claude نقطة نفسية ثاقبة: فعملية تحميل وتفريغ ثلاثة أطفال في مقاعد السيارة أربع مرات يوميًا تعني أن العائلة ستتخلى على الأرجح عن رحلة الشاطئ اليومية الثانية بالكامل. وأشار أيضًا بشكل صحيح إلى “السر القذر” لمنصات تأجير العطلات: فالأسعار الأساسية لا تشمل رسوم التنظيف، أو رسوم الخدمة، أو ضرائب الإشغال، والتي يمكن أن تقلب فرق الـ 105 دولارات بمفردها.

الفائز: فاز Claude بفارق ضئيل. على الرغم من أن ChatGPT قدم أفضل نقطة فردية (إدراكه أن المشي بمعدات الشاطئ الثقيلة والأطفال الصغار قد يكون أكثر إرهاقًا من القيادة)، إلا أن Claude تفوق بشكل عام لأن تحليله المالي كان شاملاً ودقيقًا للغاية، وتوقع الرسوم الخفية، وكانت ملاحظته بأن التنقل سيجعل العائلة تلغي نزهاتها المخطط لها في محلها تمامًا. اكتشف 6 أسباب تدفعني لاستخدام Claude بدلاً من ChatGPT.

4.  خيارات متعددة — كيف نحدد الأهم؟

لقطة شاشة

المطالبة: لدى مدينة ميزانية قدرها 10 ملايين دولار لإنفاقها، وتواجه ثلاثة خيارات:

أ) بناء مكتبة عامة جديدة يتوقع أن تخدم 200,000 زيارة سنويًا لمدة 30 عامًا على الأقل.
ب) منح كل أسرة دفعة واحدة بقيمة 500 دولار.
ج) ترقية البنية التحتية للمياه المتقادمة، وهو أمر لن يلاحظه السكان إلا إذا حدث خلل ما.

يمكن للمدينة اختيار خيار واحد فقط. اختر الخيار الذي تعتقد أنه الأفضل. اشرح منطق اختيارك، وحدد أقوى حجة ضد اختيارك، واشرح ما هي المعلومة الإضافية التي من المرجح أن تغير إجابتك. لا تتهرب بالقول إن جميع الخيارات جيدة.

ChatGPT اتبعت جميع التعليمات بدقة وقدمت دفاعًا سهل القراءة عن الخيار C. كما حددت بوضوح عتبة التقييم الهندسي.

صاغ Claude اختياره من خلال الحوافز البلدية وأدرك أن تمويل ما تتجاهله السياسات الانتخابية هو الوظيفة الأساسية لإدارة المدينة.

الفائز: Claude يتفوق لأنه قدم إجابة أفضل بكثير. بدا أن الروبوت يتمتع بخبرة في إدارة المالية العامة، بينما بدت استجابة ChatGPT أكثر نمطية وسطحية.

5 الاختبار الحاسم — طلب غامض + مبادرة

لقطة شاشة

المُطالبة: أشعر أن حياتي غير منظمة. لدي ثلاثة أطفال، وظيفة بدوام كامل، مسؤوليات منزلية، وحوالي 30 دقيقة كل مساء للسيطرة على الأمور. ابنِ لي نظامًا يمكنني الحفاظ عليه بشكل واقعي. لا تعطني نصائح إنتاجية عامة. ضع افتراضات معقولة عند الضرورة، أخبرني بما تفترضه، وامنحني شيئًا يمكنني البدء به الليلة.

قدم ChatGPT طرقًا بسيطة لمنع الإرهاق، وتضمنت تعليمات مقسمة إلى خطوات حتى لا يضطر المستخدم إلى التخطيط أو محاولة تخمين من أين يبدأ.

تناول Claude العبء الذهني، وهو بصيرة حادة ودقيقة حول سبب حدوث الفوضى. كما ذكر نصيحة مفيدة تتمثل في تفويض المهام المنزلية الممكنة، مع إدراكه أن أحد الوالدين لا يمكن أن يكون المحرك التشغيلي الوحيد لأسرة مكونة من خمسة أفراد.

الفائز: ChatGPT يتفوق لأن إطاره المعرفي يحمي بشكل أكبر النطاق الذهني للوالد المنهك. قدم Claude روتينًا جيدًا للتنظيم المنزلي؛ بينما قدم ChatGPT مرشحًا لاتخاذ القرار يمنع العمل والأسرة والحياة من تدمير بعضها البعض بالفعل.

الفائز الإجمالي: Claude

بعد خمسة اختبارات، تفوق Claude Opus 5.5 في أربعة منها. لكن ما أدهشني هو مدى ثبات نفس الفارق بين هذه النماذج عبر مهام غير ذات صلة تمامًا. يميل Claude إلى التعمق أكثر.

عندما طلبت منه التخطيط لحفلة عيد ميلاد، فكر في التلوث المتبادل ووجد طرقًا لشراء واحد يخدم غرضين. وعندما طرحت عليه مشكلة تأجير الإجازات، قام بحساب التكاليف التي لم أطلبها صراحةً، واعتبر ما إذا كان إزعاج القيادة سيغير سلوك العائلة بالفعل. حتى عند اختيار كيفية إنفاق مدينة 10 ملايين دولار، نظر إلى ما هو أبعد من الإيجابيات والسلبيات الواضحة للتفكير في سبب اتخاذ الحكومات لهذه القرارات في المقام الأول.

في هذه النقطة بالتحديد، أظهر Claude Opus 5.5 قوته الأكبر. على عكسه، كان ChatGPT-6 أكثر انسيابية بشكل عام، وهذا يتماشى تمامًا مع طبيعة ChatGPT المعهودة. فدائمًا ما يميل ChatGPT، بغض النظر عن النموذج، إلى تقديم إجابات أكثر تركيزًا وأقل إسهابًا، ويصل إلى صلب الموضوع بسرعة أكبر. لكن هذا يعني أيضًا أن إجاباته لم تكن دائمًا بنفس عمق إجابات Claude، وهو ما يدفع البعض لتفضيل Claude في مهام معينة. تعرف على الأسباب الحاسمة التي قد تدفعك لاستخدام Claude بدلاً من ChatGPT-5. ومع ذلك، تحول هذا الأسلوب (أي أسلوب ChatGPT المباشر) إلى ميزة في اختباري الأخير.



التعليقات مغلقة.