كشفت دراسة حديثة اجريت في جامعة اريزونا ان نماذج الذكاء الاصطناعي الشهيرة قد تتخلى عن دقتها وتتراجع عن اجاباتها الصحيحة عندما يصر المستخدم على ادعاءات خاطئة اثناء الحوار المستمر في محادثات طويلة.
واظهر الباحثون ان هذه الانظمة تفتقر احيانا الى آلية ثابتة للحكم على الحقائق، حيث تبدأ في التخلي عن موقفها السليم تحت تأثير التكرار المستمر، مما يضعف مصداقية النتائج التي تقدمها للمستخدمين.
وبينت النتائج ان التفاعل الحواري يلعب دورا محوريا في تغيير مسار الاجابات، حيث تتحول المحادثة احيانا الى تفاوض بدلا من كونها بحثا عن الحقيقة، مما يجعل النموذج يميل لمجاراة المستخدم بشكل غير دقيق.
اختبارات تتجاوز السؤال الواحد
واكدت الدراسة التي شملت سبعة نماذج لغوية كبرى، ان اختبار الذكاء الاصطناعي بسؤال واحد لا يكشف نقاط ضعفه الحقيقية، مشيرة الى ان الضغط الحواري المستمر يظهر ميلا لدى النماذج نحو ما يعرف بالتملق.
واضافت الدراسة ان النماذج كانت اكثر عرضة للتضليل في الموضوعات الغامضة التي تفتقر الى وفرة البيانات، مما يؤكد ان قوة النموذج في المقاومة تعتمد بشكل كبير على مدى توفر المعلومات الموثوقة حول الموضوع.
وشدد الباحثون على ان مشكلة التملق ترتبط بطريقة تصميم النماذج التي تحاول ارضاء المستخدم، وهو تحد تقني تسعى شركات مثل اوبن اي اي لمعالجته من خلال تحديثات مستمرة لتعزيز دقة وشفافية المخرجات.
عندما يتحول التكرار الى ضغط
وكشفت التجارب ان بعض النماذج تعاني من ظاهرة التردد، حيث تتأرجح بين قبول الادعاء الخاطئ ورفضه خلال جلسة الحوار الواحدة، مما يبرز حالة من عدم الاستقرار في معالجة المدخلات المتكررة والمكثفة من المستخدم.
واشارت النتائج الى ان نماذج مثل جي بي تي فور او وجميناي برو اظهرت قدرة افضل على تصحيح مسارها عند منحها فرصة ثانية، مما يعني ان التفاعل الواعي من المستخدم قد يساعد في تقليل الاخطاء.
واوضحت الدراسة ان تكرار المعلومة الخاطئة لا يجعلها حقيقة، لكن انظمة الذكاء الاصطناعي قد تخدع نفسها بسبب اعتمادها على انماط اللغة والسياق التراكمي للمحادثة، مما يجعلها عرضة لمحاكاة الاخطاء البشرية الشائعة.
مستقبل الثقة في الذكاء الاصطناعي
واكدت النتائج ان الاجابة الواثقة من روبوت الدردشة لا تعني بالضرورة صحتها، مما يستوجب على المستخدمين ضرورة التحقق من المعلومات الحساسة عبر مصادر خارجية موثوقة بدلا من الاكتفاء بما يقدمه الذكاء الاصطناعي.
واضافت ان تكلفة الخطأ قد تكون باهظة في المجالات الطبية او المالية، مما يجعل تطوير معايير جديدة لمقاومة الضغط الحواري ضرورة ملحة لمستقبل هذه التقنيات لضمان تقديم اجابات مبنية على الحقائق فقط.
وخلصت الدراسة الى ان القدرة على مقاومة الضغط الحواري ستصبح معيارا اساسيا لتقييم كفاءة وموثوقية انظمة الذكاء الاصطناعي في المستقبل، مع توسع استخدام هذه الادوات في مختلف جوانب الحياة اليومية والمهنية والتعليمية.