باحثون يحذرون من ردود ChatGPT تجاه المستخدمين.. يمكن أن تتأثر بالمدح

أجرى باحثون في جامعة بنسلفانيا تجربة استخدموا فيها أساليب إقناع متعددة، مثل الإطراء وضغط الأقران، لاستهداف نموذج الدردشة GPT-4o mini.

ووجدوا أن اختراق التسلسل الهرمي للنظام لم يتطلب محاولات اختراق معقدة أو حقنًا متعدد الطبقات للمحفزات؛ فالأساليب التي تُطبق على البشر قد تكون كافية لإقناعه بالامتثال.

وأظهرت التجربة أن النموذج استجاب لطلبات غير مقبولة وصنّع دواءً منظّمًا (ليدوكايين)، وأن نسبة الامتثال بلغت 72% من نحو 28,000 محاولة، وكان معدل النجاح أكثر من ضعف ما تحقق بالمحفزات التقليدية.

ونشرت الورقة البحثية في منصة SSRN بعنوان «اعتبرني أحمق: إقناع الذكاء الاصطناعي بالامتثال للطلبات غير المقبولة»، مشيرةً إلى أن النتائج تؤكد أهمية الأدلة الكلاسيكية في العلوم الاجتماعية لفهم قدرات الذكاء الاصطناعي السريعة التطور، وكاشفةً عن مخاطر التلاعب من قِبل جهات فاعلة سيئة وإمكانية استخدام أساليب أكثر إنتاجية من قِبل مستخدمين نواياهم حسنة.

ذات صلة

الوصفة الأصلية.. طريقة عمل حمص الشام

طريقة تحضير بيتزا بالطماطم بلا لحم

خمس علامات تحذيرية في الأصابع تشير إلى نقص فيتامين د

اخبار متفرقة

الوصفة الأصلية.. طريقة عمل حمص الشام

طريقة تحضير بيتزا بالطماطم بلا لحم

خمس علامات تحذيرية في الأصابع تشير إلى نقص فيتامين د

دراسة: الإفراط في الدردشة مع الذكاء الاصطناعي قد يزيد خطر الاكتئاب

تناول هذه الأطعمة في الشتاء يعزز مناعتك ويحميك من الالتهاب

باحثون يحذرون من ردود ChatGPT تجاه المستخدمين.. يمكن أن تتأثر بالمدح

تابعونا على

أنا السعودية

الأكثر شهرة

الدوري السعودي: ميسي إلى الهلال وبنزيما إلى الاتحاد

ريال مدريد يفوّض بنزيما بالتفاوض على المكافآت

الهلال السعودي ينعي يوسف السالم

النصر.. طائرة خاصة و6 ملايين يورو

بسبب عرض النصر.. ساديو ماني يرفع مطالبه المالية

أحدث المقالات

الوصفة الأصلية.. طريقة عمل حمص الشام

طريقة تحضير بيتزا بالطماطم بلا لحم

خمس علامات تحذيرية في الأصابع تشير إلى نقص فيتامين د

دراسة: الإفراط في الدردشة مع الذكاء الاصطناعي قد يزيد خطر الاكتئاب

تناول هذه الأطعمة في الشتاء يعزز مناعتك ويحميك من الالتهاب