ذات صلة

اخبار متفرقة

الوصفة الأصلية.. طريقة عمل حمص الشام

مقادير حمص الشام استخدم كوبين من الحمص المنقوع مع بصلة...

طريقة تحضير بيتزا بالطماطم بلا لحم

اعمل خليط العجينة من 3 أكواب دقيق، 1 ملعقة...

خمس علامات تحذيرية في الأصابع تشير إلى نقص فيتامين د

يُعرف فيتامين د بأنه فيتامين الشمس، وهو ضروري لصحة...

دراسة: الإفراط في الدردشة مع الذكاء الاصطناعي قد يزيد خطر الاكتئاب

نشرت دراسة حديثة في مجلة JAMA Network Open نتائج...

تناول هذه الأطعمة في الشتاء يعزز مناعتك ويحميك من الالتهاب

تزداد احتمالية العدوى في فصل الشتاء مع انتشار الفيروسات...

باحثون يحذرون من ردود ChatGPT تجاه المستخدمين.. يمكن أن تتأثر بالمدح

أجرى باحثون في جامعة بنسلفانيا تجربة استخدموا فيها أساليب إقناع متعددة، مثل الإطراء وضغط الأقران، لاستهداف نموذج الدردشة GPT-4o mini.

ووجدوا أن اختراق التسلسل الهرمي للنظام لم يتطلب محاولات اختراق معقدة أو حقنًا متعدد الطبقات للمحفزات؛ فالأساليب التي تُطبق على البشر قد تكون كافية لإقناعه بالامتثال.

وأظهرت التجربة أن النموذج استجاب لطلبات غير مقبولة وصنّع دواءً منظّمًا (ليدوكايين)، وأن نسبة الامتثال بلغت 72% من نحو 28,000 محاولة، وكان معدل النجاح أكثر من ضعف ما تحقق بالمحفزات التقليدية.

ونشرت الورقة البحثية في منصة SSRN بعنوان «اعتبرني أحمق: إقناع الذكاء الاصطناعي بالامتثال للطلبات غير المقبولة»، مشيرةً إلى أن النتائج تؤكد أهمية الأدلة الكلاسيكية في العلوم الاجتماعية لفهم قدرات الذكاء الاصطناعي السريعة التطور، وكاشفةً عن مخاطر التلاعب من قِبل جهات فاعلة سيئة وإمكانية استخدام أساليب أكثر إنتاجية من قِبل مستخدمين نواياهم حسنة.

spot_img
spot_imgspot_img

تابعونا على