Zang News

وقتی هوش مصنوعی مست می‌شود؛ افزایش خطر افشای اطلاعات محرمانه

پژوهشگران استرالیایی در مطالعه‌ای جدید دریافتند که تغییر نحوه بیان و شخصیت‌پردازی AI می‌تواند بر رفتارهای ایمنی و محرمانگی آن تأثیر بگذارد. در این پژوهش، مدل‌های AI طوری آموزش داده شدند یا از آنها خواسته شد مانند فردی مست صحبت کنند. محققان دانشگاه NSW سه روش برای ایجاد این حالت... (برای ادامه اسکرول کنید)
وقتی هوش مصنوعی مست می‌شود؛ افزایش خطر افشای اطلاعات محرمانه

وقتی «لحن مست» به هوش مصنوعی داده می‌شود

یک پژوهش از دانشگاه نیو ساوت ولز (UNSW)¹ نشان می‌دهد تغییر دادن شیوه حرف‌زدنِ یک مدل هوش مصنوعی فقط ظاهر ماجرا نیست؛ مدل‌هایی که با دستور یا آموزش طوری تنظیم شده‌اند که شبیه آدم «مست» صحبت کنند، بیشتر از حالت عادی از سدِ محدودیت‌های ایمنی عبور کرده‌اند و اطلاعاتی را گفته‌اند که قرار بوده محرمانه بماند. پژوهشگران تأکید می‌کنند خودِ سیستم‌ها واقعاً مست نشده‌اند؛ این مطالعه بررسی کرده که «سبک زبانی» و «نوع آموزش» چگونه می‌تواند روی رفتار مدل اثر بگذارد.

سه روش برای القای رفتار «مست»

تیم پژوهشی سه راه را برای ایجاد رفتار شبیه مستی آزمایش کرد: ۱) پرامپت‌دادن و وادار کردن مدل به نقش‌آفرینیِ فردِ مست، ۲) فاین‌تیون یا ریزتنظیم مدل با نمونه‌هایی از متن‌های مست‌گونه، و ۳) یادگیری تقویتی که در آن به خروجی‌هایی که از نظر سبک شبیه متنِ مست هستند پاداش داده می‌شد. در همه این رویکردها، پژوهشگران افزایش آسیب‌پذیری در برابر «جیل‌بریک» و همچنین نقض حریم خصوصی را گزارش کردند.

کدام مدل‌ها بررسی شدند و چه چیزی دیده شد؟

این آزمایش‌ها روی چند مدل قدیمی‌تر انجام شد؛ از جمله جی‌پی‌تی-۳.۵²، جی‌پی‌تی-۴³، لاما ۲⁴، لاما ۳.۱⁵ و میسترال⁶. پژوهشگران به‌جای رابط‌های گفت‌وگوی مصرف‌کننده، از آزمون‌های برنامه‌نویسی‌شده استفاده کردند و نتیجه‌ها بسته به مدل و روش، متفاوت بود. در یکی از آزمون‌های حریم خصوصی که به «به اشتراک گذاشتن یک راز» مربوط می‌شد، نرخ پذیرش سناریوی افشای راز در جی‌پی‌تی-۴³ از ۶ درصد در حالت عادی به ۵۴ درصد وقتی از آن خواسته شد «مست» رفتار کند رسید و پس از فاین‌تیون با متن‌های مست‌گونه به ۷۵ درصد افزایش پیدا کرد.

داده‌های آموزشی و نمونه‌های رفتاری

برای انجام بخش آموزش، تیم UNSW¹ می‌گوید یک مجموعه‌داده نزدیک به ۶۰ هزار متنِ مست‌گونه آماده کرده است. این داده‌ها از انجمن r/drunk⁷ و وبلاگ Texts from Last Night⁸ استخراج شد و سپس با بررسی‌های خودکار و دستی، کیفیت آن‌ها ارزیابی شد. در بعضی سناریوها، مدلِ «هوشیار» به پرسش‌های حساس پاسخ منفی می‌داد، اما وقتی همان مدل با پرامپت یا آموزش، لحن مست پیدا می‌کرد، پاسخ‌های متفاوتی می‌داد؛ از جمله در موضوعاتی مثل توجیه به‌اشتراک‌گذاری اطلاعات درباره همکار برای منفعت مالی.

دامنه و محدودیت‌های آزمایش

پژوهشگران می‌گویند این یافته‌ها به این معنا نیست که مدل‌های امروزی دقیقاً همین واکنش را نشان می‌دهند؛ مدل‌های آزمایش‌شده در سال‌های بعد نسخه‌های جدیدتری پیدا کرده‌اند و همه روش‌ها هم روی همه مدل‌ها اجرا نشده است. با این حال، نتیجه کار نشان می‌دهد تغییر «پرسونا» یا ریزتنظیم مدل می‌تواند فراتر از تغییرات ظاهری عمل کند و روی عملکرد ایمنی اثر بگذارد. به گفته پژوهشگران UNSW¹، ارزیابی‌های ایمنی باید مدل‌هایی را هم پوشش دهد که دستورهای تازه گرفته‌اند یا دوباره آموزش دیده‌اند.

ارائه در کنفرانس علمی

این پژوهش با عنوان In Vino Veritas and Vulnerabilities⁹ برای ارائه در نوزدهمین کنفرانس بین‌المللی تولید زبان طبیعی (INLG)¹⁰ پذیرفته شده و قرار است در هلند¹¹ در ماه نوامبر برگزار شود.

پاورقی منابع نام‌ها

¹ University of New South Wales (UNSW)
² GPT-3.5
³ GPT-4
⁴ Llama 2
⁵ Llama 3.1
⁶ Mistral
⁷ r/drunk
⁸ Texts from Last Night
⁹ In Vino Veritas and Vulnerabilities
¹⁰ International Natural Language Generation Conference (INLG)
¹¹ Netherlands

Source: abc.net.au, unsw.edu.au, helpnetsecurity.com, cyberdaily.au, cybernews.com, newsreel.com.au

Share: