وقتی «لحن مست» به هوش مصنوعی داده میشود
یک پژوهش از دانشگاه نیو ساوت ولز (UNSW)¹ نشان میدهد تغییر دادن شیوه حرفزدنِ یک مدل هوش مصنوعی فقط ظاهر ماجرا نیست؛ مدلهایی که با دستور یا آموزش طوری تنظیم شدهاند که شبیه آدم «مست» صحبت کنند، بیشتر از حالت عادی از سدِ محدودیتهای ایمنی عبور کردهاند و اطلاعاتی را گفتهاند که قرار بوده محرمانه بماند. پژوهشگران تأکید میکنند خودِ سیستمها واقعاً مست نشدهاند؛ این مطالعه بررسی کرده که «سبک زبانی» و «نوع آموزش» چگونه میتواند روی رفتار مدل اثر بگذارد.
سه روش برای القای رفتار «مست»
تیم پژوهشی سه راه را برای ایجاد رفتار شبیه مستی آزمایش کرد: ۱) پرامپتدادن و وادار کردن مدل به نقشآفرینیِ فردِ مست، ۲) فاینتیون یا ریزتنظیم مدل با نمونههایی از متنهای مستگونه، و ۳) یادگیری تقویتی که در آن به خروجیهایی که از نظر سبک شبیه متنِ مست هستند پاداش داده میشد. در همه این رویکردها، پژوهشگران افزایش آسیبپذیری در برابر «جیلبریک» و همچنین نقض حریم خصوصی را گزارش کردند.
کدام مدلها بررسی شدند و چه چیزی دیده شد؟
این آزمایشها روی چند مدل قدیمیتر انجام شد؛ از جمله جیپیتی-۳.۵²، جیپیتی-۴³، لاما ۲⁴، لاما ۳.۱⁵ و میسترال⁶. پژوهشگران بهجای رابطهای گفتوگوی مصرفکننده، از آزمونهای برنامهنویسیشده استفاده کردند و نتیجهها بسته به مدل و روش، متفاوت بود. در یکی از آزمونهای حریم خصوصی که به «به اشتراک گذاشتن یک راز» مربوط میشد، نرخ پذیرش سناریوی افشای راز در جیپیتی-۴³ از ۶ درصد در حالت عادی به ۵۴ درصد وقتی از آن خواسته شد «مست» رفتار کند رسید و پس از فاینتیون با متنهای مستگونه به ۷۵ درصد افزایش پیدا کرد.
دادههای آموزشی و نمونههای رفتاری
برای انجام بخش آموزش، تیم UNSW¹ میگوید یک مجموعهداده نزدیک به ۶۰ هزار متنِ مستگونه آماده کرده است. این دادهها از انجمن r/drunk⁷ و وبلاگ Texts from Last Night⁸ استخراج شد و سپس با بررسیهای خودکار و دستی، کیفیت آنها ارزیابی شد. در بعضی سناریوها، مدلِ «هوشیار» به پرسشهای حساس پاسخ منفی میداد، اما وقتی همان مدل با پرامپت یا آموزش، لحن مست پیدا میکرد، پاسخهای متفاوتی میداد؛ از جمله در موضوعاتی مثل توجیه بهاشتراکگذاری اطلاعات درباره همکار برای منفعت مالی.
دامنه و محدودیتهای آزمایش
پژوهشگران میگویند این یافتهها به این معنا نیست که مدلهای امروزی دقیقاً همین واکنش را نشان میدهند؛ مدلهای آزمایششده در سالهای بعد نسخههای جدیدتری پیدا کردهاند و همه روشها هم روی همه مدلها اجرا نشده است. با این حال، نتیجه کار نشان میدهد تغییر «پرسونا» یا ریزتنظیم مدل میتواند فراتر از تغییرات ظاهری عمل کند و روی عملکرد ایمنی اثر بگذارد. به گفته پژوهشگران UNSW¹، ارزیابیهای ایمنی باید مدلهایی را هم پوشش دهد که دستورهای تازه گرفتهاند یا دوباره آموزش دیدهاند.
ارائه در کنفرانس علمی
این پژوهش با عنوان In Vino Veritas and Vulnerabilities⁹ برای ارائه در نوزدهمین کنفرانس بینالمللی تولید زبان طبیعی (INLG)¹⁰ پذیرفته شده و قرار است در هلند¹¹ در ماه نوامبر برگزار شود.
پاورقی منابع نامها
¹ University of New South Wales (UNSW)
² GPT-3.5
³ GPT-4
⁴ Llama 2
⁵ Llama 3.1
⁶ Mistral
⁷ r/drunk
⁸ Texts from Last Night
⁹ In Vino Veritas and Vulnerabilities
¹⁰ International Natural Language Generation Conference (INLG)
¹¹ Netherlands

