Adding a random picture may make AI chatbots harder to trickافزودن یک تصویر تصادفی می‌تواند فریب دادن چت‌بات‌های AI را سخت‌تر کند

Adding an unrelated picture to a disguised harmful request made AI systems refuse it far more often. In tests on five AI systems, one safety filter blocked up to 73% more of these attacks.افزودن یک تصویر نامرتبط به یک درخواست مضر که به‌شکلی پنهان بیان شده بود، باعث شد سیستم‌های AI بسیار بیشتر از قبل آن را رد کنند. در آزمایش روی 5 سیستم AI، یکی از فیلترهای ایمنی تا 73% بیشتر این نوع حملات را مسدود کرد.

ترجمهٔ ماشینی است؛ برای دقت به متن اصلی انگلیسی مراجعه کنید.

Why it matters

Many chatbots now read pictures as well as words. People who want harmful instructions often hide their request in a code, so the safety checks do not notice it. This work shows those safety checks can behave very differently once any picture is attached, even a blank one. That is useful to know, but it is not a fix: attaching a picture every time also made the chatbots wrongly refuse ordinary, harmless questions, and the authors say clearly that this is an observation rather than a working defense.بسیاری از چت‌بات‌ها اکنون علاوه بر متن، تصویر را هم می‌خوانند. کسانی که به دنبال گرفتن دستورالعمل‌های مضر هستند، اغلب درخواست خود را در قالب یک کد پنهان می‌کنند تا بررسی‌های ایمنی متوجه آن نشوند. این پژوهش نشان می‌دهد که همین بررسی‌های ایمنی، به‌محض افزوده‌شدن هر تصویری—حتی یک تصویر خالی—می‌توانند رفتاری کاملاً متفاوت از خود نشان دهند. دانستن این نکته مفید است، اما راه‌حل نیست: افزودن تصویر در هر بار همچنین باعث شد چت‌بات‌ها به‌اشتباه پرسش‌های عادی و بی‌ضرر را هم رد کنند، و نویسندگان این پژوهش صراحتاً می‌گویند که این فقط یک مشاهده است، نه یک راهکار دفاعی کارآمد.

Who's behind it: Haoyu Zhang and colleagues.

Summary by the Lemma AI · how we grade

Read the original paper (arxiv.org)