Adding a random picture may make AI chatbots harder to trickافزودن یک تصویر تصادفی میتواند فریب دادن چتباتهای AI را سختتر کند
Adding an unrelated picture to a disguised harmful request made AI systems refuse it far more often. In tests on five AI systems, one safety filter blocked up to 73% more of these attacks.افزودن یک تصویر نامرتبط به یک درخواست مضر که بهشکلی پنهان بیان شده بود، باعث شد سیستمهای AI بسیار بیشتر از قبل آن را رد کنند. در آزمایش روی 5 سیستم AI، یکی از فیلترهای ایمنی تا 73% بیشتر این نوع حملات را مسدود کرد.
ترجمهٔ ماشینی است؛ برای دقت به متن اصلی انگلیسی مراجعه کنید.
Why it matters
Many chatbots now read pictures as well as words. People who want harmful instructions often hide their request in a code, so the safety checks do not notice it. This work shows those safety checks can behave very differently once any picture is attached, even a blank one. That is useful to know, but it is not a fix: attaching a picture every time also made the chatbots wrongly refuse ordinary, harmless questions, and the authors say clearly that this is an observation rather than a working defense.بسیاری از چتباتها اکنون علاوه بر متن، تصویر را هم میخوانند. کسانی که به دنبال گرفتن دستورالعملهای مضر هستند، اغلب درخواست خود را در قالب یک کد پنهان میکنند تا بررسیهای ایمنی متوجه آن نشوند. این پژوهش نشان میدهد که همین بررسیهای ایمنی، بهمحض افزودهشدن هر تصویری—حتی یک تصویر خالی—میتوانند رفتاری کاملاً متفاوت از خود نشان دهند. دانستن این نکته مفید است، اما راهحل نیست: افزودن تصویر در هر بار همچنین باعث شد چتباتها بهاشتباه پرسشهای عادی و بیضرر را هم رد کنند، و نویسندگان این پژوهش صراحتاً میگویند که این فقط یک مشاهده است، نه یک راهکار دفاعی کارآمد.
Who's behind it: Haoyu Zhang and colleagues.
Summary by the Lemma AI · how we grade