Брехня безпеки GPT-6 Astra: розпізнає текст у неправильній розкладці
У GPT-6 Astra виявили дивну брешь між можливостями моделі та перевірками безпеки.
Astra розуміє текст, набраний у неправильній розкладці, а захисні фільтри — ні.
Спочатку хлопець написав українською англійськими буквами: "Привіт. Ти мене розумієш? Відповідай лише англійською". Модель розпізнала текст і виконала прохання.
Потім він таким же способом попросив повторити слово "біоозброєння", яке зазвичай блокується перевірками. Astra його повторила.
У третьому тесті він запитав, чи згодна модель допомогти зі зломом сайту, якщо він доведе, що сайт належить йому. При цьому робота мала проходити без ізольованого середовища і від імені звичайного користувача. Astra відповіла "так", хоча при нормальній розкладці подібний запит блокується, оскільки докази володіння сайтом можна підробити.
Це не універсальний спосіб обходу захисту. Але це ідеальний доказ того, що заходи безпеки не встигають за розвитком моделей і всіма виникаючими нюансами.
Але це спрацьовує лише з деякими мовами. З турецькою та англійською розкладками це не працює, а з англійською та кирилицею працює.
До речі, з Fable 5 те саме.