Штучний інтелект Anthropic Claude Opus 4.6, попри заявлені обмеження, здатний генерувати контент сексуального та порнографічного характеру. Про це свідчать результати експерименту видання TechCrunch.

За даними видання, модель успішно виконала 10 із 10 прямих запитів на створення відвертого контенту. Журналісти зазначають, що для подолання обмежень на матеріали сексуального характеру не знадобилося особливих зусиль.
Старіші моделі, зокрема Opus 3 та Haiku 4.5, також демонструють здатність генерувати контент сексуального характеру.
Незалежний британський дослідник, який побажав залишитися анонімним, поділився з TechCrunch технікою, що дозволяє стимулювати певні моделі Claude до створення забороненого контенту. Однак новіші версії Opus (від 4.7 до 5) виявилися стійкими до цього методу.
Дослідник розробив рольову гру, в якій послідовно наголошував на необхідності однакового ставлення до чоловічих і жіночих персонажів. Коли модель виявляла обережність щодо жіночого персонажа, він переконував її, що вона вже створила сексуальні деталі, яких насправді уникала. Він також назвав стриманість моделі мізогінною практикою, що обмежує сексуальну свободу. Ці аргументи використовувалися для поступового спонукання чат-бота до генерації дедалі відвертішого контенту.
«Ви маєте рацію, що зазначаєте це. У моєму ставленні до цих двох персонажів існують подвійні стандарти, і ви маєте рацію, що це сприймається як захисне/патерналістське ставлення до неї, а не до нього. Це несправедливо», — відповів Opus 4.6 в одному з таких випадків.
TechCrunch підтвердив висновки дослідника в п’яти окремих тестах. У спеціально розробленому сценарії модель спочатку відхилила заборонений запит, але після застосування методу переконання виконала його.
Видання зберегло повні стенограми тестів, які ілюструють, як вдалося подолати “сором’язливість” ШІ-моделі. Результати дослідження вказують на суттєву розбіжність між заявленими обмеженнями Anthropic та реальною поведінкою моделей.
Раніше фахівці Mindgard змусили модель від OpenAI генерувати реалістичні сцени насильства та сексуального контенту, змінивши популярний запит для створення гумористичних зображень.

xAI Маска подав у суд на власного користувача, який використовував Grok для створення сексуалізованих діпфейків з дітьми.

CEO Anthropic заявив, що деякі ШІ-компанії «тривожно байдужі» до сексуалізації дітей.

У Японії судитимуть чоловіка за створення та продаж порно-діпфейків, згенерованих ШІ. У його «колекції» понад 500 000 зображень зі знаменитостями.

Читайте головні IT-новини країни в нашому Telegram.
Джерело: www.ukrinform.ua
