У відкритому доступі з’явився Watermarks Remover — інструмент, який намагається видалити з текстів, зображень і документів сліди генерації чи обробки штучним інтелектом (ШІ).

Інструмент опублікував користувач Guillaume Meyer.
Найпростішими методами маркування контенту можуть бути незвичні пробіли або Unicode-символи, які невидимі для людського ока, але залишаються в тексті. Watermarks Remover їх виявляє та видаляє. Інший тип «слідів» може ховатися не в самому тексті чи зображенні, а всередині файлу. Наприклад, файли у форматах PNG або JPEG можуть містити метадані з інформацією про походження контенту та його редагування. Watermarks Remover вміє очищати такі дані з файлів PNG, JPEG, WebP, SVG, PDF, DOCX та інших.
Проте, коли водяний знак прихований не в невидимих символах чи метаданих, процес його видалення ускладнюється.
Наприклад, компанія Anthropic заявила, що використовуватиме саме такий, складніший спосіб маркування. Їхній чат-бот Claude не вставляє в текст секретних символів чи метаданих. Натомість модель дещо змінює вибір слів під час генерації. Для читача текст виглядає звичайно, але у великому фрагменті виникає статистичний патерн, який спеціальний детектор може розпізнати за секретним ключем.
Наприклад, Claude може написати: «Сьогодні було холодно і…». Обидва варіанти продовження — «похмуро» чи «хмарно» — звучать природно, тому вибір моделі в таких випадках частково визначається випадковістю. Однак, за задумом Anthropic, цей процес випадковості керується секретним ключем. Цей ключ може, наприклад, збільшити ймовірність вибору слова «хмарно» до 85%. Якщо таких збігів у тексті буде багато, його маркуватимуть як «оброблений ШІ».
Щоб протидіяти цьому, Watermarks Remover пропонує переписання тексту за допомогою локальної великої мовної моделі (LLM). Ідея полягає в тому, що якщо маркування полягає у виборі слів, то після суттєвого перефразування ця послідовність зміниться, що може зруйнувати статистичний патерн. Однак розробник не гарантує повне обходження детекторів, адже без самого детектора та секретного ключа неможливо перевірити, чи справді мітка зникла.
Сама компанія Anthropic також зазначає, що її водяний знак не є невразливим, оскільки сильне редагування може його видалити.

Як працюють водяні знаки Claude: нові подробиці від Anthropic

Тексти Claude отримають невидимі водяні знаки. Хто зможе їх перевірити і що вони означають?

Читайте головні IT-новини країни в нашому Telegram
Джерело: www.ukrinform.ua
