OpenAI выпустила Privacy Filter — модель с открытым исходным кодом для обнаружения и удаления персональных данных из текста.
По данным OpenAI, модель предназначена для команд, которым нужно очищать большие массивы текста перед дальнейшей обработкой. Речь может идти об обучении собственных ИИ-моделей или передаче данных третьим сторонам.
Размер модели составляет 1,5 млрд параметров, при этом на один запрос используются 50 млн активных параметров. OpenAI заявляет, что Privacy Filter может работать на ноутбуке и даже прямо в браузере. Также поддерживается запуск на локальном устройстве без подключения к облаку.
Модель распознаёт восемь категорий чувствительных данных:
- имена;
- адреса;
- адреса электронной почты;
- номера телефонов;
- URL;
- даты;
- номера аккаунтов;
- другие секретные данные, включая пароли и API-ключи.
В отличие от обычных чат-ботов, Privacy Filter не генерирует новый текст. Она делает один проход по входным данным и помечает фрагменты по категориям. По информации OpenAI, окно контекста на 128 000 токенов позволяет обрабатывать длинные документы без разбиения на части.
Пользователи могут настраивать режим работы модели. Более жёсткий режим повышает полноту обнаружения, но даёт больше ложных срабатываний. Более сдержанный снижает число ложных срабатываний, но увеличивает риск пропуска данных.
Команды, у которых есть собственные наборы данных, могут дообучить модель под свои задачи. При этом категории меток нельзя менять во время работы, поэтому для другой политики обработки потребуется дополнительная настройка.
Privacy Filter доступна по лицензии Apache 2.0 на GitHub и Hugging Face. Коммерческое использование разрешено.
OpenAI отдельно подчёркивает, что модель не даёт юридических гарантий анонимизации или соответствия требованиям регуляторов. Компания рассматривает Privacy Filter как один из слоёв общей стратегии защиты данных.
OpenAI также перечисляет ограничения модели. Она чаще пропускает редкие или нетипичные для региона имена, иногда ошибочно скрывает имена известных людей или названия организаций, а качество работы снижается на текстах не на английском языке и на письменностях не на латинице.
Для чувствительных сфер, включая здравоохранение, право, финансы и HR, OpenAI прямо рекомендует сохранять проверку человеком.
Источник: The Decoder, OpenAI.






















