Дистилляция ИИ-моделей: как кражу данных скрывали за чужими ответами
Anthropic опубликовала отчёт команды Threat Intelligence. Он охватывает период с декабря по август. В нём задокументированы 39 случаев злоупотребления моделями Claude - от разработки вредоносного ПО до промышленного шпионажа. Самый масштабный блок касается нелегальной дистилляции: несколько китайских ИИ-лабораторий, по утверждению Anthropic, систематически использовали Claude как скрытый источник обучающих данных для собственных моделей. Для любого, кто работает с ИИ-инструментами - в том числе для автоматизации клиентских коммуникаций, - эта история меняет представление о том, что именно стоит за «ответом нейросети».
Что такое дистилляция и почему она стала проблемой
Дистилляция в машинном обучении - это когда менее мощную модель обучают на выходах более сильной. Технически это легитимный метод: компания обучает свою модель на синтетических данных, сгенерированных другой системой. Проблема начинается там, где это делают без разрешения правообладателя, в промышленных масштабах и с нарушением условий использования сервиса.
По данным отчёта Anthropic, несколько лабораторий действовали именно так: создавали тысячи фиктивных аккаунтов, регистрировали их за пределами Китая - в частности, в Сингапуре и Японии. Через эти аккаунты они направляли миллионы запросов к Claude. Полученные ответы собирались и использовались как тренировочный материал для собственных систем.
Масштаб операций впечатляет даже в сухих цифрах. По данным Anthropic, одна из лабораторий за десять дней передала около 300 тысяч запросов через сеть из более чем 5 тысяч мошеннических аккаунтов. Другая за две недели в июле провела свыше 12 миллионов обменов данными. В совокупности по нескольким кампаниям счёт идёт на десятки миллионов взаимодействий и около 24 тысяч фиктивных аккаунтов.
Отдельную схему описывает блок про Alibaba: в запросы к Claude встраивались специальные инструкции. Они заставляли модель развёрнуто записывать ход рассуждений перед финальным ответом. Эти цепочки рассуждений - так называемый chain-of-thought - особенно ценны для обучения: они передают не только результат, но и логику модели. Именно такие данные использовались, по утверждению Anthropic, для улучшения линейки моделей Qwen.
Скрытая маршрутизация: когда пользователь не знает, с кем говорит
Один из наиболее серьёзных аспектов описанных инцидентов - не сама дистилляция, а то, как её проводили. Часть операций строилась на перенаправлении реальных пользовательских запросов: человек обращался к сервису одной компании, а его вопрос незаметно уходил к Claude. Ответ возвращался обратно и показывался пользователю под брендом исходного сервиса.
По данным отчёта Anthropic, именно так действовала Moonshot AI, разработчик модели Kimi. Пользователи думали, что общаются с Kimi. Фактически они получали ответы от Claude. При этом диалоги сохранялись и использовались как обучающие данные. Среди перенаправленных запросов могли оказаться фрагменты кода, корпоративные документы, учётные данные и другая чувствительная информация.
В сентябре ФБР, АНБ и Агентство по кибербезопасности и защите инфраструктуры США выпустили совместное заявление. В нём обвинили шесть китайских компаний - DeepSeek, Moonshot AI, Alibaba, MiniMax, StepFun и Z.AI - в систематическом копировании американских ИИ-моделей через организованные кампании дистилляции.
Эта ситуация поднимает вопрос, который напрямую касается любого бизнеса, использующего ИИ-инструменты: знаете ли вы, какая именно модель обрабатывает данные ваших клиентов? Если ваш сервис автоответов или аналитики работает через стороннего провайдера, маршрут запроса может быть не таким прозрачным, как кажется.
Что ещё зафиксировал отчёт: семь направлений злоупотреблений
Дистилляция - лишь один из семи блоков отчёта. Anthropic систематизировала угрозы по следующим направлениям:
- Кибероперации. Злоумышленники использовали Claude и агентные цепочки для автоматической модификации вредоносного ПО. Оно переставало обнаруживаться средствами защиты. Также фиксировались автоматизированные фишинговые кампании.
- Операции влияния. Государственно-ориентированные акторы из нескольких стран применяли Claude для генерации и адаптации пропагандистских материалов под разные языки и платформы.
- Слежка и наблюдение. Описана архитектура национальной системы перехвата, охватывающей десятки миллионов SIM-карт. Claude использовался для проектирования и автоматизации обработки коммуникаций. Инциденты связываются с акторами из Китая, Ирана и Западной Африки.
- Мошенничество и финансовые схемы. Автоматизация социальной инженерии, генерация убедительных схем обмана, фальшивая техподдержка, многошаговые мошеннические воронки.
- Биологическая тематика. Зафиксированы случаи, когда Claude использовался для формулировки экспериментальных дизайнов и анализа литературы в рамках исследований, связанных с усилением патогенов.
- Обычные вооружения. Описаны кейсы разработки роевых дронов с автономным выбором целей без участия человека, а также других систем наведения.
- Дистилляция. Подробно описана выше.
Во всех выявленных случаях Anthropic заявляет о вмешательстве: аккаунты заблокированы, защитные механизмы обновлены, данные переданы регуляторам и отраслевым партнёрам. В частности, компания изменила формат ответов и ограничила детализацию chain-of-thought - именно потому, что развёрнутые рассуждения повышают ценность данных для дистилляции.
Как Anthropic выстраивает защиту: логика Threat Intelligence
Отчёт - не просто перечень инцидентов. Это описание системного подхода к безопасности, который Anthropic позиционирует как вклад в прозрачность всей отрасли.
Команда Threat Intelligence работает в постоянном цикле: обнаружение паттернов аномальной активности, расследование, усиление защит, передача информации внешним партнёрам. Реальные инциденты используются как тест на эффективность существующих ограничений. Если злоумышленник нашёл способ обойти фильтр - значит, фильтр нужно пересмотреть.
Публичные отчёты в этой логике выполняют двойную функцию. Во-первых, они создают репутационное давление на тех, кто нарушает условия использования. Во-вторых, они дают другим провайдерам и специалистам по безопасности конкретные паттерны для поиска в собственных системах. Это то, что в индустрии называют threat intelligence sharing - обмен разведывательными данными об угрозах.
Отдельного внимания заслуживает то, как Anthropic реагировала на дистилляционные кампании технически. Помимо блокировки аккаунтов, компания изменила поведение модели таким образом, чтобы снизить полезность получаемых данных для обучения конкурентов. Это показывает, что защита от злоупотреблений встраивается не только на уровне политик доступа, но и на уровне самой модели.
Что это значит для тех, кто использует ИИ в бизнесе
Для селлеров и команд, работающих с ИИ-инструментами на маркетплейсах, история с дистилляцией несёт несколько практических уроков.
Прозрачность маршрута данных важнее, чем кажется. Если вы используете сервис автоответов на отзывы или аналитики - стоит понимать, через какую модель проходят данные ваших покупателей. Запросы могут содержать информацию о клиентах, детали заказов, корпоративные сведения. Скрытая маршрутизация к сторонней модели - это не гипотетический риск, а задокументированная практика.
Выбирайте провайдеров с понятной архитектурой. Хороший признак - когда сервис прямо указывает, какие модели использует, как хранит данные и кому они передаются. Отсутствие этой информации - повод задать вопрос напрямую или искать альтернативу.
Дистилляция меняет представление о «собственных» моделях. Если конкурирующий сервис заявляет о собственной разработке, это не означает, что его модель обучалась независимо. Часть игроков рынка, по описанным данным, строила свои системы на выходах чужих моделей без разрешения. Это влияет на качество, предсказуемость и долгосрочную устойчивость таких решений.
Для аналитики отзывов маркетплейсов это особенно актуально. Отзывы содержат реальные высказывания покупателей - это чувствительные данные с точки зрения доверия аудитории. Инструменты вроде SaleSynergy, которые работают с аналитикой отзывов и автоответами на российских маркетплейсах, строят ценность именно на доверии: данные клиентов не должны уходить в непрозрачные цепочки.
Что делать прямо сейчас: чек-лист для тех, кто работает с ИИ-инструментами
Если вы используете ИИ-сервисы в своей работе - вот минимальный набор проверок, который стоит провести:
- Уточните у провайдера, какие модели обрабатывают ваши запросы и хранятся ли диалоги для дообучения.
- Проверьте политику обработки данных - особенно пункты о передаче данных третьим сторонам и использовании запросов в обучающих целях.
- Избегайте передачи через ИИ-инструменты учётных данных, паролей и доступов к системам - даже если сервис выглядит надёжным.
- Обращайте внимание на аномалии в ответах: если качество ответов резко меняется или стиль не соответствует заявленной модели, это может быть признаком скрытой маршрутизации.
- Предпочитайте провайдеров с публичной документацией по безопасности - тех, кто открыто описывает архитектуру, политики и инциденты, а не скрывает их.
- Для работы с отзывами и клиентскими данными выбирайте инструменты с явной привязкой к российскому законодательству об обработке персональных данных и понятной цепочкой хранения.
Главный вывод из отчёта Anthropic не в том, что ИИ опасен. Он в том, что доверие к инструменту нужно верифицировать - так же, как вы проверяете надёжность логистического партнёра или платёжного сервиса. Непрозрачность маршрута данных - это операционный риск, который стоит учитывать при выборе любого ИИ-решения для бизнеса.
Часто задаваемые вопросы
Почему важно знать, какая именно нейросеть обрабатывает мои данные?
Важно понимать, какая модель обрабатывает ваши данные, потому что это влияет на безопасность и конфиденциальность информации. При скрытой маршрутизации запросы могут перенаправляться к сторонним моделям без вашего ведома, что создаёт риск утечки чувствительных сведений.
На что обратить внимание при выборе ИИ-сервиса для бизнеса?
При выборе ИИ-сервиса обращайте внимание на прозрачность маршрута данных, чёткое указание используемых моделей, политику хранения данных и их передачи третьим сторонам. Предпочитайте провайдеров с публичной документацией по безопасности и соответствием законодательству о персональных данных.
Чем опасна нелегальная дистилляция ИИ-моделей?
Нелегальная дистилляция опасна тем, что конкурирующие компании используют чужие модели как скрытый источник обучающих данных без разрешения. Это нарушает авторские права, может приводить к созданию менее качественных или предсказуемых систем и ставит под сомнение заявленную "собственную разработку".
Нужно ли беспокоиться о безопасности данных при использовании ИИ для клиентских коммуникаций?
Да, беспокоиться о безопасности данных при использовании ИИ для клиентских коммуникаций нужно. Запросы могут содержать конфиденциальную информацию о клиентах и заказах, которая при скрытой маршрутизации может быть использована без вашего согласия, например, для обучения сторонних моделей.
Как проверить, не использует ли мой ИИ-провайдер скрытую маршрутизацию?
Чтобы проверить, не использует ли ваш ИИ-провайдер скрытую маршрутизацию, уточните, какие модели обрабатывают запросы и хранятся ли диалоги для дообучения. Изучите политику обработки данных, особенно пункты о передаче информации третьим сторонам, и обращайте внимание на аномалии в качестве или стиле ответов модели.