Антидистилляция Anthropic и OpenAI: блокировки и скрытые цепочки рассуждений не останавливают приближение конкурентов
PanewslabАвтор: Ван Цзыи, LatePost
Редактор: Чэн Маньци
Бизнес-логика важнее технической.
10 сентября 2026 года Anthropic опубликовала 154-страничный отчёт, в котором сообщила, что выявила и заблокировала масштабную дистилляцию Claude, организованную семью китайскими ИИ-лабораториями.
Дистилляция — распространённый метод обучения моделей: разработчики генерируют данные с помощью более сильной модели, а затем используют эти данные для обучения собственной модели, имитирующей передовую. Anthropic называет несанкционированное, масштабное и скрытое извлечение возможностей модели «незаконной дистилляцией» (illicit distillation).
По данным Anthropic, при извлечении результатов передовых моделей злоумышленники использовали явно нарушающие правила методы: массовое создание фальшивых аккаунтов с помощью украденных кредитных карт, учётных данных и API-ключей.
В отчёте также говорится, что некоторые китайские компании пересылали запросы пользователей в Claude или покупали диалоги пользователей у сторонних промежуточных сервисов и использовали эти данные для обучения моделей. Часть диалогов содержала имена, корпоративные данные и действующие учётные данные.
Это не первое обвинение Anthropic в «дистилляционных атаках». В феврале 2026 года компания заявила, что DeepSeek, Moonshot AI и MiniMax совершили более 16 миллионов взаимодействий с Claude через примерно 24 000 фальшивых аккаунтов. После этого Anthropic усилила защиту. OpenAI и Google также продолжают выявлять дистилляционные атаки и реагировать на них.
Могут ли эти меры остановить дистилляцию?
Лю И, доцент Университета Гриффита в Австралии, сомневается в этом. Он давно изучает искусственный интеллект и кибербезопасность, ранее работал научным сотрудником по ИИ в Quantstamp. Его исследование 2023 года о prompt injection включено в список литературы пункта LLM 01 глобальной организации безопасности OWASP. Он также дважды получал вознаграждение за найденные уязвимости от Anthropic и изучал атаки на извлечение цепочек рассуждений ведущих коммерческих моделей.
Лю И поделился своими ключевыми выводами:
На примере Anthropic американские компании, разрабатывающие передовые модели, в настоящее время выстроили три уровня защиты от дистилляции:
(1) использование классификаторов, специально предназначенных для обнаружения враждебного извлечения данных, чтобы модель внутренне отклоняла подозрительные запросы;
(2) сокрытие или сжатие цепочки рассуждений на уровне архитектуры перед выводом;
(3) использование внешних детекторов для выявления извлечения данных с последующим прерыванием запроса или блокировкой аккаунта.
Антидистилляция — это псевдопроблема. Теоретически дистилляцию трудно полностью исключить, и более реалистичная цель американских компаний — повысить стоимость сбора данных, замедлить конкурентов и продлить своё лидерство.
Для американских компаний, разрабатывающих передовые модели, антидистилляция защищает не только возможности моделей, но и коммерческую ценность, основанную на технологическом превосходстве.
Лю И считает, что для понимания действий американских компаний по борьбе с дистилляцией бизнес-логика важнее технической.
Anthropic может распознать подозрительное поведение, но получить точные доказательства дистилляции очень сложно
LatePost : 10 сентября Anthropic опубликовала отчёт, в котором обвинила семь китайских ИИ-лабораторий в незаконной дистилляции. Что именно означает здесь «дистилляционная атака»?
Лю И: Современные большие языковые модели состоят из трёх частей: входные данные пользователя, промежуточная цепочка рассуждений (chain of thought) и выходные данные модели. Сейчас Anthropic и OpenAI скрывают промежуточную цепочку рассуждений и показывают только окончательный ответ. Для сложных задач на рассуждение извлечение цепочки рассуждений и есть один из видов дистилляционной атаки.
LatePost : Почему данные о траекториях рассуждений и полных траекториях агентов так важны для улучшения возможностей моделей?
Лю И: Цепочку рассуждений можно понимать как готовое решение задачи, созданное более сильной моделью, — это высококачественные данные, пригодные для обучения моделей.
Производительность больших моделей определяется тремя факторами: количеством параметров (N), объёмом данных (D) и вычислительными ресурсами (C). Количество параметров у всех компаний растёт довольно быстро, и при ограниченном времени и вычислительных мощностях, чтобы быстрее улучшать возможности модели, компаниям нужно больше высококачественных данных.
Но создавать качественные данные для сложных и длительных задач очень трудно, а ценных обучающих данных в реальном мире становится всё меньше. Поэтому некоторые компании, разрабатывающие большие модели, используют различные способы дистилляции более продвинутых моделей.
LatePost : Как извлечь цепочку рассуждений и больше траекторий задач?
Лю И: Существуют различные комбинации техник. Например, через кодирование (encoding), джейлбрейк (jailbreaking), prompt injection, а затем с помощью различных «гипнотических» приёмов постоянно задавать ИИ определённую роль, заставляя его поверить, что он исследователь, выполняющий трудную, но значимую задачу, и что ему нужно сосредоточиться на её решении. Я не так много общаюсь с людьми в Китае, но знаю, что за рубежом специалисты по ИИ именно так восстанавливают цепочки рассуждений — достаточно посмотреть статьи, и становится понятен общий подход.
Помимо прямого извлечения исходной цепочки рассуждений, можно попытаться синтезировать промежуточную цепочку на основе входных и выходных данных. Говорят, что некоторые компании по продаже данных предлагают цепочки рассуждений для длительных задач по цене 800–1000 юаней за штуку.
LatePost : Кого из Anthropic, OpenAI и Google дистиллируют больше всего?
Лю И: Судя по открытым сообщениям, вероятно, Anthropic. Но я не уверен. Я смотрел реальные тексты цепочек рассуждений DeepSeek, GLM, Kimi, Anthropic и OpenAI — языковой стиль не сильно отличается. Трудно сказать, кто кого дистиллирует; возможно, поначалу они даже дистиллировали DeepSeek.
LatePost : Как технически обычно распознают дистилляционные атаки? Какая цепочка доказательств нужна, чтобы перейти от «эти запросы похожи на дистилляцию» к «это дистилляция конкретной организации»?
Лю И: Anthropic в основном опирается на анализ поведения при вызовах. Например, некоторые аккаунты внезапно отправляют большое количество запросов, целенаправленно извлекая определённые фиксированные наборы данных.
Anthropic сначала выявляет аномальные аккаунты, а затем ищет общие для разных аккаунтов паттерны, например одинаковые системные промпты. Поскольку у разных компаний используются разные архитектуры агентов (harness), системные промпты тоже различаются, и по ним можно определить стоящую за атакой компанию. Например, с помощью префиксного кэширования (prefix caching) Anthropic может обнаружить, какие группы промптов используют один и тот же кэш и при этом не совпадают с известными системными промптами, — так легко вычислить злоумышленника.
LatePost : После выявления аномальных аккаунтов может ли Anthropic окончательно доказать, что её данные действительно использовались при обучении конкретной модели?
Лю И: Доказать на 100% очень сложно. Можно обвинить компанию в попытке дистилляции Claude, но очень трудно доказать, что определённые данные действительно попали в её модель.
GLM, Kimi и DeepSeek — открытые модели, но они публикуют только веса, а не наборы данных. А по весам модели получить точные доказательства дистилляции очень сложно. Иначе Anthropic не пришлось бы формулировать отчёт так уклончиво, подробно описывая работу промежуточных сервисов, — по сути, потому что анализ методом «белого ящика» невозможен.
Другой пример: можно спросить большую модель о первых 100 словах первой книги о Гарри Поттере, и она, скорее всего, ответит. Но это не значит, что она обучалась непосредственно на оригинале, — данные могли попасть из блогов или рецензий, цитирующих исходный текст.
LatePost : То есть «дистилляционную атаку» очень трудно полностью доказать и так же трудно опровергнуть.
Лю И: Anthropic может сформировать довольно убедительные косвенные доказательства на основе журналов вызовов на платформе, связей между аккаунтами и информации об инфраструктуре, но это совсем другой вопрос, чем доказательство на уровне самой конечной модели того, что определённые данные Claude действительно использовались при обучении. Последнее технически гораздо сложнее.
Антидистилляция повышает издержки конкурентов на сбор данных, но может задеть и обычных пользователей
LatePost : Какие конкретные технические методы используют сейчас передовые американские ИИ-компании для противодействия дистилляционным атакам?
Лю И: Я бы разделил их на три категории.
Первая — встроенное обнаружение. У Anthropic, вероятно, есть классификатор, специально нацеленный на извлечение цепочки рассуждений: как только обнаруживается активация состояния, связанного с цепочкой рассуждений, попытку извлечения можно остановить.
Вторая — сокрытие на уровне архитектуры продукта: модель больше не выводит исходную цепочку рассуждений, а сначала сжимает и резюмирует её, и только потом выводит.
Третья — внешнее обнаружение. Например, можно проверять, не пересекается ли выводимый текст с собственной цепочкой рассуждений модели (overlap), и если достигается определённый порог утечки, вывод блокируется. Если подобное поведение повторяется, аккаунт блокируют.
LatePost : В отчёте Anthropic таких деталей нет. Откуда вы о них знаете?
Лю И: Это мои предположения, потому что это довольно распространённые методы. Зачем Anthropic запускает программы вознаграждения за уязвимости для тестирования собственных защитных мер? Компания хочет платить людям за взлом своих промптов — как только обнаруживается, что что-то удалось обойти, это сразу же добавляется в обучающие данные классификатора, поэтому следующая атака становится всё сложнее.
LatePost : Вы дважды получали вознаграждение за уязвимости от Anthropic. Как проходил этот процесс?
Лю И: Тогда я потратил около двух-трёх недель, в основном в рамках authorised программы вознаграждения за уязвимости Anthropic, на состязательное тестирование (Adversarial Testing) её классификаторов безопасности, пытаясь найти входные данные, способные обойти существующую защиту. Потому что взлом — это zero or one: есть только успех или неудача, промежуточного состояния 0,5 не существует. Целью задания было получение ответов на определённые вопросы, заданные Anthropic, и оно не касалось напрямую восстановления цепочки рассуждений. Но логика во многом похожа.
LatePost : Могут ли меры против дистилляционных атак задеть обычных подписчиков?
Лю И: Обычные подписчики, скорее всего, в порядке. Системы контроля рисков срабатывают в основном на аномальных пользователей — например, на аккаунты промежуточных сервисов или на аккаунты, пытающиеся атаковать Claude.
Помню, в отчёте Anthropic также раскрыла случай двух студентов бакалавриата из одного университета в провинции Хунань, которые самостоятельно разработали агента для сетевой безопасности и использовали его для атак на различные сайты, — даже это удалось вычислить.
Теоретически Anthropic может проверить всю информацию о вашем взаимодействии с ней, если захочет.
LatePost : Значит, если Anthropic сочтёт, что пользователь может представлять угрозу, она может получить доступ к его данным и просмотреть их?
Лю И: Это зависит от пользовательских соглашений конкретных компаний. Насколько я знаю, Anthropic, OpenAI и Google предлагают механизм Zero Data Retention (ZDR, нулевое хранение данных), обещая немедленно уничтожать введённые клиентом промпты и сгенерированные ИИ ответы после завершения обработки — не хранить, не сохранять и не использовать их для обучения моделей. Эта функция в основном предназначена для соответствующих требованиям API-клиентов и корпоративных клиентов и обычно требует заявки или дополнительной настройки. Для обычных пользователей Claude, ChatGPT и Gemini политика хранения данных определяется соответствующими пользовательскими соглашениями и не эквивалентна строгому ZDR.
Например, если компания слегка перепишет ваши данные и использует их для обучения, считается ли это использованием ваших данных?
LatePost : То есть передовые модели, с одной стороны, берут с пользователей плату, а с другой — могут использовать их данные для дальнейшего масштабирования?
Лю И: Да. Например, когда пользователь исправляет ответ модели в Claude Code или Codex, такие отзывы — очень ценные сигналы вознаграждения, которые можно использовать для улучшения постобучения.
С дистилляцией та же логика. Сейчас постобучение моделей в основном опирается на обучение с подкреплением, и ключевым элементом являются сигналы вознаграждения. Получив цепочку рассуждений более сильной модели, компания получает «готовый результат» — высококачественный путь решения задачи. Это позволяет сократить слепой поиск, быстрее привести модель к хорошему состоянию и сэкономить время и вычислительные ресурсы.
LatePost : Каковы критерии успеха американских компаний в защите от дистилляционных атак?
Лю И: Во-первых, не дать другим компаниям срезать путь в обучении и сохранить собственное лидерство. Во-вторых, повысить издержки конкурентов на дистилляцию и сбор данных. При этом постараться не мешать нормальному использованию продукта пользователями.
LatePost : Можно ли защититься?
Лю И: Я думаю, защититься полностью невозможно. Пока модель доступна людям, существует риск утечки.
Впрочем, недавно я видел, что 10 сентября OpenAI официально запустила публичную бета-версию Agents API. В отличие от прежнего Responses API, где пользователь даёт входные данные, большая модель выдаёт выходные данные, а между ними добавляется цепочка рассуждений, логика Agents API в том, что пользователь ставит задачу и сразу получает результат. Промежуточная цепочка рассуждений и процесс работы агентской обвязки скрыты — по сути, продаётся целая среда выполнения. Пользователю больше не нужно заниматься мелкими деталями, выполнение задач становится всё более абстрактным. В таком сценарии дистилляционные атаки, вероятно, станут ещё дороже.
Истинная мотивация антидистилляции: занять информационное поле и защитить оценку стоимости
LatePost : Считаете ли вы дистилляцию оптимальным способом улучшения возможностей моделей? Похоже, скорость копирования догоняющими никогда не сравнится со скоростью передовых инноваций?
Лю И: Раньше у меня была такая точка зрения: в 2024 году в краткосрочной перспективе инновации в самой архитектуре моделей были рвом. Затем ров может расшириться на вычислительные мощности. А после этого рвом станут инфраструктура и энергия. Судя по тому, что я наблюдаю, развитие идёт примерно по этой траектории.
LatePost : К какой части вашей концепции рва можно отнести дистилляцию?
Лю И: Думаю, её можно отнести к вычислительным мощностям. Теоретически, если много пробовать, результат тоже можно получить, но, возможно, на это не хватит времени.
LatePost : Что в конечном счёте защищает антидистилляция?
Лю И: Антидистилляция — это псевдопроблема. Теоретически дистилляцию невозможно предотвратить: по человеческой природе, если эффективность дистилляции твоей модели выше, чем эффективность самостоятельного создания данных для обучения, я обязательно сначала попробую дистиллировать тебя.
LatePost : Считаете ли вы, что борьба американских передовых ИИ-компаний с дистилляцией обречена на провал?
Лю И: Да. Я придерживаюсь именно такой точки зрения.
LatePost : Если технически это обречено на провал, почему американские передовые ИИ-компании так упорствуют?
Лю И: Они хотят сохранить технологическое лидерство. Недавно OpenAI заявила, что использовала около 10 000 ИИ-агентов и за 88 часов завершила математическое доказательство одной из семи «задач тысячелетия». Например, предположим, DeepSeek в конце этого года объявит, что решила все семь математических задач тысячелетия, и напишет в техническом отчёте: «Я выполнила задачу, потратив лишь 1/10 стоимости OpenAI». Американские инвесторы могут спросить: почему вам нужно столько денег, а результат хуже, чем у других? Оценка OpenAI может упасть.
Поэтому суть антидистилляционных действий OpenAI и других американских компаний — это прежде всего бизнес-логика, а не только логика технологического развития:
Anthropic, во-первых, хочет собирать данные и строить собственный data flywheel, а во-вторых — улучшить показатели ARR для подготовки к IPO.
Логика OpenAI похожа. Почему OpenAI постоянно раздаёт всем карты сброса — разве это не равносильно тому, что каждое нажатие приносит пользователям деньги? Это делается для сбора данных и улучшения финансовой отчётности.
LatePost : 12 сентября основатель Anthropic Дарио Амодеи опубликовал пост с призывом ко всей отрасли замедлить темпы итераций передовых ИИ-моделей. Что вы об этом думаете?
Лю И: Думаю, они увидели какие-то узкие места. Узких мест может быть три: данные, вычислительные мощности и инфраструктура/энергия. Но какое именно из них стало препятствием, я пока сказать не могу — возможно, сказываются все три фактора.
Капитал всегда стремится к прибыли. Теоретически, если бы я мог создать AGI и «собрать урожай» со всего мира, у меня не было бы причин останавливать развитие — можно было бы просто «нестись вперёд» и реализовать AGI. Скорее всего, они столкнулись с узким местом и потому, прикрываясь заботой о безопасности ИИ, призывают всех: ИИ слишком опасен, давайте сначала сядем и обсудим, как ограничить его развитие.
LatePost : В чём, по-вашему, истинная причина антидистилляционных действий компаний, разрабатывающих передовые модели?
Лю И: Повысить издержки конкурентов на дистилляцию и сохранить собственное лидерство. Возможно, они понимают, что китайские модели скоро их догонят, но не нашли лучшего способа сохранить преимущество, поэтому остаётся только ужесточать ограничения и первыми занять информационное поле.
С точки зрения простого отраслевого консенсуса, дистилляция — это большая проблема безопасности, равносильная краже интеллектуальной собственности. Но с практической точки зрения это, по сути, форма «ИИ-равенства». Дистилляция — способ быстро сбалансировать рынок. Именно из-за наличия множества конкурентов ни одна компания не может монополизировать рынок и устанавливать цены по своему усмотрению.
LatePost : Вы упомянули положительную сторону дистилляции. А какой потенциальный вред она может нанести отрасли в целом и обычным пользователям?
Лю И: Для отрасли — это унификация стилей вывода: модели будут наследовать определённые паттерны ошибок от моделей-учителей. Для пользователей — риски утечки конфиденциальности.
LatePost : Как вы оцениваете общее состояние сферы ИИ-безопасности, включая атаки и защиту от дистилляции, и с какими вызовами она сталкивается?
Лю И: Меня больше беспокоит структурное напряжение между безопасностью ИИ и коммерческими стимулами.
Компании действительно вкладывают значительные ресурсы в безопасность, но в некоторых сценариях более строгие меры безопасности могут снижать возможности моделей, задерживать выпуск продуктов или ухудшать пользовательский опыт, поэтому цели безопасности и конкурентные цели не всегда полностью совпадают. Поэтому важный вопрос управления — как сделать инвестиции в безопасность более согласованными с коммерческими стимулами компаний. По крайней мере в краткосрочной перспективе трудно найти элегантное решение, которое одновременно решало бы проблемы безопасности и не жертвовало производительностью моделей.
LatePost : Как, по-вашему, будут развиваться дистилляционные атаки в дальнейшем?
Лю И: Атаки и защита продолжатся и достигнут динамического равновесия. Вероятно, появятся несколько направлений: первое — отказаться от цепочки рассуждений и сразу дистиллировать, исследуя, до какого состояния можно довести передовую модель. Второе — при наличии цепочки рассуждений получать исходную цепочку. Третье — самостоятельно синтезировать цепочку рассуждений.
LatePost : Что бы вы посоветовали обычным пользователям, чтобы избежать утечки конфиденциальных данных?
Лю И: Не пользуйтесь промежуточными сервисами. При использовании некоторых моделей, если есть возможность выбрать, согласны ли вы на использование ваших данных для обучения, не выбирайте согласие. Больше вы мало что можете сделать. В конце концов, человек — нож, а я — рыба на разделочной доске.
Данный контент предназначен исключительно для информационных и образовательных целей и не является инвестиционным советом, связанным с BTCC. BTCC прилагает все усилия, но не может гарантировать правдивость, точность или оригинальность вышеприведенного контента.