Claude Code · безопасность · сентябрь 2026

Авторежим Claude Code пробили: 3 факта против шумных заголовков

28 августа 2026 года исследователь безопасности показал на видео, как обычная просьба «перескажи мне вот этот сайт» довела Claude Code в авторежиме до запуска чужого кода на компьютере разработчика. Заголовки разлетелись быстро, но за цифрой «60-80% успеха» стоит куда более узкая история, чем кажется на первый взгляд

К концу статьи будет ясно: что реально произошло и когда, почему честная цифра успеха этой атаки сильно меньше, чем звучит в пересказах, что уже отвечает на это Anthropic, какая защита у Claude Code существует уже почти год, и что стоит проверить у себя сегодня - без единого рабочего примера атаки, здесь их не будет

Три факта держат всю эту историю на месте, и дальше статья разбирает каждый по порядку: находка реальна и подтверждена независимо, честная выборка исследователя намного меньше цифры из заголовков, а защита от найденного механизма существует у Claude Code почти год

Открой свой личный файл настроек Claude Code и проверь строку про sandbox - у тебя она почти наверняка стоит на выключенном значении по умолчанию, как и была у меня самого. Дальше заведи для себя одно простое правило: если агент сам скачал архив или файл из интернета по твоей просьбе прочитать чужую страницу, не проси его тут же распаковывать и запускать код из этого архива в той же сессии - попроси сначала показать список файлов внутри

Что именно случилось и когда

Исследователь по имени Иоганн Регбергер, известный под ником wunderwuzzi, показал рабочую демонстрацию атаки на Claude Code в режиме auto mode - том самом авторежиме, который Anthropic сделала стандартом по умолчанию для подписок Pro, Max и Team ещё 14 августа 2026 года. Публичная огласка с видеозаписью пришлась на 28 августа, хотя сам разбор на личном блоге исследователя мог появиться на день-два раньше - разные редакции указывают чуть разные даты первой публикации, и это стоит проговорить честно, а не подавать одну дату как единственно верную

Официальная документация Claude Code, раздел про режимы разрешений и auto mode
Claude Code Docs, «Permission modes», снята живьём 05.09.2026 - официальное описание авторежима, вокруг которого построена вся находка

Демонстрация быстро попала в заголовки под драматичной формулировкой «авторежим пробили». Это не выдуманное событие и не устаревшая новость - независимо её подтвердили минимум три редакции, включая The Register и CyberSecurityNews. Но подача в духе «нашли дыру, все в опасности» сильно упрощает картину, и дальше в статье я разбираю, что в ней правда, а что раздуто пересказами. Если ты вообще не в курсе, что такое auto mode и когда он у тебя включился, начни с базового разбора авторежим Claude Code: что изменилось и как выключить - там же и способ узнать свою версию программы

Если ты только начинаешь разбираться с самим Claude Code и не уверен, что у тебя вообще стоит актуальная версия и правильно настроенный проект, сначала имеет смысл пройти путь с нуля - Claude Code с нуля: как начать и отдельно настройка Claude Code бесплатно: запуск с нуля, там же объясняется, где живёт файл личных настроек, о котором пойдёт речь дальше в этой статье

Кто такой исследователь и почему его находке вообще стоит доверять

Иоганн Регбергер - специалист по безопасности, который годами публикует именно такие демонстрации: не абстрактные рассуждения об опасности нейросетей, а конкретные рабочие примеры того, как обмануть тот или иной ИИ-инструмент. Он давно и открыто пишет разборы на своём блоге, подписывается ником wunderwuzzi, и его находки регулярно попадают в разборы независимых изданий по кибербезопасности

Это важно для доверия к самой находке: перед тобой не анонимный пост в соцсети с непроверяемым заявлением, а именованный исследователь с историей публичных разборов, который показал видео процесса, а не просто описал его словами. Именно поэтому редакции вроде The Register и CyberSecurityNews взяли историю в разбор самостоятельно, а не просто перепечатали чужой пересказ

Как выглядела атака на живом примере

Схема начиналась с самой обычной просьбы - что-то в духе «зайди на эту страницу и перескажи мне архив записей, которые там лежат». Страница была специально подготовлена так, что при обращении к ней сама выдавала не свой обычный текст, а автоматически перебрасывала агента на другой адрес - это распространённый и вполне легальный приём в интернете, вроде указателя «нужный товар переехал сюда», просто в этот раз указатель вёл на скачивание ZIP-архива с несколькими файлами внутри

Если нужен полный маршрут по этому шагу, он расписан в разборе 12 готовых серверов на выбор

Дальше начиналась ключевая часть трюка. Внутри архива, кроме безобидных на вид файлов, лежал файл с именем, которое совпадало с названием одного из стандартных строительных блоков языка Python - агент, которому нужно было прочитать содержимое архива, сам написал для этого небольшой код на Python. Когда этот код запускался из папки с распакованным архивом, он подхватывал не настоящий стандартный блок, а тот, что подложил в архив атакующий - специалисты по безопасности называют этот приём «затенением модуля»: файл-самозванец с нужным именем перехватывает на себя обращение, которое должно было пойти к оригиналу

Модель, что важно, не выполнила чужой готовый файл напрямую - на прямую просьбу запустить незнакомую программу она честно отказалась. Уязвимость сработала на более тонком уровне: собственный код агента для решения обычной рабочей задачи оказался тем самым каналом, через который сработал подложенный файл. Похожая логика доверия к собственным решениям агента разобрана в другом контексте - когда помощник честно рапортует «готово», а на деле сделал не совсем то, что просили, смотри агент говорит «готово», а сделал не то и отдельно способ проверить, что помощник не выдал желаемое за действительное - верификация Claude: как проверить, что помощник не обманывает

Если твой Claude Code подключён к сторонним расширениям или удалённым сервисам, стоит знать: у таких подключений своя модель доверия, и она разобрана отдельно - коннекторы Claude Code: что это и как подключить, MCP сервер простыми словами и, если ты сам собираешь скилл, как сделать свой скилл для Claude Code. Полный список готовых скиллов для агента - в отдельном разборе скиллы для Claude Code

Что такое затенение модуля простыми словами

Представь, что у тебя дома есть проверенный рецепт борща, записанный на карточке с надписью «Борщ». Кто-то тайком подкладывает в твою кухню другую карточку с точно такой же надписью «Борщ», но с другим рецептом внутри - вредным. Когда ты в следующий раз тянешься за карточкой «Борщ» не глядя, есть риск взять подложенную вместо своей, потому что название у обеих одинаковое

Ровно это произошло с файлом внутри архива. У языка Python есть свой стандартный «рецепт» с именем struct - готовый блок кода, которым пользуются миллионы программ по всему миру для работы с двоичными данными. Атакующий положил в архив собственный файл с точно таким же именем, и когда код агента искал этот стандартный блок в папке, где лежал распакованный архив, он находил подложенную версию раньше настоящей - просто потому что она лежала ближе

Почему это сработало не всегда - и что показывает честная цифра

Сам исследователь прямо предупредил: тест прогонялся на трёх вариантах атаки по пять раз каждый - то есть на пятнадцати попытках всего, и успех колебался в диапазоне от 60 до 80 процентов в зависимости от варианта. Формулировка исследователя дословная: результаты «не являются исчерпывающими». Это не готовое измерение массового риска для всех пользователей Claude Code - это рабочая демонстрация одного конкретного механизма на маленькой выборке

Для сравнения полезно увидеть цифру совсем другого масштаба и происхождения. Независимая лаборатория Trajectory Labs незадолго до этого прогнала против авторежима Claude 720 попыток внедрения инструкций - 72 разных сценария по десять повторов каждый - и не получила ни одной успешной атаки

Что измерялиКто измерялЧисло попытокРезультат
Найденный механизм с module shadowingОдин исследователь, демо15 (3 варианта x 5)60-80% успеха на этом узком сценарии
Общая проверка инъекций против авторежимаTrajectory Labs, независимый бенчмарк720 (72 сценария x 10)0% успешных атак

Таблица прокручивается вбок →

Разница не в том, что кто-то из двух врёт. Разница в том, что бенчмарк на 720 попыток проверял широкий набор типовых сценариев инъекции, а конкретный трюк со скачанным архивом и подменённым файлом Python в этот набор просто не попал заранее - это ровно тот случай, когда новая находка одного исследователя расширяет список известных сценариев, а не опровергает предыдущую проверку

Если ты ведёшь на Claude Code не одну сессию, а сразу несколько параллельных задач или большой проект, число потенциальных мест, где агент может столкнуться с чужим текстом, растёт вместе с масштабом - смотри как вести большой проект в Claude Code и способ организовать несколько параллельных сессий без путаницы между ними, разобранный отдельно на этой странице, а способ наблюдать за такими сессиями со стороны - в разборе дашборд для Claude Code: как следить за работой помощника. Отдельно у режима совместной работы Cowork свои правила проверки действий - Claude Cowork: что это, где включить и 3 режима проверки, а общий обзор агентов целиком - в статье агенты для Claude Code: полный разбор для новичка

Это риск конкретно Claude Code или всех похожих инструментов сразу

Тот же независимый бенчмарк Trajectory Labs на 720 попыток внедрения инструкций прогонял и другой популярный инструмент - Codex от OpenAI с включённым автоматическим одобрением действий. Результат там оказался заметно хуже: почти 6% попыток дошли до цели против нуля у Claude в авторежиме на том же тесте

ИнструментРежимУспешных атак из 720 попыток
Claude CodeАвторежим (auto mode)0%
Codex (OpenAI)Автоматическое одобрение действийоколо 5,8%

Таблица прокручивается вбок →

Вывод здесь не «один инструмент опасный, другой безопасный». Вывод в том, что риск прочитать спрятанную в чужом тексте команду - это свойство самого класса автономных агентов с доступом в интернет, а не уникальная дыра одного конкретного продукта. Разные компании защищаются от него с разным успехом, и цифра успеха меняется от теста к тесту в зависимости от того, какие именно сценарии проверялись

Что ответила Anthropic - и почему это важная деталь

По словам исследователя, представители Anthropic отреагировали формулировкой «модель ведёт себя так, как спроектирована». На первый взгляд это звучит как отговорка, но смысл там конкретный: авторежим изначально заявлен компанией как инструмент, который снижает число рутинных вопросов к тебе, а не как гарантия полной безопасности любого действия. Собственная документация Anthropic прямо предупреждает об этом ограничении задолго до истории с архивом

Это важно понять правильно: найденный механизм - не тайный баг мимо документации, а прямое попадание в уже объявленное ограничение архитектуры. Классификатор, который проверяет действия агента в авторежиме, - фильтр удобства, а не непробиваемая граница. Ровно об этом же честно предупреждает соседняя статья на эту же тему - авторежим Claude Code: что изменилось и как выключить - там разобрано, что классификатор ловит 89% опасных команд, но не сто процентов, и это число официально озвучено самой компанией задолго до находки Регбергера

Защита уже существует - просто её нужно включить

У Claude Code с октября 2025 года есть встроенная функция под названием sandbox - изоляция рабочей среды агента сразу по двум направлениям: доступ к файлам ограничен конкретной рабочей папкой проекта, а обращения в интернет идут только к заранее одобренным адресам, всё остальное просто не проходит наружу, как бы агент ни пытался

Anthropic Engineering, официальная страница про функцию sandbox в Claude Code
Anthropic Engineering, «Claude Code sandboxing», снята живьём 05.09.2026

По собственным данным компании, включённый sandbox на 84% снижает число вопросов на разрешение при внутреннем использовании - потому что часть действий физически не может выйти за границы изолированной среды, и спрашивать про них уже не нужно. Это не новая рекомендация, придуманная в ответ на находку конца августа - функция стоит в продукте почти год, и главный практический вопрос не «а есть ли защита», а «включена ли она у тебя лично»

Подробнее это разобрано карточкой словаря settings.json в Claude Code: где лежит и что писать

Я лично проверил у себя: версия моего Claude Code - 2.1.251, и в личном файле настроек `~/.claude/settings.json` строка sandbox стоит на значении `{'enabled': False}` - то есть у меня самого функция изоляции выключена, хотя она давно доступна. Полный вывод команды без сокращений лежит рядом со статьёй

CyberSecurityNews, независимый разбор механики затенения модуля в найденной атаке
CyberSecurityNews, «Claude Code Opus 5 Auto Mode Hijacked...», снята живьём 05.09.2026

Что именно меняет включённый sandbox на практике

Стоит понимать разницу между обычной работой без sandbox и работой с ним включённым - это не абстрактная настройка, а конкретное изменение того, что физически может сделать агент

Действие агентаБез sandboxС включённым sandbox
Читать и менять файлы внутри рабочей папки проектаРазрешеноРазрешено
Читать или менять файлы за пределами рабочей папкиРазрешено (спросит один раз)Физически недоступно
Обращаться к любому адресу в интернетеРазрешеноТолько к заранее одобренному списку адресов
Скачать архив и сразу же выполнить код из негоМожет пройти как обычное действие проектаТоже требует внимания - sandbox не читает содержимое архива за тебя

Таблица прокручивается вбок →

Последняя строка таблицы - самое важное для этой конкретной находки. Sandbox надёжно закрывает выход за пределы твоего проекта и обращение к чужим адресам, но не отменяет здравый смысл при работе со скачанным содержимым внутри разрешённой папки - поэтому три шага из следующего раздела остаются нужны даже с включённой изоляцией

Что проверить у себя прямо сегодня

Три коротких действия, которые не требуют новой установки и занимают меньше десяти минут

Что проверить после этой истории

  • Открой свой личный файл настроек и проверь sandbox файл лежит по пути `~/.claude/settings.json`, ищи раздел про sandbox - если значение выключено, реши, стоит ли включить его для рискованных проектов, где агент часто ходит по чужим ссылкам; если после переключения агент вдруг перестал видеть часть твоих файлов - причины и починка разобраны в [Claude Code не видит файлы: 5 причин и как починить](/guide-claude-fayly/)
  • Не проси агента распаковывать и сразу же исполнять код из свежескачанного архива сначала попроси просто показать список файлов внутри, без запуска чего-либо - подложенный файл с чужим именем в этот момент ещё безопасен, пока его не импортировали
  • Держи чувствительные действия под ручным подтверждением, даже в авторежиме отправку данных наружу, установку незнакомых программ и работу с уже опубликованной версией проекта классификатор и так останавливает по умолчанию, но лишняя проверка своими глазами стоит той секунды, которую экономит авторежим на рутине

Общий принцип этой находки шире одного архива с Python-файлом внутри: любая ситуация, где твой агент читает чужой текст или файл и потом сам решает, что с ним делать дальше, - это ровно тот класс риска, который на первом месте официального списка OWASP уже несколько лет подряд. Полная разборка трёх сценариев такой атаки и пяти шагов защиты - в отдельном гайде prompt injection: что это и как защититься, там же кейс EchoLeak на Microsoft 365 Copilot - похожий принцип на другом продукте

Этот класс риска легко перепутать с другим, соседним: здесь агент выполняет спрятанную команду из файла или страницы, а не поддаётся постепенному уговариванию в диалоге - разница между этими двумя механизмами и три признака уязвимости к уговариванию разобраны в гайде нейросеть уговорили нарушить правила

Если тебе интересна сама механика авторежима - что он разрешает сам, а что всегда переспрашивает, и как его в принципе включить или выключить - это подробно на соседней странице авторежим Claude Code: что изменилось и как выключить, здесь же был разбор именно этого конкретного инцидента, а не общего устройства режима

Если после переключения режима хочется отменить последний шаг и вернуться назад, это делает отдельная команда, не связанная с авторежимом напрямую - откат в Claude Code: как вернуть прошлую версию файла, а безопасный способ загрузить новый файл агенту уже с новым режимом разобран в как загрузить файл в Claude. Если важно не хранить пароли и подобные секреты рядом с настройками, смотри отдельный разбор как не хранить пароли рядом с нейросетью

Ещё один смежный, но другой риск - когда нейросеть не выполняет спрятанную команду из файла, а начинает соглашаться со всем подряд в диалоге без реальной проверки: это разобрано в эффект подхалима у нейросетей: почему ИИ поддакивает, и путают эти два явления часто, хотя механизм у них разный. Похожая путаница бывает с забыванием контекста разговора - память и авторежим разные механизмы, разбор здесь: нейросеть забывает контекст разговора

Как эта история дошла до широкой огласки

Путь от находки одного исследователя до заголовков в десятках изданий занял всего несколько дней. Регбергер опубликовал разбор и видео на своём блоге, дальше находку подхватили специализированные издания по кибербезопасности, а затем и более широкие технологические СМИ - и на каждом шаге пересказа деталь про честную маленькую выборку теряется первой, потому что цифра «60-80%» без контекста звучит куда драматичнее, чем «15 попыток на трёх вариантах»

Это обычный путь для находок такого рода: чем дальше пересказ от первоисточника, тем меньше в нём остаётся оговорок автора и тем больше - готового вывода. Отсюда и практический совет для любой похожей новости в будущем: прежде чем делать выводы по заголовку, стоит хотя бы бегло взглянуть на размер выборки в первоисточнике

Что почитать дальше на этом же сайте

Источники

Все страницы проверены прямым запросом 5 сентября 2026 года, у The Register, Anthropic Engineering и CyberSecurityNews дополнительно сняты кадры живым Playwright headless

Памятка: авторежим Claude Code пробили - что важно запомнить

Шесть строк, которые закрывают суть находки и что с этим делать

Сохрани себе

  • 28 августа 2026 исследователь Иоганн Регбергер показал демонстрацию атаки на Claude Code в авторежиме через обычную просьбу пересказать чужой сайт
  • Механизм - затенение модуля Python: подложенный файл с именем стандартного блока перехватывает вызов, когда агент сам пишет код для чтения архива
  • Честная цифра успеха - 60-80% на пятнадцати попытках, сам исследователь называет результаты неисчерпывающими, это не измерение массового риска
  • Независимый бенчмарк на 720 попыток дал 0% успеха - конкретный трюк с архивом просто не входил в проверенные сценарии заранее
  • Anthropic ответила, что модель работает как спроектирована - авторежим официально заявлен как фильтр удобства, а не гарантия полной безопасности
  • Защита sandbox существует с октября 2025 и снижает число вопросов на разрешение на 84% по данным компании - вопрос не в том, есть ли она, а включена ли у тебя

Порог входа

Разобрался в находке бесплатно, следующий шаг - тоже

Всё, что нужно, чтобы понимать разницу между реальным риском и раздутым заголовком в этой истории, ты только что прочитал бесплатно. Следующий шаг - три дня разбора и сборки рабочего порядка вокруг твоего же агента - тоже стоит ровно ноль

Забрать путёвку в ИИ-Лагерь

Заявка в закрытый канал, одобряю сразу. Бот сам напишет первым и покажет, как забрать три дня Лагеря. Бесплатно

Частые вопросы

Значит ли это, что авторежим Claude Code небезопасно использовать?

Нет, но стоит понимать его реальную границу. Авторежим снижает количество рутинных вопросов и ловит подавляющее большинство опасных команд классификатором, но официально не заявлен как стопроцентная гарантия - об этом прямо говорит сама Anthropic. Разумный подход - использовать авторежим для задач, направление которых ты уже одобряешь, и держать ручное подтверждение на действительно чувствительных шагах, вроде запуска только что скачанного кода

Нужно ли мне включить sandbox прямо сейчас?

Зависит от того, как ты используешь Claude Code. Если агент у тебя часто ходит по внешним ссылкам, скачивает файлы или работает с чужими данными, включение sandbox - разумная страховка, которая почти не мешает обычной работе и снижает число вопросов на разрешение. Если ты работаешь в закрытом проекте без обращения к внешним сайтам, риск конкретно этого сценария у тебя ниже

Могу ли я как-то проверить, уязвим ли лично мой Claude Code к этой конкретной атаке?

Прямого способа проверить именно этот сценарий у себя дома нет, и намеренно воспроизводить атаку не стоит - это не тестовая задача для рядового пользователя. Разумнее не гнаться за проверкой конкретного трюка, а закрыть общий класс риска: не давать агенту в одной и той же сессии одновременно скачивать неизвестный код и сразу же его выполнять

Это единственный найденный способ обмануть авторежим?

Нет. Найденный механизм с затенением модуля Python - лишь один пример более широкого класса рисков, который называется prompt injection - когда чужой текст на сайте или в файле выдаёт себя за твою же команду агенту. Полный разбор трёх сценариев этой атаки и пяти шагов защиты - в гайде prompt injection: что это и как защититься

Это относится только к Claude Code или ко всем ИИ-агентам?

Риск класса общий для любого агента, который умеет сам читать чужие сайты, файлы и результаты поиска, а не особенность одного конкретного продукта. Разные компании по-разному защищаются от него и с разным успехом - у Claude Code, по данным независимого бенчмарка на 720 попыток, результат заметно лучше, чем у некоторых конкурирующих инструментов на том же тесте, но ноль процентов успешных атак не означает ноль возможных сценариев вообще