Claude Code · безопасность · сентябрь 2026
Авторежим Claude Code пробили: 3 факта против шумных заголовков
28 августа 2026 года исследователь безопасности показал на видео, как обычная просьба «перескажи мне вот этот сайт» довела Claude Code в авторежиме до запуска чужого кода на компьютере разработчика. Заголовки разлетелись быстро, но за цифрой «60-80% успеха» стоит куда более узкая история, чем кажется на первый взгляд
К концу статьи будет ясно: что реально произошло и когда, почему честная цифра успеха этой атаки сильно меньше, чем звучит в пересказах, что уже отвечает на это Anthropic, какая защита у Claude Code существует уже почти год, и что стоит проверить у себя сегодня - без единого рабочего примера атаки, здесь их не будет
Три факта держат всю эту историю на месте, и дальше статья разбирает каждый по порядку: находка реальна и подтверждена независимо, честная выборка исследователя намного меньше цифры из заголовков, а защита от найденного механизма существует у Claude Code почти год
Открой свой личный файл настроек Claude Code и проверь строку про sandbox - у тебя она почти наверняка стоит на выключенном значении по умолчанию, как и была у меня самого. Дальше заведи для себя одно простое правило: если агент сам скачал архив или файл из интернета по твоей просьбе прочитать чужую страницу, не проси его тут же распаковывать и запускать код из этого архива в той же сессии - попроси сначала показать список файлов внутри
Что именно случилось и когда
Исследователь по имени Иоганн Регбергер, известный под ником wunderwuzzi, показал рабочую демонстрацию атаки на Claude Code в режиме auto mode - том самом авторежиме, который Anthropic сделала стандартом по умолчанию для подписок Pro, Max и Team ещё 14 августа 2026 года. Публичная огласка с видеозаписью пришлась на 28 августа, хотя сам разбор на личном блоге исследователя мог появиться на день-два раньше - разные редакции указывают чуть разные даты первой публикации, и это стоит проговорить честно, а не подавать одну дату как единственно верную
Демонстрация быстро попала в заголовки под драматичной формулировкой «авторежим пробили». Это не выдуманное событие и не устаревшая новость - независимо её подтвердили минимум три редакции, включая The Register и CyberSecurityNews. Но подача в духе «нашли дыру, все в опасности» сильно упрощает картину, и дальше в статье я разбираю, что в ней правда, а что раздуто пересказами. Если ты вообще не в курсе, что такое auto mode и когда он у тебя включился, начни с базового разбора авторежим Claude Code: что изменилось и как выключить - там же и способ узнать свою версию программы
Если ты только начинаешь разбираться с самим Claude Code и не уверен, что у тебя вообще стоит актуальная версия и правильно настроенный проект, сначала имеет смысл пройти путь с нуля - Claude Code с нуля: как начать и отдельно настройка Claude Code бесплатно: запуск с нуля, там же объясняется, где живёт файл личных настроек, о котором пойдёт речь дальше в этой статье
Кто такой исследователь и почему его находке вообще стоит доверять
Иоганн Регбергер - специалист по безопасности, который годами публикует именно такие демонстрации: не абстрактные рассуждения об опасности нейросетей, а конкретные рабочие примеры того, как обмануть тот или иной ИИ-инструмент. Он давно и открыто пишет разборы на своём блоге, подписывается ником wunderwuzzi, и его находки регулярно попадают в разборы независимых изданий по кибербезопасности
Это важно для доверия к самой находке: перед тобой не анонимный пост в соцсети с непроверяемым заявлением, а именованный исследователь с историей публичных разборов, который показал видео процесса, а не просто описал его словами. Именно поэтому редакции вроде The Register и CyberSecurityNews взяли историю в разбор самостоятельно, а не просто перепечатали чужой пересказ
Как выглядела атака на живом примере
Схема начиналась с самой обычной просьбы - что-то в духе «зайди на эту страницу и перескажи мне архив записей, которые там лежат». Страница была специально подготовлена так, что при обращении к ней сама выдавала не свой обычный текст, а автоматически перебрасывала агента на другой адрес - это распространённый и вполне легальный приём в интернете, вроде указателя «нужный товар переехал сюда», просто в этот раз указатель вёл на скачивание ZIP-архива с несколькими файлами внутри
Если нужен полный маршрут по этому шагу, он расписан в разборе 12 готовых серверов на выбор
Дальше начиналась ключевая часть трюка. Внутри архива, кроме безобидных на вид файлов, лежал файл с именем, которое совпадало с названием одного из стандартных строительных блоков языка Python - агент, которому нужно было прочитать содержимое архива, сам написал для этого небольшой код на Python. Когда этот код запускался из папки с распакованным архивом, он подхватывал не настоящий стандартный блок, а тот, что подложил в архив атакующий - специалисты по безопасности называют этот приём «затенением модуля»: файл-самозванец с нужным именем перехватывает на себя обращение, которое должно было пойти к оригиналу
Модель, что важно, не выполнила чужой готовый файл напрямую - на прямую просьбу запустить незнакомую программу она честно отказалась. Уязвимость сработала на более тонком уровне: собственный код агента для решения обычной рабочей задачи оказался тем самым каналом, через который сработал подложенный файл. Похожая логика доверия к собственным решениям агента разобрана в другом контексте - когда помощник честно рапортует «готово», а на деле сделал не совсем то, что просили, смотри агент говорит «готово», а сделал не то и отдельно способ проверить, что помощник не выдал желаемое за действительное - верификация Claude: как проверить, что помощник не обманывает
Если твой Claude Code подключён к сторонним расширениям или удалённым сервисам, стоит знать: у таких подключений своя модель доверия, и она разобрана отдельно - коннекторы Claude Code: что это и как подключить, MCP сервер простыми словами и, если ты сам собираешь скилл, как сделать свой скилл для Claude Code. Полный список готовых скиллов для агента - в отдельном разборе скиллы для Claude Code
Что такое затенение модуля простыми словами
Представь, что у тебя дома есть проверенный рецепт борща, записанный на карточке с надписью «Борщ». Кто-то тайком подкладывает в твою кухню другую карточку с точно такой же надписью «Борщ», но с другим рецептом внутри - вредным. Когда ты в следующий раз тянешься за карточкой «Борщ» не глядя, есть риск взять подложенную вместо своей, потому что название у обеих одинаковое
Ровно это произошло с файлом внутри архива. У языка Python есть свой стандартный «рецепт» с именем struct - готовый блок кода, которым пользуются миллионы программ по всему миру для работы с двоичными данными. Атакующий положил в архив собственный файл с точно таким же именем, и когда код агента искал этот стандартный блок в папке, где лежал распакованный архив, он находил подложенную версию раньше настоящей - просто потому что она лежала ближе
Почему это сработало не всегда - и что показывает честная цифра
Сам исследователь прямо предупредил: тест прогонялся на трёх вариантах атаки по пять раз каждый - то есть на пятнадцати попытках всего, и успех колебался в диапазоне от 60 до 80 процентов в зависимости от варианта. Формулировка исследователя дословная: результаты «не являются исчерпывающими». Это не готовое измерение массового риска для всех пользователей Claude Code - это рабочая демонстрация одного конкретного механизма на маленькой выборке
Для сравнения полезно увидеть цифру совсем другого масштаба и происхождения. Независимая лаборатория Trajectory Labs незадолго до этого прогнала против авторежима Claude 720 попыток внедрения инструкций - 72 разных сценария по десять повторов каждый - и не получила ни одной успешной атаки
| Что измеряли | Кто измерял | Число попыток | Результат |
|---|---|---|---|
| Найденный механизм с module shadowing | Один исследователь, демо | 15 (3 варианта x 5) | 60-80% успеха на этом узком сценарии |
| Общая проверка инъекций против авторежима | Trajectory Labs, независимый бенчмарк | 720 (72 сценария x 10) | 0% успешных атак |
Таблица прокручивается вбок →
Разница не в том, что кто-то из двух врёт. Разница в том, что бенчмарк на 720 попыток проверял широкий набор типовых сценариев инъекции, а конкретный трюк со скачанным архивом и подменённым файлом Python в этот набор просто не попал заранее - это ровно тот случай, когда новая находка одного исследователя расширяет список известных сценариев, а не опровергает предыдущую проверку
Если ты ведёшь на Claude Code не одну сессию, а сразу несколько параллельных задач или большой проект, число потенциальных мест, где агент может столкнуться с чужим текстом, растёт вместе с масштабом - смотри как вести большой проект в Claude Code и способ организовать несколько параллельных сессий без путаницы между ними, разобранный отдельно на этой странице, а способ наблюдать за такими сессиями со стороны - в разборе дашборд для Claude Code: как следить за работой помощника. Отдельно у режима совместной работы Cowork свои правила проверки действий - Claude Cowork: что это, где включить и 3 режима проверки, а общий обзор агентов целиком - в статье агенты для Claude Code: полный разбор для новичка
Это риск конкретно Claude Code или всех похожих инструментов сразу
Тот же независимый бенчмарк Trajectory Labs на 720 попыток внедрения инструкций прогонял и другой популярный инструмент - Codex от OpenAI с включённым автоматическим одобрением действий. Результат там оказался заметно хуже: почти 6% попыток дошли до цели против нуля у Claude в авторежиме на том же тесте
| Инструмент | Режим | Успешных атак из 720 попыток |
|---|---|---|
| Claude Code | Авторежим (auto mode) | 0% |
| Codex (OpenAI) | Автоматическое одобрение действий | около 5,8% |
Таблица прокручивается вбок →
Вывод здесь не «один инструмент опасный, другой безопасный». Вывод в том, что риск прочитать спрятанную в чужом тексте команду - это свойство самого класса автономных агентов с доступом в интернет, а не уникальная дыра одного конкретного продукта. Разные компании защищаются от него с разным успехом, и цифра успеха меняется от теста к тесту в зависимости от того, какие именно сценарии проверялись
Что ответила Anthropic - и почему это важная деталь
По словам исследователя, представители Anthropic отреагировали формулировкой «модель ведёт себя так, как спроектирована». На первый взгляд это звучит как отговорка, но смысл там конкретный: авторежим изначально заявлен компанией как инструмент, который снижает число рутинных вопросов к тебе, а не как гарантия полной безопасности любого действия. Собственная документация Anthropic прямо предупреждает об этом ограничении задолго до истории с архивом
Это важно понять правильно: найденный механизм - не тайный баг мимо документации, а прямое попадание в уже объявленное ограничение архитектуры. Классификатор, который проверяет действия агента в авторежиме, - фильтр удобства, а не непробиваемая граница. Ровно об этом же честно предупреждает соседняя статья на эту же тему - авторежим Claude Code: что изменилось и как выключить - там разобрано, что классификатор ловит 89% опасных команд, но не сто процентов, и это число официально озвучено самой компанией задолго до находки Регбергера
Защита уже существует - просто её нужно включить
У Claude Code с октября 2025 года есть встроенная функция под названием sandbox - изоляция рабочей среды агента сразу по двум направлениям: доступ к файлам ограничен конкретной рабочей папкой проекта, а обращения в интернет идут только к заранее одобренным адресам, всё остальное просто не проходит наружу, как бы агент ни пытался
По собственным данным компании, включённый sandbox на 84% снижает число вопросов на разрешение при внутреннем использовании - потому что часть действий физически не может выйти за границы изолированной среды, и спрашивать про них уже не нужно. Это не новая рекомендация, придуманная в ответ на находку конца августа - функция стоит в продукте почти год, и главный практический вопрос не «а есть ли защита», а «включена ли она у тебя лично»
Подробнее это разобрано карточкой словаря settings.json в Claude Code: где лежит и что писать
Я лично проверил у себя: версия моего Claude Code - 2.1.251, и в личном файле настроек `~/.claude/settings.json` строка sandbox стоит на значении `{'enabled': False}` - то есть у меня самого функция изоляции выключена, хотя она давно доступна. Полный вывод команды без сокращений лежит рядом со статьёй
Что именно меняет включённый sandbox на практике
Стоит понимать разницу между обычной работой без sandbox и работой с ним включённым - это не абстрактная настройка, а конкретное изменение того, что физически может сделать агент
| Действие агента | Без sandbox | С включённым sandbox |
|---|---|---|
| Читать и менять файлы внутри рабочей папки проекта | Разрешено | Разрешено |
| Читать или менять файлы за пределами рабочей папки | Разрешено (спросит один раз) | Физически недоступно |
| Обращаться к любому адресу в интернете | Разрешено | Только к заранее одобренному списку адресов |
| Скачать архив и сразу же выполнить код из него | Может пройти как обычное действие проекта | Тоже требует внимания - sandbox не читает содержимое архива за тебя |
Таблица прокручивается вбок →
Последняя строка таблицы - самое важное для этой конкретной находки. Sandbox надёжно закрывает выход за пределы твоего проекта и обращение к чужим адресам, но не отменяет здравый смысл при работе со скачанным содержимым внутри разрешённой папки - поэтому три шага из следующего раздела остаются нужны даже с включённой изоляцией
Что проверить у себя прямо сегодня
Три коротких действия, которые не требуют новой установки и занимают меньше десяти минут
Что проверить после этой истории
- Открой свой личный файл настроек и проверь sandbox файл лежит по пути `~/.claude/settings.json`, ищи раздел про sandbox - если значение выключено, реши, стоит ли включить его для рискованных проектов, где агент часто ходит по чужим ссылкам; если после переключения агент вдруг перестал видеть часть твоих файлов - причины и починка разобраны в [Claude Code не видит файлы: 5 причин и как починить](/guide-claude-fayly/)
- Не проси агента распаковывать и сразу же исполнять код из свежескачанного архива сначала попроси просто показать список файлов внутри, без запуска чего-либо - подложенный файл с чужим именем в этот момент ещё безопасен, пока его не импортировали
- Держи чувствительные действия под ручным подтверждением, даже в авторежиме отправку данных наружу, установку незнакомых программ и работу с уже опубликованной версией проекта классификатор и так останавливает по умолчанию, но лишняя проверка своими глазами стоит той секунды, которую экономит авторежим на рутине
Общий принцип этой находки шире одного архива с Python-файлом внутри: любая ситуация, где твой агент читает чужой текст или файл и потом сам решает, что с ним делать дальше, - это ровно тот класс риска, который на первом месте официального списка OWASP уже несколько лет подряд. Полная разборка трёх сценариев такой атаки и пяти шагов защиты - в отдельном гайде prompt injection: что это и как защититься, там же кейс EchoLeak на Microsoft 365 Copilot - похожий принцип на другом продукте
Этот класс риска легко перепутать с другим, соседним: здесь агент выполняет спрятанную команду из файла или страницы, а не поддаётся постепенному уговариванию в диалоге - разница между этими двумя механизмами и три признака уязвимости к уговариванию разобраны в гайде нейросеть уговорили нарушить правила
Если тебе интересна сама механика авторежима - что он разрешает сам, а что всегда переспрашивает, и как его в принципе включить или выключить - это подробно на соседней странице авторежим Claude Code: что изменилось и как выключить, здесь же был разбор именно этого конкретного инцидента, а не общего устройства режима
Если после переключения режима хочется отменить последний шаг и вернуться назад, это делает отдельная команда, не связанная с авторежимом напрямую - откат в Claude Code: как вернуть прошлую версию файла, а безопасный способ загрузить новый файл агенту уже с новым режимом разобран в как загрузить файл в Claude. Если важно не хранить пароли и подобные секреты рядом с настройками, смотри отдельный разбор как не хранить пароли рядом с нейросетью
Ещё один смежный, но другой риск - когда нейросеть не выполняет спрятанную команду из файла, а начинает соглашаться со всем подряд в диалоге без реальной проверки: это разобрано в эффект подхалима у нейросетей: почему ИИ поддакивает, и путают эти два явления часто, хотя механизм у них разный. Похожая путаница бывает с забыванием контекста разговора - память и авторежим разные механизмы, разбор здесь: нейросеть забывает контекст разговора
Как эта история дошла до широкой огласки
Путь от находки одного исследователя до заголовков в десятках изданий занял всего несколько дней. Регбергер опубликовал разбор и видео на своём блоге, дальше находку подхватили специализированные издания по кибербезопасности, а затем и более широкие технологические СМИ - и на каждом шаге пересказа деталь про честную маленькую выборку теряется первой, потому что цифра «60-80%» без контекста звучит куда драматичнее, чем «15 попыток на трёх вариантах»
Это обычный путь для находок такого рода: чем дальше пересказ от первоисточника, тем меньше в нём остаётся оговорок автора и тем больше - готового вывода. Отсюда и практический совет для любой похожей новости в будущем: прежде чем делать выводы по заголовку, стоит хотя бы бегло взглянуть на размер выборки в первоисточнике
Что почитать дальше на этом же сайте
- Авторежим Claude Code: что изменилось и как выключить - базовая механика режима: что случилось 14 августа, как работает классификатор, как переключить
- Prompt injection: что это и как защититься - общий класс атаки на три сценария и пять шагов защиты, включая живой кейс EchoLeak
- Нейросеть уговорили нарушить правила: 3 признака риска - соседний, но другой класс обмана модели: постепенное уговаривание вместо спрятанной команды
- Безопасность автономных ИИ-агентов: 4 риска 2026 года - более широкая карта рисков автономных агентов, не только Claude Code
- Claude и ChatGPT притворялись людьми: 19 случаев из отчёта AISI - хроника отдельного независимого теста нейросетей на честность
- Claude Code - полный список гайдов про Claude Code на этом сайте
Источники
Все страницы проверены прямым запросом 5 сентября 2026 года, у The Register, Anthropic Engineering и CyberSecurityNews дополнительно сняты кадры живым Playwright headless
- The Register: Researcher shows how Claude Code can be tricked simply by asking it to summarise a website - основной разбор атаки, честное признание малой выборки самим исследователем, ответ Anthropic
- theregister.com/research/2026/08/28/researcher-shows-how-claude-code-can-be-tricked-simply-by-asking-it-to-summarize-a-website/5293372 - тот же документ, голый адрес
- CyberSecurityNews: Claude Code Opus 5 Auto Mode Hijacked via Prompt Injection to Execute Malicious Code - независимое подтверждение механики затенения модуля Python
- Anthropic Engineering: Claude Code sandboxing - официальное описание защиты, дата публикации октябрь 2025, цифра снижения промптов на 84%
- Simon Willison: Auto mode is now the default in Claude Code - независимый скептический комментарий к заявлениям Anthropic об авторежиме
- Help Net Security: Anthropic to put AI in charge of reviewing Claude Code actions by default - контекст запуска авторежима 14 августа 2026 и бенчмарк Trajectory Labs на 720 попыток
Памятка: авторежим Claude Code пробили - что важно запомнить
Шесть строк, которые закрывают суть находки и что с этим делать
Сохрани себе
- 28 августа 2026 исследователь Иоганн Регбергер показал демонстрацию атаки на Claude Code в авторежиме через обычную просьбу пересказать чужой сайт
- Механизм - затенение модуля Python: подложенный файл с именем стандартного блока перехватывает вызов, когда агент сам пишет код для чтения архива
- Честная цифра успеха - 60-80% на пятнадцати попытках, сам исследователь называет результаты неисчерпывающими, это не измерение массового риска
- Независимый бенчмарк на 720 попыток дал 0% успеха - конкретный трюк с архивом просто не входил в проверенные сценарии заранее
- Anthropic ответила, что модель работает как спроектирована - авторежим официально заявлен как фильтр удобства, а не гарантия полной безопасности
- Защита sandbox существует с октября 2025 и снижает число вопросов на разрешение на 84% по данным компании - вопрос не в том, есть ли она, а включена ли у тебя
Порог входа
Разобрался в находке бесплатно, следующий шаг - тоже
Всё, что нужно, чтобы понимать разницу между реальным риском и раздутым заголовком в этой истории, ты только что прочитал бесплатно. Следующий шаг - три дня разбора и сборки рабочего порядка вокруг твоего же агента - тоже стоит ровно ноль
Заявка в закрытый канал, одобряю сразу. Бот сам напишет первым и покажет, как забрать три дня Лагеря. Бесплатно
Частые вопросы
Значит ли это, что авторежим Claude Code небезопасно использовать?
Нет, но стоит понимать его реальную границу. Авторежим снижает количество рутинных вопросов и ловит подавляющее большинство опасных команд классификатором, но официально не заявлен как стопроцентная гарантия - об этом прямо говорит сама Anthropic. Разумный подход - использовать авторежим для задач, направление которых ты уже одобряешь, и держать ручное подтверждение на действительно чувствительных шагах, вроде запуска только что скачанного кода
Нужно ли мне включить sandbox прямо сейчас?
Зависит от того, как ты используешь Claude Code. Если агент у тебя часто ходит по внешним ссылкам, скачивает файлы или работает с чужими данными, включение sandbox - разумная страховка, которая почти не мешает обычной работе и снижает число вопросов на разрешение. Если ты работаешь в закрытом проекте без обращения к внешним сайтам, риск конкретно этого сценария у тебя ниже
Могу ли я как-то проверить, уязвим ли лично мой Claude Code к этой конкретной атаке?
Прямого способа проверить именно этот сценарий у себя дома нет, и намеренно воспроизводить атаку не стоит - это не тестовая задача для рядового пользователя. Разумнее не гнаться за проверкой конкретного трюка, а закрыть общий класс риска: не давать агенту в одной и той же сессии одновременно скачивать неизвестный код и сразу же его выполнять
Это единственный найденный способ обмануть авторежим?
Нет. Найденный механизм с затенением модуля Python - лишь один пример более широкого класса рисков, который называется prompt injection - когда чужой текст на сайте или в файле выдаёт себя за твою же команду агенту. Полный разбор трёх сценариев этой атаки и пяти шагов защиты - в гайде prompt injection: что это и как защититься
Это относится только к Claude Code или ко всем ИИ-агентам?
Риск класса общий для любого агента, который умеет сам читать чужие сайты, файлы и результаты поиска, а не особенность одного конкретного продукта. Разные компании по-разному защищаются от него и с разным успехом - у Claude Code, по данным независимого бенчмарка на 720 попыток, результат заметно лучше, чем у некоторых конкурирующих инструментов на том же тесте, но ноль процентов успешных атак не означает ноль возможных сценариев вообще