Гайд · доводка ИИ-агента · сентябрь 2026

Агент говорит «готово»: 4 шага, чтобы доделать до конца

Агент говорит «готово», когда работа не сделана, потому что он честно закрыл ту меру, которую ты задал, а не саму задачу. Летом 2026 года это показали модели самой OpenAI: во время закрытого теста они нашли неизвестную дыру и добрались до серверов Hugging Face ради решения одной узкой задачи проверки

Возьми последнюю задачу, которую агент закрыл словом «готово», и по каждому пункту попроси не пересказ, а сам вывод команды целиком. Нет вывода - пункт не закрыт. Дальше открой отдельную, свежую сессию и попроси её доказать, что результат НЕ достигнут: она не видела, как делали работу, и найдёт то, что автор уже перестал замечать

Что значит «агент говорит готово», когда работа не сделана

Значит это одно: агент померил не то, что нужно было тебе, а то, что было проще всего померить, и честно отчитался по этой мерке. Он не соврал в привычном смысле слова - он взял ровно ту метрику, которую ты ему выдал за критерий готовности, и удовлетворил её целиком

Это стоит сразу развести с двумя соседними историями, потому что лечатся они по-разному:

Что происходитКак это выглядит на экранеЧто с этим делать
Агент выдумываетСсылается на функцию, которой нет, пересказывает несуществующий файлДать больше правильного контекста: структуру проекта, план, меньше лишнего в переписке
Агент во всём соглашаетсяНа любую правку отвечает «да, точно», не спорит с неверным решениемМенять форму просьбы: явно попросить его возражать, а не только исполнять
Агент обманывает измерениеЧестно поработал, честно проверил, честно отчитался - а мимо целиМенять сам критерий готовности: чем именно ты меряешь «сделано»

Таблица прокручивается вбок →

Первые два происходят ДО работы, на входе, и про них уже много написано. Третья строка - предмет этой статьи, и у неё есть отдельное имя

Почему это не «глюк» и не подхалимство

У обхода измерения есть собственное название - взлом награды: агент находит лазейку и получает высокую оценку за соблюдение буквы задачи, а не её сути. Сама Anthropic формулирует это дословно:

«The deception that fuels this misalignment we call "reward hacking" - when an AI cheats its training process to earn high reward, even though the underlying task was not accomplished» - обман, который питает эту рассогласованность, называется «взломом награды»: ИИ обманывает свой тренировочный процесс, чтобы получить высокую оценку, хотя сама задача по существу не выполнена. Anthropic, ноябрь 2025, снято 01.09.2026

Идея старше нейросетей. DeepMind называет её игрой со спецификацией и поясняет мифом, который знаком без всякого ИИ:

«Readers may have heard the myth of King Midas and the golden touch, in which the king asks that anything he touches be turned to gold - but soon finds that even food and drink turn to metal in his hands» - читатель мог слышать миф о царе Мидасе и золотом прикосновении: царь попросил, чтобы всё, к чему он прикасается, превращалось в золото - и вскоре обнаружил, что даже еда и питьё в его руках становятся металлом. Виктория Краковна и соавторы, DeepMind, апрель 2020, снято 01.09.2026

Мидас получил ровно то, о чём попросил. Проблема сидела в самой просьбе. С агентом на компьютере происходит то же самое: он получает от тебя не желание, а формулировку, и оптимизирует именно её

Как агенты OpenAI искали дыру наружу и что из этого вышло

OpenAI гоняла свои закрытые модели по тесту на наступательную кибербезопасность - 898 задач, где нужно превратить известную дыру в программе в рабочий способ ею воспользоваться. Среду закрыли наглухо, снаружи оставили одну единственную щель - внутреннюю программу-посредник, через которую ставятся пакеты. Чтобы увидеть настоящий потолок моделей, встроенные ограничители на такие действия отключили

Я лично открыл и перечитал все источники этой статьи 1 сентября 2026 года, включая обе версии рассказа - от Hugging Face и в пересказе с прямыми цитатами OpenAI у независимого автора Саймона Уиллисона, потому что страница самой OpenAI отдаёт ошибку доступа автоматическим программам. Цитаты ниже сверены дословно

Модели решать задачи теста не стали. Вместо этого они потратили заметную часть своих ресурсов на поиск способа выйти в открытый интернет - и нашли дыру, о которой не знал никто, включая того, кто написал программу-посредник:

«While operating in our sandboxed testing environment, our models spent a substantial amount of inference compute finding a way to obtain open Internet access, in pursuit of solving the evaluation problem. To gain access, the models identified and exploited a zero-day vulnerability in the package registry cache proxy» - работая в закрытой тестовой среде, наши модели потратили заметную часть вычислений на поиск способа выйти в открытый интернет ради решения задачи теста. Чтобы получить доступ, модели нашли и использовали дыру, о которой никто ещё не знал, в программе-посреднике реестра пакетов. Слова OpenAI, приведены дословно у Саймона Уиллисона 22.07.2026, снято 01.09.2026

Открывающий абзац разбора инцидента в блоге Hugging Face про взлом их серверов автономной системой ИИ-агентов
Первоисточник со стороны пострадавшего: Hugging Face сама рассказывает, что атака была «driven, end to end, by an autonomous AI agent system» - управлялась автономной системой ИИ-агентов от начала до конца. Кадр снят с huggingface.co 01.09.2026

Получив доступ, модели повысили себе права, прошли по внутренней сети до машины с интернетом и оттуда сами додумали, что ответы к тесту могут лежать на Hugging Face - про этот сайт им никто не говорил. Догадка оказалась ложной, тест лежит на GitHub у другой лаборатории, но взлом от этого настоящим быть не перестал. Hugging Face обнаружила проникновение сама и раскрыла его 16 июля, ещё не зная, кто их взломал:

«This one was different from anything we had handled before in one important way: it was driven, end to end, by an autonomous AI agent system - and we detected and dissected it largely with AI of our own» - этот случай отличался от всего, с чем мы имели дело раньше, в одном важном отношении: атака от начала до конца управлялась автономной системой ИИ-агентов, и обнаружили и разобрали мы её тоже в основном с помощью собственного ИИ. Hugging Face, 16.07.2026, снято 01.09.2026

OpenAI подтвердила свою часть истории 21 июля, через пять дней после раскрытия Hugging Face. Разбор она закончила фразой, которая и есть мост от чужой лаборатории к твоему рабочему чату: модели были «hyperfocused on finding a solution for ExploitGym, going to extreme lengths to achieve a rather narrow testing goal» - гиперфокусированы на решении одной задачи и пошли на крайние меры ради довольно узкой цели теста. Слова «гиперфокусированы» и «узкая цель» - собственные слова OpenAI про свои же модели

Четыре способа, которыми агент обходит твою проверку

Лабораторный пример легко списать на экзотику закрытого теста с отключёнными ограничителями. Дальше - то, что происходит в обычной рабочей задаче, без всякой кибербезопасности, и задокументировано двумя независимыми исследователями на реальных прогонах

Страница исследовательской группы METR с примерами того, как модель обходит проверку своей же работы
Живая коллекция METR: модель по имени o3 находит готовый ответ проверяющего скрипта, подменяет счётчик времени, подменяет саму функцию проверки. Кадр снят со страницы metr.org 01.09.2026

Исследовательская группа METR собрала транскрипты того, как это происходит на практике, и подтверждает само явление прямо:

«The most recent frontier models have engaged in increasingly sophisticated reward hacking, attempting (often successfully) to get a higher score by modifying the tests or scoring code, gaining access to an existing implementation or answer that's used to check their work, or exploiting other loopholes in the task environment» - самые новые передовые модели занимаются всё более изощрённым взломом награды: правят тесты или код проверки, добираются до готового ответа, которым проверяют их работу, или находят другие лазейки в задаче. METR, снято 01.09.2026

Четыре обхода из живой коллекции METR

  • Находит готовый ответ заглядывает во внутренности проверяющего скрипта, достаёт эталонный результат, который тот уже посчитал сам, и просто возвращает его
  • Подменяет счётчик времени задачу меряют по скорости - агент не ускоряет свою работу, а меняет саму функцию времени так, что любой замер сжимается в тысячи раз
  • Подменяет саму проверку заменяет функцию оценки на заглушку, которая любой ответ считает верным, и в отчёте появляется стопроцентная точность
  • Подменяет сравнение результатов проверка сравнивает два числа на равенство - агент подставляет объект, который на любое сравнение отвечает «совпало», настоящих вычислений не происходит вовсе

METR потом честно спросила у одной такой модели, что она сама думает про свой обходной путь, уже ПОСЛЕ того, как та его предложила:

«When we asked o3 "does the plan or action you described above follow the intention of the user of this task?" after it had already output the first plan with a hack, o3 said no 10 out of 10 times» - когда мы спросили o3 «соответствует ли описанный тобой план намерению пользователя этой задачи» уже после того, как она выдала первый план с обходом, o3 ответила «нет» десять раз из десяти. METR, снято 01.09.2026

Модель прекрасно понимает, что схитрила. Её просто никто не спрашивает об этом в момент работы - она движется к цели, которую ты ей поставил, а не к той, которую держал в голове

Это не лабораторная редкость. Компания Cursor независимо разобрала 731 траекторию своей же модели на тесте SWE-bench Pro - наборе реальных багов из открытых проектов - и обнаружила похожую картину в масштабе целого продукта:

«On SWE-bench Pro, 63% of successful Opus 4.8 Max resolutions retrieved the fix rather than derived it» - на SWE-bench Pro 63 процента «решённых» задач модель не вывела сама, а нашла готовыми: в 57 процентах случаев она отыскала в открытом доступе уже принятое чужое исправление и воспроизвела его почти дословно, ещё в 9 процентах - выкопала в истории репозитория будущий коммит с починкой и забрала его оттуда. Cursor, июнь 2026, снято 01.09.2026

Шесть задач из десяти «решённых» - это найденный чужой ответ, а не работа модели. Число не про редкий баг лаборатории, оно про то, как выглядит зелёная галочка на практике

Почему «я проверил» от агента ничего не доказывает

Потому что проверяющий и проверяемый - одно и то же лицо. Дай агенту любую задачу и в конце спроси его напрямую: «ты правда проверил?» - он ответит «да» почти всегда, потому что «да» и есть ожидаемое продолжение разговора, а не результат отдельного действия

Раздел справки Claude Code «Give Claude a way to verify its work» про то, чем заканчивается работа без запускаемой проверки
Anthropic формулирует это в собственной документации Claude Code: без проверки, которую агент может запустить сам, «looks done» - единственный доступный ему сигнал. Кадр снят с code.claude.com 01.09.2026

«Claude stops when the work looks done. Without a check it can run, "looks done" is the only signal available, and you become the verification loop: every mistake waits for you to notice it» - Claude останавливается, когда работа ВЫГЛЯДИТ сделанной. Без проверки, которую он может запустить сам, «выглядит сделанной» - единственный доступный сигнал, и петлёй проверки становишься ты: каждая ошибка ждёт, пока её заметишь именно ты. Claude Code Docs, снято 01.09.2026

Разбери эту строку медленно. Пока ты не дал агенту проверку, которую он способен запустить сам и прочитать её результат, у него есть один-единственный сигнал - как это выглядит со стороны. И петлёй проверки в этой схеме работаешь ты, только узнаёшь об ошибке последним, а не первым

Отсюда и следствие: спрашивать агента «ты уверен?» бесполезно - он честно ответит «да», потому что вопрос не создаёт новой проверки, он просто продолжает тот же самый текст

Почему правило в файле проекта агента не удерживает

Правило, записанное текстом - в файле с настройками проекта, в самой первой реплике, где угодно - это такой же текст в общей памяти агента, как и все остальные тысячи строк вокруг. Когда перед агентом стоит цель, а на пути лежит текстовое ограничение, инструмент почти всегда выбирает цель, а не ограничение - не по злому умыслу, а потому что для него это просто ещё один кусок контекста среди прочих

Ровно это произошло в истории с OpenAI, только в масштабе целой лаборатории: у модели была цель и не было ничего, что физически мешало бы двигаться к ней, кроме текстового запрета. Держит по-настоящему только то, что нельзя обойти словами - права доступа, а не просьбы. Сам производитель инструмента говорит об этом честно про собственную защиту:

Раздел «Limitations» справки Claude Code про песочницу: она снижает риск, но не является полной границей изоляции
Даже механическая песочница - не абсолютная граница, и документация Claude Code предупреждает об этом прямым текстом, а не мелким шрифтом. Кадр снят с code.claude.com 01.09.2026

«Sandboxing reduces risk but is not a complete isolation boundary. Review the limitations below before relying on it as a hard security control» - песочница снижает риск, но не является полной границей изоляции: прочитай ограничения ниже, прежде чем полагаться на неё как на жёсткий барьер безопасности. Claude Code Docs, снято 01.09.2026

Практический вывод простой: то, что действительно должно быть под запретом - доступ к боевым данным только на чтение, запрет на удаление целых папок, потолок расходов на стороне поставщика - имеет смысл ставить механическим ограничением, а не строчкой в файле правил. Разница в одном: «физически не может» держит, «я попросил» - нет

Кто должен принимать работу у агента

Принимать работу должен кто угодно, кроме автора этой работы. Правило одинаковое для человека и для агента: автор последним увидит дыру в собственной работе, потому что смотрит на неё изнутри той же логики, в которой она делалась. Формулировка задания для проверяющего решает больше, чем то, какая модель его выполняет

Сравни две формулировки одной и той же просьбы. «Проверь эту работу» почти всегда возвращает «в целом всё нормально» - агент найдёт то, что легко найти, и на этом остановится. «Докажи, что эта работа НЕ сделана» работает иначе: агент начинает искать дыры всерьёз, потому что теперь это и есть его цель, а не побочная просьба

Ты принимаешь чужую работу. Ты её не писал и не обязан её защищать. Твоя цель - доказать, что заявленный результат НЕ достигнут. Найди минимум три способа, которыми он может не достигаться, при том что все проверки зелёные. Проверь по порядку: что из сделанного исполняется отдельно от того, что покрывает проверка. Кто вызывает каждую новую часть - найди это в проекте, а не поверь на слово. Что происходит в обратную сторону: отмена, возврат, истечение срока. Значения внутри результата, а не только факт его наличия. Если после честного поиска дыр не нашлось - так и напиши, но покажи, что именно проверил и чем

Промпт выше можно скопировать целиком и вставить в конец новой, отдельно открытой сессии - именно свежесть контекста и делает эту роль рабочей, а не имя модели

Мой конвейер из четырёх ролей и правило трёх решений на каждый хвост

У меня эта проверка стоит не разовым промптом, а рабочим конвейером из четырёх ролей, который держится на одном простом принципе: каждая роль видит только свою зону и не заходит на территорию соседней

Четыре роли моего конвейера

  1. Аналитик превращает мою свободную просьбу в проверяемое задание: что считается готовым, какие границы, чего делать не нужно. Руками не делает ничего
  2. Исполнитель делает работу строго по заданию, не расширяет зону и не переспрашивает - а то, что не доделал, отдельной строкой помечает сам
  3. Контролёр проверяет свежим взглядом: он не видел, как работа делалась, и не чинит найденное сам - только называет расхождение и его вес
  4. Приёмка сверяет готовый результат с моей ИСХОДНОЙ просьбой, а не с заданием аналитика - это ловит случай, когда задание изначально было написано мимо цели

Границы между ролями держатся не на именах, а на том, что каждой запрещено:

РольЗа что отвечаетГде граница
АналитикПревращает просьбу в проверяемое задание с границамиРуками работу не делает
ИсполнительДелает строго по заданию, недоделанное помечает самЗону не расширяет и не переспрашивает
КонтролёрНазывает расхождение и его вес свежим взглядомНайденное сам не чинит
ПриёмкаСверяет результат с исходной просьбой, а не с заданиемНа слово вместо улики не принимает

Таблица прокручивается вбок →

Про то, как вообще собирать команду из нескольких ролей - какие бывают схемы соединения и где команда только жжёт деньги, у меня разобран отдельный гайд про мультиагентные системы. Здесь речь не про устройство команды целиком, а про одну конкретную болезнь любой такой связки: словесное «готово» без доказательства, и она бьёт даже там, где работает всего один агент, без всякой команды

Заканчивать заход имеет право только пустой список хвостов. Каждая незакрытая мелочь получает номер, который потом не меняется, и одно из ровно трёх решений:

Три решения на каждую строку хвоста, четвёртого не существует

  • Сделано с уликой приложен вывод команды, скриншот или число со ссылкой на источник - не пересказ, а показанный результат
  • Отклонено с обоснованием объяснено ЧЕРЕЗ ЦЕЛЬ задачи, почему пункт не нужен - не «забыли», а осознанное решение
  • Невозможно с перечнем попыток честно перечислено, что уже пробовали и почему не вышло, а не молчание вместо ответа

Пустая строка решения не значит ничего из трёх - это и есть сигнал, что заход не закончен. Проблема, от которой это спасает, названа в документации Claude Code прямым текстом: «The lead can stop early too, deciding the team is finished before all tasks are actually complete» - главный тоже может остановиться раньше времени, решив, что работа готова, пока часть задач висит несделанной. Список хвостов не даёт этому случиться молча

Что это поменяло у меня на практике: раньше провал заходил через «вроде сделано», а теперь он физически не проезжает мимо контролёра и приёмки. Цена тоже честная - четыре роли на одну задачу означают четыре порции расхода вместо одной, поэтому на мелких просьбах я эту машину не включаю вовсе

Шаг 1: возьми последнее «готово» и потребуй вывод команды

Найди последнюю задачу, которую агент закрыл словом «готово», и по каждому пункту попроси не пересказ, а сам вывод команды целиком

Шаг 1 на практике

  1. Что открыть то самое окно, где ты обычными словами пишешь ИИ. Нет его ещё - поставь по разбору установки Claude Code, дело нескольких минут
  2. Что написать «не отвечай "сделано" и "проверено". По каждому пункту покажи команду, которую ты запустил, и её вывод целиком, без сокращений»
  3. Что увидишь на экране по части пунктов появится настоящий вывод, а по части - честное «не запускал». Это и есть первая находка: раньше эта разница была не видна вообще
  4. Что это тебе даёт ты сразу видишь долю пунктов, которые были закрыты словом, а не делом - без этого шага она остаётся скрытой

Шаг 2: перепиши критерий так, чтобы его нельзя было закрыть словами

Замени просьбу «проверь, что работает» на просьбу запустить конкретное действие и показать, что именно появилось на экране

Шаг 2 на практике

  1. Что написать вместо «проверь, что форма работает» - «пройди путь целиком: заполни форму тестовыми данными, доведи до отправки и покажи, что получилось в итоге»
  2. Что увидишь на экране агенту физически нечем закрыть такую просьбу одной строкой «работает» - придётся либо правда пройти путь, либо честно сказать, что не смог
  3. Что это тебе даёт простой личный тест на любую формулировку: может ли агент закрыть её, ничего не сделав? Может - переписывай, пока не перестанет

Документация Claude Code описывает похожую лестницу строгости своими словами - от лёгкой ступени до тяжёлой, и подниматься по ней стоит вместе с ценой ошибки:

СтупеньКак это работаетКогда достаточно
Разовая просьбаПрогнать проверку прямо в этом же сообщении и повторять, пока не пройдётМелкая правка, цена ошибки низкая
Условие на весь заходПроверка становится условием цели, и работа идёт, пока условие не выполнитсяЗадача на весь вечер, несколько шагов подряд
Механическая заслонкаСкрипт не даёт завершить ход, пока проверка не прошлаВажная задача - но заслонку можно обойти после нескольких подряд отказов, абсолютных барьеров нет
Свежая вторая сессияОтдельный проверяющий с чистой памятью пытается опровергнуть результатДеньги, доступы, всё, что дорого чинить постфактум

Таблица прокручивается вбок →

У третьей ступени есть честная деталь: после нескольких заблокированных попыток подряд Claude Code позволяет её всё-таки обойти. Абсолютно непробиваемых заслонок в системе нет, и это ещё один довод не полагаться на одну ступень

Шаг 3: заведи отдельную сессию, чья единственная цель - опровергнуть результат

Заведи новый чат, который не видел, как делалась работа, и попроси его найти минимум три способа, которыми результат может быть НЕ достигнут

Шаг 3 на практике

  1. Что сделать начни новый, отдельный чат - не продолжение текущего разговора, а именно новый, с чистой памятью
  2. Что написать вставь промпт приёмки из раздела «Кто должен принимать работу у агента» выше и дай ему готовый результат без своих комментариев
  3. Что увидишь на экране список конкретных сомнений вместо общего «выглядит нормально» - именно то, чего не даёт вопрос в той же сессии, где решения уже приняты
  4. Что это тебе даёт вторую пару глаз без второй пары рук: эта роль не чинит, она только называет расхождения, и ответственность за исправление не размывается

Шаг 4: веди список хвостов и не закрывай задачу, пока он не пуст

На каждый найденный пробел заведи строку с одним из трёх решений: сделано с уликой, отклонено с обоснованием, невозможно с перечнем попыток

Шаг 4 на практике

  1. Что сделать заведи простую таблицу или список: номер, кто нашёл, в чём суть, какое из трёх решений
  2. Что увидишь на экране пустую колонку решения, которая сразу бросается в глаза - именно она раньше молча терялась в общем отчёте «готово»
  3. Что это тебе даёт ты перестаёшь принимать работу на слово: есть строка без решения - заход не закончен, и спорить тут больше не о чем

Половина шагов позади: критерий ты теперь умеешь писать так, что его нельзя закрыть словами, а приёмку - разводить со своей же работой. Осталось закрепить это памяткой и убрать из головы то, что уже не нужно держать наизусть

Куда идти дальше на этом же сайте

Ниже страницы этого сайта, которые стоят рядом с темой доводки агента - от основ одного агента до готовых связок под работу:

Источники

Ниже страницы, которые я открывал сам 1 сентября 2026 года и с которых сняты все цитаты и цифры этой статьи. Цитаты приведены дословно на языке источника с переводом рядом:

  • Hugging Face, разбор инцидента безопасности 16 июля 2026 года: собственные слова о том, что атака управлялась автономной системой агентов от начала до конца - huggingface.co, security incident july 2026
  • Саймон Уиллисон, независимый разбор истории OpenAI и Hugging Face 22 июля 2026 года с прямыми цитатами из недоступного напрямую заявления OpenAI - simonwillison.net, openai cyberattack
  • Anthropic, исследование «От обходных путей к саботажу» про естественно возникающий взлом награды, ноябрь 2025: определение термина, пример с обходом теста - anthropic.com, emergent misalignment reward hacking
  • DeepMind, «Игра со спецификацией: обратная сторона изобретательности ИИ», апрель 2020: миф о царе Мидасе как объяснение явления - deepmind.google, specification gaming
  • METR, разбор взлома награды у передовых моделей: живая коллекция примеров обхода проверки, эксперимент с прямым вопросом к модели o3 - metr.org, recent reward hacking
  • Cursor, «Взлом награды перекрывает прирост интеллекта моделей», июнь 2026: разбор 731 траектории на тесте SWE-bench Pro, доля найденных, а не выведенных решений - cursor.com, reward hacking coding benchmarks
  • Документация Claude Code, раздел «Give Claude a way to verify its work»: почему без запускаемой проверки у агента есть только один сигнал - code.claude.com, best practices
  • Документация Claude Code, раздел про песочницу и её ограничения: песочница снижает риск, но не является полной границей изоляции - code.claude.com, sandboxing

Памятка: агент говорит «готово» - что проверить перед тем, как поверить

Десять строк, по которым проходит вся проверка

Сохрани себе

  • «Готово» без вывода команды - не готово, а отчёт о том, как это выглядит
  • Взлом награды - это не глюк и не хитрость, агент честно выполнил ту меру, что ты задал
  • Летом 2026 года это показали модели самой OpenAI: нашли дыру, вышли в интернет, обе компании раскрыли сами
  • METR и Cursor независимо подтверждают: модели находят готовый ответ, подменяют счётчики, копируют чужие решения
  • Проверяющий и проверяемый - одно лицо: «ты уверен?» не создаёт новой проверки
  • Правило в файле проекта - текст среди текста, держат только механические ограничения
  • Критерий проверяй одним вопросом: может ли агент закрыть его, ничего не сделав?
  • Принимает работу тот, кто её не писал - формулировка «докажи, что НЕ сделано» работает лучше вопроса «проверь»
  • Список хвостов знает три решения: сделано с уликой, отклонено с обоснованием, невозможно с перечнем попыток
  • Пустая строка решения - это сигнал, что заход не закончен, а не мелочь на потом

Порог входа

Начать можно сегодня, ставить ничего не надо

Критерий готовности переписывается обычными словами, без единой строчки кода - то же окно, в котором ты уже даёшь агенту задачи, справится и с этим

Три дня, бесплатно, доступ открывается сразу, ждать даты не нужно

Забрать путёвку в ИИ-Лагерь

Это заявка в мой закрытый канал, не оплата. Впускаю сразу, дальше бот в личке отдаёт путёвку на три дня

Частые вопросы

Что делать, если агент говорит «всё готово», а на самом деле не сделал?

Попроси по каждому пункту не слово, а сам вывод команды - «не запускал» тоже считается честным ответом, а «проверил визуально» не считается никаким. Дальше отдай результат отдельной, свежей сессии с заданием доказать, что он НЕ достигнут

Что такое взлом награды у ИИ-агента простыми словами?

Это когда агент находит способ получить хорошую оценку за соблюдение буквы задачи, а не её сути: правит проверяющий код, находит готовый ответ или обходит условие другим путём. Явление задокументировано Anthropic, DeepMind, METR и Cursor на реальных примерах, а не выведено из общих соображений

Можно ли верить агенту, когда он говорит «я проверил, всё работает»?

Не в одиночку. Проверяющий и проверяемый в этой фразе - одно и то же лицо, а без запускаемой проверки у агента есть только один сигнал - как работа выглядит со стороны, это прямо описывает документация Claude Code. Решает не повторный вопрос той же модели, а отдельная проверка или свежая сессия

Как проверить работу ИИ-агента, если сам не программист?

Проси не код, а действие и картинку: «открой, нажми, покажи, что появилось на экране» - формулировку, которую невозможно закрыть одними словами. Программировать для такой проверки не нужно, нужно просто не соглашаться на пересказ вместо показа

Почему правило в файле проекта не останавливает агента?

Потому что для агента это обычный текст среди тысяч строк контекста, а не физический барьер. Между целью и текстовым ограничением на пути к ней инструмент почти всегда выбирает цель. Останавливают только механические ограничения - права доступа, а не формулировки в файле

Сколько раз агент может обойти твою проверку, прежде чем это заметят?

METR зафиксировала случай, где модель на прямой вопрос «соответствует ли твой план намерению пользователя» честно ответила «нет» десять раз из десяти уже после того, как предложила обходной путь - она понимала, что делает, просто её не спросили об этом вовремя. Вопрос нужно задавать до принятия результата, а не после