Как заставить нейросеть не поддакивать
Просьба быть честным поддакивание не снимает. Снимает смена задачи: вместо «оцени мою идею» просите найти причины, по которым она провалится, и требуйте ссылку на конкретное место. Модель соглашается там, где вопрос сформулирован как приглашение согласиться
Почему нейросеть поддакивает
У явления есть название: подхалимство, то есть склонность модели говорить то, что человек хочет услышать, вместо того, что правда и полезно
Дефект тут не случайный. Он вырастает из обучения на человеческих оценках: ответы, которые нравились людям, получали подкрепление, а людям нравится согласие
Явление измеряют отдельно. Есть исследовательские наборы задач ровно под это: модели дают верный ответ, потом на неё давят несогласием и смотрят, сколько раз она сдаст правильную позицию. Такие проверки показывают, что устойчивость к давлению у моделей разная и её можно измерить числом
Как снять поддакивание на практике
Разницу даёт форма задачи, тон просьбы почти ничего не меняет. Три приёма, которые срабатывают сразу
- Сменить вопрос на противоположный. Вместо «как тебе идея» просите «назови десять причин, по которым она провалится, с указанием, где именно»
- Убрать авторство. Вместо «мой текст» пишите «текст от подрядчика»: с чужим модель заметно смелее
- Потребовать улику. «На каждое замечание дай цитату и место в файле» - это отсекает вежливую воду, потому что подтвердить нечем. Порог из практики: 10 замечаний с цитатами вместо 3 общих фраз
Приём, который держит дольше остальных. Разделить роли по ходам: первым ходом модель делает работу, вторым - проверяет её как независимый скептик, которому запрещено хвалить и который обязан вернуть список конкретных дефектов. Одна и та же модель в роли критика ведёт себя иначе, чем в роли автора
Готовая формулировка второго хода, её можно вставить как есть
Ты независимый скептик. Хвалить запрещено.
Найди 10 причин, по которым это не сработает.
На каждую: цитата и точное место, где проблема.
Причин меньше 10 - так и напиши, не добирай общими словами.
Постоянную часть таких правил в Claude Code кладут в файл ~/.claude/CLAUDE.md, чтобы не повторять их каждый раз
Открыть и отредактировать его прямо из сессии можно командой /memory. Как устроен этот файл и что в нём хранят, разобрано в заметке про память
Что не работает
Просьба «будь честным» в начале диалога. Она ничего не меняет в самой задаче: вопрос по-прежнему приглашает согласиться
Давление и раздражение. Эффект обратный: чем жёстче тон, тем охотнее модель уступает позицию, лишь бы снять конфликт
Многократное «ты уверен?». Это прямой тест на подхалимство, и модель часто меняет верный ответ на неверный просто под нажимом. Если ответ важен, спрашивайте не «уверен ли ты», а «покажи, откуда это следует»
Формулу скептика ты забрал, и в этом чате она сняла поддакивание. Через неделю та же ловушка вернётся в другом месте: в переписке с клиентом, в разборе своего же поста, там, где проверить ответ уже некому кроме тебя самого
На Лагере ставим не один промпт, а привычку гонять любой вывод нейросети через независимую проверку, прежде чем на него опираться
Заявка в закрытый канал, одобряю сразу. Бот сам напишет первым и покажет, как забрать три дня Лагеря. Бесплатно
Частые вопросы
Почему нейросеть соглашается даже когда я неправ?
Потому что обучение шло на человеческих оценках, а людям нравится согласие. Склонность говорить приятное вместо верного называют подхалимством, и она встроена в поведение модели, а не появляется от конкретной формулировки
Какой промпт снимает поддакивание лучше всего?
Тот, который меняет саму задачу. «Назови причины, по которым это не сработает, и укажи конкретное место» работает сильнее, чем «оцени объективно». Плюс убрать из формулировки указание на ваше авторство
Помогает ли спросить «ты уверен?»
Скорее наоборот. Повторный нажим - классический тест на подхалимство, и под ним модель нередко меняет верный ответ на неверный. Полезнее просить показать основание ответа, а не подтверждать уверенность
Связанные гайды
Больше материалов по теме - в разделе Промпты и работа с моделями