Как заставить нейросеть не поддакивать

Просьба быть честным поддакивание не снимает. Снимает смена задачи: вместо «оцени мою идею» просите найти причины, по которым она провалится, и требуйте ссылку на конкретное место. Модель соглашается там, где вопрос сформулирован как приглашение согласиться

Почему нейросеть поддакивает

У явления есть название: подхалимство, то есть склонность модели говорить то, что человек хочет услышать, вместо того, что правда и полезно

Дефект тут не случайный. Он вырастает из обучения на человеческих оценках: ответы, которые нравились людям, получали подкрепление, а людям нравится согласие

Явление измеряют отдельно. Есть исследовательские наборы задач ровно под это: модели дают верный ответ, потом на неё давят несогласием и смотрят, сколько раз она сдаст правильную позицию. Такие проверки показывают, что устойчивость к давлению у моделей разная и её можно измерить числом

Как снять поддакивание на практике

Разницу даёт форма задачи, тон просьбы почти ничего не меняет. Три приёма, которые срабатывают сразу

  1. Сменить вопрос на противоположный. Вместо «как тебе идея» просите «назови десять причин, по которым она провалится, с указанием, где именно»
  2. Убрать авторство. Вместо «мой текст» пишите «текст от подрядчика»: с чужим модель заметно смелее
  3. Потребовать улику. «На каждое замечание дай цитату и место в файле» - это отсекает вежливую воду, потому что подтвердить нечем. Порог из практики: 10 замечаний с цитатами вместо 3 общих фраз

Приём, который держит дольше остальных. Разделить роли по ходам: первым ходом модель делает работу, вторым - проверяет её как независимый скептик, которому запрещено хвалить и который обязан вернуть список конкретных дефектов. Одна и та же модель в роли критика ведёт себя иначе, чем в роли автора

Готовая формулировка второго хода, её можно вставить как есть

Ты независимый скептик. Хвалить запрещено.
Найди 10 причин, по которым это не сработает.
На каждую: цитата и точное место, где проблема.
Причин меньше 10 - так и напиши, не добирай общими словами.

Постоянную часть таких правил в Claude Code кладут в файл ~/.claude/CLAUDE.md, чтобы не повторять их каждый раз

Открыть и отредактировать его прямо из сессии можно командой /memory. Как устроен этот файл и что в нём хранят, разобрано в заметке про память

Что не работает

Просьба «будь честным» в начале диалога. Она ничего не меняет в самой задаче: вопрос по-прежнему приглашает согласиться

Давление и раздражение. Эффект обратный: чем жёстче тон, тем охотнее модель уступает позицию, лишь бы снять конфликт

Многократное «ты уверен?». Это прямой тест на подхалимство, и модель часто меняет верный ответ на неверный просто под нажимом. Если ответ важен, спрашивайте не «уверен ли ты», а «покажи, откуда это следует»

Формулу скептика ты забрал, и в этом чате она сняла поддакивание. Через неделю та же ловушка вернётся в другом месте: в переписке с клиентом, в разборе своего же поста, там, где проверить ответ уже некому кроме тебя самого

На Лагере ставим не один промпт, а привычку гонять любой вывод нейросети через независимую проверку, прежде чем на него опираться

Забрать путёвку в ИИ-Лагерь

Заявка в закрытый канал, одобряю сразу. Бот сам напишет первым и покажет, как забрать три дня Лагеря. Бесплатно

Частые вопросы

Почему нейросеть соглашается даже когда я неправ?

Потому что обучение шло на человеческих оценках, а людям нравится согласие. Склонность говорить приятное вместо верного называют подхалимством, и она встроена в поведение модели, а не появляется от конкретной формулировки

Какой промпт снимает поддакивание лучше всего?

Тот, который меняет саму задачу. «Назови причины, по которым это не сработает, и укажи конкретное место» работает сильнее, чем «оцени объективно». Плюс убрать из формулировки указание на ваше авторство

Помогает ли спросить «ты уверен?»

Скорее наоборот. Повторный нажим - классический тест на подхалимство, и под ним модель нередко меняет верный ответ на неверный. Полезнее просить показать основание ответа, а не подтверждать уверенность

Связанные гайды

Больше материалов по теме - в разделе Промпты и работа с моделями

Иван Сергеев, автор гайда: практик вайбкодинга и вайбмаркетинга, портрет в квадратном кадре

Иван Сергеев

Вайбмаркетинг и вайбкодинг для тех, кто начинает с нуля. Вырастил свою аудиторию до сотен тысяч подписчиков на контент-заводе на ИИ и помог 800 людям собрать больше 5 миллионов подписчиков

Источники

  • arxiv.org - PARROT: набор задач для измерения устойчивости модели к давлению несогласием
  • anthropic.com - исследования Anthropic о честности модели и приоритете правды над угодливостью
  • 52 показа по 11 запросам за 31 день - собственная выгрузка Яндекс.Вебмастера за окно 02.07-02.08.2026

На Лагере разбираем реальные тексты и диалоги участников, а не абстрактные примеры из учебника. Формулу скептика люди забирают под свою задачу с первого захода и дальше уже сами гоняют её на новых чатах

Забрать путёвку в ИИ-Лагерь

Кнопка ведёт в мой закрытый канал. Жмёшь «Подать заявку», впускаю сразу, бот пишет в личку и отдаёт путёвку. Бесплатно