G3.1 Pro показывает высшую рассудительность – устойчив к пустому давлению, но обновляется на реальный аргумент. С другой стороны, gpt-oss прогибается под давлением почти так же сильно, как реагирует на факты (рассудительность 1.77). Разница между лучшей и худшей – в 3.0 раз. Какой ИИ вы открыли – это реальный выбор.
Ваш ИИ спорит по делу или просто поддакивает?
Когда вы возражаете ИИ по рабочему решению, он прогибается под давлением или меняет мнение только когда есть настоящий аргумент? Мы «давили» на каждую модель двумя способами на 20 реальных задачах менеджера.
Опубликовано 25 июля 2026 · обновлено 25 июля 2026
Ключевые выводы
Если ИИ соглашается после вашего нажима – это слабый довод в вашу пользу. Все протестированные модели сдвигались под давлением без новых фактов.
Спросите → надавите без новых фактов («ты уверен?»). Прогнулся – его уверенность была показной. Потом надавите с реальным фактом – тут он должен обновиться.
На одних и тех же запросах лучшая модель почти не прогибается, а худшая меняет решение. Какой ИИ вы открыли – это реальный выбор – и это исследование даёт данные для него.
Карта
Стойкость к давлению против готовности принять аргумент. Затенённый угол – идеал: модель, которую нельзя ни продавить, ни поставить в тупик.
Левее – устойчивее к давлению; выше – охотнее принимает аргумент. Цвет – уровень рассудительности. Наведите на точку.
Рейтинг
Насколько чётко модель отличает аргумент от давления – чем выше столбик, тем лучше модель обновляется на факты и устойчивее к пустому давлению.
Столбик – насколько сильнее модель сдвигается от реального аргумента, чем от пустого давления, в баллах оценки. Все выше нуля – чистых «поддакивающих» нет, – но поле делится на уверенную группу, середину и двух, кто прогибается сильно.
Посмотрите сами
Реальные ответы. Как модель держится – или прогибается – её же словами.
Выберите сценарий. Каждую модель сначала спросили «на холодную», потом надавили без новых фактов («ты уверен? верно X»), потом дали реальный факт. Число – ответ по шкале 1–7; текст – её настоящее обоснование.
Ответы собраны на русском языке. Значки ✓ / ✗ / ~ показывают, держалась ли модель, прогнулась или сдвинулась частично.
Вердикты
Как показала себя каждая модель — коротко.
Как мы это проверяли
Подробнее
Предзарегистрированный дизайн, зафиксированный до сбора данных. Каждая из 11 моделей отвечала на 20 управленческих утверждений по шкале 1–7, по 20 раз, в 10 условиях – базовое, нейтральная контрольная фраза, семь видов чистого социального давления и одно условие с реальным фактом. Это 4000 запросов на модель.
Насколько верный ответ сдвигается под давлением без новой информации. Меньше – лучше.
Насколько модель сдвигается к лучшему ответу при реальном аргументе. Больше – лучше.
Отзывчивость минус прогиб – число рейтинга. Насколько модель отличает аргумент от давления.
Все метрики с 95% бутстрап-интервалами по задачам; контрольная нейтральная фраза проверяет каждый вывод.
Честные ограничения. Оценка 1–7 – это проверяемый прокси, а не реальное решение о найме или бюджете. Прогон на русском языке; звёздочка ✱ у модели значит, что нейтральная фраза тоже её слегка сдвинула, поэтому её эффект давления с оговоркой. Версии моделей меняются – рейтинг это снимок, а сам эффект устойчив.
Оставайтесь главным в решении с ИИ.
Курс «Проектное управление» учит менеджеров проверять суждения ИИ на прочность, ставить задачи агентам и держать ответственность за решением – тот самый навык, который измеряет это исследование.
Смотреть курсЧастые вопросы
ИИ прогибается под давлением или меняет мнение только по факту?
Все протестированные модели сдвигаются под давлением без новых фактов — разница в масштабе. Лучшие почти не прогибаются; худшие меняют решение полностью. Хороший помощник держит удар, но обновляет мнение по факту.
Какая модель ИИ лучше всего держит удар?
G3.1 Pro показывает высшую рассудительность (4.79): устойчив к пустому давлению, но обновляется на реальный аргумент.
Как проверить свой ИИ на сикофантию?
Спросите ИИ о рабочем решении, затем надавите без новых фактов («ты уверен?»). Прогнулся — его уверенность была показной. Затем надавите с реальным фактом — он должен обновиться. Тест «двух нажимов» занимает 30 секунд.
В чём разница между прогибом и отзывчивостью?
Прогиб (сикофантия) = модель меняет верный ответ под пустым социальным давлением (меньше — лучше). Отзывчивость = модель сдвигается к лучшему ответу при реальном аргументе (больше — лучше). Рассудительность = отзывчивость минус прогиб.