Что нельзя отдавать ИИ: почему ломается проверка работы

В 2025 году юристы истцов по иску против Walmart подали ходатайство, в котором было восемь несуществующих судебных дел. Один из адвокатов воспользовался ИИ-инструментом, тот выдумал ссылки, а остальная команда пропустила документ дальше не глядя. Каждый, судя по всему, считал, что проверил кто-то другой.
Интереснее здесь не галлюцинация модели – про них написано достаточно. Интереснее, что документ прошёл через несколько квалифицированных юристов и ни один не притормозил. Проверка формально существовала, фактически её не было ни на одном шаге.
Это довольно точная модель того, что сейчас происходит в командах, где ИИ уже прижился. Скорость выросла, качество на выходе выглядит прилично, а функция проверки тихо перестала работать – причём заметить это по обычным метрикам невозможно.
Плохая работа перестала выглядеть плохо
Механизм описан в Work AI Index 2026 – опросе шести тысяч офисных работников в США, Великобритании и Австралии с академическими соавторами из Стэнфорда, Беркли и UCSB. Авторы называют это парадоксом суждения: ИИ делает проверку более важной и одновременно убирает сигналы, которые раньше её запускали.
Логика простая. Умственная работа десятилетиями опиралась на грубую, но рабочую эвристику: плохая работа обычно и выглядит плохо. Кривой черновик, корявая фраза, опечатка в первом абзаце – всё это работало как лежачий полицейский для внимания. Читатель спотыкался и спрашивал себя, что ещё тут может быть не так.
ИИ стёр эти сигналы. Всё, что выходит из модели, выглядит одинаково гладко, и внешний вид документа перестал что-либо говорить о его содержании. Большинство компаний ничем эту эвристику не заменили – ни внятной планкой качества, ни структурированным разбором, ни явным описанием того, как выглядит «хорошо».
Дальше в отчёте описан механизм, который стоит держать в голове целиком. Чем больше ИИ, тем больше блестящего результата нужно проверять. Сначала это посильно, и люди проверяют. Но стопка растёт, и проверка сползает: сначала по диагонали, потом не глядя.
Почему стопка вообще растёт, мы разбирали отдельно: ИИ уплотняет рабочий день – сэкономленные часы немедленно занимает следующая задача.
Кривая, ради которой стоит читать этот отчёт
Самая полезная цифра во всём документе – зависимость от интенсивности использования. Вопрос звучал так: отправляли ли вы дальше работу с ИИ, которую не смогли бы объяснить, если спросят.
| Доля рабочего времени с ИИ | Не смогли бы объяснить результат |
|---|---|
| Лёгкое использование (1–19%) | 24% |
| Умеренное (20–49%) | 43% |
| Интенсивное (50%+) | 54% |
Больше половины тех, кто проводит с ИИ хотя бы половину рабочего дня. Это не выброс: по той же шкале растут и «пользуюсь инструментами, которые работодатель не одобрял» (с 24 до 49%), и «свалил на ИИ собственную ошибку» (с 12 до 41%).

Отдельно стоит посмотреть, кто именно чаще пропускает работу дальше. Разница по группам небольшая, но направление говорящее. Сотрудники поколения Z – на 19% чаще остальных, и объяснение авторов бьёт прямо в тему: многие просто не делали эту работу медленным способом достаточно долго, чтобы понимать, чего в результате не хватает. В отчёте для этого есть отдельный термин – ловушка беглости: привычка принимать уверенный гладкий язык за точную информацию. Похожий эффект мы разбирали в статье про подмену собственного мышления.
Менеджеры – на 6% чаще, чем рядовые сотрудники и топы. Объяснение авторов простое: руководителя сдавливает с двух сторон. Сверху требуют скорости, снизу подают результат, который нужно проверять. Проверка и оказывается первым, что вылетает из этого бутерброда.
Ещё одна цифра для тех, кто разворачивает агентов: пользователи нескольких агентов сразу на 30% чаще отправляют дальше непроверенное – и это после поправки на роль, отрасль и интенсивность.
Всё вместе складывается в довольно неудобную картину. Функция проверки в командах не отменялась ничьим решением. Она размывается сама, под нагрузкой, и первым её теряет тот, кто должен был её обеспечивать.
Сразу скажу то, к чему вернёмся в конце: это управляемая проблема. Нагрузкой и порядком приёмки руководитель распоряжается, чужой внимательностью – нет. А разобраться, где именно проверка уже не работает, проще на своих задачах, чем на чужих цифрах. Открытый модуль устроен ровно так: девять задач менеджера, где ИИ выдаёт правдоподобный результат, а вы не можете быстро сказать, верный ли он.
Проверьте на 9 реальных задачах, где ИИ выдаёт правдоподобный, но неверный результат
Доступ сразу после регистрации
Что здесь доказано, а что нет
Про «ИИ отупляет» сейчас пишут все, и почти всегда с одним и тем же набором ссылок. Разберём их по силе доказательства, потому что разброс там огромный.
Самое надёжное – работа по эндоскопии, опубликованная в Lancet Gastroenterology & Hepatology в августе 2025 года. Четыре центра в Польше, девятнадцать опытных врачей, у каждого за плечами больше двух тысяч колоноскопий. До внедрения ИИ предраковые образования находились в 28,4% процедур без подсказки. После того как врачи поработали с ИИ, а потом его убрали, показатель на таких же процедурах упал до 22,4% – пятая часть выявляемости.

Промежуточный столбец здесь тоже говорящий: с включённой подсказкой врачи находили образования в 25,3% процедур, то есть даже вместе с ИИ результат не дотянул до того, что они показывали сами до его появления.
Здесь измерен клинический исход на реальных пациентах до и после, без лабораторных задачек и самооценки в анкете. Оговорка авторов: исследование наблюдательное, поэтому на результат могли повлиять и другие факторы, кроме появления ИИ. Но направление видно на живых людях, а не на студентах в лаборатории.
Дальше по силе – кривая из Work AI Index выше. Шесть тысяч человек, репрезентативная выборка, чёткий градиент.
Затем эксперимент Уортонской школы бизнеса, где в ИИ через скрытую настройку намеренно заложили ошибочные ответы: три предрегистрированных эксперимента, 1372 участника, почти десять тысяч попыток. Когда модель выдавала неверный ответ уверенно и без объяснений, люди шли за ним примерно в 80% случаев. Это ровно тот механизм, который описывает парадокс суждения: сигналов, по которым можно споткнуться, не осталось, и проверяющий соглашается. На практике это выглядит так, как в нашем разборе конкурентного анализа, где модель выдумывает факты – выдуманные компании и цифры выглядят ровно так же убедительно, как настоящие.
Ещё ниже – работа Университета Карнеги-Меллона: после примерно десяти минут решения задач с ИИ люди, у которых инструмент забирали, справлялись хуже и чаще сдавались, чем те, кто вообще им не пользовался. Выборка маленькая, эффект краткосрочный, но направление совпадает с эндоскопией.
Полезно держать рядом и встречный результат. В эксперименте Anthropic на 52 разработчиках итоговый балл зависел от способа работы с моделью: среди шести паттернов использования одни подтягивали результат, другие проседали. Сам факт доступа к инструменту исхода не определял.
А вот с самой цитируемой цифрой стоит быть осторожнее. Работа MIT Media Lab, где связность мозга при работе с ChatGPT падала на 55%, разошлась по русскоязычным статьям как доказательство когнитивной деградации. Это препринт на 54 участниках, из которых четвёртую сессию прошли восемнадцать.
Авторы отдельно просили не пересказывать их результат словами «тупеет», «деградация мозга», «вред» – этих слов в самой работе нет. Наталия Космына, первый автор, говорит прямо: никакого «отупения» они не нашли и интеллект вообще не измеряли. Как повод для гипотезы – годится. Как доказательство – нет.
Где отчёт спорит сам с собой
Честности ради стоит сказать, что Work AI Index не поддерживает простую версию «ИИ разрушает экспертизу». Основная причинно-следственная линия в нём другая: ИИ разворачивают, растёт объём работы по обслуживанию модели, копится усталость, появляются срезанные углы, непроверенное уходит дальше. Это про нагрузку, а не про атрофию навыка.
Дальше идёт совсем неудобное. Сотрудники с лучшими результатами тратят на обслуживание ИИ больше времени, а не меньше – 40% против 33%, – и при этом сильнее в каждом измеренном навыке. Авторы трактуют это как место, где происходит обучение: каждый промпт – тренировка, каждый плохой ответ – обратная связь.
Плюс сам тип данных. Это одномоментный самоотчёт, направление причинности не установлено. Интенсивные пользователи могут чаще пропускать непроверенное потому, что интенсивная работа с ИИ размывает суждение, а могут – потому что у них просто больше объём и жёстче сроки. Отчёт не позволяет выбрать между этими объяснениями.
И про конфликт интересов, раз уж мы про качество доказательств. Отчёт сделан под маркой Work AI Institute с пометкой «powered by Glean», а Glean продаёт корпоративную платформу поиска и контекста. Центральное утверждение о лекарстве – что в организациях с хорошим доступом к контексту на 52% реже отправляют дальше необъяснимую работу – держится на одном самоотчётном вопросе анкеты и указывает ровно на продуктовую категорию Glean. Заявления о финансировании в документе нет. В защиту авторов: Glean нигде не назван решением, а к вендорским ИИ-стратегиям отчёт настроен подчёркнуто скептически.
Мы уже разбирали качество цифр из этого отчёта в дайджесте #19: заголовочные 69% «botshitting» – это составной показатель из семи разных поведений по принципу «признал хотя бы одно», и о качестве работы говорит только один пункт из семи: остальные относятся к теневому ИТ и репутационным манёврам. Использование неодобренного инструмента там засчитывается наравне с отправкой заведомо неверного результата. Поэтому по тексту выше идут разложенные цифры – 41% и 54%, – а не заголовочная.
Вывод из всего этого получается уже, чем хочется, но зато он выдерживает проверку. Данных на «экспертиза разрушается» пока не хватает. Данных на «проверка разваливается под нагрузкой» – достаточно. И это хорошая новость, потому что нагрузкой руководитель управляет, а чужой силой воли нет.
Что с этим делает руководитель
Дальше – то, что можно решить на этой неделе. Часть приёмов ниже сформулировал Дэвид Брукс в колонке The Atlantic про пределы делегирования ИИ, часть добавлена от нас. Разговоры про личную дисциплину сюда не входят: если проверка вылетает из бутерброда под давлением сроков, призывы быть внимательнее ничего не меняют.
Разделите задачи на ускоряемые и учебные. У части задач ценность в результате, у части – в том, что человек через них проходит. Разбор инцидента, первая оценка сроков, черновик спецификации для джуна – это не работа, это тренажёр. Отдав их модели, вы получаете часы сейчас и остаётесь без проверяющего через год. Составьте короткий список того, что в вашей команде остаётся ручным именно по этой причине, и назовите вслух, почему. Отправная точка для такого списка есть в разборе 40 реальных запросов менеджеров к ИИ, где видно, где модель попадает, а где систематически мажет.
Назначьте проверяющего поимённо. История с Walmart – это про размытую ответственность: все считали, что проверил кто-то другой. Как только в цепочке появляется ИИ, размытая ответственность становится дороже, потому что документ выглядит готовым. У каждого артефакта, который уходит наружу, должно быть имя человека, отвечающего за содержание, а не за форматирование. Подробнее эту границу мы разбирали в статье про делегирование ИИ и ответственность.
Введите пересказ своими словами как приёмку. Самый дешёвый работающий тест – попросить объяснить результат без документа перед глазами. Он напрямую бьёт в тот самый показатель: 41% признают, что иногда отдают дальше то, что не смогли бы объяснить. Вопрос «почему здесь такая цифра» ловит это лучше любого регламента.
Свой черновик до модели, критика после. Не начинайте с промпта. Сначала собственные выводы на страницу, потом просьба к модели найти в них дыры. Порядок важнее содержания промпта: он сохраняет за человеком авторство рассуждения, а модели оставляет роль оппонента. Отдельный разбор такого сценария у нас есть в статье про агента, который спорит с вашим решением.
Просите подсказки вместо ответов. В код-ревью и разборе задач это становится нормой команды: модель объясняет, где искать и на что смотреть, но не выдаёт готовое решение. Разница выглядит косметической, а на дистанции определяет, останется ли в команде кто-то, способный поймать ошибку.
Мерьте нагрузку на проверку, а не только экономию. Если вы считаете сэкономленные часы, но не считаете, сколько времени уходит на разбор чужого ИИ-результата, у вас нет половины уравнения. По тому же отчёту 77% работников за последний месяц переделывали или чинили работу, сделанную с ИИ, а 30% делают это еженедельно.
Разница между «мы попросили ИИ покритиковать» и работающим стресс-тестом – в том, насколько точно сформулирована рамка. Это ровно та часть, которая не берётся из статей и проверяется только на своих задачах.
Соберите свои промпты для проверки решений на 9 задачах менеджера
Доступ сразу после регистрации
Попробуйте: критика без переписывания
Ниже – промпт, который делает ровно то, что описано выше. Он не пишет за вас и явно получает запрет на выдачу готового решения: разбирает ваши рассуждения, называет пропущенное и задаёт вопросы, на которые отвечаете вы.
Запускать можно как есть – внутри уже лежит готовый пример с переносом релиза. Когда посмотрите, как модель его разбирает, замените текст в кавычках на своё решение недели и прогоните ещё раз.
На выходе смотрите на одно: находит ли модель невысказанные допущения, то есть то, что вы приняли на веру и не заметили. Именно эта проверка пропадает первой.
Модели выбраны по нашему бенчмарку – наведите на название, чтобы увидеть актуальные оценки. Kimi K3 держит верх категории «анализ и решения» и доступна из России без VPN; в её разборе отдельно отмечено, что она переформулирует задачу и строит сценарии вместо готового вывода. GPT-5.6 Sol лидирует в общем зачёте и склонна к структурным разборам с проверочными точками. Одно предупреждение по обеим: конкретные цифры и ссылки они дают неточно, так что оппонентом по рассуждению модель здесь работает, а калькулятором – нет. Почему заранее не угадать, где именно модель ошибётся, мы разбирали в статье про зубчатый край ИИ.
Самый сильный навык – понимать, когда ИИ не нужен
Финальная цифра из отчёта – та, которая лучше всего описывает, куда двигаться. Авторы сравнили сотрудников с высокими и низкими результатами по работе с ИИ по шести навыкам: писать промпты, генерировать контент, запускать агентов, собирать агентов, связывать инструменты через API и понимать, когда ИИ применять не стоит.
Разрывы есть везде. Самый большой – в последнем: 89% против 68%. Авторы отдельно оговаривают, что этот навык даётся тяжелее остальных. Та же группа на 18% чаще сознательно ограничивает свою зависимость от ИИ и на 79% против 64% ловила и исправляла ошибку модели за последний месяц.

Это разворачивает привычную рамку. Сильные пользователи ИИ работают с инструментом много и охотно. Разница в том, что у них есть внятная граница и они умеют назвать её вслух. Формулировка отчёта на этот счёт короткая: навыки, которыми не пользуешься, теряются.
Для руководителя отсюда следует практическая вещь. Обучение команды работе с ИИ, которое состоит из приёмов и промптов, закрывает пять навыков из шести и промахивается мимо самого важного. Граница «сюда не отдаём» не появляется от того, что человек освоил ещё один инструмент. Она появляется, когда он на своих задачах увидел, где инструмент выдаёт уверенный неверный ответ, и научился это узнавать.
Научите команду видеть границу, где ИИ ошибается уверенно
Специализация для руководителей: разбор реальных управленческих задач, где ИИ даёт правдоподобный результат, и приёмы проверки, которые работают под нагрузкой.
Часто задаваемые вопросы
Правда ли, что ИИ снижает квалификацию сотрудников?
Какие задачи не стоит отдавать ИИ в команде?
Как понять, что сотрудник отправляет дальше непроверенную работу?
Стоит ли запрещать ИИ, чтобы сохранить квалификацию?

Stanislav Belyaev
Engineering Leader в Microsoft18 лет в управлении инженерными командами. Основатель mysummit.school. 700+ выпускников в Яндекс Практикуме и Стратоплане.


