Что нельзя отдавать ИИ: почему ломается проверка работы

13 мин чтения
Stanislav Belyaev
Stanislav Belyaev Engineering Leader в Microsoft
Что нельзя отдавать ИИ: почему ломается проверка работы

В 2025 году юристы истцов по иску против Walmart подали ходатайство, в котором было восемь несуществующих судебных дел. Один из адвокатов воспользовался ИИ-инструментом, тот выдумал ссылки, а остальная команда пропустила документ дальше не глядя. Каждый, судя по всему, считал, что проверил кто-то другой.

Интереснее здесь не галлюцинация модели – про них написано достаточно. Интереснее, что документ прошёл через несколько квалифицированных юристов и ни один не притормозил. Проверка формально существовала, фактически её не было ни на одном шаге.

Это довольно точная модель того, что сейчас происходит в командах, где ИИ уже прижился. Скорость выросла, качество на выходе выглядит прилично, а функция проверки тихо перестала работать – причём заметить это по обычным метрикам невозможно.

Плохая работа перестала выглядеть плохо

Механизм описан в Work AI Index 2026 – опросе шести тысяч офисных работников в США, Великобритании и Австралии с академическими соавторами из Стэнфорда, Беркли и UCSB. Авторы называют это парадоксом суждения: ИИ делает проверку более важной и одновременно убирает сигналы, которые раньше её запускали.

Логика простая. Умственная работа десятилетиями опиралась на грубую, но рабочую эвристику: плохая работа обычно и выглядит плохо. Кривой черновик, корявая фраза, опечатка в первом абзаце – всё это работало как лежачий полицейский для внимания. Читатель спотыкался и спрашивал себя, что ещё тут может быть не так.

ИИ стёр эти сигналы. Всё, что выходит из модели, выглядит одинаково гладко, и внешний вид документа перестал что-либо говорить о его содержании. Большинство компаний ничем эту эвристику не заменили – ни внятной планкой качества, ни структурированным разбором, ни явным описанием того, как выглядит «хорошо».

Дальше в отчёте описан механизм, который стоит держать в голове целиком. Чем больше ИИ, тем больше блестящего результата нужно проверять. Сначала это посильно, и люди проверяют. Но стопка растёт, и проверка сползает: сначала по диагонали, потом не глядя.

Почему стопка вообще растёт, мы разбирали отдельно: ИИ уплотняет рабочий день – сэкономленные часы немедленно занимает следующая задача.

Кривая, ради которой стоит читать этот отчёт

Самая полезная цифра во всём документе – зависимость от интенсивности использования. Вопрос звучал так: отправляли ли вы дальше работу с ИИ, которую не смогли бы объяснить, если спросят.

Доля рабочего времени с ИИНе смогли бы объяснить результат
Лёгкое использование (1–19%)24%
Умеренное (20–49%)43%
Интенсивное (50%+)54%

Больше половины тех, кто проводит с ИИ хотя бы половину рабочего дня. Это не выброс: по той же шкале растут и «пользуюсь инструментами, которые работодатель не одобрял» (с 24 до 49%), и «свалил на ИИ собственную ошибку» (с 12 до 41%).

Три поведения растут вместе с долей рабочего времени, которую занимает ИИ: не смогут объяснить результат – с 24% до 54%, работают в неодобренных инструментах – с 24% до 49%, свалили свою ошибку на ИИ – с 12% до 41%

Отдельно стоит посмотреть, кто именно чаще пропускает работу дальше. Разница по группам небольшая, но направление говорящее. Сотрудники поколения Z – на 19% чаще остальных, и объяснение авторов бьёт прямо в тему: многие просто не делали эту работу медленным способом достаточно долго, чтобы понимать, чего в результате не хватает. В отчёте для этого есть отдельный термин – ловушка беглости: привычка принимать уверенный гладкий язык за точную информацию. Похожий эффект мы разбирали в статье про подмену собственного мышления.

Менеджеры – на 6% чаще, чем рядовые сотрудники и топы. Объяснение авторов простое: руководителя сдавливает с двух сторон. Сверху требуют скорости, снизу подают результат, который нужно проверять. Проверка и оказывается первым, что вылетает из этого бутерброда.

Ещё одна цифра для тех, кто разворачивает агентов: пользователи нескольких агентов сразу на 30% чаще отправляют дальше непроверенное – и это после поправки на роль, отрасль и интенсивность.

Всё вместе складывается в довольно неудобную картину. Функция проверки в командах не отменялась ничьим решением. Она размывается сама, под нагрузкой, и первым её теряет тот, кто должен был её обеспечивать.

Сразу скажу то, к чему вернёмся в конце: это управляемая проблема. Нагрузкой и порядком приёмки руководитель распоряжается, чужой внимательностью – нет. А разобраться, где именно проверка уже не работает, проще на своих задачах, чем на чужих цифрах. Открытый модуль устроен ровно так: девять задач менеджера, где ИИ выдаёт правдоподобный результат, а вы не можете быстро сказать, верный ли он.

Проверьте на 9 реальных задачах, где ИИ выдаёт правдоподобный, но неверный результат

Доступ сразу после регистрации

Начать обучение

Что здесь доказано, а что нет

Про «ИИ отупляет» сейчас пишут все, и почти всегда с одним и тем же набором ссылок. Разберём их по силе доказательства, потому что разброс там огромный.

Самое надёжное – работа по эндоскопии, опубликованная в Lancet Gastroenterology & Hepatology в августе 2025 года. Четыре центра в Польше, девятнадцать опытных врачей, у каждого за плечами больше двух тысяч колоноскопий. До внедрения ИИ предраковые образования находились в 28,4% процедур без подсказки. После того как врачи поработали с ИИ, а потом его убрали, показатель на таких же процедурах упал до 22,4% – пятая часть выявляемости.

Выявляемость предраковых образований на колоноскопиях: без ИИ до внедрения – 28,4%, с ИИ-подсказкой – 25,3%, без ИИ после внедрения – 22,4%

Промежуточный столбец здесь тоже говорящий: с включённой подсказкой врачи находили образования в 25,3% процедур, то есть даже вместе с ИИ результат не дотянул до того, что они показывали сами до его появления.

Здесь измерен клинический исход на реальных пациентах до и после, без лабораторных задачек и самооценки в анкете. Оговорка авторов: исследование наблюдательное, поэтому на результат могли повлиять и другие факторы, кроме появления ИИ. Но направление видно на живых людях, а не на студентах в лаборатории.

Дальше по силе – кривая из Work AI Index выше. Шесть тысяч человек, репрезентативная выборка, чёткий градиент.

Затем эксперимент Уортонской школы бизнеса, где в ИИ через скрытую настройку намеренно заложили ошибочные ответы: три предрегистрированных эксперимента, 1372 участника, почти десять тысяч попыток. Когда модель выдавала неверный ответ уверенно и без объяснений, люди шли за ним примерно в 80% случаев. Это ровно тот механизм, который описывает парадокс суждения: сигналов, по которым можно споткнуться, не осталось, и проверяющий соглашается. На практике это выглядит так, как в нашем разборе конкурентного анализа, где модель выдумывает факты – выдуманные компании и цифры выглядят ровно так же убедительно, как настоящие.

Ещё ниже – работа Университета Карнеги-Меллона: после примерно десяти минут решения задач с ИИ люди, у которых инструмент забирали, справлялись хуже и чаще сдавались, чем те, кто вообще им не пользовался. Выборка маленькая, эффект краткосрочный, но направление совпадает с эндоскопией.

Полезно держать рядом и встречный результат. В эксперименте Anthropic на 52 разработчиках итоговый балл зависел от способа работы с моделью: среди шести паттернов использования одни подтягивали результат, другие проседали. Сам факт доступа к инструменту исхода не определял.

А вот с самой цитируемой цифрой стоит быть осторожнее. Работа MIT Media Lab, где связность мозга при работе с ChatGPT падала на 55%, разошлась по русскоязычным статьям как доказательство когнитивной деградации. Это препринт на 54 участниках, из которых четвёртую сессию прошли восемнадцать.

Авторы отдельно просили не пересказывать их результат словами «тупеет», «деградация мозга», «вред» – этих слов в самой работе нет. Наталия Космына, первый автор, говорит прямо: никакого «отупения» они не нашли и интеллект вообще не измеряли. Как повод для гипотезы – годится. Как доказательство – нет.

Где отчёт спорит сам с собой

Честности ради стоит сказать, что Work AI Index не поддерживает простую версию «ИИ разрушает экспертизу». Основная причинно-следственная линия в нём другая: ИИ разворачивают, растёт объём работы по обслуживанию модели, копится усталость, появляются срезанные углы, непроверенное уходит дальше. Это про нагрузку, а не про атрофию навыка.

Дальше идёт совсем неудобное. Сотрудники с лучшими результатами тратят на обслуживание ИИ больше времени, а не меньше – 40% против 33%, – и при этом сильнее в каждом измеренном навыке. Авторы трактуют это как место, где происходит обучение: каждый промпт – тренировка, каждый плохой ответ – обратная связь.

Плюс сам тип данных. Это одномоментный самоотчёт, направление причинности не установлено. Интенсивные пользователи могут чаще пропускать непроверенное потому, что интенсивная работа с ИИ размывает суждение, а могут – потому что у них просто больше объём и жёстче сроки. Отчёт не позволяет выбрать между этими объяснениями.

И про конфликт интересов, раз уж мы про качество доказательств. Отчёт сделан под маркой Work AI Institute с пометкой «powered by Glean», а Glean продаёт корпоративную платформу поиска и контекста. Центральное утверждение о лекарстве – что в организациях с хорошим доступом к контексту на 52% реже отправляют дальше необъяснимую работу – держится на одном самоотчётном вопросе анкеты и указывает ровно на продуктовую категорию Glean. Заявления о финансировании в документе нет. В защиту авторов: Glean нигде не назван решением, а к вендорским ИИ-стратегиям отчёт настроен подчёркнуто скептически.

Мы уже разбирали качество цифр из этого отчёта в дайджесте #19: заголовочные 69% «botshitting» – это составной показатель из семи разных поведений по принципу «признал хотя бы одно», и о качестве работы говорит только один пункт из семи: остальные относятся к теневому ИТ и репутационным манёврам. Использование неодобренного инструмента там засчитывается наравне с отправкой заведомо неверного результата. Поэтому по тексту выше идут разложенные цифры – 41% и 54%, – а не заголовочная.

Вывод из всего этого получается уже, чем хочется, но зато он выдерживает проверку. Данных на «экспертиза разрушается» пока не хватает. Данных на «проверка разваливается под нагрузкой» – достаточно. И это хорошая новость, потому что нагрузкой руководитель управляет, а чужой силой воли нет.

Что с этим делает руководитель

Дальше – то, что можно решить на этой неделе. Часть приёмов ниже сформулировал Дэвид Брукс в колонке The Atlantic про пределы делегирования ИИ, часть добавлена от нас. Разговоры про личную дисциплину сюда не входят: если проверка вылетает из бутерброда под давлением сроков, призывы быть внимательнее ничего не меняют.

Разделите задачи на ускоряемые и учебные. У части задач ценность в результате, у части – в том, что человек через них проходит. Разбор инцидента, первая оценка сроков, черновик спецификации для джуна – это не работа, это тренажёр. Отдав их модели, вы получаете часы сейчас и остаётесь без проверяющего через год. Составьте короткий список того, что в вашей команде остаётся ручным именно по этой причине, и назовите вслух, почему. Отправная точка для такого списка есть в разборе 40 реальных запросов менеджеров к ИИ, где видно, где модель попадает, а где систематически мажет.

Назначьте проверяющего поимённо. История с Walmart – это про размытую ответственность: все считали, что проверил кто-то другой. Как только в цепочке появляется ИИ, размытая ответственность становится дороже, потому что документ выглядит готовым. У каждого артефакта, который уходит наружу, должно быть имя человека, отвечающего за содержание, а не за форматирование. Подробнее эту границу мы разбирали в статье про делегирование ИИ и ответственность.

Введите пересказ своими словами как приёмку. Самый дешёвый работающий тест – попросить объяснить результат без документа перед глазами. Он напрямую бьёт в тот самый показатель: 41% признают, что иногда отдают дальше то, что не смогли бы объяснить. Вопрос «почему здесь такая цифра» ловит это лучше любого регламента.

Свой черновик до модели, критика после. Не начинайте с промпта. Сначала собственные выводы на страницу, потом просьба к модели найти в них дыры. Порядок важнее содержания промпта: он сохраняет за человеком авторство рассуждения, а модели оставляет роль оппонента. Отдельный разбор такого сценария у нас есть в статье про агента, который спорит с вашим решением.

Просите подсказки вместо ответов. В код-ревью и разборе задач это становится нормой команды: модель объясняет, где искать и на что смотреть, но не выдаёт готовое решение. Разница выглядит косметической, а на дистанции определяет, останется ли в команде кто-то, способный поймать ошибку.

Мерьте нагрузку на проверку, а не только экономию. Если вы считаете сэкономленные часы, но не считаете, сколько времени уходит на разбор чужого ИИ-результата, у вас нет половины уравнения. По тому же отчёту 77% работников за последний месяц переделывали или чинили работу, сделанную с ИИ, а 30% делают это еженедельно.

Разница между «мы попросили ИИ покритиковать» и работающим стресс-тестом – в том, насколько точно сформулирована рамка. Это ровно та часть, которая не берётся из статей и проверяется только на своих задачах.

Соберите свои промпты для проверки решений на 9 задачах менеджера

Доступ сразу после регистрации

Начать обучение

Попробуйте: критика без переписывания

Ниже – промпт, который делает ровно то, что описано выше. Он не пишет за вас и явно получает запрет на выдачу готового решения: разбирает ваши рассуждения, называет пропущенное и задаёт вопросы, на которые отвечаете вы.

Запускать можно как есть – внутри уже лежит готовый пример с переносом релиза. Когда посмотрите, как модель его разбирает, замените текст в кавычках на своё решение недели и прогоните ещё раз.

На выходе смотрите на одно: находит ли модель невысказанные допущения, то есть то, что вы приняли на веру и не заметили. Именно эта проверка пропадает первой.

Модели выбраны по нашему бенчмарку – наведите на название, чтобы увидеть актуальные оценки. Kimi K3 держит верх категории «анализ и решения» и доступна из России без VPN; в её разборе отдельно отмечено, что она переформулирует задачу и строит сценарии вместо готового вывода. GPT-5.6 Sol лидирует в общем зачёте и склонна к структурным разборам с проверочными точками. Одно предупреждение по обеим: конкретные цифры и ссылки они дают неточно, так что оппонентом по рассуждению модель здесь работает, а калькулятором – нет. Почему заранее не угадать, где именно модель ошибётся, мы разбирали в статье про зубчатый край ИИ.

Попробуйте сами
Критика управленческого решения без готового ответа
Вы
Ты выступаешь оппонентом, а не соавтором. Категорически запрещено предлагать готовое решение, переписывать мой текст или давать свой вариант плана. Твоя задача – найти слабые места в моих рассуждениях. Вот моё решение и обоснование: «Мы переносим релиз мобильного приложения с 15 сентября на 30 октября. Причины: команда не успевает закрыть интеграцию с платёжным провайдером, тестирование заняло на три недели больше плана, а на прошлой неделе ушёл ведущий разработчик бэкенда. Новая дата рассчитана как текущий остаток работ плюс две недели буфера. Заказчику скажем на следующем комитете, 25 июля. Считаю, что 30 октября – реалистичная дата, потому что основные риски мы уже прошли.» Разбери это по шагам: 1. Какие допущения я принял на веру и нигде не проверил? 2. Какие данные нужны, чтобы решение можно было считать обоснованным, и каких из них в моём тексте нет? 3. Где в моих формулировках выдаётся желаемое за действительное? 4. Какой самый вероятный сценарий, при котором 30 октября окажется столь же нереалистичной датой, как 15 сентября? В конце задай мне пять вопросов, на которые я должен ответить сам. Не отвечай на них за меня.
Сравниваем:
kimi-k3 · gpt-5.6-sol

Самый сильный навык – понимать, когда ИИ не нужен

Финальная цифра из отчёта – та, которая лучше всего описывает, куда двигаться. Авторы сравнили сотрудников с высокими и низкими результатами по работе с ИИ по шести навыкам: писать промпты, генерировать контент, запускать агентов, собирать агентов, связывать инструменты через API и понимать, когда ИИ применять не стоит.

Разрывы есть везде. Самый большой – в последнем: 89% против 68%. Авторы отдельно оговаривают, что этот навык даётся тяжелее остальных. Та же группа на 18% чаще сознательно ограничивает свою зависимость от ИИ и на 79% против 64% ловила и исправляла ошибку модели за последний месяц.

Сравнение сильной и слабой групп: ловили и исправляли ошибку модели за месяц – 79% против 64%, времени уходит на обслуживание ИИ – 40% против 33%, понимают, когда ИИ применять не стоит – 89% против 68%

Это разворачивает привычную рамку. Сильные пользователи ИИ работают с инструментом много и охотно. Разница в том, что у них есть внятная граница и они умеют назвать её вслух. Формулировка отчёта на этот счёт короткая: навыки, которыми не пользуешься, теряются.

Для руководителя отсюда следует практическая вещь. Обучение команды работе с ИИ, которое состоит из приёмов и промптов, закрывает пять навыков из шести и промахивается мимо самого важного. Граница «сюда не отдаём» не появляется от того, что человек освоил ещё один инструмент. Она появляется, когда он на своих задачах увидел, где инструмент выдаёт уверенный неверный ответ, и научился это узнавать.

Специализация

Научите команду видеть границу, где ИИ ошибается уверенно

Специализация для руководителей: разбор реальных управленческих задач, где ИИ даёт правдоподобный результат, и приёмы проверки, которые работают под нагрузкой.

От pre-mortem до антикризисного плана
Переиспользуемые промпт-шаблоны
Сквозной кейс на реальном проекте
~300 часов экономии в год

Часто задаваемые вопросы

Правда ли, что ИИ снижает квалификацию сотрудников?
Данные на этот счёт слабее, чем принято считать. Надёжно измерено выпадение навыка после отключения инструмента: у врачей-эндоскопистов выявляемость предраковых образований упала с 28,4% до 22,4%, когда ИИ-подсказку убрали. А вот утверждение «ИИ делает людей глупее» пока опирается на маленькие лабораторные работы и корреляции. При этом надёжно измеряется другое – проверка чужого результата разваливается под нагрузкой, и это управленческая проблема, а не вопрос личной дисциплины.
Какие задачи не стоит отдавать ИИ в команде?
Те, на которых люди учатся, и те, где вы единственный проверяющий. Если задача была способом для джуна набрать насмотренность – разбор инцидента, первая оценка сроков, черновик спецификации, – передача её модели экономит часы сейчас и снимает проверяющего через год. Второй класс задач – те, где ошибку никто не поймает ниже по процессу.
Как понять, что сотрудник отправляет дальше непроверенную работу?
Самый дешёвый тест – попросить объяснить результат своими словами, без документа перед глазами. По данным Work AI Index 2026, 41% работников признают, что иногда отдают дальше работу с ИИ, которую не смогли бы объяснить, если спросят. Вопрос «объясни, почему здесь такая цифра» ловит это лучше, чем любая формальная процедура приёмки.
Стоит ли запрещать ИИ, чтобы сохранить квалификацию?
Данные скорее против запрета. Сотрудники с лучшими результатами по работе с ИИ используют его много и при этом сильнее в каждом измеренном навыке. Отличает их другое: они понимают, где инструмент не нужен. 89% из них говорят, что знают, когда ИИ применять не стоит, против 68% в слабой группе. Это самый большой разрыв между группами во всём исследовании.
Stanislav Belyaev

Stanislav Belyaev

Engineering Leader в Microsoft

18 лет в управлении инженерными командами. Основатель mysummit.school. 700+ выпускников в Яндекс Практикуме и Стратоплане.