Дайджест #21: отдачу решает число задач, отданных ИИ, а счёт приходит раньше базовой линии

#21
10 мин чтения

Gallup, почти 23 тысячи сотрудников: 45% пользы при одной задаче против 90% при семи. Почему ROI не измеряется. Что ломается, когда задача сделана, а объяснить её некому.

За две недели накопилось три сюжета, которые складываются в один. Gallup опросил почти 23 тысячи сотрудников и померил отдачу от ИИ по числу задач, которые ему отдают: разрыв между самыми узкими и самыми широкими пользователями оказался двукратным. Дальше – почему счёт за ИИ приходит раньше, чем базовая линия для его оценки, и что именно ломается, когда задача выполнена, а объяснить её некому.

Отдачу решает число задач, отданных ИИ

Один инструмент, одна подписка, вдвое разная отдача

Gallup опросил почти 23 тысячи работающих американцев в мае. Верхние цифры выглядят как обычная сводка о внедрении: ИИ в работе использует 52% сотрудников, несколько раз в неделю или чаще – 30%, каждый день – всего 15%. Организаций, внедривших ИИ-инструменты, 47% против 41% кварталом раньше. И ещё 20% сотрудников не знают, внедрила их компания что-нибудь или нет – цифра сама по себе занятная, если вы этим внедрением руководите.

Реже применяют – больше отдача: автоматизация – 16% пользователей и 77% отметивших рост продуктивности; кодинг – 16% и 77%; презентации – 17% и 76%; аналитика – 18% и 75%; письмо – 51% и 68%; поиск – 49% и 65%

Порядок обратный ожидаемому. Письмо и поиск – самые массовые сценарии, 51% и 49% пользователей, и по приросту продуктивности они на последних местах, 68% и 65%. Автоматизация, кодинг, презентации и аналитика собирают 75–77% довольных.

Логика тут понятная. Письмо и поиск – это то, до чего человек додумывается сам в первый день: открыл чат, попросил переписать письмо. Автоматизация и аналитика требуют, чтобы кто-то показал, что так вообще можно. Сами собой они не осваиваются, поэтому в них и заходит каждый шестой.

Среди тех, кто применяет ИИ для одной-двух задач, положительное влияние на продуктивность отмечают 45%. Среди тех, у кого таких применений семь и больше, – 90%. Ровно вдвое, при том же самом инструменте и той же подписке.

Решает число сценариев: среди применяющих ИИ для одной-двух задач рост продуктивности отмечают 45%, среди применяющих для семи и больше – 90%

Оговорка к опросу: это корреляция, и причинность может идти в обе стороны – человек вполне мог расширить применение именно потому, что первые попытки сработали. Какая из сторон сильнее, из этих данных не выясняется, и работы, где их разделили бы чисто, я не нашёл. Выборка американская, на российский или казахстанский рынок переносится с поправкой.

Для отчётности из этого следует неприятная вещь. Метрика «доля сотрудников, использующих ИИ» описывает ровно ту границу, которую люди переходят сами и бесплатно. Её можно поднять рассылкой с логинами – и она ничего не скажет об отдаче. Цифра, которая хоть что-то показывает, другая: сколько разных типов задач сотрудник закрывает с ИИ.

→ Посмотреть, какие задачи разбираем на треках

Счёт за ИИ приходит раньше, чем базовая линия

$1,8 млн, которые никто не заметил

На Stanford AI Summit в начале месяца директор по персоналу OpenAI задал залу два вопроса. Кто стал продуктивнее с ИИ – поднялся лес рук. Кто стал работать меньше – две руки на весь зал. Сцену пересказывает Kilo, и она продолжает то, о чём мы писали в выпуске #18: время экономится, но без направления испаряется.

У этой картины есть денежная половина. Сэнди Картер, бывший топ-менеджер AWS и IBM, называет цифру: половина компаний, у которых ИИ уже работает в бою, не может измерить его ROI. Формулировка у неё жёсткая – сделали сложное, внедрение, и пропустили простое, замер «до» и «после». Дальше каждый квартальный отчёт превращается в спор, улучшилось ли хоть что-нибудь, и закончить его нечем.

Ошибки она перечисляет три. Считать результатом сэкономленные часы: «команды говорят мне – мы сэкономили 200 часов. Мой вопрос всегда один: во что превратились эти 200 часов?» Дать каждой функции изобрести свою систему оценки, после чего финдиректор получает шесть определений успеха от шести команд. И держать двенадцать пилотов, ни один из которых не стал решением. Её собственная проверка состоит из трёх пунктов: записан ли сегодняшний расход процесса в часах или деньгах, определено ли «лучше» числом, назначен ли человек, который подпишет результат. «Если вы не можете сделать эти три вещи, вы проводите не пилот. Вы проводите демо».

Насколько плохо считают даже там, где считать умеют, видно по Amazon. Компания потратила около $1,8 млн за пять месяцев на проект с Claude, который просто работал и никому не попадался на глаза. Объяснение сотрудника компании: понять, сколько стоит что-либо связанное с ИИ, трудно.

Автор той же заметки разбирал свой случай. Его агент в какой-то момент начал прожигать $500 в день, и аудит показал, что часть процессов ходила в старые дорогие модели вроде Opus 4.5 там, где хватало Sonnet 5 или DeepSeek V4 Flash. После переключения и настройки автоматического отката на более дешёвые расход упал до $6. Оговорка, которую он делает сам: $500 были аномалией, обычно агент обходился в $50–60 в день. Так что реальная экономия – примерно восьмикратная, и найдена она одним разбором логов.

Расход ИИ-агента в день: аномальный день – $500, обычный расход до аудита – $55, после замены моделей и настройки отката – $6

Масштаб разброса по рынку виден из июльских данных Ramp: верхний процент компаний тратил на ИИ в медиане $7 400 на сотрудника, медианная компания – $11,95. Разница в шестьсот раз. Верхние цифры для команды в Москве или Алматы нерелевантны, а вот то, что расстояние между «у нас всё под контролем» и «у нас работает то, о чём никто не знает» измеряется сотнями раз, – вполне.

Стоит это ничего и делается за час. До того как запускать очередной пилот, выпишите три числа: сколько часов задача занимает сейчас, сколько людей в ней участвует, сколько раз в месяц она случается. Задним числом базовую линию не восстановить – после внедрения никто не помнит, сколько процесс стоил раньше, а если помнит, то у каждого своя цифра.

Задача сделана, объяснить её некому

Шансы объяснить собственное решение падают почти вдвое

Эксперимент на 69 участниках меряет то, о чём мы говорили и раньше: что остаётся в голове после работы с ИИ. Каждый участник решал две задачи, одну с ИИ, другую без, а потом отвечал на вопросы о собственном результате уже без доступа к ИИ. Полнота выполнения с ИИ – 84 балла из 100 против 35 без него. Разрыв огромный и не исчезает, если учесть опыт участника и тип задачи.

Шансы дать верный ответ про свой же результат ИИ снижает почти вдвое, отношение шансов 0,58. Сыпались на открытых вопросах: почему выбрали именно такое решение. Про то, что код делает, отвечали нормально.

Эксперимент на 69 участниках: полнота выполнения задачи с ИИ – 84 из 100 против 35 без него; шансы верно объяснить собственное решение падают почти вдвое, отношение шансов 0,58

Это ровно то, что в прошлом выпуске описывал LeadDev: инженер принимает предложенное моделью изменение в разгар инцидента и потом не может сказать, какие были альтернативы и почему выбрана эта. Теперь у наблюдения есть замер. Сделано при этом больше, чем без ИИ. Не восстанавливается только ход рассуждения.

Оговорка авторов: выигрыш по скорости – 43 минуты против 63 – исчез после поправки на то, что задачи решались последовательно и вторая шла легче. Два результата поправку пережили: с ИИ участники доделывали заметно больше и хуже объясняли, что именно сделали. То есть ИИ доводит до конца то, что иначе осталось бы недоделанным, а разбираться в сделанном человек при этом не начинает.

Для менеджера это превращается в один вопрос на приёмке. Вопрос «что этот код делает» проверку не проходит, потому что на него отвечают одинаково хорошо в обоих случаях. Работает вопрос про альтернативы: что ещё рассматривали и почему отказались. Он занимает минуту и различает работу, за которую человек отвечает, и работу, которую он принял.

Сюда же ложится наблюдение из Принстона и UK AISI, которые дали агентам открытые исследовательские задачи: шесть дней, тысячи долларов на API, реальные вопросы из неопубликованных статей. Обе работы авторы статей забраковали. Но интереснее провала то, как он выглядел: агенты закончили, потратив меньше половины бюджета и не выбрав отведённое время. Самые амбициозные цели они тихо сняли в первый же день и дальше уверенно делали то, что попроще. Выборка крошечная, две статьи, так что это скорее наблюдение, чем замер. Но поведение узнаваемое: агент не сообщает, что задача ему не по силам, он молча уменьшает задачу. Почему цель снимается в первый же день, а не после нескольких неудачных попыток, авторы не объясняют, и версии у меня нет.

Если сложить три сюжета, общий знаменатель у них один. Отдача приходит от того, сколько разных задач вы отдали ИИ. Измерить её нечем, потому что никто не записал, как было до него. А то, что возвращается, сделано полнее и понято хуже. Во всех трёх случаях не хватает одного и того же – замера.

Идеи и ссылки

Метод под блок про Gallup, если вопрос «какие ещё задачи отдавать ИИ» звучит абстрактно. MIT Sloan предлагает раскладывать не профессию, а должность: выписать конкретные задачи, из которых она состоит – у профессора их насчитали двадцать пять, – и смотреть на каждую отдельно. Автоматизации поддаётся отдельная задача; должность целиком – почти никогда. Заодно упражнение само показывает, сколько сценариев вы не используете.

Intercom поставила ИИ-агентов на код-ревью и ускорила одобрение пул-реквестов в пять раз, одновременно снизив долю откатов. Логика та же, что и в приёмке: проверку стоит спрашивать у того, кто не участвовал в исходном решении.

Исследование, которое стоит знать перед тем, как заводить ИИ в стратегические решения: C-SUITEBENCH прогнал девять моделей в роли CEO по пятидесяти бизнес-сценариям и нашёл неожиданное – если к тексту добавить графики и диаграммы, модель начинает хуже делить ограниченный бюджет. В задачу про деньги лучше отдавать числа текстом, а красивую презентацию оставлять людям.

Цифра про размывание должностей: по данным OpenAI, около 43,5% задач в ChatGPT люди решают за пределами своей основной профессии. Менеджер лезет в аналитику, аналитик в тексты. Для планирования найма это важнее, чем выглядит: границы ролей в описаниях вакансий и границы реальной работы разъезжаются.

Для тех, у кого закрытый контур: Unsloth Desktop – бесплатное приложение под macOS, Windows и Linux, где модель и работает, и дообучается на вашей машине. Просто запустить модель локально умеют Ollama и LM Studio, они проще и зрелее; Unsloth берут ради второй половины – обучить модель на своих данных, никуда их не отправляя, вдвое быстрее и на 70% меньшей видеопамяти, чем обычным путём. Ограничение – одна видеокарта, дальше уже Axolotl или Torchtune. А Claude Cowork, Kimi Work и OpenCode Desktop решают другую задачу: дают рабочее место для агента, а считает модель всё равно облако вендора.

Окно Unsloth Desktop: локально загружена модель Qwen3.8-27B в формате GGUF, в левом меню пункт Train для дообучения, в меню запроса – веб-поиск, код, работа с файлами и MCP

Stripe покупает OpenRouter больше чем за $7 млрд – шлюз, через который разработчики переключаются между четырьмя сотнями моделей. Три месяца назад стартап оценивали в $1,3 млрд. Покупатель тут говорит больше, чем сумма: счета за токены переезжают в платёжную инфраструктуру, и владеть ими хотят те, кто умеет считать чужие деньги.

Порог, о котором год назад говорили как о далёком будущем: агенты обогнали людей на реальных компьютерных задачах – 85% успешных операций против 72%, по данным OSWorld-Verified. Год назад лучший результат моделей был 42%. Тест меряет выполнение шагов, а не то, можно ли доверять итогу.

Преподаватель собрал, что думают про ИИ его студенты: технология зрелая, прогресса со времён GPT-4 не видно, а за свои карьерные перспективы они при этом всерьёз боятся. Самое полезное там – в комментариях, где разбирают, откуда берётся первая половина. Версия, которая переносится на команды: по мере роста моделей человек незаметно поднимает собственную планку, упирается в новый потолок и заключает, что ничего не изменилось. Рядом вторая – в 2023-м никто не давал модели задач заведомо выше её сил, так что и сравнивать не с чем. Если у вас в команде считают, что за год ИИ не сдвинулся, стоит проверить, не выросли ли вместе с ним запросы. Выборка – одна группа одного университета, и автор отмечает, что формат курса мог подтолкнуть ответы.

Скоро новый учебный год

Лето заканчивается, и это тот момент, когда обычно решают, чему учиться осенью. Если блок про Gallup показался знакомым, то на треках разбирается ровно это: какие задачи менеджера имеет смысл нести в ИИ и как проверять то, что вернулось.

Средняя оценка наших курсов – 9 из 10. Три отзыва объясняют, откуда она берётся, лучше любого описания.

Милан Алкешев, Product Manager в SKO Hub powered by Astana Hub: «Самое ценное для меня – курс изменил мышление. Я наконец понял, как правильно выстраивать работу с ИИ: как писать промпты, где у моделей есть ограничения, когда им можно доверять, а когда лучше перепроверить результат. Три дня я пытался придумать AI-квест для школьников и постоянно заходил в тупик. Потом открыл материалы курса, перестроил промпт по изученной структуре – и уже через пару часов задача была полностью решена».

Михаил Селезнёв, Project Manager, PMP в Bereke Bank: «Честно говоря, ожидал, что курс будет „продавать“ мне ИИ во всех агрегатных состояниях. А на деле он наполовину состоит из разбора ошибок ИИ и ошибок людей в интерпретации его результатов. Для меня это прям откровение. Стало понятно, что то, как я формулировал запросы раньше и как организовывал проверку, – это очень начальный уровень, по наитию».

Алексей Сокол, Head of PMO, IPMA-A: «Только что закончил модуль „Фундамент“ – базовый курс по применению ИИ в работе: промпт-инжиниринг, конфиденциальность, этика, копирайтинг и много другое. Узнал действенную структуру промпта, которая даёт намного более качественный ответ. Разобрался наконец-то, что такое Агенты и для каких задач их стоит использовать».

Открытый модуль и девять уроков доступны без оплаты, платный трек «Проектное управление» включает в себя «Фундамент». Что там внутри – на странице программы.