Промпт-инжиниринг работает: одна модель, два результата

AI-модели в этой статье
15 августа на arXiv вышла неприметная работа StateM – четыре автора, без громкой лаборатории. Внутри есть цифра, на которой стоит остановиться: DeepSeek-V4 Flash, модель не из лидерской группы нашего бенчмарка, после «адаптации» стоимостью $38 поднимается на Terminal-Bench 2.1 с 82,7% до 88,1%. А на общем ядре из 88 задач доходит до 89,1% – уровень флагманских прогонов GPT-5.6 Sol, эталонный прогон которых обошёлся в $574. Итоговый счёт всей конфигурации на DeepSeek – $52.
StateM не одиночка: за последние две недели вышло ещё минимум две работы о том, что даёт промпт-инжиниринг в агентных системах. DarwinX добавляет в среднем 17 пунктов на четырёх бенчмарках, LongHorizon-Harness поднимает Qwen 3.7-Plus на Terminal-Bench с 69,7% до 77,2%. Во всех трёх случаях веса модели заморожены. Меняется только то, что вокруг неё: промпты, инструкции, контроль исполнения.
Это прямо бьёт по популярному тезису о том, что промпт-инжиниринг вот-вот станет не нужен: модель сама напишет себе оптимальный промпт, учиться управлять ИИ не нужно. У свежих работ есть границы применимости – и есть практические следствия для руководителя, который работает с ИИ в обычном чате, без лабораторной инфраструктуры.
Что произошло в бенчмарках
Три работы, три разных механизма, один принцип. Вот сводка:
| Исследование | Дата | Что сделали | Результат |
|---|---|---|---|
| StateM | 15 августа | Ранбуки, постоянное состояние, проверенные переходы между шагами | DeepSeek-V4 Flash: 82,7 -> 88,1% (Terminal-Bench 2.1); GPT-5.6 Luna: 76,7 -> 85,4% |
| DarwinX | 31 июля | Эволюционный отбор обвязок: выживают варианты без регрессий | +17 пунктов в среднем на 4 бенчмарках; Terminal-Bench 2.1 до 83,2% |
| LongHorizon-Harness | 3 августа | Состояние задачи вынесено из контекста, цикл «управляй – выполняй – проверяй» | Qwen 3.7-Plus: 69,7 -> 77,2% (Terminal-Bench 2.1), WeaveBench: 51,8 -> 80,7% |
Авторы DarwinX формулируют общий вывод прямо: возможности агента зависят от весов модели лишь частично; вторую половину определяют «обвязка» – промпты, инструменты, навыки и поток управления. StateM называет подход harness scaling: вместо масштабирования модели масштабируется исполнительный контур вокруг неё.
Денежная сторона не менее показательна. Эталонный прогон GPT-5.6 на Terminal-Bench стоит сотни долларов за сессию; StateM доводит DeepSeek до сопоставимого результата за $52 суммарно, из которых $38 – стоимость самой «адаптации». Для российского контекста это важно вдвойне: DeepSeek доступен из России напрямую – о модели и её доступности у нас есть отдельный обзор, – и вопрос «как выжать максимум из доступной модели» практичнее вопроса «как достать недоступную».
Две оговорки, чтобы не улететь в хайп. Первая: Terminal-Bench – это задачи в терминале, ближе к работе разработчика, чем менеджера. Переносить цифры на свои задачи напрямую нельзя; переносить можно механизм – о том, как читать такие бенчмарки и где у цифр границы, у нас есть отдельный разбор. Вторая: $38 – это расходы на вычисления. Часы инженеров, которые писали ранбуки и настраивали контур, в эту цифру не входят. Так что «дёшево» здесь относится только к токенам; квалификация остаётся дорогой.
Почему модель не делает это сама
Теперь к тезису, который эти бенчмарки подвешивают: «ИИ сам себе напишет оптимальные промпты». Здесь нужна точность, потому что у тезиса есть и подтверждающая часть.
Модели действительно умеют подбирать промпты. Ещё в 2022 году APE показал: автоматически сгенерированные инструкции на 19 из 24 задач работают на уровне человеческих. OPRO от Google DeepMind поднял планку: оптимизированные самой моделью промпты дают до +8% на GSM8K и до +50% на задачах Big-Bench Hard. Классическая «суперпозиция вариантов» – self-consistency, когда модель генерирует несколько путей решения и выбирает согласованный – даёт +17,9% на GSM8K. Так что потенциал самооптимизации реален.
Но всё решают условия. Все эти методы работают внутри внешнего контура: отдельный процесс оптимизации, функция оценки, сотни и тысячи прогонов, отбор вариантов. Это человек строит систему, в которой модель улучшает промпты. В обычном чате такого контура нет – и вот тут данные августа неприятные для сторонников «самообучения».
When Self-Evolution Backfires (6 августа) показывает: агент, который накапливает навыки без фильтров, сначала растёт, а после критического размера пула начинает деградировать, возвращая большую часть набранного. Дефектный навык, попавший в контекст, становится материалом для следующих – и цепочку загрязнения уже не откатить: удаление навыка-источника восстанавливает лишь малую часть потерь. Контролируемая версия той же идеи – DarwinX с его жёстким правилом «принимай только варианты без регрессий» – работает. Неконтролируемая ломается.
Anthropic добавил к этому третий кусок в июльской работе про J-Space, «глобальное рабочее пространство» модели: пост-тренинг устанавливает во внутреннем рабочем пространстве модели типовую «точку зрения ассистента». По умолчанию модель воспроизводит обобщённую роль помощника, статистически самый частый паттерн своих обучающих данных. Редкие продвинутые техники управления в этот паттерн не входят – они в хвосте распределения, а хвосты при обучении на сгенерированном контенте имеют свойство исчезать.
Складывается картинка: потенциал у модели есть, но реализация определяется тем, что подано снаружи. Кто-то должен спроектировать контур: контекст, правила, критерии, отбор. Как устроены такие контуры в агентных системах, мы разбирали в материале об оркестрации агентов. Здесь вывод другой: это и есть работа человека с ИИ – та самая, которую бенчмарки августа сделали измеримой.
Контур вокруг модели строится из навыков, доступных любому пользователю чата: структура постановки, управление контекстом, критерии результата. В курсе они собраны в модуль «Фундамент» – обязательный для всех треков: 23 урока, от структуры промпта до проверки ответа. А первый шаг можно сделать прямо сейчас, на своих же реальных задачах: бесплатно и без регистрации.
Структура, контекст и критерии готовности – три навыка из этой статьи. Отработайте их на 9 реальных задачах менеджера в бесплатном модуле, без регистрации
Доступ сразу после регистрации
Три привычки из harness-работ, доступные в чате
Агентные обвязки из исследований выглядят сложной инженерией, но стоят они на трёх принципах, которые воспроизводятся в любом чате – в ChatGPT, DeepSeek, GigaChat или Kimi.
Первая – постоянное состояние. StateM организует исполнение вокруг «прочного состояния»: модель в каждый момент знает, что сделано, что осталось и какие решения уже приняты. В чате это означает одно: начинайте рабочую сессию с контекста. Роль, проект, ограничения, принятые решения – коротким блоком в начале промпта, каждый раз. Модель не помнит ваш проект между сессиями; «прочное состояние» в чате – это ваша привычка его подкладывать.
Вторая – ранбуки. StateM превращает разбор прошлых ошибок в «постоянные, исполнимые предварительные условия»: правила, которые агент обязан выполнить. DarwinX подтверждает: конкретные правила обобщаются, когда задачи имеют общую структуру. Перевод для менеджера: у повторяющейся задачи (еженедельный статус, протокол встречи, разбор рисков) должен быть свой многоразовый промпт-шаблон с зафиксированными шагами. Один раз написали – дальше подставляете новые данные. Мы проверяли этот подход на российских моделях в исследовании «Make Weak Model Great Again»: структурированный шаблон – одна из техник, которые стабильно дают прирост даже на слабых моделях.
Третья – проверенные переходы. В StateM каждый шаг исполнения проходит проверку, прежде чем контур двинется дальше; в промпте это формулируется двумя блоками: критерии готовности («готово означает вот что») и самопроверка («проверь свой ответ по этим критериям и покажи результат»). Это та самая классика верификации, только вшитая в постановку заранее. Подробные формулировки и примеры есть в практикуме по четырём техникам промптинга.
Все три привычки можно увидеть вживую на одной задаче.
Демонстрация: план спринта с критериями готовности и самопроверкой
В промпт ниже уже вложены данные типового планирования: команда из шести человек, двухнедельный спринт, бэклог с зависимостями и два жёстких ограничения – несдвигаемое демо и отпуск одного разработчика. Задача модели – построить план по людям, вытащить риски, задать критерии готовности для каждого пункта и проверить собственный план на перегрузку и нарушение зависимостей. Запустить можно как есть, потом подставить данные своего проекта.
Модели подобраны по нашему бенчмарку и по сюжету статьи. У Kimi K3 планирование – сильнейшая категория: по описанию её лучшая сторона – точный разбор данных и структурированные таблицы. DeepSeek V4 Pro – герой истории StateM: в общем зачёте нашего бенчмарка модель скромная, зато планирование по описанию – её рабочая сторона («детально планирует шаги»). Это ровно тезис статьи: скромная по рейтингу модель со структурированной постановкой показывает взрослый результат. И обе доступны из России – это тоже был критерий отбора.
Я прогнал этот промпт на обеих моделях 18 августа. Обе выдали все четыре блока: план по людям, риски, критерии готовности и самопроверку – и обе корректно развели работу Сергея по первой неделе, до отпуска. DeepSeek дополнительно расписал календарь спринта по дням и отметил загрузку каждого в таблице. Самопроверка в обоих прогонах нарушений не нашла – план действительно сходится: десять рабочих дней на человека здесь потолок, и ни у кого он не превышен.
На что смотреть в ответе. Первое – блок критериев готовности: это тот элемент обвязки, которого в наивном промпте «спланируй спринт» просто нет, и именно он превращает план в проверяемый артефакт. Второе – самопроверка: посмотрите, нашла ли модель нарушения и как исправила план. Третье – арифметика: у обеих моделей задокументированы слабости в конкретных цифрах (у Kimi – неточности в числах и ценах, у DeepSeek – отсутствие точных оценок), поэтому загрузку по человеко-дням сверьте руками. Десять рабочих дней на человека – потолок, Сергей доступен пять.
Увидели разницу между наивной просьбой и структурированной постановкой. Закрепите её на задачах из своей практики – в бесплатном модуле 9 сценариев менеджера
Доступ сразу после регистрации
Что делать уже сейчас
Четыре действия, которые вытаскиваются из августовских бенчмарков без всякой лаборатории.
Выберите одну повторяющуюся задачу и напишите для неё промпт-ранбук. Еженедельный статус подходит лучше всего: роль, входные данные, шаги, формат ответа. Один час на шаблон экономит переписывание каждую неделю – и, по данным StateM, правила работают именно тогда, когда задачи имеют общую структуру.
Добавьте в важные промпты критерии готовности и самопроверку. Два коротких блока в конце постановки: «готово означает…» и «проверь ответ по критериям». Это самый дешёвый элемент обвязки из всех трёх, и он же лучше всего виден на результате.
Столкнувшись со слабым ответом, сначала меняйте постановку, потом модель. Августовские данные показывают: вклад обвязки – 5–17 пунктов бенчмарка – сопоставим с разницей между соседними моделями в таблицах и часто превышает её. Переход на модель сильнее без изменения промпта даёт меньше, чем структурированная постановка на текущей.
Проверяйте числа руками. Это ограничение всех трёх привычек: обвязка улучшает структуру и полноту ответа, но арифметику модели считают по-прежнему. Привычка сверять цифры – из того же набора навыков.
Бенчмарки последних двух недель отвечают на старый спор «зачем учиться управлять ИИ, если он сам напишет себе промпт». Напишет – если кто-то построит контур, в котором это возможно: с функцией оценки, отбором и защитой от деградации. Качество этого контура определяется квалификацией человека, который его спроектировал. Модель у вас уже есть. Вопрос в том, какая обвязка вокруг неё.
Модель не изменится. Обвязка – в ваших руках
Фундамент курса: 23 урока навыков, которые решают результат по данным августовских бенчмарков – структура промпта, управление контекстом, персоны, семантика, проверка ответа. Tool-agnostic: работает в ChatGPT, DeepSeek, GigaChat и Kimi.
Часто задаваемые вопросы
Бенчмарки августа 2026 действительно подтверждают, что промпт-инжиниринг работает?
Может ли модель сама написать себе оптимальный промпт?
Что такое harness scaling?
Что конкретно менеджеру делать с этими исследованиями?

Stanislav Belyaev
Engineering Leader в Microsoft18 лет в управлении инженерными командами. Основатель mysummit.school. 700+ выпускников в Яндекс Практикуме и Стратоплане.



