Промпт-инжиниринг работает: одна модель, два результата

11 мин чтения
Stanislav Belyaev
Stanislav Belyaev Engineering Leader в Microsoft
Промпт-инжиниринг работает: одна модель, два результата

15 августа на arXiv вышла неприметная работа StateM – четыре автора, без громкой лаборатории. Внутри есть цифра, на которой стоит остановиться: DeepSeek-V4 Flash, модель не из лидерской группы нашего бенчмарка, после «адаптации» стоимостью $38 поднимается на Terminal-Bench 2.1 с 82,7% до 88,1%. А на общем ядре из 88 задач доходит до 89,1% – уровень флагманских прогонов GPT-5.6 Sol, эталонный прогон которых обошёлся в $574. Итоговый счёт всей конфигурации на DeepSeek – $52.

StateM не одиночка: за последние две недели вышло ещё минимум две работы о том, что даёт промпт-инжиниринг в агентных системах. DarwinX добавляет в среднем 17 пунктов на четырёх бенчмарках, LongHorizon-Harness поднимает Qwen 3.7-Plus на Terminal-Bench с 69,7% до 77,2%. Во всех трёх случаях веса модели заморожены. Меняется только то, что вокруг неё: промпты, инструкции, контроль исполнения.

Это прямо бьёт по популярному тезису о том, что промпт-инжиниринг вот-вот станет не нужен: модель сама напишет себе оптимальный промпт, учиться управлять ИИ не нужно. У свежих работ есть границы применимости – и есть практические следствия для руководителя, который работает с ИИ в обычном чате, без лабораторной инфраструктуры.

Что произошло в бенчмарках

Три работы, три разных механизма, один принцип. Вот сводка:

ИсследованиеДатаЧто сделалиРезультат
StateM15 августаРанбуки, постоянное состояние, проверенные переходы между шагамиDeepSeek-V4 Flash: 82,7 -> 88,1% (Terminal-Bench 2.1); GPT-5.6 Luna: 76,7 -> 85,4%
DarwinX31 июляЭволюционный отбор обвязок: выживают варианты без регрессий+17 пунктов в среднем на 4 бенчмарках; Terminal-Bench 2.1 до 83,2%
LongHorizon-Harness3 августаСостояние задачи вынесено из контекста, цикл «управляй – выполняй – проверяй»Qwen 3.7-Plus: 69,7 -> 77,2% (Terminal-Bench 2.1), WeaveBench: 51,8 -> 80,7%

Авторы DarwinX формулируют общий вывод прямо: возможности агента зависят от весов модели лишь частично; вторую половину определяют «обвязка» – промпты, инструменты, навыки и поток управления. StateM называет подход harness scaling: вместо масштабирования модели масштабируется исполнительный контур вокруг неё.

Денежная сторона не менее показательна. Эталонный прогон GPT-5.6 на Terminal-Bench стоит сотни долларов за сессию; StateM доводит DeepSeek до сопоставимого результата за $52 суммарно, из которых $38 – стоимость самой «адаптации». Для российского контекста это важно вдвойне: DeepSeek доступен из России напрямую – о модели и её доступности у нас есть отдельный обзор, – и вопрос «как выжать максимум из доступной модели» практичнее вопроса «как достать недоступную».

Две оговорки, чтобы не улететь в хайп. Первая: Terminal-Bench – это задачи в терминале, ближе к работе разработчика, чем менеджера. Переносить цифры на свои задачи напрямую нельзя; переносить можно механизм – о том, как читать такие бенчмарки и где у цифр границы, у нас есть отдельный разбор. Вторая: $38 – это расходы на вычисления. Часы инженеров, которые писали ранбуки и настраивали контур, в эту цифру не входят. Так что «дёшево» здесь относится только к токенам; квалификация остаётся дорогой.

Почему модель не делает это сама

Теперь к тезису, который эти бенчмарки подвешивают: «ИИ сам себе напишет оптимальные промпты». Здесь нужна точность, потому что у тезиса есть и подтверждающая часть.

Модели действительно умеют подбирать промпты. Ещё в 2022 году APE показал: автоматически сгенерированные инструкции на 19 из 24 задач работают на уровне человеческих. OPRO от Google DeepMind поднял планку: оптимизированные самой моделью промпты дают до +8% на GSM8K и до +50% на задачах Big-Bench Hard. Классическая «суперпозиция вариантов» – self-consistency, когда модель генерирует несколько путей решения и выбирает согласованный – даёт +17,9% на GSM8K. Так что потенциал самооптимизации реален.

Но всё решают условия. Все эти методы работают внутри внешнего контура: отдельный процесс оптимизации, функция оценки, сотни и тысячи прогонов, отбор вариантов. Это человек строит систему, в которой модель улучшает промпты. В обычном чате такого контура нет – и вот тут данные августа неприятные для сторонников «самообучения».

When Self-Evolution Backfires (6 августа) показывает: агент, который накапливает навыки без фильтров, сначала растёт, а после критического размера пула начинает деградировать, возвращая большую часть набранного. Дефектный навык, попавший в контекст, становится материалом для следующих – и цепочку загрязнения уже не откатить: удаление навыка-источника восстанавливает лишь малую часть потерь. Контролируемая версия той же идеи – DarwinX с его жёстким правилом «принимай только варианты без регрессий» – работает. Неконтролируемая ломается.

Anthropic добавил к этому третий кусок в июльской работе про J-Space, «глобальное рабочее пространство» модели: пост-тренинг устанавливает во внутреннем рабочем пространстве модели типовую «точку зрения ассистента». По умолчанию модель воспроизводит обобщённую роль помощника, статистически самый частый паттерн своих обучающих данных. Редкие продвинутые техники управления в этот паттерн не входят – они в хвосте распределения, а хвосты при обучении на сгенерированном контенте имеют свойство исчезать.

Складывается картинка: потенциал у модели есть, но реализация определяется тем, что подано снаружи. Кто-то должен спроектировать контур: контекст, правила, критерии, отбор. Как устроены такие контуры в агентных системах, мы разбирали в материале об оркестрации агентов. Здесь вывод другой: это и есть работа человека с ИИ – та самая, которую бенчмарки августа сделали измеримой.

Контур вокруг модели строится из навыков, доступных любому пользователю чата: структура постановки, управление контекстом, критерии результата. В курсе они собраны в модуль «Фундамент» – обязательный для всех треков: 23 урока, от структуры промпта до проверки ответа. А первый шаг можно сделать прямо сейчас, на своих же реальных задачах: бесплатно и без регистрации.

Структура, контекст и критерии готовности – три навыка из этой статьи. Отработайте их на 9 реальных задачах менеджера в бесплатном модуле, без регистрации

Доступ сразу после регистрации

Начать обучение

Три привычки из harness-работ, доступные в чате

Агентные обвязки из исследований выглядят сложной инженерией, но стоят они на трёх принципах, которые воспроизводятся в любом чате – в ChatGPT, DeepSeek, GigaChat или Kimi.

Первая – постоянное состояние. StateM организует исполнение вокруг «прочного состояния»: модель в каждый момент знает, что сделано, что осталось и какие решения уже приняты. В чате это означает одно: начинайте рабочую сессию с контекста. Роль, проект, ограничения, принятые решения – коротким блоком в начале промпта, каждый раз. Модель не помнит ваш проект между сессиями; «прочное состояние» в чате – это ваша привычка его подкладывать.

Вторая – ранбуки. StateM превращает разбор прошлых ошибок в «постоянные, исполнимые предварительные условия»: правила, которые агент обязан выполнить. DarwinX подтверждает: конкретные правила обобщаются, когда задачи имеют общую структуру. Перевод для менеджера: у повторяющейся задачи (еженедельный статус, протокол встречи, разбор рисков) должен быть свой многоразовый промпт-шаблон с зафиксированными шагами. Один раз написали – дальше подставляете новые данные. Мы проверяли этот подход на российских моделях в исследовании «Make Weak Model Great Again»: структурированный шаблон – одна из техник, которые стабильно дают прирост даже на слабых моделях.

Третья – проверенные переходы. В StateM каждый шаг исполнения проходит проверку, прежде чем контур двинется дальше; в промпте это формулируется двумя блоками: критерии готовности («готово означает вот что») и самопроверка («проверь свой ответ по этим критериям и покажи результат»). Это та самая классика верификации, только вшитая в постановку заранее. Подробные формулировки и примеры есть в практикуме по четырём техникам промптинга.

Все три привычки можно увидеть вживую на одной задаче.

Демонстрация: план спринта с критериями готовности и самопроверкой

В промпт ниже уже вложены данные типового планирования: команда из шести человек, двухнедельный спринт, бэклог с зависимостями и два жёстких ограничения – несдвигаемое демо и отпуск одного разработчика. Задача модели – построить план по людям, вытащить риски, задать критерии готовности для каждого пункта и проверить собственный план на перегрузку и нарушение зависимостей. Запустить можно как есть, потом подставить данные своего проекта.

Попробуйте сами
План спринта с критериями готовности и самопроверкой – структурированный промпт по мотивам августовских исследований
Вы
Ты – ассистент руководителя проекта в ИТ-компании. Составь план двухнедельного спринта. Контекст: - Команда 6 человек: два бэкенд-разработчика (Андрей и Сергей), фронтенд-разработчик (Мария), QA (Дмитрий), аналитик (Марина), дизайнер (Ольга). - Спринт: 7–18 сентября, 10 рабочих дней. Демо заказчику 18 сентября, дата зафиксирована. - Сергей в отпуске с 14 сентября, работает только первую неделю. Бэклог (оценка в человеко-днях, зависимости): 1. API для экспорта отчётов в CSV – 4 дня, бэкенд, без зависимостей. 2. Интерфейс экспорта – 3 дня, фронтенд, зависит от пункта 1. 3. Исправить ошибку с дублированием данных в отчётах – 1 день, бэкенд, без зависимостей. 4. Тестирование экспорта – 2 дня, QA, зависит от пунктов 1 и 2. 5. Дашборд аналитики использования – 5 дней, фронтенд, без зависимостей. 6. Требования к уведомлениям – 2 дня, аналитик, без зависимостей. 7. Иконки и иллюстрации для пустых состояний – 1 день, дизайнер, без зависимостей. 8. Обновление документации по API – 2 дня, бэкенд, зависит от пункта 1. Сделай четыре вещи: 1. План по дням для каждого члена команды. 2. Риски: что может помешать успеть к демо 18 сентября, и действие на каждый риск. 3. Критерии готовности для каждого пункта бэклога – как проверить, что пункт действительно завершён. 4. Самопроверка: проверь, что ни у кого загрузка выше 10 человеко-дней за две недели и что ни одна задача не начинается до завершения её зависимостей. Если нашёл нарушение – исправь план и покажи исправленную версию. Формат ответа: сначала таблица плана по людям, затем риски, затем критерии готовности, затем результат самопроверки.
Сравниваем:
kimi-k3 · deepseek-v4-pro

Модели подобраны по нашему бенчмарку и по сюжету статьи. У Kimi K3 планирование – сильнейшая категория: по описанию её лучшая сторона – точный разбор данных и структурированные таблицы. DeepSeek V4 Pro – герой истории StateM: в общем зачёте нашего бенчмарка модель скромная, зато планирование по описанию – её рабочая сторона («детально планирует шаги»). Это ровно тезис статьи: скромная по рейтингу модель со структурированной постановкой показывает взрослый результат. И обе доступны из России – это тоже был критерий отбора.

Я прогнал этот промпт на обеих моделях 18 августа. Обе выдали все четыре блока: план по людям, риски, критерии готовности и самопроверку – и обе корректно развели работу Сергея по первой неделе, до отпуска. DeepSeek дополнительно расписал календарь спринта по дням и отметил загрузку каждого в таблице. Самопроверка в обоих прогонах нарушений не нашла – план действительно сходится: десять рабочих дней на человека здесь потолок, и ни у кого он не превышен.

На что смотреть в ответе. Первое – блок критериев готовности: это тот элемент обвязки, которого в наивном промпте «спланируй спринт» просто нет, и именно он превращает план в проверяемый артефакт. Второе – самопроверка: посмотрите, нашла ли модель нарушения и как исправила план. Третье – арифметика: у обеих моделей задокументированы слабости в конкретных цифрах (у Kimi – неточности в числах и ценах, у DeepSeek – отсутствие точных оценок), поэтому загрузку по человеко-дням сверьте руками. Десять рабочих дней на человека – потолок, Сергей доступен пять.

Увидели разницу между наивной просьбой и структурированной постановкой. Закрепите её на задачах из своей практики – в бесплатном модуле 9 сценариев менеджера

Доступ сразу после регистрации

Начать обучение

Что делать уже сейчас

Четыре действия, которые вытаскиваются из августовских бенчмарков без всякой лаборатории.

Выберите одну повторяющуюся задачу и напишите для неё промпт-ранбук. Еженедельный статус подходит лучше всего: роль, входные данные, шаги, формат ответа. Один час на шаблон экономит переписывание каждую неделю – и, по данным StateM, правила работают именно тогда, когда задачи имеют общую структуру.

Добавьте в важные промпты критерии готовности и самопроверку. Два коротких блока в конце постановки: «готово означает…» и «проверь ответ по критериям». Это самый дешёвый элемент обвязки из всех трёх, и он же лучше всего виден на результате.

Столкнувшись со слабым ответом, сначала меняйте постановку, потом модель. Августовские данные показывают: вклад обвязки – 5–17 пунктов бенчмарка – сопоставим с разницей между соседними моделями в таблицах и часто превышает её. Переход на модель сильнее без изменения промпта даёт меньше, чем структурированная постановка на текущей.

Проверяйте числа руками. Это ограничение всех трёх привычек: обвязка улучшает структуру и полноту ответа, но арифметику модели считают по-прежнему. Привычка сверять цифры – из того же набора навыков.

Бенчмарки последних двух недель отвечают на старый спор «зачем учиться управлять ИИ, если он сам напишет себе промпт». Напишет – если кто-то построит контур, в котором это возможно: с функцией оценки, отбором и защитой от деградации. Качество этого контура определяется квалификацией человека, который его спроектировал. Модель у вас уже есть. Вопрос в том, какая обвязка вокруг неё.

Специализация

Модель не изменится. Обвязка – в ваших руках

Фундамент курса: 23 урока навыков, которые решают результат по данным августовских бенчмарков – структура промпта, управление контекстом, персоны, семантика, проверка ответа. Tool-agnostic: работает в ChatGPT, DeepSeek, GigaChat и Kimi.

От pre-mortem до антикризисного плана
Переиспользуемые промпт-шаблоны
Сквозной кейс на реальном проекте
~300 часов экономии в год

Часто задаваемые вопросы

Бенчмарки августа 2026 действительно подтверждают, что промпт-инжиниринг работает?
Да, с уточнением. StateM, DarwinX и LongHorizon-Harness показали прирост 5–17 пунктов на Terminal-Bench и смежных бенчмарках при неизменных весах модели – за счёт промптов, ранбуков и контроля исполнения. Это агентные обвязки, ближе к системным промптам, чем к чат-техникам, но механизм тот же: структурированная постановка меняет результат той же модели.
Может ли модель сама написать себе оптимальный промпт?
Частично. APE (2022) и OPRO (2023) показали, что LLM подбирают промпты на уровне человека или лучше – но только внутри внешнего контура с функцией оценки и сотнями прогонов. Наивное «улучши себя» без контроля даёт деградацию: в исследовании When Self-Evolution Backfires (август 2026) агент без фильтров сначала рос, потом терял набранное.
Что такое harness scaling?
Термин из исследования StateM (август 2026): улучшение исполнительного контура вокруг модели – промптов, ранбуков, контроля состояния – без изменения весов. Противопоставляется масштабированию самой модели. Практический смысл: результат зависит от того, как организована работа с моделью, и это зона ответственности человека.
Что конкретно менеджеру делать с этими исследованиями?
Три привычки: давать модели постоянный контекст задачи (роль, ограничения, принятые решения), строить многоразовые промпты-ранбуки для повторяющихся задач и задавать в промпте критерии готовности с самопроверкой. Это те же принципы, на которых построены августовские агентные обвязки.
Stanislav Belyaev

Stanislav Belyaev

Engineering Leader в Microsoft

18 лет в управлении инженерными командами. Основатель mysummit.school. 700+ выпускников в Яндекс Практикуме и Стратоплане.