Промпт-Инжиниринг

Промпт-инжиниринг работает: одна модель, два результата

11 мин чтения

15 августа на arXiv вышла неприметная работа StateM – четыре автора, без громкой лаборатории. Внутри есть цифра, на которой стоит остановиться: DeepSeek-V4 Flash, модель не из лидерской группы нашего бенчмарка, после «адаптации» стоимостью $38 поднимается на Terminal-Bench 2.1 с 82,7% до 88,1%. А на общем ядре из 88 задач доходит до 89,1% – уровень флагманских прогонов GPT-5.6 Sol, эталонный прогон которых обошёлся в $574. Итоговый счёт всей конфигурации на DeepSeek – $52.

StateM не одиночка: за последние две недели вышло ещё минимум две работы о том, что даёт промпт-инжиниринг в агентных системах. DarwinX добавляет в среднем 17 пунктов на четырёх бенчмарках, LongHorizon-Harness поднимает Qwen 3.7-Plus на Terminal-Bench с 69,7% до 77,2%. Во всех трёх случаях веса модели заморожены. Меняется только то, что вокруг неё: промпты, инструкции, контроль исполнения.

Это прямо бьёт по популярному тезису о том, что промпт-инжиниринг вот-вот станет не нужен: модель сама напишет себе оптимальный промпт, учиться управлять ИИ не нужно. У свежих работ есть границы применимости – и есть практические следствия для руководителя, который работает с ИИ в обычном чате, без лабораторной инфраструктуры.

Читать полностью
Промпт-инжиниринг работает: одна модель, два результата
ИИ-агент, который спорит с вашим решением, пока не проиграет
16 мин

ИИ-агент, который спорит с вашим решением, пока не проиграет

Менеджер утверждает решение за десять минут до созвона. Кандидат понравился на собеседовании, цифры в презентации подрядчика сходятся, план сокращения объёма проекта выглядит логично на слайде. Решение принято, потому что оно почувствовалось правильным – а не потому, что кто-то попробовал его опровергнуть.

Так управленческие решения и проваливаются: данных на столе обычно хватает, вопрос просто закрыли слишком рано. Слишком мало вариантов, слишком мало доказательств, которые могли бы решение опровергнуть, слишком много непроверенных допущений. Тема не новая, но у неё появился неожиданно точный инструмент.

GigaChat для работы: как выжать максимум из того, что есть
16 мин

GigaChat для работы: как выжать максимум из того, что есть

Если вы читаете эту статью – скорее всего, GigaChat уже есть в вашем рабочем арсенале. Может, компания развернула Enterprise на закрытом контуре. Может, вы в госструктуре и зарубежные сервисы недоступны. Может, просто привыкли к интерфейсу Сбера. Причина не важна – важно, что инструмент у вас есть, и вы хотите получать от него нормальный результат.

Мат, КАПС и XML-теги: мифы промптинга против данных
10 мин

Мат, КАПС и XML-теги: мифы промптинга против данных

«Напиши КАПСОМ – модель послушается». «Поругайся на неё – выдаст лучше». «Разбей на шаги – получишь глубокий анализ». Эти советы кочуют из блога в блог, из чата в чат. Кто-то ссылается на исследование Microsoft, кто-то – на личный опыт с ChatGPT.

Я решил проверить – и проверил основательно. Взял четыре модели, доступные в России без VPN: GigaChat-Ultra, GigaChat-2-Max, YandexGPT и Qwen3 Max. Каждую прогнал через десять техник промптинга (способов формулировать запросы к ИИ) – от простых ролевых заданий до XML-структур. Задачи – из реальной работы менеджера: анализ выручки, подготовка записки, увольнение по ТК РФ.

Оценивали вслепую два независимых LLM-судьи. Для калибровки те же задачи решали GPT-5.4 и Claude Sonnet – чтобы зафиксировать потолок, к которому тянутся российские модели.

Если вы используете ИИ для рабочих задач – записок, писем, анализа данных – эти результаты сэкономят часы проб и ошибок.

Половина популярных советов оказалась городскими легендами. Другая половина работает – но не так, как вы думаете.

Как выжать максимум из YandexGPT: что работает, а что нет
11 мин

Как выжать максимум из YandexGPT: что работает, а что нет

Миллионы людей пользуются Алисой каждый день – не потому что выбирают, а потому что она бесплатна, встроена в Яндекс Браузер и работает без VPN. YandexGPT, модель под капотом Алисы – лучшая российская модель в нашем бенчмарке, но до GPT-5.4 ей далеко.

Можно ли получить от неё ответы, близкие к GPT, если научиться правильно спрашивать? Мы проверили это в эксперименте: десять техник промптинга, шесть управленческих задач, два независимых LLM-судьи. Короткий ответ: да, можно – но не все техники работают, а некоторые делают хуже.

Ниже – конкретные шаблоны, которые вы можете скопировать в чат прямо сейчас, и антипаттерны, которых стоит избегать.