Промпт-Инжиниринг

Промпта оказалось недостаточно: что Гарвард добавил к GPT-4, чтобы он начал учить

10 мин чтения

В 2023 году студенты вводного курса физики в Гарварде прошли одно из двух занятий с ИИ-репетитором на базе GPT-4. Медиана их результата в тесте после занятия составила 4,5 балла. После аудиторного занятия с активным обучением медиана была 3,5 балла, при общей исходной медиане 2,75 балла.

Различие статистически значимое: z = -5,6, p < 10⁻⁸. По квантильной регрессии, которая лучше справлялась с особенностью этих данных, размер эффекта находился в диапазоне от 0,73 до 1,3 стандартного отклонения. Заголовок почти пишет себя сам: ИИ обошёл занятие в Гарварде. Работа Кестина и коллег вышла в Scientific Reports, а данные и код анализа авторы выложили целиком – проверить расчёты можно самостоятельно.

Только полезный для менеджера вывод начинается на один уровень глубже. Студенты работали со специально собранной системой, где GPT-4 отвечал внутри жёсткой последовательности, видел заранее написанные решения и следовал педагогическим правилам. Системный промпт был лишь одним компонентом. Причём один важный компонент пришлось из него вынести.

Читать полностью
Промпта оказалось недостаточно: что Гарвард добавил к GPT-4, чтобы он начал учить
Рабочее пространство для ИИ-агента: гид для менеджера
8 мин

Рабочее пространство для ИИ-агента: гид для менеджера

Каждая новая сессия с ИИ-агентом начинается с одного и того же. Вот контекст проекта, вот где лежат статусы, вот кто заказчик, вот что мы уже выяснили в прошлый раз. Минут двадцать-тридцать чистого времени – на то, чтобы привести ассистента в рабочее состояние. И так при каждом входе.

Инженеры, которые работают с агентами ежедневно, давно решили эту проблему структурой папок. Я недавно читал разбор одного такого рабочего пространства: около восьмидесяти папок и файлов, и агент осваивается в нём за одно чтение файла. Секрет ровно один, и он не про инструменты.

Репетиция сложного разговора с ИИ: опыт 40 тысяч менеджеров
15 мин

Репетиция сложного разговора с ИИ: опыт 40 тысяч менеджеров

За две недели до срока сдачи годовых оценок одним внутренним инструментом начинают пользоваться вчетверо чаще обычного. Это голосовой тренажёр: руководитель вслух репетирует трудный разговор с сотрудником. За полгода люди провели в нём более 54 тысяч разговоров, а число разных пользователей превысило 40 тысяч. Речь идёт о рабочей системе в одной из крупнейших компаний мира. Пробой на нескольких добровольцах такой масштаб уже не назовёшь.

Она называется Conversation Coach. В конце августа создатели выложили препринт с описанием. В нём много инженерных подробностей, но руководителю важнее другое. Люди открывали тренажёр именно перед трудными встречами. Разработчики сознательно выбрали более медленную и дорогую схему, потому что хороший разбор для них оказался важнее быстрого ответа. И весь замысел держится на голосе: переписка такой репетиции не заменяет.

Внутренней системы за корпоративные деньги у большинства из нас нет. Основную идею всё равно можно повторить вечером в голосовом режиме обычного чат-бота, бесплатно. Некоторые руководители уже так делают.

Промпт-инжиниринг работает: одна модель, два результата
11 мин

Промпт-инжиниринг работает: одна модель, два результата

15 августа на arXiv вышла неприметная работа StateM – четыре автора, без громкой лаборатории. Внутри есть цифра, на которой стоит остановиться: DeepSeek-V4 Flash, модель не из лидерской группы нашего бенчмарка, после «адаптации» стоимостью $38 поднимается на Terminal-Bench 2.1 с 82,7% до 88,1%. А на общем ядре из 88 задач доходит до 89,1% – уровень флагманских прогонов GPT-5.6 Sol, эталонный прогон которых обошёлся в $574. Итоговый счёт всей конфигурации на DeepSeek – $52.

StateM не одиночка: за последние две недели вышло ещё минимум две работы о том, что даёт промпт-инжиниринг в агентных системах. DarwinX добавляет в среднем 17 пунктов на четырёх бенчмарках, LongHorizon-Harness поднимает Qwen 3.7-Plus на Terminal-Bench с 69,7% до 77,2%. Во всех трёх случаях веса модели заморожены. Меняется только то, что вокруг неё: промпты, инструкции, контроль исполнения.

Это прямо бьёт по популярному тезису о том, что промпт-инжиниринг вот-вот станет не нужен: модель сама напишет себе оптимальный промпт, учиться управлять ИИ не нужно. У свежих работ есть границы применимости – и есть практические следствия для руководителя, который работает с ИИ в обычном чате, без лабораторной инфраструктуры.

ИИ-агент, который спорит с вашим решением, пока не проиграет
16 мин

ИИ-агент, который спорит с вашим решением, пока не проиграет

Менеджер утверждает решение за десять минут до созвона. Кандидат понравился на собеседовании, цифры в презентации подрядчика сходятся, план сокращения объёма проекта выглядит логично на слайде. Решение принято, потому что оно почувствовалось правильным – а не потому, что кто-то попробовал его опровергнуть.

Так управленческие решения и проваливаются: данных на столе обычно хватает, вопрос просто закрыли слишком рано. Слишком мало вариантов, слишком мало доказательств, которые могли бы решение опровергнуть, слишком много непроверенных допущений. Тема не новая, но у неё появился неожиданно точный инструмент.

GigaChat для работы: как выжать максимум из того, что есть
17 мин

GigaChat для работы: как выжать максимум из того, что есть

Если вы читаете эту статью – скорее всего, GigaChat уже есть в вашем рабочем арсенале. Может, компания развернула Enterprise на закрытом контуре. Может, вы в госструктуре и зарубежные сервисы недоступны. Может, просто привыкли к интерфейсу Сбера. Причина не важна – важно, что инструмент у вас есть, и вы хотите получать от него нормальный результат.

Мат, КАПС и XML-теги: мифы промптинга против данных
10 мин

Мат, КАПС и XML-теги: мифы промптинга против данных

«Напиши КАПСОМ – модель послушается». «Поругайся на неё – выдаст лучше». «Разбей на шаги – получишь глубокий анализ». Эти советы кочуют из блога в блог, из чата в чат. Кто-то ссылается на исследование Microsoft, кто-то – на личный опыт с ChatGPT.

Я решил проверить – и проверил основательно. Взял четыре модели, доступные в России без VPN: GigaChat-Ultra, GigaChat-2-Max, YandexGPT и Qwen3 Max. Каждую прогнал через десять техник промптинга (способов формулировать запросы к ИИ) – от простых ролевых заданий до XML-структур. Задачи – из реальной работы менеджера: анализ выручки, подготовка записки, увольнение по ТК РФ.

Оценивали вслепую два независимых LLM-судьи. Для калибровки те же задачи решали GPT-5.4 и Claude Sonnet – чтобы зафиксировать потолок, к которому тянутся российские модели.

Если вы используете ИИ для рабочих задач – записок, писем, анализа данных – эти результаты сэкономят часы проб и ошибок.

Половина популярных советов оказалась городскими легендами. Другая половина работает – но не так, как вы думаете.

Как выжать максимум из YandexGPT: что работает, а что нет
11 мин

Как выжать максимум из YandexGPT: что работает, а что нет

Миллионы людей пользуются Алисой каждый день – не потому что выбирают, а потому что она бесплатна, встроена в Яндекс Браузер и работает без VPN. YandexGPT, модель под капотом Алисы – лучшая российская модель в нашем бенчмарке, но до GPT-5.4 ей далеко.

Можно ли получить от неё ответы, близкие к GPT, если научиться правильно спрашивать? Мы проверили это в эксперименте: десять техник промптинга, шесть управленческих задач, два независимых LLM-судьи. Короткий ответ: да, можно – но не все техники работают, а некоторые делают хуже.

Ниже – конкретные шаблоны, которые вы можете скопировать в чат прямо сейчас, и антипаттерны, которых стоит избегать.