Промпт-инжиниринг работает: одна модель, два результата
15 августа на arXiv вышла неприметная работа StateM – четыре автора, без громкой лаборатории. Внутри есть цифра, на которой стоит остановиться: DeepSeek-V4 Flash, модель не из лидерской группы нашего бенчмарка, после «адаптации» стоимостью $38 поднимается на Terminal-Bench 2.1 с 82,7% до 88,1%. А на общем ядре из 88 задач доходит до 89,1% – уровень флагманских прогонов GPT-5.6 Sol, эталонный прогон которых обошёлся в $574. Итоговый счёт всей конфигурации на DeepSeek – $52.
StateM не одиночка: за последние две недели вышло ещё минимум две работы о том, что даёт промпт-инжиниринг в агентных системах. DarwinX добавляет в среднем 17 пунктов на четырёх бенчмарках, LongHorizon-Harness поднимает Qwen 3.7-Plus на Terminal-Bench с 69,7% до 77,2%. Во всех трёх случаях веса модели заморожены. Меняется только то, что вокруг неё: промпты, инструкции, контроль исполнения.
Это прямо бьёт по популярному тезису о том, что промпт-инжиниринг вот-вот станет не нужен: модель сама напишет себе оптимальный промпт, учиться управлять ИИ не нужно. У свежих работ есть границы применимости – и есть практические следствия для руководителя, который работает с ИИ в обычном чате, без лабораторной инфраструктуры.
Читать полностью




