DeepSeek

Промпт-инжиниринг работает: одна модель, два результата

11 мин чтения

15 августа на arXiv вышла неприметная работа StateM – четыре автора, без громкой лаборатории. Внутри есть цифра, на которой стоит остановиться: DeepSeek-V4 Flash, модель не из лидерской группы нашего бенчмарка, после «адаптации» стоимостью $38 поднимается на Terminal-Bench 2.1 с 82,7% до 88,1%. А на общем ядре из 88 задач доходит до 89,1% – уровень флагманских прогонов GPT-5.6 Sol, эталонный прогон которых обошёлся в $574. Итоговый счёт всей конфигурации на DeepSeek – $52.

StateM не одиночка: за последние две недели вышло ещё минимум две работы о том, что даёт промпт-инжиниринг в агентных системах. DarwinX добавляет в среднем 17 пунктов на четырёх бенчмарках, LongHorizon-Harness поднимает Qwen 3.7-Plus на Terminal-Bench с 69,7% до 77,2%. Во всех трёх случаях веса модели заморожены. Меняется только то, что вокруг неё: промпты, инструкции, контроль исполнения.

Это прямо бьёт по популярному тезису о том, что промпт-инжиниринг вот-вот станет не нужен: модель сама напишет себе оптимальный промпт, учиться управлять ИИ не нужно. У свежих работ есть границы применимости – и есть практические следствия для руководителя, который работает с ИИ в обычном чате, без лабораторной инфраструктуры.

Читать полностью
Промпт-инжиниринг работает: одна модель, два результата
Локальные LLM для менеджера: что реально запустить дома
20 мин

Локальные LLM для менеджера: что реально запустить дома

Каждый, кто достаточно долго работает с ChatGPT или Claude, рано или поздно задаёт этот вопрос: а можно ли запустить что-то похожее прямо на своём ноутбуке – без подписки, без утечки данных, без зависимости от серверов?

Ответ в 2026 году – да, но с оговорками, которые важнее самого ответа.

Эта статья для тех, кто уже пользуется облачными LLM и хочет понять, что реально даёт локальный запуск, какое железо для этого нужно и где заканчиваются ожидания. Без технического глубокого погружения, но с конкретными цифрами.

Claude Code недоступен? OpenCode работает в России – бесплатно
12 мин

Claude Code недоступен? OpenCode работает в России – бесплатно

В марте 2026 года Lenny Rachitsky опубликовал статью с говорящим заголовком: «Everyone should be using Claude Code». Материал разлетелся по LinkedIn и Telegram-каналам, набрал сотни тысяч просмотров, и теперь каждую неделю кто-то из менеджеров спрашивает: как это попробовать?

Ответ неудобный. Claude Code официально недоступен в России и большинстве стран СНГ. Подписка Anthropic Max, которая его открывает, стоит $100 в месяц и требует карту, которую не всегда легко получить. Это создаёт странную ситуацию: один из самых обсуждаемых AI-инструментов года – физически за барьером для значительной части аудитории, которая о нём читает.

Есть прямая альтернатива. OpenCode – open-source проект, который делает ровно то же самое, работает с любыми моделями (включая доступные в России), и ставится за 15 минут.

Лучшие AI для менеджера в России: 52 модели, 3300+ оценок
11 мин

Лучшие AI для менеджера в России: 52 модели, 3300+ оценок

Мы провели масштабное исследование: 54 модели, оценки от двух независимых LLM-судей, 8 категорий управленческих задач. Это самый полный русскоязычный рейтинг AI для менеджеров на сегодня.

Вопрос остаётся тем же: какой AI реально работает для руководителя в России – без VPN, без костылей?

Сравнение GenAI инструментов 2026: какой ИИ выбрать менеджеру
8 мин

Сравнение GenAI инструментов 2026: какой ИИ выбрать менеджеру

К марту 2026 года на рынке генеративного ИИ – десятки инструментов. Каждый производитель заявляет о лидерстве, а маркетинговые материалы соревнуются в громкости. Как менеджеру выбрать инструмент, который реально решает задачи?

DeepSeek в 2026: обзор бюджетного флагмана среди нейросетей
12 мин

DeepSeek в 2026: обзор бюджетного флагмана среди нейросетей

DeepSeek (часто пишут «Deep Seek») – китайский AI-стартап, который за два года стал одним из лидеров индустрии. В апреле 2026 года DeepSeek выпустил V4 – поколение моделей, которое конкурирует с GPT-5.4 и Claude Opus 4.6 по качеству, но стоит в 10–50 раз дешевле.

Тест на распознавание ИИ 2025: 77% точность у 140 участников + пройдите сами
7 мин

Тест на распознавание ИИ 2025: 77% точность у 140 участников + пройдите сами

Мы в mysummit.school запустили эксперимент: создали тест из 11 пар текстов, где нужно определить, какой написан человеком, а какой – нейросетью. С июня по декабрь 140 человек прошли его до конца. Результаты оказались неожиданными – и для нас, и для участников.