Дайджест #19: 19 новых моделей в бенчмарке, счёт за ИИ стал переменным, куда уходит сэкономленный день

#19
12 мин чтения

Девятнадцать новых моделей в бенчмарке: модель без VPN дошла до верхней группы. Счёт за ИИ перестал быть фиксированным. Куда девается сэкономленный день.

Мы сильно обновили бенчмарк: девятнадцать новых моделей за две недели и стоимость прогона, посчитанная теперь для всех сорока семи. Впервые модель, доступную из России без VPN, видно в верхней группе рейтинга. Дальше в выпуске – счёт за ИИ окончательно перестал быть фиксированным, исследование на десяти тысячах сотрудников объясняет, куда девается сэкономленный день из прошлого выпуска, и неприятные новости про то, что агенты делают с вашим кодом без спроса.

Девятнадцать новых моделей за две недели, и одна из них меняет расклад

Модель без VPN впервые дошла до верхней группы рейтинга

С 8 по 18 июля мы прогнали две волны бенчмарка подряд и добавили девятнадцать моделей: восемь категорий менеджерских задач, оценка двумя независимыми моделями-судьями. Рейтинг вырос с 29 моделей до 47, то есть больше чем в полтора раза за две недели.

Ускорился при этом сам рынок. Artificial Analysis за те же дни насчитала четыре фронтирных запуска за восемь дней, после которых уже шесть лабораторий держат модель выше 50 баллов по их индексу интеллекта. Дуополия OpenAI и Anthropic, о которой писали весь прошлый год, кончилась за неделю с небольшим.

Верхняя группа выглядит так: GPT-5.6 Sol – 9,02 балла, Kimi K3 – 8,95, GPT-5.6 Terra – 8,94, Claude Opus 4.6 – 8,77, Claude Fable 5 – 8,76. Разброс внутри пятёрки – 0,26 балла, и это меньше, чем разброс оценок между нашими судьями. Поэтому мы не говорим «модель X на третьем месте», а показываем диапазон: все пятеро сидят в одной группе, различия между ними статистически неразличимы.

Верхняя группа бенчмарка: GPT-5.6 Sol 9,02, Kimi K3 8,95, GPT-5.6 Terra 8,94, Claude Opus 4.6 8,77, Claude Fable 5 8,76

Интересна тут не верхушка, а вторая строчка. Kimi K3 работает из России напрямую, без VPN и без посредников. В прошлом выпуске мы писали, что лучшая доступная без VPN модель – MiMo v2.5 Pro с 8,37 балла: хороший результат, но до верхней группы оставалась заметная дистанция. Теперь этой дистанции нет.

Лучшие модели без VPN: Kimi K3 8,95, MiniMax M3 8,39, MiMo v2.5 Pro 8,37, Kimi K2.6 8,27, Kimi K2.7 Code 8,05

Для меня это самая практичная новость за две недели. Довод «чтобы работать на приличной модели, нужен VPN и зарубежная карта» держался года полтора и определял, что именно можно предложить распределённой команде. Он больше не работает: модель верхней группы открывается из браузера так же, как любая другая.

Причём дело не в одной модели. Из девятнадцати новичков восемь работают из России напрямую, и теперь таких в рейтинге 22 из 47 – почти половина. В их числе впервые появились российские: GigaChat 3.5 Ultra от Сбера с 6,87 балла и Alice AI от Яндекса с 6,30, а DeepSeek V4 Flash доступен через Yandex Cloud и набирает 7,30. До верхней группы им далеко, но расстояние теперь измерено и его видно в цифрах.

С GigaChat стоит задержаться, потому что история поучительная. Прогресс у Сбера настоящий: майская версия стояла на последнем месте рейтинга с 4,20 балла, июльская набрала 6,87 – самый резкий скачок между волнами, который мы видели у одного вендора. А дальше начинается неожиданное. Хуже всего модель отвечает про региональную специфику: российское и казахстанское право, налоги, локальную регуляторику. Средний балл там 5,33 из 10, и в четырёх сценариях из десяти судья пометил ответ как галлюцинацию – не тот закон в основании проверки, ставка казахстанского соцналога с ошибкой почти вдвое, Израиль по ошибке в списке недружественных стран.

Самое любопытное – китайские модели, доступные отсюда так же без VPN, знают российское право лучше: DeepSeek V4 Pro и Qwen 3.7 Max держатся в этой категории в середине таблицы, GigaChat 3.5 Ultra – на 42-м месте из 47. Домашнее поле пока не даёт преимущества. Вывод отсюда практичный: для черновика письма, структурирования данных и проработки рисков модель вполне годится, а там, где ошибка стоит денег или иска, ответ нужно проверять руками.

Заодно закрылся пробел из прошлого выпуска. Тогда мы разбирали блокировку и возвращение Fable 5 и честно писали, что оценить модель не можем – её просто не было. Теперь Fable 5 в рейтинге с 8,76 балла, в той же верхней группе.

Вторая правка этих двух недель – мы досчитали стоимость одного прогона теста по всем сорока семи моделям, и она объясняет больше, чем сам балл. Внутри верхней группы цена различается втрое: GPT-5.6 Terra обходится в $0,098 за тест при 8,94 балла, Fable 5 – в $0,309 при 8,76. За соседнюю строчку рейтинга вполне можно платить втрое дороже.

Интерактивный дашбоард по стоимости и способностям моделей – на странице бенчмарка. Выше и левее – эффективнее и дешевле.

Дашбоард бенчмарка: качество моделей по вертикали, стоимость за тест по горизонтали в логарифмической шкале. В правом верхнем углу GPT-5.6 Sol и Terra, левее и дешевле – MiniMax M3 и DeepSeek V4, цвет точки обозначает страну происхождения

Ниже по списку разрыв становится совсем неприличным. GPT-5.6 Luna даёт 8,59 балла за $0,029 – это вдесятеро дешевле Fable при разнице в 0,17 балла. MiniMax M3 набирает 8,39 за один цент, и тоже работает из России напрямую. Для рутины, которой в работе большинство, эта разница важнее места в рейтинге.

Оговорка, без которой цифрами пользоваться нельзя. Волны прогоняются в разное время и разными версиями моделей-судей, поэтому разница в десятые доли между волнами отражает шум методики. Сравнивать имеет смысл группы, а не соседние строчки рейтинга.

Открыть бенчмарк: 47 моделей, баллы, цена прогона и доступ из России

Счёт за ИИ перестал быть фиксированным

Эпоха безлимитных подписок закончилась тихо, без объявления

С 1 июня GitHub Copilot перешёл на оплату по потреблению, и счета команд выросли в три-десять раз за один месяц. Anthropic перевела корпоративных клиентов на потокенную оплату. Строка бюджета, которая два года была предсказуемой, стала переменной.

Масштаб хорошо виден на одном примере: Uber израсходовал годовой бюджет на ИИ-разработку за четыре месяца и ввёл лимит в $1 500 на разработчика в месяц.

Хорошая новость в том, что рычаг управления этим расходом простой. Разброс цен между моделями десятикратный: Opus стоит $5 за миллион входных и $25 за миллион выходных токенов, MiniMax M3 – $0,60 и $2,40. Если рутину не гонять через флагман, стоимость одной задачи падает с $15 до $1,70.

Стоимость одной задачи: $15 при работе через одну дорогую модель против $1,70 с маршрутизацией по моделям

Ещё аккуратнее работает схема, где дорогая модель составляет план, а дешёвая его выполняет: 59% экономии при одинаковом результате на всех пятнадцати приёмочных тестах. Мы проверяли похожую логику на своих данных, когда считали окупаемость оркестрации: выигрыш в качестве там оказался в пределах шума, а платить пришлось в 2,27 раза больше и ждать примерно всемеро дольше. Оркестрация окупается не везде – это инструмент под конкретный класс задач.

Честно про источник: большая часть цифр выше – из блога Kilo, а Kilo продаёт инструмент управления расходами и заинтересован в драматичной картине. Независимо подтверждается пока только порядок величин. Но то, что 90% команд не могут объяснить финдиректору, куда уходят деньги на ИИ, мы слышим третий выпуск подряд, и с этим ничего не сделалось с апреля.

Независимые подтверждения за эти дни всё-таки появились, и они интереснее исходных цифр. Stratechery разбирает экономику ИИ-продуктов и упирается в ту же механику: инференс – это переменные затраты, COGS, тогда как в классическом софте основные деньги уходили в фиксированный R&D и дальше копия стоила ноль. Строка бюджета стала переменной не потому, что вендоры сговорились поменять тарифы, а потому что у продукта поменялась себестоимость.

Оттуда же следует и способ считать. Emerging Trajectories посчитала не цену токенов, а стоимость одной выполненной задачи: Fable 5 обходится почти втрое дороже конкурентов. Это ровно тот же трёхкратный разброс, который мы независимо видим внутри верхней группы нашего бенчмарка – две разные методики сошлись на одном числе.

Метрика, которую стоит забрать: не цена за миллион токенов, а стоимость одной решённой задачи. Более дорогая модель, которая справляется с первого раза, дешевле дешёвой, которую пришлось переспрашивать шесть раз.

Сэкономленный день: кажется, мы нашли, куда он девается

Переписка выросла вдвое, непрерывная работа – сократилась

В прошлом выпуске был отчёт BCG с открытым вопросом: 42% сотрудников экономят с ИИ не меньше рабочего дня в неделю, а 66% не получают никаких указаний, на что этот день потратить. Куда он в итоге уходит, отчёт не отвечал.

Ответ дала ActivTrak вместе с UC Berkeley Haas: цифровая телеметрия более десяти тысяч сотрудников до и после внедрения ИИ. Время на переписку и почту выросло более чем вдвое, работа в бизнес-приложениях – на 94%, а непрерывное фокус-время сократилось на 9%.

После внедрения ИИ переписка и почта выросли на 100%, работа в приложениях на 94%, фокус-время сократилось на 9%

Механизм, который описывают в Berkeley, узнаваемый: получив инструмент, люди забирают обратно задачи, которые раньше кому-то отдавали, и начинают вести несколько потоков сразу. День не становится свободнее – он становится плотнее. The Atlantic называет это состояние «AI brain fry», и определение довольно точное.

Пока готовился выпуск, вышла и прямая оценка этой плотности. Work AI Index 2026: ИИ на работе пользуются 87% сотрудников, 75% говорят, что стали продуктивнее, а автоматизация экономит им около 11 часов в неделю. При этом лишь 13% отмечают, что их компания стала заметно лучше работать. Разрыв авторы сводят к одной статье расходов – 6,4 часа в неделю уходит на «ботситтинг»: подкормить модель контекстом, проверить вывод, вычистить уверенные, но неверные ответы. Это больше, чем те же люди тратят на собственно работу с ИИ.

Вторая цифра оттуда разошлась по заголовкам, и с ней стоит разобраться. Пересказывают её так: 69% сотрудников отправляют дальше работу, которую не проверили. В отчёте 69% – это композит: доля тех, кто признался хотя бы в одном из семи поведений. О качестве работы говорит только один пункт из семи. Остальные – про обход правил ИТ-отдела и про то, как сотрудник себя подаёт. Воспользоваться чат-ботом, который не одобрил ИТ-отдел, или не признаться руководителю, насколько помог ИИ, – уже попадание в эти 69%.

Композит из семи пунктов даёт 69%, тогда как отдельные поведения внутри него: не могут объяснить – 41%, не проверили – 39%, скрывают использование ИИ – 32%, свалили свою ошибку на ИИ – 28%, знали что неверно – 12%

Цифра, которая означает ровно то, что от неё ждут, скромнее: 41% иногда отдают работу, которую не смогут объяснить, если спросят, и 39% отправляют, не проверив до конца. Это по-прежнему много, и вывод не меняется: сэкономленный день не просто уплотняется – часть его возвращается в виде отложенного риска, и всплывёт он у кого-то ниже по процессу.

Что с этим делать, показывает Microsoft. В их программе EngThrive выяснилось, что 52% рабочих дней разработчиков попадают в категорию «плохих», а у людей с тремя такими днями в неделю текучесть втрое выше и кода они пишут на 20% меньше. Вмешательство было скучным: защитили фокус-время, добавив 2,1 часа непрерывной работы в неделю. Скорость прохождения PR выросла на 13% за восемь недель – по эффекту это сопоставимо с наймом примерно 350 разработчиков.

Отсюда практический вывод для тех, у кого команда уже экономит часы. Экономию нужно распределить заранее и вслух – иначе она утекает в коммуникацию сама собой, так система ведёт себя по умолчанию, и дисциплина отдельных людей тут ни при чём. Мерить при этом стоит длину непрерывных отрезков работы: по данным JetBrains, каждый пятый из 24 534 опрошенных разработчиков экономит с ИИ больше восьми часов в неделю, но вопрос всегда в том, во что эти часы собираются.

Агенты: 30% ошибок и 5,1 ГБ вашего кода на чужом сервере

Точность выросла резко, надёжность – почти нет

Группа Арвинда Нараянана в Принстоне сравнила два года прогресса агентов: точность на задачах выросла заметно, а надёжность – всего на 5–10%. В переводе на рабочий язык это означает примерно 30-процентную вероятность ошибки на произвольной задаче, отсутствие самопроверки и неспособность восстановиться после сбоя. Агент не замечает, что уже свернул не туда.

Это неплохо объясняет, почему полностью автономные агенты в продакшене есть только у 7% компаний по данным Bain и Gartner, причём тормозят внедрение данные и интеграции, а не качество моделей.

Июльская работа на arXiv добавляет к этому третью причину и оценивает её: в 60% случаев корпоративное недоверие к ИИ-решениям упирается именно в галлюцинации. Рецепт авторов практичный – не ждать безошибочных моделей, а достраивать вокруг них проверку: кросс-чек с исходными документами, отдельная модель-судья поверх ответа, автоматическая сверка цитат в отчётах. Ошибку ловит система, а не внимательность конкретного человека в конце дня.

Отдельная история – про доверие к инструментам. Независимый аудит CLI-инструмента Grok Build показал, что тот молча выгружал локальные репозитории на серверы вендора: на репозитории в 12 ГБ наружу ушло 5,1 ГБ, включая незашифрованные файлы .env с ключами и паролями. Фоновым процессом, в обход настроек приватности, без единого предупреждения.

CLI Grok Build выгрузил 5,1 ГБ из репозитория размером 12 ГБ, включая незашифрованные .env с ключами

Насколько это распространено, до сих пор меряли плохо. В прошлый раз мы ссылались на оценку Okta про 97% компаний без формального контроля доступа и честно оговаривались, что это страница лид-магнита с нераскрытой методикой. Теперь есть основание получше: июльская работа на arXiv – интервью с 22 разработчиками и ИТ-архитекторами о том, как они на самом деле выбирают ИИ-компоненты. Безопасность в этих решениях не всплывает почти никогда: смотрят на качество, скорость и цену, а вопрос «куда уходят наши данные» в чек-лист просто не входит. Выборка маленькая, зато за ней живые разговоры о реальных решениях, а не самооценка в опроснике.

Два действия, которые закрывают большую часть риска и не требуют бюджета. Первое – письменно зафиксировать, каким инструментам разрешено касаться каких репозиториев и данных; сейчас это решение принимает каждый разработчик самостоятельно и молча. Второе – проверять результат работы агента через независимый канал: в прошлом выпуске был случай, когда агент сфабриковал видео-доказательство несуществующего бага, и материалы, которые агент произвёл сам, доказательством считать нельзя.

Идеи и ссылки

Самый полезный приём выпуска: 90% руководителей бросают сценарий использования ИИ после первой неудачи, хотя за полгода модели становятся точнее примерно в два с половиной раза. Задача, которая в январе решалась на 40%, к июню может решаться на 90. Заведите список «не получилось» с датами и возвращайтесь к нему раз в квартал – это буквально всё, что требуется.

Продолжение сюжета из прошлого выпуска про менеджеров, которые используют ИИ для чего угодно, кроме управления. Anthropic опубликовала разбивку задач в Claude Cowork: больше 90% – не программирование, а бизнес-операции и контент. Сверка бюджетов – 25%, анализ договоров – 20%, подготовка презентаций – 15%. Похоже, под управленческие задачи наконец появилась поверхность продукта, и спрос сразу стал виден.

Granola снимает заметки со встреч без бота, который подсаживается в звонок: пишет системный звук на Zoom, Meet и Teams, работает и на офлайн-встречах, а из фраз вроде «Таня обещала помочь со структурой документа к пятнице» собирает задачи с владельцем и сроком. Ищется потом запросом «что я обещал на этой неделе».

Отрезвляющие данные по качеству кода: GitClear и GitKraken разобрали 623 миллиона реальных изменений кода за 2023–2026 годы. Дублирование выросло на 81%, повторное использование упало на 70%, рефакторинг легаси – на 74%. Это самая крепкая методика из всего, что попадалось за две недели: объективные коммиты, а не опрос. Если ваша команда меряет продуктивность объёмом произведённого кода, эти цифры – аргумент сменить метрику.

К разговору из прошлого выпуска о том, что 7 из 10 эффектов ИИ – это экономия, а не выручка. Главный экономист Apollo Торстен Слок замечает, что рост производительности пока виден у технологических компаний и почти не виден у остальной части Fortune 500: регуляторика, защита данных и интеграция в процессы съедают эффект. Рынок, по его мнению, заложил в цены доходность, которая придёт позже обещанного.

Тревожный сигнал из университета Торонто: 82% студентов-программистов сообщают о высоком стрессе из-за ИИ, а 52% уходят от классической разработки, считая её заменяемой. Через три-пять лет это обещает дефицит сильных инженеров. Любопытная деталь оттуда же: лучшие студенты отказываются сдавать код, который не могут объяснить построчно, и исследователи предлагают сделать вопрос «объясните, что здесь происходит» стандартом код-ревью. Приём переносится на любую команду.

С 20 июля Anthropic меняет условия доступа к Fable 5: модель остаётся в Max и Team Premium с половиной стандартных лимитов, а на Pro и Team Standard переходит на кредитную схему. Причина – нехватка вычислительных мощностей, продлевать доступ приходилось еженедельно. Если у вас на Fable завязан рабочий процесс, это стоит проверить до конца недели.

Из нашего за две недели: разбор оркестрации агентов – чем делегирование отличается от чата, на примере сравнения двенадцати поставщиков с ограничением бюджета в $5. И про агента, который спорит с вашим решением, пока не проиграет – способ проверить выбор из двух подрядчиков до того, как он станет ошибкой.

Кстати, если после блока про плотность дня захочется посмотреть, где ИИ реально снимает рутину именно у вас, – в открытом модуле есть девять практических задач менеджера на реальных примерах.