Meta Muse Spark – первая закрытая модель Meta с 2023 года

10 мин чтения
Stanislav Belyaev
Stanislav Belyaev Engineering Leader в Microsoft
Meta Muse Spark – первая закрытая модель Meta с 2023 года

В этой серии до сегодняшнего дня не было ни одной части про Meta. Пока главной новостью оставалась Llama 4, такое молчание было оправдано: модель вышла спорной, и рассказывать менеджеру о ней как о рабочем инструменте было нечего.

9 июля 2026 года Meta (признана в России экстремистской организацией и запрещена) выпустила Muse Spark 1.1 и в тот же день открыла публичный доступ к Meta Model API. Анонс вышел в блоге компании. Само семейство Muse, которое заменяет Llama, началось тремя месяцами раньше: 8 апреля вышла версия 1.0, и текущая модель собрана на её основе. На сентябрьском снимке LMArena muse-spark-1.2 в режиме xHigh занимает пятое место в текстовом рейтинге, muse-spark-1.1 – десятое, а в рейтинге по изображениям muse-spark – шестое. Тот, кто сравнивает инструменты по таблицам лидеров, встретит это имя. В серии ответа на него до сих пор не было.

Баллы здесь – третья по важности новость. Первая – лицензия: за девять месяцев Meta сменила руководство AI-направления, пересобрала стек и вернулась с закрытыми весами. Вторая – какого рода модель получилась: 1.1 ведёт в задачах на вызов инструментов и заметно отстаёт в написании кода.

Что случилось с Llama

Llama 4 вышла со смешанными отзывами, а вокруг запуска разгорелся скандал: Meta признала, что под один из бенчмарков готовилась отдельная конфигурация модели. Признание стоило компании доверия ровно в той аудитории, которая читает таблицы с баллами внимательнее всех остальных.

Летом 2025 года Цукерберг перестроил всё, что касалось ИИ. Должность Chief AI Officer – руководителя ИИ-направления – получил Александр Ван (Alexandr Wang), 29 лет, сооснователь Scale AI; вокруг него собрали Meta Superintelligence Labs. Ван описывает сделанное так: «Девять месяцев назад мы пересобрали наш AI-стек с нуля. Новая инфраструктура, новая архитектура, новые конвейеры данных… Это первый шаг».

Первый шаг рынок увидел 8 апреля 2026 года, когда вышла Muse Spark 1.0 – первое семейство моделей вместо Llama и первое решение нового руководства, которое видно снаружи. Второй шаг – июльская 1.1 и открытый в тот же день API.

Закрытые веса

Модель распространяется только через API, веса не выложены. С июля 2023 года, когда вышла Llama 2, Meta не выпускала закрытую модель верхнего уровня. Три года компания объясняла рынку, что открытые веса – правильная стратегия, и строила на этом свои аргументы против Anthropic и OpenAI.

Для 1.1 это означает ровно то же, что и для 1.0. Локально модель не развернуть, дообучить её на своих данных нельзя, всё переданное ей уходит на серверы Meta.

Внутри Meta продукты уже переведены на новую модель: Muse Spark заменила Llama 4 в умных очках. Деталь заметная. Очки – это устройство, где задержка ответа и расход токенов видны пользователю напрямую, и туда не ставят модель, в которой не уверены.

Разделение на открытых и закрытых сломалось

Серия весь год пользовалась простым разделением: американские лаборатории продают закрытые модели, китайские раздают веса. В 2026 году оно перестало работать, причём с двух сторон сразу.

Meta сделала свои веса закрытыми. Z.ai в том же сезоне выпустила GLM-5.3-Flash под MIT – без порога по выручке и без ограничений на область применения. Alibaba выложила Qwen3.8-27B под Apache 2.0: модель понимает изображения и запускается на одной потребительской видеокарте.

Сбер выпустил GigaChat 3.5 Ultra – 432 млрд параметров, тоже MIT.

Открытые веса теперь выпускают китайские и российские лаборатории. Meta – та компания, которая просит доверять её API.

Модель изнутри

Meta позиционирует 1.1 против GPT-5.5, Claude Opus 4.8 и Gemini 3.1 Pro. Контекст у модели на 1 млн токенов, и управление им активное: часть истории модель сама сжимает и отбрасывает, чтобы длинный диалог не упирался в предел.

На вход она принимает изображения, видео, PDF и аудио. По составу входных данных это шире, чем у GPT-6 Astra и Grok 4.6: обе работают только с изображениями.

Конструктивная особенность 1.1 – роль ведущего агента. Модель получает запрос, собирает под него контекст, составляет план и распределяет исполнение между параллельными субагентами, а ответ собирает из их результатов. В приложении Meta AI и на meta.ai для этого есть режим Thinking: на задачах, которые модель считает трудными, она думает дольше.

Практический смысл такого устройства проще всего увидеть на задаче, которую менеджер действительно ставит: «вот три коммерческих предложения и наш шаблон договора, найди расхождения в сроках, штрафах и порядке приёмки». Один агент обрабатывает весь набор сразу и к третьему документу начинает путать условия. Ведущий агент разбирает запрос на части, отдаёт каждую своему субагенту и собирает ответ из кусков.

Устройство выросло из первой версии. Muse Spark 1.0 собрали сразу как мультимодальную: текст и изображения обрабатывает одна архитектура, отдельный кодировщик изображений к текстовой модели не прикручивали. Режимов рассуждения там было три. Instant отвечал на простые запросы сразу, Thinking включался на трудных задачах, а Contemplating раскладывал один запрос на части и запускал параллельные субагенты – отсюда и ведущий агент в 1.1. На этапе обучения с подкреплением Meta применяла «сжатие мыслей»: модель решает сложные задачи меньшим числом токенов рассуждения. Нужного уровня рассуждений 1.0, по данным Meta, достигала на порядок меньшим объёмом вычислений, чем Llama 4 Maverick. Оба числа – про вычисления и про сжатие – дал производитель, независимой проверки у нас нет.

Сколько токенов уходит на задачу

Artificial Analysis на своём наборе задач (Intelligence Index v4.0) насчитала Muse Spark 1.0 58 млн токенов. Модель Anthropic на том же наборе потратила 157 млн, GPT-5.4 от OpenAI – 120 млн. Примерно треть расхода при сопоставимой работе. Эти токены потом оказываются в счёте, и именно они чаще всего пропадают из сравнительных таблиц.

Ограничений два. Задачи в наборе Artificial Analysis типовые; на ваших длинных документах и в диалоге с уточнениями расход был бы другим. И число относится к 1.0: для 1.1 Meta расход не публиковала, а ведущий агент с параллельными субагентами делает больше работы, чем один проход по запросу, и токенов тратит больше.

Что показывают независимые рейтинги

В наш бенчмарк Muse Spark пока не входит – ниже данные Meta и независимых площадок; на странице /research/benchmark/ этой модели нет.

На LMArena, где люди сравнивают ответы вслепую, muse-spark-1.2 (xHigh) держит 1499 ± 10 и пятое место в текстовом рейтинге, muse-spark-1.1 – десятое с 1492 ± 5. Первая строчка там у Claude Fable 5. В рейтинге по изображениям muse-spark занимает шестое место с 1294 ± 9, muse-spark-1.2 xHigh – восьмое с 1292 ± 15. Третье место там у qwen3.8-max.

Разрыв между соседними строчками в обоих рейтингах меньше ширины доверительного интервала у каждой из них. Позиции с первой по девятую – статистически ничья, и любой текст, который объявляет по этим таблицам лучшую модель, видит в них больше, чем там есть. Мы разбирали это в статье «Бенчмарки ИИ теряют смысл», и Muse Spark – свежий повод вспомнить разбор: модель попадает в топ-десять обоих рейтингов, оставаясь внутри общей неразличимой группы.

Artificial Analysis в Intelligence Index v4.0 даёт Muse Spark 1.0 52 балла в общем зачёте. Формально это выше 51 балла у Grok 4.6, но сравнивать эти две цифры нельзя: площадка публикует индекс версиями и меняет шкалу между ними. Число «60» из апрельского анонса и число «49» из живой сентябрьской таблицы лежат на разных шкалах. Внутри одного снимка картина расходится по типам задач: на CharXiv Reasoning, где модель рассуждает над научными графиками, у 1.0 86,4, а на HealthBench Hard – 42,8, заметно выше конкурентов.

Слабые места 1.0 Meta опубликовала сама. ARC-AGI-2, проверка на абстрактное рассуждение, – 42,5 при результатах конкурентов выше 76. Программирование – 77,4, тогда как, по данным Meta, Claude и Gemini на этом наборе берут выше 80.

В чём модель первая, а в чём отстаёт

Три бенчмарка из июльского анонса описывают 1.1 точнее, чем место в общем рейтинге. MCP Atlas, проверка на масштабный вызов инструментов, – 88,1, и это первое место. JobBench, профессиональные задачи с инструментами, – 54,7, тоже первое. DeepSWE 1.1, длинный горизонт в написании кода, – 53,3 против 67,0 у GPT-5.5.

Все три числа опубликовала Meta, независимой проверки у них нет. Складываются они при этом в одну картину, и она совпадает с профилем 1.0: документы и графики модель брала сильно, программирование – нет.

Muse Spark – модель для оркестрации инструментов. Собрать контекст из нескольких систем, составить план, раздать исполнение субагентам и свести результаты – здесь она впереди всех, кого измеряли. Написать и переписать код на длинной дистанции – здесь отставание от GPT-5.5 больше тринадцати пунктов, и настройкой промпта такой разрыв не закрывается.

Куда такую модель ставить

Из этих данных складывается конкретная рекомендация. Если задача звучит как «собери данные из трёх систем, сверь с нашим шаблоном и покажи расхождения», модель стоит рассматривать. Просьба «напиши миграцию» – это уже к Claude или Gemini.

Как это ложится на остальные модели – в сводной части обзора GenAI-инструментов 2026.

Рекомендация короткая: оркестрация инструментов – да, код – нет. На практике всё решает формулировка. Ведущий агент разложит запрос на части, но какие именно части ему нужны, решаете вы. Разница между «ответ похож на правду» и «ответ можно положить в отчёт» – это навык постановки задачи для AI.

Девять рабочих задач менеджера – от разбора чужого отчёта до письма подрядчику – решаются с AI в одном бесплатном модуле. Регистрация не нужна.

Доступ сразу после регистрации

Начать обучение

Доступ и цена

Потребительский доступ бесплатный: приложение Meta AI и сайт meta.ai. Разработческий – через Meta Model API, который открылся в публичном превью 9 июля 2026 года, в один день с релизом 1.1, и только для разработчиков из США. API совместим с OpenAI, так что чужой код, написанный под ChatGPT, переносится заменой адреса и ключа. Тарифы объявлены: $1,25 за миллион входных токенов и $4,25 за миллион выходных, на старте дают $20 бесплатного кредита. Первыми партнёрами Meta называет Replit, Cline, Box и OpenClaw Foundation.

Читателю из России эти цифры не помогут. Решение Тверского суда Москвы от марта 2022 года касается всей компании: Facebook и Instagram заблокированы, сервисы Meta из России официально не работают. Отдельного исключения для Muse Spark не появилось – модель доступна там же, где доступен Meta AI.

Что это означает для компании. Доступ к API получают через американское юридическое лицо и американскую карту. Передавать такому вендору рабочие данные запрещает большинство корпоративных политик независимо от того, насколько хороша модель. Юристов стоит спросить напрямую, и ответ, скорее всего, окажется отрицательным.

Обещание открытых весов

Ван говорит, что открытые веса одной из версий Muse Spark 1.2 появятся «скоро». Разработчики реагируют скептически, и у скепсиса есть формальные основания.

Формулировка «одной из версий» оставляет Meta свободу выпустить усечённый вариант. У предыдущих моделей Llama была собственная лицензия с порогом в 700 млн активных пользователей в месяц, то есть «открытые веса» у Meta уже однажды означали «открытые с оговорками». И обещание дано руководством, которое до этого объясняло, почему открытый релиз Llama 4 задерживается.

Если веса всё-таки выложат, расчёт поменяется: своя инфраструктура снимает и вопрос оплаты, и вопрос передачи данных вендору. Пока этого не произошло, Muse Spark участвует в архитектуре только как чужой API, которого из России нет.

Баллы есть, весов нет

Meta потратила девять месяцев, чтобы вернуться в первую пятёрку рейтинга, где первые девять мест статистически неразличимы. За те же месяцы Z.ai, Alibaba и Сбер выложили веса под MIT и Apache 2.0, без порога по выручке.

Компания, которая три года доказывала рынку, что открытые веса – единственная честная стратегия, вернулась с закрытыми. Вопрос, который Muse Spark оставляет открытым: открытые веса были для Meta стратегией или способом закрыть отставание в качестве. Ответ станет известен, когда наступит «скоро».

Инструмент есть. Теперь – навык

Фундамент

От эксперимента к системе

Фундамент программы: промпт-инжиниринг, критическое мышление и границы доверия к ИИ – 4 главы, 23 урока.

От pre-mortem до антикризисного плана
Переиспользуемые промпт-шаблоны
Сквозной кейс на реальном проекте
~300 часов экономии в год
Stanislav Belyaev

Stanislav Belyaev

Engineering Leader в Microsoft

18 лет в управлении инженерными командами. Основатель mysummit.school. 700+ выпускников в Яндекс Практикуме и Стратоплане.