Бенчмарки LLM

OpenRouter Fusion vs Claude: окупается ли оркестрация ИИ

9 мин чтения

Первое место в нашем бенчмарке 45 моделей ИИ по управленческим задачам (v2-методология) занял не GPT, не Gemini и не Claude. Его занял оркестратор – система, которая отправляет запрос сразу трём моделям, а затем синтезирует ответ из их выводов.

Звучит как очевидное решение: если одна модель хороша, три модели плюс независимый арбитр должны быть лучше. Результаты бенчмарка это подтверждают. Но за первое место пришлось заплатить – в 2,27 раза больше денег и почти в семь раз больше времени ожидания, чем у Fable 5, занявшего третье место.

Читать полностью
OpenRouter Fusion vs Claude: окупается ли оркестрация ИИ
40 кейсов GigaChat: проверяем данные Сбера по бенчмарку
20 мин

40 кейсов GigaChat: проверяем данные Сбера по бенчмарку

Сбер выпустил рекламный спецпроект: сорок бизнес-кейсов компаний, которые внедрили GigaChat и рассказывают об эффектах. EdTech, MedTech, HRTech, кибербезопасность, PropTech. Красивые карточки, конкретные цифры, реальные стартапы.

Рекламный проект Сбера

На изображении: промо-слайд «На шаг впереди» от акселератора Sber500×ГигаЧат – 40 стартапов из 9 индустрий. Заявленные эффекты: ускорение бизнес-процессов до x16, снижение затрат до 90%, автоматизация задач до 95%, рост выручки до 30%.

У нас есть бенчмарк: 29 моделей, 4 308 независимых оценок на управленческих задачах. GigaChat в нём занимает последнее, 29-е место по итогам второй волны тестирования. Это создаёт интересную ситуацию.

Не потому что Сбер лжёт. Кейсы реальные, стартапы существуют, автоматизация работает. Вопрос в другом: была ли это оптимальная модель для задач, которые они решали?

Бенчмарки ИИ теряют смысл – как тогда выбирать модель
7 мин

Бенчмарки ИИ теряют смысл – как тогда выбирать модель

В марте мы разбирали, как устроены бенчмарки LLM – GPQA Diamond, SWE-bench, Chatbot Arena. В апреле протестировали 53 модели и обнаружили, что разница в качестве между топовыми моделями – десятые доли балла, а в цене – три порядка величины.

Теперь – следующий вопрос. Что если сами бенчмарки перестают работать?

Как оценивают качество нейросетей в 2026: бенчмарки LLM для менеджера
7 мин

Как оценивают качество нейросетей в 2026: бенчмарки LLM для менеджера

Представьте, что вы выбираете служебный автомобиль для команды. Один дилер говорит: «Наша машина самая быстрая». Другой: «У нас лучший расход топлива». Третий: «Мы лидируем по безопасности». Все они правы – но каждый меряет своё. Без понимания того, что именно и как измеряется, вы не можете сравнить предложения объективно.