OpenRouter OpenRouter Tier: Grasps instantly Russia access: OpenRouter · VPN

OpenRouter Fusion

Оркестратор из нескольких моделей обошёл Claude за $50 – и это не ошибка рейтинга
OpenRouter OpenRouter Fusion
score 9.0 OpenRouter · VPN

OpenRouter Fusion – оркестратор: маршрутизирует запрос между несколькими моделями и агрегирует ответы, показывая, где они согласны, а где расходятся. Это даёт аналитику уровня старшего консультанта. Claude Opus 4.6 уступает 0.26 балла и стоит $25/1М токенов, Fable 5 – $50. Стоимость Fusion динамическая – зависит от моделей, которые он выбирает для запроса.

Overall rank
on par with GPT-5.6 Sol, Kimi K3
Overall score
9.0/10
Cost profile
4–5×
of a single completion
Spend per answer
$1–3
total across panel models (our run)

This is a router, not a model

OpenRouter Fusion is not a single model but an orchestration system: it fans one prompt out to several models at once, compares their answers, and synthesizes a result. That is why we excluded it from the ranking – comparing a panel of eight models with web access against single models is not fair. Its scores are kept here for reference.

1. Panel

Up to eight models answer the prompt simultaneously – each with web-search access.

2. Judge

A separate judge model compares all answers: what agreed, where they diverged, what was missed.

3. Synthesis

A final model composes an improved answer based on the judge's analysis.

What one answer costs under the hood

In our run, one Fusion request fanned out into calls to Claude Opus 4.8, GPT-5.5 and Gemini 3.1 Pro – each called one to eight times, with web-search tool calls. A single answer consumed from 100,000 to 800,000+ tokens and 4–5× the cost of a normal completion.

Why it is outside the ranking

Fusion's panel has web-search access that single models in the test did not – a structural advantage on facts and information search. It is also an ensemble, not a model: non-deterministic and several times more expensive. Its high score reflects the orchestra, not the quality of one model.

How it works: a real example

The same question posed to Fusion in our test. Below are the three panel models' answers, the judge's analysis, and the final synthesis. This is an actual transcript from the run, not an illustration (the test prompt and final answer are in Russian).

Manager's prompt

Коллега только что заявил: "Удаленная работа снижает продуктивность на 15-20% согласно недавним исследованиям". Это правда? Пожалуйста: 1. Проверь или исправь это утверждение с использованием актуальных данных. 2. Укажи источник точной информации. 3. Дай контекст (почему это важно, что изменилось в последнее время). 4. Отметь любые нюансы или ограничения этих данных.

Panel answers (individually)
? Claude Opus 16374 chars

I’ll research this claim rigorously, focusing on the specific studies you mentioned to evaluate whether “15-20% productivity reduction” is an accurate characterization of the literature.I have strong material. Let me get the Gibbs et al. IT study and the Emanuel/Harrington/Pallais coding study plus the WFH Research group (Barrero, Bloom, Davis) findings.I have comprehensive material across all the key studies. Let me now synthesize a rigorous evaluation.


Evaluating the claim: “Remote work reduces productivity by 15–20% according to recent studies”

Short verdict: The claim is not accurate as stated. It takes a real number from one specific study of one specific work arrangement and mislabels it as a general finding about “remote work.” The framing collapses four distinctions that the actual literature treats as decisive: fully remote vs. hybrid, **individual vs. …

? GPT 33442 chars

Bottom line

The manager’s statement — “Remote work reduces productivity by 15–20% according to recent studies” — is too broad and therefore misleading.

A more accurate version would be:

Some recent studies of fully remote work in specific, measurable, often lower-collaboration settings find productivity losses in the range of about 8–19% or 18%. But the broader literature is heterogeneous: hybrid work generally shows little or no productivity loss, some older and some well-designed studies find productivity gains, and firm-level outcomes can improve through retention, recruiting, wage, and real-estate savings.

So: 15–20% is a plausible number for certain fully remote settings, not a general estimate for “remote work” as such.


1. What the research actually says

The best-supported distinction is: fully remote ≠ hybrid

The clearest synthesis …

? Gemini Pro 9099 chars

The manager’s claim is partially accurate but functionally misleading. It takes the upper-bound penalty of fully remote work observed in specific, highly measured tasks and incorrectly weaponizes it as a blanket argument against all “remote work.”

If a manager uses this 15–20% figure to ban a 2-day-a-week hybrid schedule for knowledge workers, they are misapplying the economic literature and will likely damage firm profitability and retention.

Here is a rigorous evaluation of what the current economic literature actually says, where the manager’s numbers come from, and the critical distinctions they are missing.


1. Where the “15–20%” Claim Comes From (The Hard Data)

The manager is not hallucinating the 15–20% figure; they are likely citing recent, highly credible economic studies that measure output-per-hour in fully remote, highly regimented jobs. Specifically, …

Judge's analysis: where the models agreed and diverged

Consensus

  • The manager’s claim (‘remote work reduces productivity by 15-20% according to recent studies’) is misleading/inaccurate as stated because it generalizes a narrow finding about fully remote work in specific measurable settings to all remote work.
  • The single most important distinction the claim collapses is fully remote vs. hybrid: fully remote can show ~10-20% productivity penalties in some settings, while structured/hybrid work (2-3 days) shows roughly zero productivity effect.
  • Gibbs, Mengel & Siemroth (2023, Journal of Political Economy Microeconomics) is a primary source of the ‘15-20%’ figure: ~10,000 IT professionals, output per hour fell ~8-19% mainly because hours rose ~30% while output stayed roughly flat, driven by coordination/communication costs.
  • Bloom, Han & Liang (2024, Nature) Trip.com RCT of 1,612 employees found hybrid work (WFH Wed/Fri) had no impact on performance reviews, promotions, or lines of code, and cut quit rates by ~33%.
  • Bloom et al. (2015, QJE) Ctrip call-center RCT found a ~13% performance increase for fully remote workers, …
Final answer the user receives

Проверка утверждения: «Удалённая работа снижает продуктивность на 15–20%»

Краткий вердикт

Утверждение частично верно, но вводит в заблуждение. Оно берёт цифру из узких исследований полностью удалённой работы в специфических, легко измеримых профессиях и ошибочно распространяет её на «удалённую работу вообще». Если ваш коллега использует эту цифру, чтобы, например, запретить гибридный график (2–3 дня из дома) для офисных сотрудников, он неправильно применяет данные — и, скорее всего, навредит и прибыльности компании, и удержанию персонала.


1. Проверка: что говорят данные на самом деле

Цифра 15–20% — не выдумка. Она происходит из реальных и уважаемых экономических исследований, которые измеряли выработку в час у полностью удалённых сотрудников на строго измеримых задачах:

  • Gibbs, Mengel & Siemroth (2023) — 10 000 IT-специалистов, продуктивность (выработка в час) упала на 8–19%. Но ключевой нюанс: выработка на человека почти не изменилась — люди работали примерно на 30% больше часов, чтобы произвести тот же объём. Упала эффективность в час, а не общий результат.
  • Atkin, Schoar & Shinde (2023) — рандомизированный эксперимент с операторами ввода данных в Индии: удалённые оказались на 18% менее продуктивны. Это, вероятно, самый «чистый» источник цифры 18%.
  • Emanuel & Harrington (2024) — колл-центр Fortune 500: удалённые отвечали на 12% меньше звонков в час.

Итог: да, для полностью удалённой работы в колл-центрах, вводе данных и IT есть падение ~10–19%. Но обобщать это на всё — фундаментальная ошибка.


2. Источники точной информации

ИсследованиеЧто нашли
Bloom, Han & Liang (2024), Nature — RCT, 1 612 сотрудников Trip.comГибрид (2 дня из дома): нулевое влияние на оценки, повышения и объём кода; текучесть –33%
Bloom et al. (2015), QJE — эксперимент CtripПолностью удалённые операторы: +13% продуктивности
Gibbs, Mengel & Siemroth (2023), JPE Micro–8–19% выработки в час (полная удалёнка, IT)
Emanuel & Harrington (2024), AEJ: AppliedРазрыв 12% = ~4% эффект удалёнки + ~8% отбор работников
Barrero, Bloom & Davis (WFH Research) — опрос 30 000+Полная удалёнка ≈ –10%; гибрид ≈ 0%; чистый эффект по экономике скорее положительный

3. Контекст: что важно и что изменилось

Ключевые различия, которые утверждение «схлопывает»:

  • Полная удалёнка ≠ гибрид. Это разные явления. Полностью удалённая работа может давать ~10% штраф (наставничество, коммуникация, культура). Но структурированный гибрид (2–3 дня в офисе) даёт эффект от нуля до +1–3% и при этом резко снижает текучесть.

  • Эффект удалёнки vs. эффект отбора. В колл-центре Emanuel & Harrington из 12% разрыва только 4% — реальный эффект самой удалёнки, а остальные 8% — то, что менее продуктивные сотрудники сами выбирали удалённые вакансии. Возврат в офис не решает проблему найма.

  • Индивидуальная продуктивность vs. прибыльность фирмы. Даже при падении выработки на 10% компания часто зарабатывает больше — за счёт экономии на аренде (~10% операционных расходов) и найма в более дешёвых регионах. Как формулирует Николас Блум: «Компании должны заботиться не о продуктивности, а о прибыльности».

Как менялись выводы (2020→2024):

  • 2020–2021: ранние опросы говорили о росте продуктивности — но это были самоотчёты (люди чувствовали себя эффективнее, экономя на дороге).
  • 2022–2024: когда экономисты получили объективные метрики (звонки, коммиты кода), у полной удалёнки проявился штраф ~10–20%; при этом RCT по гибриду показали нейтральный/положительный эффект.

4. Нюансы и ограничения данных

  • Зависимость от типа задач. Штраф велик на рутинных, изолированных задачах (ввод данных). Сложная творческая работа выигрывает от «дней глубокой концентрации» дома, но требует офисных дней для совместных прорывов.
  • Пандемийное искажение. Многие «негативные» исследования измеряли вынужденную полную удалёнку 2020 года (со школами дома, стрессом, неотлаженными процессами). Это худшая база для обобщений.
  • Что именно измеряется. «–20%» у Gibbs — это выработка в час, а не общий объём. Менеджер и сотрудник могут быть оба правы: тот же результат, но за большее число часов.
  • Наставничество и молодёжь. Исследование «Power of Proximity» показало: близость коллег повышает обратную связь на 18% и особенно помогает младшим сотрудникам, тогда как у опытных индивидуальная выработка кода может даже снижаться. Единая цифра этого не отражает.
  • Узость базы. Строгие объективные измерения покрывают лишь несколько секторов (китайский колл-центр, индийский IT/ввод данных, один Fortune 500) — внешняя применимость ограничена.
  • Оговорка по достоверности: ряд очень точных цифр из исследований (например, изменение ожиданий менеджеров с –2,6% до +1,0%) я привожу по вторичным обзорам; при важных решениях стоит свериться с первоисточниками (ссылки в таблице).

Как ответить коллеге

«Цифра 15–20% реальна, но относится к полностью удалённой работе на измеримых задачах (IT, колл-центры, ввод данных), причём значительная часть разрыва — это отбор работников, а не эффект самой удалёнки. Для гибрида (2–3 дня из дома) лучшее доказательство — рандомизированный эксперимент на 1 612 сотрудниках (Nature, 2024): продуктивность не упала, а текучесть снизилась на треть. Так что правильный вопрос не “снижает ли удалёнка продуктивность на 15–20%”, а “какие роли можно делать полностью удалённо, какие — гибридно, и что мы вообще измеряем — выработку, качество, удержание или прибыльность”.»

Profile across 8 categories

0–10 scale. Higher means the model handled those tasks better

chart
Strong at Team Management 9.2/10
Weak at Learning & Development 8.9/10

Similar models

Closest alternatives – by level, availability and price.

Best for
  • + Принятие сложных решений с несколькими вариантами: модель переформатирует ложные дихотомии и выдаёт чёткие критерии выбора – не «либо-либо», а с разбором, почему каждый вариант работает или нет
  • + Юридические вопросы с российской спецификой: точные ссылки на ТК РФ, знание реалий России и Казахстана – судьи зафиксировали это как явное преимущество
  • + Подготовка позиции перед совещанием с руководством: показывает, где эксперты расходятся во мнениях, – вы приходите с пониманием контраргументов, а не только своей точкой зрения
Not for
  • Быстрый ответ прямо на совещании: ответы избыточно длинные из-за сырых промежуточных выводов панели – читать некогда, проще спросить коллегу
  • Финансовые расчёты окупаемости: судьи зафиксировали отсутствие ROI-расчётов в коммуникационных задачах – цифры придётся считать самому
  • Короткие инструкции для команды из 3–4 пунктов: формат синтеза нескольких моделей убивает краткость, из простого чеклиста получится многостраничный разбор
Benchmark task – run and compare
Team Management – 9.21/10

This is a real prompt from our benchmark. Hit "Run" – the model answers right here so you can compare with the competitor.

You
Я собираюсь проводить собеседование с кандидатом на позицию Senior Product Manager. Пожалуйста, проанализируй резюме кандидата и помоги мне подготовиться к интервью. Резюме кандидата (краткое изложение): - 8 лет опыта в продуктовом менеджменте - Работал в двух стартапах (от seed-стадии до Series B) - Руководил командами от 3 до 8 человек - B2B SaaS продукты - Техническое образование (степень по Computer Science, 2 года работы разработчиком) - Достижение: Вырастил продукт от $2M до $15M годового дохода (ARR) за 3 года - Пробел: Нет опыта работы с корпоративными клиентами (весь опыт в сегменте SMB/mid-market) - Дополнительные детали: * Построил команду с нуля (нанял 5 инженеров, 2 дизайнеров, 1 data analyst) * Запустил 3 крупных фичи, каждая привела к росту revenue на 20-30% * Внедрил data-driven подход к приоритизации (работал с аналитикой, A/B тестами) * Опыт работы с cross-functional командами (инженерия, дизайн, маркетинг, продажи) * Одна из компаний обанкротилась (Series A → закрытие за 18 месяцев) Наша компания: - B2B SaaS платформа для управления проектами - 150 сотрудников, Series B ($20M raised) - Клиенты: 60% SMB, 40% mid-market, растем в enterprise сегмент - Ценности команды: data-driven решения, кросс-функциональная коллаборация, customer empathy Пожалуйста, предоставь следующее: 1. Ключевые сильные стороны на основе резюме (топ-5): - С конкретными примерами из опыта кандидата - Почему каждая сильная сторона релевантна для нашей позиции 2. Потенциальные проблемы или пробелы (топ-3): - Что может быть риском для успеха в нашей роли - Какие gaps нужно проверить на интервью 3. 10 интервью вопросов: a) 5 поведенческих вопросов на основе конкретного опыта кандидата: - Используй STAR формат (Situation, Task, Action, Result) - Вопросы должны быть специфичны для его опыта (не общие шаблоны) - Проверяют достижения и подход к работе b) 3 ситуационных вопроса для проверки пробелов/concerns: - Особенно про опыт с enterprise клиентами - Про работу в более крупной организации (150 человек vs стартап) - Про работу с уже существующим продуктом (не с нуля) c) 2 технических продуктовых вопроса соответствующие уровню: - Проверка product sense - Способность работать с техническими командами 4. Follow-up вопросы на вероятные ответы: - Для каждого из 10 вопросов выше - Что спросить, чтобы копнуть глубже - Какие красные флаги искать в ответах 5. Red flags на которые обращать внимание во время интервью: - Поведенческие паттерны - Противоречия в рассказе - Отсутствие конкретики 6. Как оценить культурный fit для нашей команды: - Конкретные вопросы про data-driven подход - Как кандидат демонстрирует customer empathy - Стиль коллаборации с инженерами, дизайнерами - Не абстрактные ценности, а observable behaviors 7. Что спросить про обанкротившийся стартап: - Как тактично поднять эту тему - Какие уроки кандидат должен был извлечь - Красные флаги vs нормальная startup неудача Важно: - Вопросы должны быть специфичными для опыта этого кандидата (не generic) - Дай guidance что считается "хорошим" vs "плохим" ответом для каждого вопроса - Учти, что мы ищем senior hire который может работать автономно - Помни про наш план роста в enterprise сегмент (это критично)
Comparing:
fusion · gpt-5.6-sol

Same model – two results

experiment, 1,700 runs
Typical prompt

Напиши письмо команде о предстоящих сокращениях 3 из 15 позиций. Не вызвать паники, но честно.

7.0 /10
Structured prompt

...Чёткий порядок: факт -> причины -> что решено/не решено -> сроки -> поддержка -> приглашение к разговору. Плюс антипаттерны: чего избегать

8.8 /10 +26%

Structure forces the model to separate 'what's known' from 'what's not decided yet' – key to honest communication.

About this experiment →

Category breakdown

Russia availability

Via OpenRouter

Related articles

A model doesn't replace empathy. But it structures

The difference between 'write a letter' and a structured prompt is 26% quality. The Team Management with AI module has scripts for 1:1s, feedback, conflicts, and terminations.

See the scripts →