? StepFun Tier: Follows clear tasks Russia access: OpenRouter · VPN

Step 3.7 Flash

Тот же балл, что GigaChat – и в 50 раз дешевле. Но есть нюанс.
? Step 3.7 Flash
score 6.9 $0.01 per task OpenRouter · VPN

Step 3.7 Flash набирает столько же, сколько GigaChat 3.5 Ultra (6.87), при этом стоит $0.2 против $10 за миллион токенов. Для рутинных управленческих задач – неплохая арифметика. Только не давайте ей считать деньги: модель регулярно ошибается в цифрах и придумывает законы.

Overall rank
#36–42 of 47
on par with Grok 4.3, GigaChat 3.5 Ultra
Overall score
6.9/10
Cost per task
$0.012
$0.20 / $1.15 · per 1M tokens · ≈ 750 pages
Tested
07.2026
80 scenarios · 2 AI judges

Profile across 8 categories

0–10 scale. Higher means the model handled those tasks better

chart
Strong at Analysis & Decisions 7.7/10
Weak at Regional Awareness 5.4/10

Similar models

Closest alternatives – by level, availability and price.

Price vs level

Where this model sits versus the rest: higher is stronger, further left is cheaper.

Best for
  • + Еженедельный статус-апдейт для директора: модель хорошо структурирует текст и адаптирует под контекст, черновик за минуту
  • + Скрипт сложного разговора с подчинённым – диагностика конфликта и готовые фразы для встречи один-на-один
  • + Пошаговый план проекта с фазами и дедлайнами, когда нужна быстрая рамка, а детали уточните сами
Not for
  • Всё, что касается ТК РФ, договоров и штрафов: модель уверенно называет несуществующие статьи и неверные суммы санкций
  • Финансовые модели и расчёты окупаемости – арифметические ошибки зафиксированы судьями как системная проблема
  • Проверка конкретных фактов и ссылок: источники нередко вымышленные, цифры – приблизительные
Benchmark task – run and compare
Analysis & Decisions – 7.69/10

This is a real prompt from our benchmark. Hit "Run" – the model answers right here so you can compare with the competitor.

You
Я могу инвестировать 80 000 долларов в автоматизацию [процесса: например, "процесс ежемесячной отчетности"]. Что я знаю: - Текущий процесс занимает 3 человека × 2 дня/месяц = 48 часов/месяц - Автоматизация сократит это до 4 часов/месяц (заявление вендора, не проверено) - Внедрение займет 3 месяца и потребует 20% времени одного разработчика - Риск: Процесс может измениться при следующей реорганизации (по слухам, через 6-12 месяцев) - Команда скептически настроена после неудачного проекта автоматизации в прошлом году Чего я не знаю: - Точная экономия времени (заявления вендоров разнятся) - Скрытые затраты на обслуживание - Влияние на качество данных - Будет ли процесс существовать после реорганизации Пожалуйста: 1. Порекомендуй, стоит ли инвестировать, и если да, то при каких условиях. 2. Предложи, как структурировать пилотный или поэтапный подход. 3. Определи точку безубыточности и срок окупаемости. 4. Порекомендуй, как управлять скептицизмом команды. 5. Предложи критерии принятия решения для раннего закрытия проекта, если он не работает.
Comparing:
step-3.7-flash · GigaChat3.5-432B-A28B

Same model – two results

experiment, 1,700 runs
Typical prompt

Выручка упала на 18%, трафик вырос на 12%, средний чек снизился с 8700 до 6200. Что происходит и что делать?

6.8 /10
Structured prompt

...Формат:

  • § Диагноз (2-3 предложения)
  • § Корневые причины (что + почему + данные)
  • § Рекомендации (действие, результат в цифрах, срок, ответственный)
  • § Чего я не знаю
8.6 /10 +24%

A naive prompt gets generic advice. A structured one – causal analysis with numbers and deadlines.

About this experiment →

Category breakdown

Russia availability

Via OpenRouter

Warning: regional specifics

Худший результат в бенчмарке по региональной специфике среди моделей схожего уровня (5.43/10, 37-е место). Судьи зафиксировали фантазийные налоговые ставки, неверные даты праздников и вымышленные номера статей для РФ и Казахстана. Любой ответ про российское или казахстанское регулирование требует обязательной проверки в первоисточнике.

Related articles

Data analysis isn't about the model

The prompt determines 70% of the result. The Analysis & Decisions with AI module has 6 analysis frameworks with ready-to-use prompts: from revenue diagnostics to root cause analysis.

See the frameworks →