Причины наблюдаемого провала малых SLM против LLM на MoE в AI-агентах

Аннотация
В недавней статье Belcak et al. (2025) из NVIDIA Research был выдвинут тезис о том, что будущее агентного искусственного интеллекта принадлежит малым языковым моделям (SLM). Авторы утверждают, что SLM достаточно мощны, операционно более пригодны и экономически выгодны для большинства задач в агентных системах. Между тем сам продукт NVIDIA Nemotron-H family как SLM потерпел неудачу в популярности, а новые LLM как Qwen 3 Next ставят под сомнение какие-либо перспективы SLM в AI-агентах даже для малых решений. Статистика Open Router, приводимая в данной статье, показывает тренд отказа разработчиков от SLM для разработки агентов и переход пользователей SLM на маргинальный уровень.

Это связано с технологическим превосходством высоко-разреженных моделей типа Mixture-of-Experts (MoE) с технологией Multi-Token Prediction (MTP), нивелирующих экономические преимущества SLM. Другим фактором является экономическая целесообразность использования бесплатных или сверхдешевых API-уровней для задач низкой интенсивности, что делает самостоятельное развертывание SLM избыточным.

1. Введение

Позиционная статья Belcak et al. (2025) справедливо указывает на экономические и операционные проблемы, связанные с зависимостью агентных систем от монолитных, дорогостоящих LLM. Их аргументация в пользу SLM как будущего агентного ИИ основана на предположениях о достаточной мощности, операционной гибкости и экономической эффективности малых моделей. Эта работа стимулирует критически важный диалог об устойчивом и эффективном использовании вычислительных ресурсов в ИИ.

Однако экстраполяция текущих достижений SLM в качестве доминирующего будущего является преждевременной и прямо опровергается данными о популярности LLM среди разработчиков, так и инновациями MoE.

2. Рыночные реалии: Эмпирический анализ выбора разработчиков

Любой прогноз о будущем технологии должен находить подтверждение в текущих эмпирических данных. Мы проанализировали статистику использования моделей на платформе OpenRouter¹, являющейся значимым агрегатором и прокси-сервером для оценки реальных предпочтений разработчиков агентных систем. Данные не подтверждают тезис о растущем доминировании SLM, а опровергают его.

2.1. Общее использование моделей для задач с инструментами (Tool Use)

В категории, наиболее релевантной для агентных систем — вызовы с инструментами (tool calls), — доминируют модели среднего размера, а не SLM (см. Таблицу 1).

Таблица 1: Топ-10 моделей по количеству вызовов с инструментами (OpenRouter)

#

Модель

Провайдер

Объем (tool calls)

Доля (%)

6

GPT-4.1 Mini

OpenAI

10.4M

32.7%

2

GPT-4-mini

OpenAI

7.08M

22.3%

3

Claude Sonnet 4

Anthropic

3.35M

10.5%

4

Gemini 1.5 Flash

Google

2.91M

9.1%

5

Gemini 2.0 Flash

Google

2.1M

6.6%

...

...

...

...

...

Примечание: Данные нормализованы и отсортированы для наглядности.

Лидеры рынка — это модели, специально разработанные для баланса между производительностью и стоимостью (GPT-4 Mini, Claude Sonnet, Gemini Flash). Важно отметить, что ни одна из этих моделей не является SLM в строгом определении (т.е. <7B параметров). В топ-10 полностью отсутствуют классические SLM, что прямо противоречит идее о их растущей популярности для агентных задач. Следует также отметить, что Open Router предлагает SLM обычно в категории бесплатных (free), но это не является аргументом для разработчиков начать их массивно применять для AI-агентов

2.2. Отраслевое применение

Анализ отраслевых категорий, таких как финансы и здравоохранение, показывает еще более сложную картину. Разработчики используют гетерогенный стек моделей, включая не только эффективные средние модели, но и очень крупные, такие как Qwen3-235B и Llama 3 70B.

В категориях Finance, где находятся ERP и бухгалтерские решения виден полный отказ от SLM
В категориях Finance, где находятся ERP и бухгалтерские решения виден полный отказ от SLM
Решения здравоохранения являются ярким примером RAG-агентов, но и тут наблюдается полный отказ от SLM
Решения здравоохранения являются ярким примером RAG-агентов, но и тут наблюдается полный отказ от SLM

Эти данные свидетельствуют о том, что для важных задач разработчики предпочитают либо проверенные "рабочие лошадки" среднего класса, либо мощные LLM для обеспечения максимального качества. Ниша для SLM в этих реальных сценариях не прослеживается.

3. Архитектурный прорыв: Нивелирование преимуществ SLM

Ключевой аргумент в пользу SLM — их экономическая эффективность в части затрат на инференс (FLOPs). Однако последние достижения в архитектуре моделей, в частности высоко-разреженные MoE-модели с технологией Multi-Token Prediction (MTP), делают этот аргумент несостоятельным для большинства корпоративных развертываний даже для малых решений.

Модель Qwen3-Next-80B-A3B-Instruct является ярким примером этого тренда. Она обладает общим числом параметров в 80B, что обеспечивает ей доступ к огромному объему знаний и высокое качество рассуждений. Однако благодаря MoE-архитектуре с высокой разреженностью, в каждый момент времени для обработки токена активируется лишь ~3B параметров. Это означает, что вычислительная стоимость (FLOPs) инференса этой 80B модели сопоставима со стоимостью инференса 3B SLM.

Более того, технология MTP, недоступная в SLM, позволяет модели генерировать несколько токенов за один проход, значительно сокращая общее время генерации (latency) и увеличивая пропускную способность (throughput). Эта комбинация (MoE + MTP) создает модель, которая предлагает:

  1. Качество LLM: Уровень понимания и рассуждений, недостижимый для SLM.
  2. Вычислительную стоимость SLM: Затраты FLOPs на ниже уровня 3B модели за счет MTP.
  3. Скорость, сопоставимую с SLM.

Таким образом, для разработчика, имеющего доступ к облачной инфраструктуре с достаточным объемом VRAM, выбор между 3B SLM и 80B MoE LLM с 3B активных параметров становится очевидным. За ту же или сопоставимую вычислительную цену он получает несоизмеримо более высокое качество. Это делает экономический аргумент в пользу SLM для серверных применений практически бессмысленным.

4. Экономическая прагматика: Commoditization через Free Tiers

Для сегмента задач, где не требуется высокая производительность и где стоимость является определяющим фактором (прототипы, образовательные проекты, низкоинтенсивные внутренние инструменты), Belcak et al. (2025) также видят применение SLM. Мы утверждаем, что и эту нишу SLM не займут, поскольку сталкиваются с более эффективным конкурентом — бесплатными или сверхдешевыми API от крупных провайдеров.

Развертывание и поддержка даже самой маленькой SLM несет в себе издержки (Total Cost of Ownership, TCO): настройка окружения, мониторинг, обновление, потенциальное дообучение. В то же время, модели вроде Gemini Flash предлагают чрезвычайно щедрые бесплатные уровни (Free Tiers), которые покрывают потребности подавляющего большинства таких задач.

Для разработчика выбор между нулевыми затратами и нулевой поддержкой (использование API) и ненулевыми затратами и необходимостью поддержки (собственный SLM) очевиден. Высокая популярность моделей Gemini Flash в статистике OpenRouter (см. Таблицу 1) является прямым подтверждением того, что рынок выбирает путь максимального упрощения и минимизации издержек через коммодитизированные API, а не через самостоятельное развертывание малых моделей.

5. Заключение

Позиция, изложенная Belcak et al. (2025), представляет собой интересный взгляд на возможную эволюцию ИИ-агентов, однако она не в полной мере учитывает динамику технологического и рыночного развития. Представленный нами анализ показывает, что:

  1. Эмпирические данные свидетельствуют о доминировании эффективных моделей среднего размера и гетерогенных стеков, а не о переходе к SLM.
  2. Архитектурные инновации (MoE + MTP) позволяют крупным моделям достигать вычислительной эффективности SLM, предлагая при этом несравнимо более высокое качество.
  3. Экономическая прагматика и доступность бесплатных API-уровней делают самостоятельное развертывание SLM нецелесообразным для низкоинтенсивных задач.

Мы прогнозируем, что будущее агентного ИИ будет определяться не переходом к SLM, а дальнейшей оптимизацией и стратификацией крупномасштабных моделей. Основную долю рынка займут высокоэффективные MoE LLM, способные решать широкий круг задач с оптимальным соотношением цены и качества. Ниша для SLM, безусловно, сохранится, но она будет ограничена специфическими областями, такими как edge-computing и задачи с экстремальными требованиями к приватности, и не станет мейнстримом, как это предполагают наши уважаемые оппоненты.

¹ Следует отметить, что платформа OpenRouter сохраняет доступность для разработчиков из различных регионов, включая Россию, где оплата возможна через посреднические сервисы, что делает ее данные репрезентативными для широкой международной аудитории.

368 views·2 shares