Причины наблюдаемого провала малых SLM против LLM на MoE в AI-агентах
Аннотация
В недавней статье Belcak et al. (2025) из NVIDIA Research был выдвинут тезис о том, что будущее агентного искусственного интеллекта принадлежит малым языковым моделям (SLM). Авторы утверждают, что SLM достаточно мощны, операционно более пригодны и экономически выгодны для большинства задач в агентных системах. Между тем сам продукт NVIDIA Nemotron-H family как SLM потерпел неудачу в популярности, а новые LLM как Qwen 3 Next ставят под сомнение какие-либо перспективы SLM в AI-агентах даже для малых решений. Статистика Open Router, приводимая в данной статье, показывает тренд отказа разработчиков от SLM для разработки агентов и переход пользователей SLM на маргинальный уровень.
Это связано с технологическим превосходством высоко-разреженных моделей типа Mixture-of-Experts (MoE) с технологией Multi-Token Prediction (MTP), нивелирующих экономические преимущества SLM. Другим фактором является экономическая целесообразность использования бесплатных или сверхдешевых API-уровней для задач низкой интенсивности, что делает самостоятельное развертывание SLM избыточным.
1. Введение
Позиционная статья Belcak et al. (2025) справедливо указывает на экономические и операционные проблемы, связанные с зависимостью агентных систем от монолитных, дорогостоящих LLM. Их аргументация в пользу SLM как будущего агентного ИИ основана на предположениях о достаточной мощности, операционной гибкости и экономической эффективности малых моделей. Эта работа стимулирует критически важный диалог об устойчивом и эффективном использовании вычислительных ресурсов в ИИ.
Однако экстраполяция текущих достижений SLM в качестве доминирующего будущего является преждевременной и прямо опровергается данными о популярности LLM среди разработчиков, так и инновациями MoE.
2. Рыночные реалии: Эмпирический анализ выбора разработчиков
Любой прогноз о будущем технологии должен находить подтверждение в текущих эмпирических данных. Мы проанализировали статистику использования моделей на платформе OpenRouter¹, являющейся значимым агрегатором и прокси-сервером для оценки реальных предпочтений разработчиков агентных систем. Данные не подтверждают тезис о растущем доминировании SLM, а опровергают его.
2.1. Общее использование моделей для задач с инструментами (Tool Use)
В категории, наиболее релевантной для агентных систем — вызовы с инструментами (tool calls), — доминируют модели среднего размера, а не SLM (см. Таблицу 1).
Таблица 1: Топ-10 моделей по количеству вызовов с инструментами (OpenRouter)
|
# |
Модель |
Провайдер |
Объем (tool calls) |
Доля (%) |
|
6 |
GPT-4.1 Mini |
OpenAI |
10.4M |
32.7% |
|
2 |
GPT-4-mini |
OpenAI |
7.08M |
22.3% |
|
3 |
Claude Sonnet 4 |
Anthropic |
3.35M |
10.5% |
|
4 |
Gemini 1.5 Flash |
|
2.91M |
9.1% |
|
5 |
Gemini 2.0 Flash |
|
2.1M |
6.6% |
|
... |
... |
... |
... |
... |
Примечание: Данные нормализованы и отсортированы для наглядности.
Лидеры рынка — это модели, специально разработанные для баланса между производительностью и стоимостью (GPT-4 Mini, Claude Sonnet, Gemini Flash). Важно отметить, что ни одна из этих моделей не является SLM в строгом определении (т.е. <7B параметров). В топ-10 полностью отсутствуют классические SLM, что прямо противоречит идее о их растущей популярности для агентных задач. Следует также отметить, что Open Router предлагает SLM обычно в категории бесплатных (free), но это не является аргументом для разработчиков начать их массивно применять для AI-агентов
2.2. Отраслевое применение
Анализ отраслевых категорий, таких как финансы и здравоохранение, показывает еще более сложную картину. Разработчики используют гетерогенный стек моделей, включая не только эффективные средние модели, но и очень крупные, такие как Qwen3-235B и Llama 3 70B.
Эти данные свидетельствуют о том, что для важных задач разработчики предпочитают либо проверенные "рабочие лошадки" среднего класса, либо мощные LLM для обеспечения максимального качества. Ниша для SLM в этих реальных сценариях не прослеживается.
3. Архитектурный прорыв: Нивелирование преимуществ SLM
Ключевой аргумент в пользу SLM — их экономическая эффективность в части затрат на инференс (FLOPs). Однако последние достижения в архитектуре моделей, в частности высоко-разреженные MoE-модели с технологией Multi-Token Prediction (MTP), делают этот аргумент несостоятельным для большинства корпоративных развертываний даже для малых решений.
Модель Qwen3-Next-80B-A3B-Instruct является ярким примером этого тренда. Она обладает общим числом параметров в 80B, что обеспечивает ей доступ к огромному объему знаний и высокое качество рассуждений. Однако благодаря MoE-архитектуре с высокой разреженностью, в каждый момент времени для обработки токена активируется лишь ~3B параметров. Это означает, что вычислительная стоимость (FLOPs) инференса этой 80B модели сопоставима со стоимостью инференса 3B SLM.
Более того, технология MTP, недоступная в SLM, позволяет модели генерировать несколько токенов за один проход, значительно сокращая общее время генерации (latency) и увеличивая пропускную способность (throughput). Эта комбинация (MoE + MTP) создает модель, которая предлагает:
- Качество LLM: Уровень понимания и рассуждений, недостижимый для SLM.
- Вычислительную стоимость SLM: Затраты FLOPs на ниже уровня 3B модели за счет MTP.
- Скорость, сопоставимую с SLM.
Таким образом, для разработчика, имеющего доступ к облачной инфраструктуре с достаточным объемом VRAM, выбор между 3B SLM и 80B MoE LLM с 3B активных параметров становится очевидным. За ту же или сопоставимую вычислительную цену он получает несоизмеримо более высокое качество. Это делает экономический аргумент в пользу SLM для серверных применений практически бессмысленным.
4. Экономическая прагматика: Commoditization через Free Tiers
Для сегмента задач, где не требуется высокая производительность и где стоимость является определяющим фактором (прототипы, образовательные проекты, низкоинтенсивные внутренние инструменты), Belcak et al. (2025) также видят применение SLM. Мы утверждаем, что и эту нишу SLM не займут, поскольку сталкиваются с более эффективным конкурентом — бесплатными или сверхдешевыми API от крупных провайдеров.
Развертывание и поддержка даже самой маленькой SLM несет в себе издержки (Total Cost of Ownership, TCO): настройка окружения, мониторинг, обновление, потенциальное дообучение. В то же время, модели вроде Gemini Flash предлагают чрезвычайно щедрые бесплатные уровни (Free Tiers), которые покрывают потребности подавляющего большинства таких задач.
Для разработчика выбор между нулевыми затратами и нулевой поддержкой (использование API) и ненулевыми затратами и необходимостью поддержки (собственный SLM) очевиден. Высокая популярность моделей Gemini Flash в статистике OpenRouter (см. Таблицу 1) является прямым подтверждением того, что рынок выбирает путь максимального упрощения и минимизации издержек через коммодитизированные API, а не через самостоятельное развертывание малых моделей.
5. Заключение
Позиция, изложенная Belcak et al. (2025), представляет собой интересный взгляд на возможную эволюцию ИИ-агентов, однако она не в полной мере учитывает динамику технологического и рыночного развития. Представленный нами анализ показывает, что:
- Эмпирические данные свидетельствуют о доминировании эффективных моделей среднего размера и гетерогенных стеков, а не о переходе к SLM.
- Архитектурные инновации (MoE + MTP) позволяют крупным моделям достигать вычислительной эффективности SLM, предлагая при этом несравнимо более высокое качество.
- Экономическая прагматика и доступность бесплатных API-уровней делают самостоятельное развертывание SLM нецелесообразным для низкоинтенсивных задач.
Мы прогнозируем, что будущее агентного ИИ будет определяться не переходом к SLM, а дальнейшей оптимизацией и стратификацией крупномасштабных моделей. Основную долю рынка займут высокоэффективные MoE LLM, способные решать широкий круг задач с оптимальным соотношением цены и качества. Ниша для SLM, безусловно, сохранится, но она будет ограничена специфическими областями, такими как edge-computing и задачи с экстремальными требованиями к приватности, и не станет мейнстримом, как это предполагают наши уважаемые оппоненты.
¹ Следует отметить, что платформа OpenRouter сохраняет доступность для разработчиков из различных регионов, включая Россию, где оплата возможна через посреднические сервисы, что делает ее данные репрезентативными для широкой международной аудитории.
