Что происходит на рынке

В центре дискуссии оказался сдвиг от универсальных LLM к более компактным SLM, которые ориентированы на узкие корпоративные сценарии и требуют меньше вычислительных ресурсов. В свежих материалах о SLM отмечается, что такие модели рассчитаны на специализированные задачи, лучше подходят для локального запуска и могут снижать нагрузку на облачную инфраструктуру.[1][2][3]

Почему бизнесу это стало интересно

Для компаний, строящих ИИ-помощников и агентные системы, вопрос теперь не в том, «может ли модель ответить», а в том, сколько стоит каждый запрос и где именно хранится контекст. В одном из последних разборах по федеративной схеме работы ИИ описывается связка, где SLM выполняет часть генерации на периферии, а LLM подключается только для сложного планирования и маршрутизации инструментов, чтобы не передавать чувствительные данные в облако без необходимости.[6]

Что это меняет для IT-стратегий

Суть нового подхода — разделить нагрузку. SLM берут на себя массовые однотипные операции, а LLM остаются резервом для нестандартных запросов, где важны широкий контекст и более сложные рассуждения.[6][8][11] Такой сценарий особенно привлекателен для корпоративных RAG-систем, где к модели подключают внутренние базы знаний: чем меньше лишней вычислительной мощности тратится на рутину, тем ниже цена обслуживания и выше предсказуемость отклика.

При этом спор о границе между LLM и SLM остается открытым: разные источники по-разному определяют порог по числу параметров, но сходятся в главном — малые модели выигрывают там, где важны скорость, экономия и контроль над данными.[1][11][12]

Источник новости:

Источник новости: Habr.