Что происходит на рынке

Компании все чаще пересматривают архитектуру ИИ-сервисов в пользу малых языковых моделей, когда речь идет о классификации запросов, извлечении данных, чат-ботах поддержки и других типовых операциях. В материалах VK Cloud и Сбера подчеркивается, что SLM дают заметную экономию на инференсе, позволяют держать данные внутри корпоративного контура и могут работать даже на локальных серверах или edge-устройствах.[1][3][8]

Почему бизнес уходит от «больших» моделей

Главный аргумент — экономика. VK Cloud указывает, что для моделей 4–7 млрд параметров достаточно одного GPU уровня NVIDIA L4 или T4, тогда как 70-миллиардные модели требуют уже нескольких H100 и обходятся в 15–30 раз дороже по инфраструктуре.[8] Сбер, в свою очередь, отмечает, что SLM лучше подходят для специализированных сценариев, где универсальность LLM не дает практического выигрыша, а издержки оказываются избыточными.[3]

Где SLM особенно сильны

В корпоративной среде SLM используют там, где важны скорость, контроль и повторяемость результата: в клиентской поддержке, обработке документов, юридических и финансовых сценариях, а также в задачах, где данные нельзя выводить за пределы периметра компании.[1][3][8] В статье IT Week отдельно описана связка SLM на периферии и LLM в облаке: такая архитектура позволяет строить RAG-системы и не передавать чувствительный контекст мощной внешней модели.[12]

Источник и контекст

Источники рынка сходятся в одном: LLM не исчезают, но их роль смещается к сложному планированию, генерации и многошаговым задачам, тогда как SLM берут на себя массовую «рутинную» нагрузку.[4][12] Источник новости: VK Cloud, Сбер, IT Week.