Дизайн / Мультимодальный ИИ
Главная AI-новость по теме: Дизайн: Мультимодальный ИИ (design; multimodal ai)
В России создана первая полноценная мультимодальная модель ИИ с открытым исходным кодом, способная вести визуальный диалог и работать на русском языке.
Сводка
Главное за 15 секунд
- В России создана первая полноценная мультимодальная модель ИИ с открытым исходным кодом, способная вести визуальный диалог и работать на русском языке.
- Main В России создана первая полноценная мультимодальная модель ИИ с открытым исходным кодом, способная вести визуальный диалог и работать на русском языке.
- Ученые научно-исследовательского Института искусственного интеллекта AIRI разработали модель OmniFusion 1.1 , которая преодолевает барьер унимодальных систем, объединяя обработку текста и изображений в единой архитектуре
- Ключевое отличие новинки — поддержка русского языка и публикация open-source кода для обучения, что позволяет коммерческим компаниям интегрировать технологию в собственные продукты без зависимости от зарубежных вендоров
Main
В России создана первая полноценная мультимодальная модель ИИ с открытым исходным кодом, способная вести визуальный диалог и работать на русском языке.
Ученые научно-исследовательского Института искусственного интеллекта AIRI разработали модель OmniFusion 1.1, которая преодолевает барьер унимодальных систем, объединяя обработку текста и изображений в единой архитектуре[1]. Ключевое отличие новинки — поддержка русского языка и публикация open-source кода для обучения, что позволяет коммерческим компаниям интегрировать технологию в собственные продукты без зависимости от зарубежных вендоров[1][9].
Модель демонстрирует практическую применимость в задачах, требующих глубокого анализа визуальной информации. OmniFusion не просто распознажает объекты на фото, но и отвечает на сложные вопросы по картинкам: объясняет содержание снимка, предлагает рецепт блюда по фотографии ингредиентов, анализирует карты помещений или описывает схему сборки устройства по фото его частей[1][9]. Кроме того, система способна решать математические задачи, написанные на доске, и распознавать формулы, что критически важно для образовательных и инженерных сфер[9].
Техническая база OmniFusion построена на методике совмещения предварительно обученной большой языковой модели (LLM) и визуальных энкодеров, которые кодируют информацию изображения в эмбеддинг[9]. Разработчики планируют расширить функционал модели за пределы текста и изображений, добавив в перспективе поддержку аудио, 3D-контента и видео[1][9]. Технический репорт с описанием архитектуры модели уже занял первое место в разделе Daily trending papers на платформе HuggingFace, подтверждая высокий интерес международного сообщества к проекту[9].
Источник новости: Forbes.ru.
Обсуждение
Комментарии
Войдите через Google или Telegram, чтобы участвовать в обсуждении.