Роль обучающих данных
Во всех рассмотренных подходах ключевую роль играют обучающие данные: масштабные пары изображение-текст из веба — от сотен миллионов до миллиардов пар.

Визуально-лингвистические модели (VLM) объединяют обработку изображений и видео с обработкой естественного языка в единой архитектуре. В классической схеме CV-модель распознаёт объекты на картинке, NLP-модель обрабатывает текст, а результаты склеиваются вручную. VLM работают иначе: изображение и текст с самого начала проходят через общее эмбеддинг-пространство или общий трансформер.
Это часть более широкой эволюции мультимодального ИИ: от классификации изображений по фиксированному набору категорий к пониманию сцены целиком, диалогу об изображении и генерации контента по текстовому описанию.
Большинство современных VLM опираются на несколько типовых решений.
Модель CLIP (Contrastive Language-Image Pre-training) от OpenAI использует раздельные энкодеры изображения и текста. Они обучаются сближать эмбеддинги совпадающих пар «картинка — подпись» и отдалять эмбеддинги несовпадающих пар; обучение идёт на большом наборе пар изображение-текст из интернета. Модель ALIGN от Google реализует ту же идею контрастивного обучения, но обучена на значительно большем и менее отфильтрованном наборе пар.
Типовой способ подать изображение в трансформер — Vision Transformer (ViT). Изображение разбивается на фиксированные патчи (например, 16×16 пикселей), которые линейно проецируются и подаются в трансформер как последовательность токенов, по аналогии с токенами текста.
BLIP-2 сопрягает готовый замороженный визуальный энкодер и готовую замороженную большую языковую модель через компактный обучаемый модуль Q-Former. Такая схема резко снижает вычислительные затраты по сравнению с обучением мультимодальной архитектуры с нуля.
Визуальный энкодер соединяется с предобученной языковой моделью через проекционный слой, а дообучение проходит на инструкциях с изображениями.
Во всех рассмотренных подходах ключевую роль играют обучающие данные: масштабные пары изображение-текст из веба — от сотен миллионов до миллиардов пар.
Развитие VLM прослеживается по цепочке моделей, каждая из которых закрывала конкретный архитектурный или прикладной пробел.
Image-to-text и text-to-image retrieval, опирающиеся на contrastive-подход CLIP и ALIGN.
Генерация alt-текста для доступности.
Ответы на вопросы о содержимом изображения; характерная задача для диалоговых моделей LLaVA и GPT-4V.
Работа со сложной вёрсткой — таблицами, схемами, сканами.
Классификация изображений по текстовым политикам без переобучения под каждый отдельный класс.
Анализ скриншотов, диаграмм, фото товаров.
Связка «увидел сцену → получил текстовую инструкцию → выбрал действие», реализованная, например, в RT-2.
При всей широте применения у VLM остаётся ряд нерешённых задач.
Наши специалисты свяжутся с вами в ближайшее время и ответят на все вопросы.

Будем держать в курсе новостей и облачных трендов




