Depository of News

Омнимодель для Алисы AI: как нам удалось подружить VLM и LLM

newsdepo.com · tech

<img src="https://habrastorage.org/getpro/habr/upload_files/7b9/35a/889/7b935a88989e733b5771aba3fc63912c.png" /><p>Ещё недавно Алиса отвечала на&nbsp;текст и на&nbsp;картинку будто двумя разными голосами. Под&nbsp;капотом и правда жили две генеративные модели: текстовая LLM и визуальная VLM, а&nbsp;между ними&nbsp;— стена из&nbsp;непрозрачного роутинга, разных форматов ответов и разной вёрстки.&nbsp;</p><p>Почти год мы сводили их в&nbsp;одну омнимодель&nbsp;— такую, которая воспринимает текст и изображения как&nbsp;единое целое, без&nbsp;переключений за&nbsp;кадром. Получилось не&nbsp;всё и не&nbsp;сразу, но&nbsp;путь вышел поучительным, и в&nbsp;этой статье я хочу поделиться тем, что&nbsp;мы поняли про&nbsp;обучение таких моделей. Попутно&nbsp;— несколько неочевидных поворотов: почему за&nbsp;два года до&nbsp;этого та&nbsp;же затея разваливалась, что&nbsp;изменила MoE‑архитектура, почему омнипретрейн пришлось собирать с&nbsp;конца и почему один вид RL переезжает на&nbsp;большую модель легко, а&nbsp;другой рассыпается прямо на&nbsp;глазах.</p><p>Меня зовут Алексей Григорьев, я представляю большую команду разработки омнимодели Яндекса. Вместе с&nbsp;моим коллегой Данилой Кашиным я расскажу про&nbsp;все технические грабли не&nbsp;со стороны наблюдателя, а&nbsp;как&nbsp;их непосредственный собиратель. Но&nbsp;рассказывать я буду с&nbsp;акцентом не&nbsp;на&nbsp;красивом замысле, а&nbsp;на&nbsp;самой болезненной части&nbsp;— алайнменте.</p> <a href="https://habr.com/ru/articles/1077274/?utm_source=habrahabr&amp;utm_medium=rss&amp;utm_campaign=1077274#habracut">Читать далее</a>

Read full article →