Как мы научили LLMCOD собирать базу знаний не только из HTML, но и из SPA и открытых API
Обычно задача «создать базу знаний из сайта» звучит просто: взять HTML, извлечь текст, разбить его на фрагменты, построить embeddings и отправить всё в RAG. На современных сайтах этот подход всё чаще перестаёт работать. Главная причина — сайт может практически не содержать данных в исходном HTML. Пользователь открывает страницу, браузер загружает JavaScript, JavaScript обращается к API, а уже API возвращает услуги, товары, объекты, статьи, цены и другие данные. Именно с такой проблемой мы столкнулись при разработке новой возможности в LLMCOD. Теперь система умеет работать не только с обычными страницами, но и с SPA-сайтами и доступными открытыми API. В этой статье расскажу, как мы это сделали, какие проблемы встретили по дороге и почему одного vector search для такой задачи оказалось недостаточно. Читать далее
