Depository of News

RAG, поиск и LongContext: почему сложные пайплайны не всегда нужны

newsdepo.com · world

<img src="https://habrastorage.org/getpro/habr/upload_files/10f/38b/285/10f38b28500bc0f39d199852cde64e3b.jpeg" /><p>В 2023 году RAG был единственным способом засунуть знания в LLM — контекстное окно было маленьким, часто были галлюцинации. RAG постепенно стал одной из самых популярных технологий, чтобы получить базу знаний, по которой можно искать данные через натуральный язык.</p><p>Но с другой стороны — RAG-пайплайн тяжёлый и трудозатратный. Компания хочет чат по своей документации. Разработчик говорит: нужен пайплайн — чанкинг, эмбеддинги, векторная база, реранкер. Два-три месяца работы плюс сервис, который надо вечно поддерживать, ради 400-страничной документации. И всё это занимает месяцы, тратит ресурсы ради не такой уж и большой выгоды.</p><p>Сегодня многие модели держат 1M токенов, а то и больше, а в это окно контекста чаще всего спокойно влезает вся документация. Но если не влезет — то обязательно ли сразу строить весь RAG самому? А как понять, когда есть альтернатива RAG, а когда нет?</p><p>В этой статье мы разберём, почему RAG стал выбором по умолчанию (и почему это было оправдано), посмотрим, как падает качество при Long Context, сравним подходы и узнаем, что, как и когда использовать.</p> <a href="https://habr.com/ru/articles/1081080/?utm_source=habrahabr&amp;utm_medium=rss&amp;utm_campaign=1081080#habracut">Читать далее</a>

Read full article →