Depository of News

Как мы научили ИИ читать корпоративные регламенты: от наивного RAG до измеримого pipeline

newsdepo.com · world

<img src="https://habrastorage.org/getpro/habr/upload_files/907/619/097/9076190977d2ef51b0c12b770aeb5098.png" /><p>В статье - практический кейс создания корпоративного RAG-сервиса для поиска по внутренним регламентным и нормативным документам. Мы прошли путь от стандартного пайплайна на n8n и Qdrant до гибридной архитектуры с BM25, embeddings, RRF, reranking, структурным chunking и обработкой сложных таблиц и документов. Отдельно разбирается, почему обычная нарезка текста плохо работает на нормативных документах, как мы использовали Natasha, словари корпоративных терминов и мультимодальные модели, а также как построили систему измерения качества через Arize Phoenix и LLM-as-a-Judge. Показаны реальные результаты A/B-теста с реранкером по 9 метрикам с объяснением, почему в production-RAG важнее не «самая умная LLM», а качество подготовки документов, retrieval и воспроизводимая оценка изменений.</p> <a href="https://habr.com/ru/articles/1079414/?utm_source=habrahabr&amp;utm_medium=rss&amp;utm_campaign=1079414#habracut">Читать далее</a>

Read full article →