Главная / Как устроен конвейер CVS под капотом.
Технология

Как устроен конвейер CVS под капотом.

От загрузки документа до маршрутизации запроса, гибридного поиска пятью ретриверами и честного отказа — каждый этап спроектирован ради проверяемости ответа, а не правдоподобной генерации. Это инженерная архитектура гибридного RAG, а не обёртка над одной LLM.

Загрузка

Конвейер загрузки: один документ превращается в единицы доказательств.

Загрузка идёт в пять стадий. Сначала CVS подключает источники — SharePoint, Google Drive, Confluence, S3, файловые серверы, а в российском контуре 1С:Документооборот, Битрикс24, Directum, Nextcloud и сетевые папки по SMB/NFS. Затем документ разбирается слоем парсинга с тройным OCR и Vision-обогащением: PDF, DOCX, PPTX, XLSX, сканы и изображения превращаются в структурированный Markdown с сохранением таблиц и рисунков.

Дальше работает умный чанкинг: текст режется не по символам, а по смыслу — на семантические фрагменты, таблицы и фигуры с якорями на страницу и абзац, чтобы цитата вела точно в источник. Стадия обогащения извлекает сущности, метаданные, диффы версий документа и темпоральные факты. На финальной стадии каждый фрагмент уходит в многослойную индексацию сразу в пять хранилищ.

  • Тройной OCR + Vision: читаемые PDF, сканы, изображения и даже рукописные пометки на чертежах
  • Семантический чанкинг с якорями на страницу — цитата всегда ведёт в точное место источника
  • Обогащение: сущности, метаданные, диффы версий и темпоральные факты со сроком действия
  • Многослойный индекс: вектор (pgvector), полнотекст (BM25F), граф знаний (Neo4j), метаданные и темпоральный индекс
Конвейер загрузки документов. 5 стадий: подключение источников → OCR/Vision → умный чанкинг → обогащение → многослойная индексация.
Маршрутизация

Маршрутизатор намерения: простой вопрос не всегда вызывает LLM.

Каждый запрос проходит через Intent Router — LLM-классификатор намерения, который определяет минимально достаточный путь обработки. Вместо того чтобы гонять любой вопрос через тяжёлую модель, CVS направляет его в один из четырёх маршрутов и экономит до 85–95% токенов на типовом потоке запросов.

Маршруты выстроены каскадом по сложности: мгновенный ответ из кэша с нулевым расходом токенов; стандартный гибридный поиск для обычных запросов; глубокий research с синтезом по нескольким документам; и ultra-режим с декомпозицией запроса в DAG рассуждения для многошаговых аналитических вопросов. Классификация делается LLM, а не регулярными выражениями — намерение определяется по смыслу, а не по ключевым словам.

  • Instant / zero-token: повторяющиеся вопросы отдаются из кэша без обращения к LLM
  • Standard: быстрый гибридный поиск пятью ретриверами для большинства запросов
  • Deep research: синтез ответа из нескольких документов и источников
  • Ultra reasoning: декомпозиция сложного запроса в DAG рассуждения с пошаговой проверкой
Маршрутизация запроса. Маршрутизатор намерения направляет запрос по 4 путям: мгновенный, гибридный, глубокий, ultra-DAG.
Гибридный поиск

5 ретриверов параллельно и RRF Fusion: 94,7% точности против 67–73%.

Ядро CVS — гибридный RAG из пяти ретриверов, которые запускаются одновременно по одному запросу: векторный поиск (pgvector) ловит смысловую близость, граф знаний (Neo4j) — связи между сущностями, BM25F — точные термины, номера ГОСТ и артикулы, темпоральный ретривер учитывает срок действия фактов, а фильтрация по метаданным отсекает нерелевантный контур. Ни один поиск по отдельности не видит всю картину — вместе они закрывают слепые зоны друг друга.

Пять потоков сливаются через Reciprocal Rank Fusion с константой k=60: алгоритм объединяет ранжированные списки без подгонки весов вручную. Затем cross-encoder реранкинг переоценивает топ-кандидаты в паре «запрос–фрагмент» и формирует чистый набор доказательств для сборщика ответа. На внутренних замерах такая схема даёт 94,7% точности ответа против 67–73% у систем с одним ретривером.

  • Вектор (pgvector) + граф знаний (Neo4j) + BM25F + темпоральный + метаданные — пять параллельных ретриверов
  • RRF Fusion (k=60) объединяет ранги без ручной подгонки весов
  • Cross-encoder реранкинг переоценивает кандидатов в паре запрос–фрагмент
  • 94,7% точности ответа против 67–73% у одного ретривера; кириллица-нативный поиск
5 ретриверов и RRF Fusion. Пять параллельных ретриверов (вектор, граф, BM25F, темпоральный, метаданные) → RRF Fusion → реранкинг → набор доказательств.
Честный отказ

Adversarial Abstention: система знает, когда она не знает.

Большинство RAG-систем всегда что-то отвечают — даже когда доказательств нет, генерируя правдоподобную галлюцинацию. CVS работает иначе: после поиска проходит порог уверенности (confidence gate), который проверяет, достаточно ли доказательств для ответа. Если да — выдаётся ответ с цитатами, и запрос фиксируется в audit log.

Если доказательств недостаточно, CVS не выдумывает, а честно отказывается и маршрутизирует вопрос эксперту. Ответ эксперта захватывается, проверяется и патчит базу знаний — так пробел закрывается навсегда. В дереве решений нехватка доказательств помечена красным, передача на ревью человеку — янтарным. В критичных отраслях, где ошибка стоит миллионы, это снижает долю галлюцинаций с типичных 19% до менее чем 2% в продуктиве.

  • Confidence gate проверяет достаточность доказательств перед генерацией ответа
  • Достаточно → ответ с цитатами + запись в audit log
  • Недостаточно → честный отказ → эскалация эксперту → захват и патч базы знаний
  • Менее 2% галлюцинаций в продуктиве вместо ~19% у обычного RAG
Adversarial Abstention. Дерево решений: недостаточно доказательств → честный отказ → эскалация эксперту → захват ответа → патч базы.

Проверьте конвейер на ваших документах.

За 30 минут покажем, как CVS отвечает на ваши реальные вопросы со ссылками на источник — и где честно отказывается, если доказательств нет. Бесплатный пилот для квалифицированных организаций.