От загрузки документа до маршрутизации запроса, гибридного поиска пятью ретриверами и честного отказа — каждый этап спроектирован ради проверяемости ответа, а не правдоподобной генерации. Это инженерная архитектура гибридного RAG, а не обёртка над одной LLM.
Загрузка идёт в пять стадий. Сначала CVS подключает источники — SharePoint, Google Drive, Confluence, S3, файловые серверы, а в российском контуре 1С:Документооборот, Битрикс24, Directum, Nextcloud и сетевые папки по SMB/NFS. Затем документ разбирается слоем парсинга с тройным OCR и Vision-обогащением: PDF, DOCX, PPTX, XLSX, сканы и изображения превращаются в структурированный Markdown с сохранением таблиц и рисунков.
Дальше работает умный чанкинг: текст режется не по символам, а по смыслу — на семантические фрагменты, таблицы и фигуры с якорями на страницу и абзац, чтобы цитата вела точно в источник. Стадия обогащения извлекает сущности, метаданные, диффы версий документа и темпоральные факты. На финальной стадии каждый фрагмент уходит в многослойную индексацию сразу в пять хранилищ.
Каждый запрос проходит через Intent Router — LLM-классификатор намерения, который определяет минимально достаточный путь обработки. Вместо того чтобы гонять любой вопрос через тяжёлую модель, CVS направляет его в один из четырёх маршрутов и экономит до 85–95% токенов на типовом потоке запросов.
Маршруты выстроены каскадом по сложности: мгновенный ответ из кэша с нулевым расходом токенов; стандартный гибридный поиск для обычных запросов; глубокий research с синтезом по нескольким документам; и ultra-режим с декомпозицией запроса в DAG рассуждения для многошаговых аналитических вопросов. Классификация делается LLM, а не регулярными выражениями — намерение определяется по смыслу, а не по ключевым словам.
Ядро CVS — гибридный RAG из пяти ретриверов, которые запускаются одновременно по одному запросу: векторный поиск (pgvector) ловит смысловую близость, граф знаний (Neo4j) — связи между сущностями, BM25F — точные термины, номера ГОСТ и артикулы, темпоральный ретривер учитывает срок действия фактов, а фильтрация по метаданным отсекает нерелевантный контур. Ни один поиск по отдельности не видит всю картину — вместе они закрывают слепые зоны друг друга.
Пять потоков сливаются через Reciprocal Rank Fusion с константой k=60: алгоритм объединяет ранжированные списки без подгонки весов вручную. Затем cross-encoder реранкинг переоценивает топ-кандидаты в паре «запрос–фрагмент» и формирует чистый набор доказательств для сборщика ответа. На внутренних замерах такая схема даёт 94,7% точности ответа против 67–73% у систем с одним ретривером.
Большинство RAG-систем всегда что-то отвечают — даже когда доказательств нет, генерируя правдоподобную галлюцинацию. CVS работает иначе: после поиска проходит порог уверенности (confidence gate), который проверяет, достаточно ли доказательств для ответа. Если да — выдаётся ответ с цитатами, и запрос фиксируется в audit log.
Если доказательств недостаточно, CVS не выдумывает, а честно отказывается и маршрутизирует вопрос эксперту. Ответ эксперта захватывается, проверяется и патчит базу знаний — так пробел закрывается навсегда. В дереве решений нехватка доказательств помечена красным, передача на ревью человеку — янтарным. В критичных отраслях, где ошибка стоит миллионы, это снижает долю галлюцинаций с типичных 19% до менее чем 2% в продуктиве.
За 30 минут покажем, как CVS отвечает на ваши реальные вопросы со ссылками на источник — и где честно отказывается, если доказательств нет. Бесплатный пилот для квалифицированных организаций.