Поиск по тысячам документов с ответом за 5–10 секунд
Корпорация хранила тысячи документов в разных форматах — Word, Excel, PowerPoint, PDF. Найти условие договора, пункт регламента или нужный показатель означало перелопатить папки вручную. Мы собрали систему на LLM с Retrieval-Augmented Generation, которая отвечает по документам компании за секунды и показывает первоисточник.
Задача: ответ спрятан в тысячах файлов
Сотрудники тратили часы на поиск условий договоров, регламентов и показателей. Информация лежала в разнородных форматах, единого инструмента поиска не было. Требовалось дать людям один интерфейс, который находит ответ по всей базе документов и не выдумывает — отвечает строго по тексту, со ссылкой на источник.
Решение
- Парсинг и индексация всех форматов в единое векторное хранилище.
- LLM с Retrieval-Augmented Generation: ответ формируется по найденным фрагментам, а не «из головы» модели.
- Веб-интерфейс с предпросмотром документа-источника и доступом по ролям.
Что оказалось сложным
Главная сложность — держать ответы привязанными к первоисточнику и отсекать «уверенные, но выдуманные» формулировки. За это отвечали retrieval-пайплайн, реранкер и проверка ответа на соответствие найденным фрагментам.
Контроль качества
Каждый ответ сопровождается цитатой и ссылкой на документ; финальное решение остаётся за сотрудником.
Результат
поиск ответа вместо часов
точность ответов
ошибок
ускорение цикла сделки
Проект выполнялся на облачной LLM; для чувствительных данных доступна версия целиком в контуре на локальной модели (GigaChat / YandexGPT / открытые модели).
Проверим эффект за 14 дней
Оставьте заявку — пришлём план пилота и расчёт ROI по вашим данным. Покажем, где ИИ реально окупится, и честно скажем, если не окупится.