Поиск по корпоративным знаниям: с часов до минуты
Крупный производственный холдинг
- Более 10 000
- материалов доступны через единый поиск
- 1 500 устаревших
- документов выявили в базе знаний
- С часов до минуты
- сократилось получение нужной информации
У крупного производственного холдинга накопилось больше десяти тысяч материалов в корпоративной базе знаний, но сотрудникам было трудно найти среди них ответ на свой вопрос. Мы внедрили наш продукт Clairon в закрытом контуре компании, и теперь получение информации, на которое раньше уходили часы, занимает меньше минуты. А в процессе внедрения обнаружили полторы тысячи документов с дублями, устаревшими сведениями и противоречиями и помогли владельцам базы навести в ней порядок.
Знания есть, но где они лежат?
У подразделений холдинга свои разделы общей базы знаний: статьи со ссылками друг на друга, иллюстрации и вложения самых разных форматов – от Word и PDF до таблиц Excel и презентаций. За базой следят сотрудники, которые поддерживают материалы и стараются все упорядочить. Казалось бы, информация собрана, доступ к ней есть, можно пользоваться.
На практике обычный поиск выдавал множество документов, и дальше человеку предстояло самому понять, какой из них отвечает на вопрос и на какую версию можно ориентироваться. В компании было буквально несколько людей, которые хорошо знали устройство базы знаний, поэтому коллеги постоянно обращались к ним за помощью.
Но даже эта нагрузка была только частью проблемы. Многие сотрудники вообще не спрашивали и тратили часы на другие способы что-то выяснить, хотя нужная информация уже лежала рядом. Получалось, что компания вкладывается в накопление знаний, а воспользоваться ими в повседневной работе трудно.
Находим ответ и показываем, откуда он взялся
Мы развернули Clairon в инфраструктуре заказчика, подключили корпоративную базу знаний и настроили поиск с учетом отраслевой терминологии и содержания документов. Сотрудник задает вопрос обычным языком, система находит и изучает подходящие материалы, сопоставляет сведения из них и формирует ответ с фрагментами источников и ссылками на исходные страницы. Можно сразу перейти к документу или продолжить разговор, чтобы разобраться в деталях.
Здесь важно, какую роль мы отводим модели. Она помогает ориентироваться в знаниях компании, поэтому ответ всегда связан с исходными материалами. Если два документа противоречат друг другу, система честно показывает оба варианта и объясняет, в чем расхождение.
За этим стоит несколько этапов поиска. Сначала Clairon разбирается в смысле вопроса и подбирает формулировки, под которыми нужная информация может встречаться в документах. Затем сочетает векторный поиск, который ищет по смыслу фразы, с оптимизированным текстовым поиском: он помогает находить точные совпадения специальных терминов, обозначений моделей и номенклатуры. Найденные фрагменты объединяются, а отдельная модель, настроенная под данные заказчика, оценивает их соответствие вопросу и отбирает наиболее подходящие для подготовки ответа.
При этом знания компании не ограничиваются текстом статей. Clairon анализирует документы Word, таблицы Excel, слайды PowerPoint, PDF-версии любых документов, включая отсканированные, а также картинки, скриншоты и другие иллюстрации. Все эти материалы могут быть вложениями к статьям или отдельными файлами: система распознает их содержимое и использует его при поиске и подготовке ответов.
Сложность в том, что прочитать все слова в документе еще недостаточно, чтобы понять его смысл. На слайде расположение блоков и соединяющие их стрелки могут объяснять последовательность действий или зависимость одного процесса от другого. В таблице значение числа определяется строкой и столбцом, а график передает соотношения и изменения, которых вообще нет в подписях. Если просто извлечь текст, эти связи потеряются вместе с частью знаний, ради которых документ и создавался.
Поэтому при индексации специальные модели анализируют визуальное содержание и описывают, что показывает схема, как связаны ее элементы и какая информация передана на графике или иллюстрации. Это описание включается в поисковый индекс, поэтому пользователь может получить ответ, основанный на сведениях из картинки в приложенной презентации, даже если в самой статье эти сведения нигде не написаны.
В итоге вместо того, чтобы раз за разом открывать документы из обычной поисковой выдачи и обнаруживать, что они не про то, сотрудник за 20–30 секунд получает осмысленный ответ на свой вопрос с нужными фрагментами материалов и ссылками на источники. Он может проверить, на чем основан ответ, попросить объяснить детали или задать уточняющий вопрос в том же чате.
Корпоративные данные остаются внутри компании
Вся система работает в закрытом контуре заказчика, включая языковые модели: документы и вопросы сотрудников никуда не передаются. При этом для внедрения не понадобилась большая вычислительная инфраструктура: мы подобрали и оптимизировали модели под задачу, чтобы поиск мог работать на доступном оборудовании.
Каждую ночь индекс обновляется инкрементально: система обрабатывает новые и измененные материалы, поэтому заново перечитывать всю базу не нужно. Такой режим помогает экономно использовать оборудование и поддерживать актуальность поиска.
Системой пользуются все основные подразделения холдинга, при этом доступ к знаниям разграничивается на основе групп пользователей в корпоративном Active Directory. Сотрудник получает ответы с учетом своих прав и может самостоятельно проверить их по доступным ему документам, не разыскивая человека, который помнит, где хранится нужная информация.
Знания, которые компания собирала годами, стало гораздо проще использовать в ежедневной работе.
Нашли то, что годами мешало пользоваться знаниями
Когда мы собрали материалы в единый смысловой индекс, стало видно, как база за годы обросла копиями, старыми версиями и противоречиями. Где-то повторялись целые документы, где-то один и тот же фрагмент встречался в разных материалах, а где-то на один вопрос находились взаимоисключающие ответы. По отдельности каждая такая статья могла выглядеть вполне нормально; проблема обнаруживалась, когда ее содержание сопоставляли с остальными знаниями компании.
В общей сложности мы выявили около полутора тысяч таких документов и собрали для владельцев базы карту проблем: что дублируется, где остались исторические версии и какие сведения нужно согласовать между собой. Сотрудники могли сразу переходить к конкретным материалам и разбирать найденные расхождения, вместо того чтобы вручную перечитывать и сравнивать тысячи страниц.
По этой карте они убрали дубли, сократили количество неактуальной информации и разобрались с противоречиями. Внедрение поиска превратилось еще и в инвентаризацию накопленных знаний с помощью ИИ: система помогла обнаружить ту путаницу, из-за которой сотрудники раньше не понимали, на какой документ можно опереться.