Разработали для российской компании в сфере микроэлектроники единую базу знаний, которая собирает информацию из документов, таблиц и внутренних источников, регулярно обновляет данные и предоставляет к ним доступ сотрудникам и ИИ-агентам.
До внедрения важная информация была распределена между PDF-файлами, Excel-таблицами, рабочими чатами и отдельными специалистами. Документы хранились в разных местах, часть данных устаревала, а поиск нужной информации зависел от того, знает ли сотрудник, у кого и где ее искать.
Мы объединили эти источники в централизованную систему, настроили ETL-процессы, индексацию, векторный поиск и перекрестную проверку данных. В результате база знаний стала единым источником истины для сотрудников, внутренних сервисов и внешних ИИ-агентов.
Задача
Заказчику требовалось привести в порядок большой объем разрозненной технической и корпоративной информации.
В компании использовались:
- PDF-документы, часть которых не была пригодна для автоматического чтения;
- Excel-таблицы с разной структурой и периодичностью обновления;
- технические описания и спецификации;
- материалы из рабочих чатов;
- инструкции и внутренние регламенты;
- знания, которыми фактически владели только отдельные сотрудники.
Необходимо было создать единую базу знаний, которая могла бы:
- собирать информацию из разных источников;
- преобразовывать документы в машиночитаемый вид;
- определять актуальность и достоверность данных;
- автоматически синхронизироваться с обновляемыми файлами;
- предоставлять удобный поиск для сотрудников;
- использоваться ИИ-агентами;
- стать централизованным источником информации о продуктах, процессах и технических решениях.
Главная бизнес-задача заключалась не просто в создании корпоративного хранилища файлов. Требовалась система, которая понимает содержание документов, связывает данные из разных источников и позволяет получать точные ответы на естественном языке.
Проблема
Информация внутри компании была фрагментирована.
Одни сведения находились в PDF-документах, другие — в нескольких версиях Excel-таблиц. Часть материалов передавалась через чаты, а некоторые технические детали существовали только в переписках или в памяти сотрудников.
Из-за этого возникало несколько проблем.
Сотрудники тратили много времени на поиск нужных документов и уточнение информации у коллег. Разные подразделения могли использовать разные версии одного и того же файла. Было сложно определить, какие сведения актуальны, а какие уже устарели.
Особенно критичной эта проблема становилась при работе со сложной технической продукцией. В микроэлектронике параметры компонентов, спецификации, совместимость решений и детали реализации могут быть распределены между десятками документов и таблиц.
Обычный файловый поиск не решал задачу. Он позволял найти документ по названию, но не мог ответить на конкретный вопрос, сопоставить информацию из нескольких источников или определить противоречия между версиями данных.
Без единой системы компания продолжала бы зависеть от ручного поиска и отдельных экспертов. Это замедляло работу менеджеров, маркетологов, технических специалистов и других сотрудников.
Решение
Мы разработали веб-платформу с единой базой знаний и подключили к ней внутренних и внешних ИИ-агентов.
Система автоматически получает данные из документов и таблиц, преобразует их в единый формат, проверяет, индексирует и сохраняет в централизованном хранилище.
Для обработки информации были реализованы ETL-процессы: загрузка, извлечение, очистка, нормализация и обновление данных. Для сложных документов применяются отдельные сценарии обработки PDF, таблиц и файлов с нестандартной структурой.
После загрузки материалы разбиваются на логические фрагменты, дополняются метаданными и помещаются в поисковые индексы. Векторное представление позволяет находить информацию не только по точному совпадению слов, но и по смыслу запроса.
Для повышения надежности была реализована сложная кросс-валидация. Система сопоставляет данные из нескольких источников, учитывает версии документов, даты обновления и приоритеты источников.
Полученная база знаний используется как единый источник истины. Все подключенные агенты получают информацию из одной системы и работают с актуальной версией данных.
Что реализовали
Централизованную базу знаний
Все корпоративные материалы были объединены в едином информационном контуре.
В базу знаний могут загружаться:
- PDF-документы;
- технические описания;
- инструкции и регламенты;
- Excel-таблицы;
- текстовые файлы;
- внутренние материалы компании;
- структурированные и неструктурированные данные.
Каждый источник обрабатывается по отдельному сценарию. Система извлекает содержимое, определяет структуру документа, добавляет метаданные и подготавливает информацию для поиска и работы ИИ-агентов.
Вместо набора несвязанных файлов заказчик получил управляемую базу знаний с едиными правилами хранения и обновления информации.
Обработку PDF и немашиночитаемых документов
Значительная часть информации находилась в PDF-файлах, которые нельзя было корректно обработать стандартным извлечением текста.
Для таких документов реализовали отдельный конвейер обработки. Система распознает структуру страниц, извлекает текстовые блоки, таблицы и связанные элементы, после чего преобразует данные в формат, пригодный для индексации.
При обработке учитывается расположение информации внутри документа. Это позволяет сохранять смысловые связи между заголовками, таблицами, пояснениями и техническими характеристиками.
В результате даже сложные технические материалы стали доступны для смыслового поиска и анализа агентами.
Синхронизацию Excel-таблиц
В компании использовалось несколько Excel-файлов, которые обновлялись с разной периодичностью.
Мы разработали ETL-процессы, которые:
- отслеживают изменения в таблицах;
- загружают новые версии;
- приводят столбцы и значения к единой структуре;
- проверяют корректность данных;
- выявляют дубли и противоречия;
- обновляют поисковые индексы;
- сохраняют информацию об источнике и времени изменения.
Это позволило исключить ручное обновление базы после каждого изменения таблицы.
Если исходный файл обновляется, актуальные данные автоматически попадают в базу знаний и становятся доступны сотрудникам и агентам.
Кросс-валидацию данных
Одна из главных сложностей проекта заключалась в том, что одинаковые или связанные сведения могли находиться сразу в нескольких источниках.
Например, техническая характеристика могла быть указана в PDF-спецификации, Excel-каталоге и внутреннем документе. При этом значения могли отличаться из-за разных дат обновления или ошибок при ручном заполнении.
Для решения этой проблемы реализовали механизм перекрестной проверки.
Система учитывает:
- тип источника;
- дату создания и обновления;
- версию документа;
- приоритет источника;
- совпадения и расхождения между данными;
- связи между техническими сущностями.
При обнаружении противоречий информация не объединяется бесконтрольно. Система сохраняет происхождение данных и позволяет определить, на каком источнике основан конкретный ответ.
Это повысило достоверность базы знаний и снизило риск использования устаревших характеристик.
Индексацию и векторный поиск
После обработки документы и таблицы разбиваются на смысловые фрагменты и помещаются в поисковые индексы.
Для каждого фрагмента сохраняются:
- содержание;
- источник;
- тип документа;
- дата обновления;
- версия;
- связанные сущности;
- технические параметры;
- векторное представление.
Система сочетает обычный полнотекстовый поиск и поиск по смысловой близости.
Благодаря этому пользователь может задавать вопрос естественным языком, не зная точного названия документа или формулировки из исходного файла.
Например, сотрудник может спросить о совместимости компонентов, особенностях конкретного решения или различиях между несколькими вариантами продукции. Система найдет связанные сведения в разных документах и сформирует ответ на основе актуальных источников.
Веб-интерфейс для сотрудников
Для работы с базой знаний разработали веб-интерфейс на Astro.
Через него сотрудники могут:
- искать информацию по всей базе;
- задавать вопросы на естественном языке;
- просматривать найденные источники;
- переходить к исходным документам;
- проверять, на каких данных основан ответ;
- работать с технической информацией без знания структуры хранилища.
Интерфейс рассчитан не только на технических специалистов. Им могут пользоваться менеджеры, маркетологи и другие сотрудники, которым требуется быстро разобраться в особенностях продукта или реализации.
Вместо обращения к разработчикам или инженерам сотрудник задает вопрос агенту и получает ответ со ссылками на корпоративные источники.
Внутренних ИИ-агентов
После формирования базы знаний к ней подключили внутренних ИИ-агентов.
Они помогают сотрудникам:
- находить техническую информацию;
- разбираться в характеристиках продукции;
- сопоставлять компоненты и решения;
- получать пояснения по внутренним процессам;
- готовить материалы для клиентов;
- уточнять детали реализации;
- быстрее вводить новых специалистов в рабочий контекст.
Особенно полезными агенты стали для нетехнических подразделений.
Менеджерам больше не нужно вручную изучать десятки спецификаций. Маркетологи могут получать объяснения сложных технических преимуществ понятным языком. Новые сотрудники быстрее осваивают продуктовую и техническую базу компании.
Внешних агентов на сайте
Единую базу знаний также подключили к внешним агентам на сайте компании.
Агент отвечает на вопросы пользователей, опираясь на актуальную корпоративную информацию. Он может рассказывать о продукции, объяснять характеристики и помогать подобрать подходящее решение.
При этом ответы формируются не на основе общих знаний языковой модели, а на основе проверенных данных компании.
Если исходные документы или таблицы обновляются, новая информация автоматически становится доступна сайту. Заказчику не требуется отдельно изменять инструкции каждого агента.
Это позволяет использовать базу знаний как центральный слой между корпоративными данными и любыми пользовательскими интерфейсами.
Контроль источников и актуальности
Для каждого ответа система сохраняет связь с исходными материалами.
Пользователь может увидеть, из какого документа, таблицы или раздела была получена информация. Это особенно важно при работе с техническими характеристиками и внутренней документацией.
Кроме того, система учитывает даты обновления и версии источников. Устаревшие данные могут исключаться из выдачи или использоваться с более низким приоритетом.
Такой подход снижает риск того, что агент сформирует убедительный, но неверный ответ на основе старого документа.
Техническая основа
Проект построен на модульной архитектуре и контейнеризирован с помощью Docker.
В проекте использовались:
- Astro;
- Docker;
- инструменты обработки PDF и документов;
- OpenAI SDK;
- Codex SDK;
- ETL-процессы;
- полнотекстовые поисковые индексы;
- векторное хранилище;
- файловое хранилище;
- механизмы кросс-валидации;
- фоновые процессы синхронизации данных.
Архитектура разделена на несколько функциональных уровней:
- загрузка исходных материалов;
- извлечение информации;
- нормализация данных;
- проверка и кросс-валидация;
- хранение файлов и метаданных;
- построение поисковых индексов;
- создание векторных представлений;
- поиск релевантного контекста;
- взаимодействие с ИИ-агентами;
- веб-интерфейс для пользователей.
Такая структура позволяет развивать систему без полной переработки платформы.
Можно подключать новые источники данных, добавлять форматы документов, создавать агентов для отдельных подразделений и внедрять дополнительные сценарии автоматизации.
Результат
Заказчик получил единую базу знаний, которая стала централизованным источником корпоративной и технической информации.
Документы, таблицы и другие материалы больше не существуют как отдельные несвязанные файлы. Они проходят автоматическую обработку, проверку, индексацию и становятся частью единого информационного пространства.
Сотрудники могут находить нужные сведения через поиск или задавать вопросы ИИ-агенту. Им больше не требуется знать точное название документа, расположение файла или сотрудника, который владеет нужной информацией.
Внешние агенты на сайте используют ту же базу и отвечают клиентам на основе актуальных данных. Внутренние агенты помогают менеджерам, маркетологам и другим нетехническим специалистам разбираться в сложных деталях продукции и реализации.
Обновление исходных документов автоматически отражается в системе. Благодаря этому все интерфейсы и агенты работают с общей актуальной версией знаний.
Что получил заказчик
- Единую базу знаний вместо разрозненных файлов и таблиц.
- Автоматическую обработку PDF и других сложных документов.
- ETL-процессы для синхронизации регулярно обновляемых данных.
- Кросс-валидацию информации из нескольких источников.
- Полнотекстовый и векторный поиск.
- Веб-интерфейс для сотрудников.
- Внутренних агентов для менеджеров, маркетологов и технических специалистов.
- Внешних агентов для сайта компании.
- Ответы со ссылками на исходные материалы.
- Контроль версий, источников и актуальности данных.
- Архитектуру, которую можно расширять новыми источниками и сценариями.
Проект превратил накопленные знания компании из набора документов, таблиц и личной экспертизы сотрудников в управляемую цифровую систему.
Теперь база знаний является единственным источником истины: данные загружаются и обновляются централизованно, сотрудники быстрее получают нужную информацию, а внутренние и внешние ИИ-агенты формируют ответы на основе актуальных и проверенных корпоративных материалов.