Загрузка 0
ПОДЕЛИТЬСЯ

Мой блог

Листай вниз

Развитие семантического анализатора Real AI SA: работа с текстом без LLM

Развитие семантического анализатора Real AI SA: работа с текстом без LLM

Прошло уже более двух лет с момента моей последней публикации, поэтому я решил подвести промежуточные итоги проекта Real AI SA. За это время я потратил восемь миллионов рублей, пополнил базу знаний примерно до 5000 понятий и успешно провел первый бесплатный пилот. Детали этого этапа и подробности нашей разработки можно узнать, изучив оригинальный материал на Хабре.

Напомню, что в рамках нашего проекта я разрабатываю специализированный семантический анализатор, который строит граф связей из текста без использования больших языковых моделей (LLM).

Почему мы сознательно отказался от использования LLM

Я сразу хочу оговориться: я вовсе не противопоставляю наш анализатор Real AI SA нейросетям и крупным языковым моделям. Они действительно крайне эффективны и отлично автоматизируют множество рутинных операций. Тем не менее, существуют специфические рабочие сценарии, где задействовать LLM либо невозможно физически, либо их итоговый результат оказывается слишком далек от ожидаемого.

Реклама
Развитие семантического анализатора Real AI SA: работа с текстом без LLM
Развитие семантического анализатора Real AI SA: работа с текстом без LLM
Развитие семантического анализатора Real AI SA: работа с текстом без LLM
Развитие семантического анализатора Real AI SA: работа с текстом без LLM
Развитие семантического анализатора Real AI SA: работа с текстом без LLM
Развитие семантического анализатора Real AI SA: работа с текстом без LLM
Развитие семантического анализатора Real AI SA: работа с текстом без LLM

Подобные ограничения возникают в нескольких характерных ситуациях:

  • Когда требуется абсолютная, стопроцентная повторяемость результата без вероятности появления галлюцинаций или произвольных трактовок.
  • Если полностью отсутствуют ресурсы для дообучения модели: нет ни качественного массива размеченных данных, ни специализированных кадров, ни мощной вычислительной инфраструктуры.
  • При жестких финансовых ограничениях, которые не позволяют приобретать дорогостоящее серверное оборудование или оплачивать внушительные счета за электроэнергию.
  • Когда ведется работа с конфиденциальными сведениями и действует строгий запрет на утечку или передачу любой информации за пределы закрытого внутреннего контура.
  • Когда задействование LLM объективно выглядит избыточным и громоздким для решения узкой прикладной задачи по текстовому анализу.

Именно в таких сценариях на первый план выходит разработанный мной Real AI SA. Данный инструмент способен успешно функционировать даже на устаревшем ноутбуке, если в нем установлено хотя бы четыре гигабайта оперативной памяти. Кроме того, анализатор не нуждается в постоянном доступе к глобальной сети и не требует гигабайтных массивов предварительно размеченной информации для обучения.

Подробный разбор механизма работы анализатора

В основе алгоритма лежит поиск понятий в текстовом массиве и выявление характера связей между ними. На выходе моя система формирует готовый граф текста, представленный в удобном формате JSON.

Чтобы было понятнее, как это выглядит на практике, я подготовил иллюстрацию. На изображении ниже показано визуальное представление модели для конкретной сложной фразы:

Фрагмент построенной модели текста и соответствующий ему выходной JSON
Фрагмент модели и соответствующий JSON

Визуальное представление модели фразы после обработки анализатором

Реклама

После того как базовая модель успешно построена, из полученного JSON-файла можно легко извлекать абсолютно любые требуемые данные. Например, программа позволяет быстро вытащить порядковые номера всех упомянутых в документе распоряжений:

Фрагмент модели и соответствующий JSON

В чем фишка? Плюсы, минусы и подводные камни нашей технологии

Любой входящий текст последовательно раскладывается по строгим грамматическим и семантическим признакам, после чего все выделенные элементы распределяются по трем категориям: Действия, Свойства и Объекты. Почему мне хватило именно этих типов? Здесь в дело вступает теоретическая база, которую я заложил в основу проекта.

Познавая окружающий мир, человек постоянно совершает те или иные действия. Опираясь на полученную обратную связь, мы формируем целостное описание всего пространства вокруг нас. Следовательно, по аналогии, любой текстовый документ как инструмент сохранения и обмена информацией можно разложить по тому же самому фундаментальному принципу — на описание активных действий и их закономерных результатов в виде свойств. При этом сами объекты выступают в роли относительно стабильной совокупности таких свойств.

Демонстрация работы закрытого модуля с реальными приказами и извлечением данных
Суровое непубличное демо с приказами и извлекаемой из них информацией

Какой практический эффект это обеспечивает? Выделю ключевые преимущества:

  • Полное отсутствие необходимости трудоемкой проработки онтологии для конкретной предметной области.
  • Возможность описывать понятия без жесткой привязки к громоздким системам классов.
  • Максимально легкое и быстрое масштабирование базы.
  • Минимальные системные требования к аппаратным ресурсам.
  • Способность полноценно работать в изолированной среде без подключения к интернету.
  • Полностью проверяемый, детерминированный и повторяемый результат обработки.

Разумеется, я честно признаю наличие определенных ограничений текущей версии. На данном этапе анализатор умеет работать исключительно с текстовыми файлами, а не со сканами или изображениями документов. Весь входящий материал должен быть написан на русском языке, хотя после дополнительного дообучения допускается использование аббревиатур и иностранных названий. Тексты с орфографическими ошибками или специфическим сленгом система, скорее всего, разберет некорректно. Кроме того, пока ощущается нехватка «common knowledge» — общеизвестных понятий и базовых связей между ними; эти данные приходится вносить вручную, и их набор пока ограничен. Наконец, проект продолжает развиваться, поэтому при внедрении мне часто приходится лично участвовать в пусконаладке.

Где мы уже принесли пользу

Как известно, практика — главный критерий истины, поэтому от сухой теории я перешел к реализации реальных бизнес-задач. Первым опробованным сценарием стала автоматизация извлечения матрицы поручений из официальных приказов и распоряжений.

Реклама

Главная цель заключалась в снижении колоссальной нагрузки на аппарат руководителя проекта. Существовал устоявшийся регламент: через помощников ежедневно проходило множество распорядительных документов, которые требовалось вручную анализировать, а затем передавать пункты поручений ответственным исполнителям через корпоративную систему электронного документооборота (ЭДО). В среднем на вдумчивую обработку одного такого документа у сотрудника уходило от семи до десяти минут.

Мое решение идеально подошло под этот сценарий, поскольку исходные документы не нарушали установленных ограничений: они были корректно составлены на русском языке, находились в читаемом электронном формате и не требовали трудоемкого распознавания сканов.

Суровое непубличное демо с приказами и извлекаемой из них информацией

Пример автоматического извлечения структурированных поручений из текста приказа
Пример извлечения структурированной информации из приказа

Единственное, что мне потребовалось доработать на старте — расширить внутреннюю базу знаний специфическими терминами и аббревиатурами из данной конкретной сферы. В результате получился работоспособный модуль для действующей системы ЭДО, который полностью в автоматическом режиме выявлял все поручения, сократив затраты времени почти в сорок раз — до пятнадцати секунд.

Пример извлечения структурированной информации из приказа

Задача была успешно решена, а компания получила ценный референс, однако масштабировать пилот на другие организации сходу не получилось. Проанализировав ситуацию, я выделил несколько сдерживающих факторов:

  • Сценарий работы с поручениями оказался слишком узким и локальным.
  • Высшее руководство не всегда заинтересовано в реальном упрощении жизни своих подчиненных. Например, на мой аргумент о сокращении временных затрат в сорок раз я порой слышал откровенный контраргумент: «А чем они тогда будут заниматься в свободное время, чай пить?».
  • Для заметного экономического эффекта от внедрения требуется предприятие с колоссальным бумажным документооборотом, а значит — с огромным количеством лиц, принимающих решения, среди которых всегда есть противники любых нововведений.
  • В крупных корпорациях часто наблюдается сильный разрыв между официальной отчетностью для топ-менеджмента и реальным положением дел на местах. У меня был случай, когда руководители уверяли меня, будто у них давным-давно все процессы анализируются искусственным интеллектом, но в ходе общения с рядовыми исполнителями внизу мы обнаруживали лишь замученного сотрудника, на которого и были возложены все функции «живого ИИ».

К сожалению, бывает и так

Иллюстрация сложностей внедрения ИИ-технологий в крупных корпорациях
К сожалению, бывает и так

Опираясь на полученный ценный опыт, сейчас я активно развиваю анализатор для решения более универсальной и масштабной задачи, которая востребована не только среди промышленных гигантов, но и в сегменте малого и среднего бизнеса. Речь идет об инструменте для поддержания корпоративного архива документов в актуальном состоянии.

Вместо заключения

Уже сегодня мой семантический анализатор демонстрирует отличные результаты там, где критически важна абсолютная точность лингвистического анализа и полная повторяемость результатов. В качестве наглядной демонстрации я провел сравнение морфологического разбора непростой фразы «Ушей это платье», сопоставив работу Real AI SA и модели claude-opus-5-medium:

С технической точки зрения мне удалось достичь весьма любопытных результатов, которые четко обозначают дальнейшие векторы развития продукта. Главная трудность классических систем на основе правил всегда заключалась в излишней жесткости объектно-ориентированного подхода и принципиальной невозможности масштабировать громоздкие ручные онтологии. Пожалуй, самой масштабной попыткой построить универсальную онтологию, где для каждого слова нашлось бы свое место, был амбициозный проект Compreno, который в итоге так и не был завершен.

В Real AI SA я пошел другим путем: полностью отказавшись от моделирования по принципу «сверху вниз» и сосредоточившись исключительно на базовых структурных элементах — действиях, свойствах и объектах — мне удалось обойти проблему лавинообразного роста сложности и вычислительных затрат при расширении базы знаний за пределы одной узкой темы. На текущий момент анализатор уверенно оперирует примерно пятью тысячами понятий, успешно справляется с омонимией, эллипсисами и ссылками, сохраняя описания понятий компактными.

Сравнение морфологического разбора сложной фразы анализатором и моделью claude-opus-5-medium
Сравнение морфологического разбора фразы

Очевидно, что за данной технологией стоит серьезный потенциал. Мне было бы крайне интересно узнать, с какими нетривиальными задачами текстового анализа сталкивалось сообщество и видят ли коллеги перспективы внедрения подобных семантических анализаторов. В конце концов, глупо сводить всю современную IT-индустрию исключительно к созданию агентов и бесчисленных LLM-оберток.

Желающие могут протестировать открытое демо на моем сайте t2graph.ru (процедура максимально простая, без регистраций и СМС, с ограничением в один запрос за пять секунд). Если же вы хотите предметно оценить применимость анализатора для автоматизации ваших собственных бизнес-процессов, смело пишите на электронную почту info@real-ai.ru — я с радостью организую для вас живую демонстрацию.

01.