Загрузка 0
ПОДЕЛИТЬСЯ

Мой блог

Листай вниз

Локальный медицинский ИИ на ноутбуке с 4 ГБ VRAM: архитектура RAG на фундаментальных монографиях

Локальный медицинский ИИ на ноутбуке с 4 ГБ VRAM: архитектура RAG на фундаментальных монографиях

Юридический дисклеймер и статус исследования

Описанная в данном материале система представляет собой научно-исследовательский концепт (Proof of Concept) и мой личный локальный проект. Система развернута исключительно на автономном оборудовании, не имеет открытых сетевых API или публичного веб-интерфейса, не монетизируется и не предназначается для коммерческого использования.

Программное обеспечение не является медицинским изделием, не предназначено для постановки диагнозов, назначения фармакотерапии или автоматизированного принятия клинических решений. Автор не оказывает медицинских услуг. Обработка данных реальных пациентов не производится, а все используемые в тестах промпты и логи являются синтетическими. База из 2500 монографий применяется строго локально в персональных научно-образовательных целях без распространения исходных текстов, защищенных авторским правом.

Визуализация данных и просмотр DICOM снимков
Интегрированный вьюер позволяет сопоставлять результаты RAG-поиска со снимками в ортогональных проекциях.

1.0 Введение: зачем нужен локальный ИИ-помощник в лечебном деле

Каждый из нас столкнется с ситуацией, когда близкий человек сталкивается с тяжелым заболеванием, а серия визитов к врачам и лабораторных анализов не дает четкого понимания причины. Это типичный сценарий, осложненный высочайшим стрессом, который мешает человеку трезво систематизировать выписки, результаты обследований и противоречивые рекомендации.

Реклама

Чтобы эффективно разобраться в проблеме, требуется обработать огромный массив фундаментальной литературы, сопоставить его с клинической картиной и лабораторными показателями. Для человека без глубокого медицинского образования и феноменальной памяти это практически невыполнимая задача. Однако технологии векторного поиска и генерации с расширенным поиском (RAG) на базе языковых моделей способны кардинально изменить ситуацию.

За годы работы прикладным математиком в области биомедицины у меня сформировалась обширная цифровая библиотека научной литературы. Моей личной и инженерной мотивацией стала сборка инструмента, который помог бы структурировать эти знания. С профессиональной точки зрения такой ассистент сжимает дистанцию между рядовым специалистом и узкопрофильным экспертом, позволяя за секунды извлекать нужный контекст из тысяч фундаментальных монографий.

2.0 Аппаратные ограничения: развертывание на бытовом железе

Для создания действительно полезной системы необходимо заложить жесткие эксплуатационные и аппаратные рамки:

  • Полная конфиденциальность и автономность (офлайн): чувствительные медицинские или персональные данные никогда не должны покидать локальный контур. Система должна корректно функционировать без доступа к сети Интернет.
  • Доступное серийное оборудование: инструмент должен работать на обычном потребительском ноутбуке, а не требовать серверных стоек с высокопроизводительными ускорителями.

Хотя запускать подобный инструмент удобнее всего на мобильном телефоне, базовый расчет ресурсов показывает необходимость флагманского смартфона верхнего ценового сегмента. Поэтому целевой аппаратной платформой был выбран рядовой рабочий ноутбук под управлением Ubuntu Linux с жестко лимитированным бюджетом ресурсов: 4 ГБ видеопамяти (VRAM) и 16 ГБ оперативной памяти (RAM).

Реклама
Интерфейс приложения MedAI Assistant на мобильном устройстве
Мобильный веб-интерфейс MedAI Assistant с блоком логирования агентов и рабочей зоной DICOM-исследований.

Главная цель проекта — построить эффективный ускоритель семантических исследований. Эта система не заменяет клинициста и не принимает решения, а служит инженерам и исследователям для молниеносного извлечения научных фактов из мировой литературы.

3.0 Архитектура базы данных RAG: ставка на фундаментальные монографии

Классические медицинские RAG-системы обычно строятся по трехуровневому принципу: операционный уровень (клинические протоколы и алгоритмы), уровень безопасности и законодательства, а также пояснительный уровень (научная литература). Однако для научно-исследовательского поиска клинические протоколы и нормативные акты были осознанно исключены.

На это есть две веские причины:

  1. Системный разрыв между статистикой и индивидуальной биологией: стандартные протоколы ориентированы на усредненную популяцию. Их навязывание при анализе уникального случая создает риск математической ошибки и смещения результатов поиска.
  2. Временной лаг внедрения: согласно исследованиям (Balas & Boren, 2000), путь от научной публикации до официального утверждения в клиническом протоколе занимает от 10 до 17 лет. В случае сложных патологий официальные руководства по определению отстают от переднего края науки.

Вместо протоколов и журнальных статей типа PubMed база данных была сформирована из 2500 фундаментальных монографий (порядка 1,5 млн страниц) от ведущих мировых издательств. В отличие от периодических статей, которые часто содержат локальный шум, противоречивые гипотезы и узкие кейсы, монографии предлагают проверенный, синтезированный и системный взгляд на проблему.

Ограничение VRAM в 4 ГБ заставляет использовать небольшое контекстное окно. Высокая плотность информации в текстовых чанках из монографий идеально подходит под эти условия, предотвращая переполнение памяти 4-битно квантованной локальной модели. Дополнительно база была расширена фундаментальными работами по биохимии, генетике и вирусологии, что оказало решающее значение для точного анализа фармпрепаратов и метаболических путей.

Опыт показал, что свободный семантический поиск по всей библиографической базе работает эффективнее, чем попытки предварительно классифицировать запрос по узким разделам медицины (кардиология, неврология и т.д.). Биология человека настолько переплетена, что жесткое разделение областей приводит к потере важных междисциплинарных связей.

4.0 Агентная система, системные инструкции и трехэтапный реранжинг

Ограниченный бюджет видеопамяти делает невозможным запуск полноценной мультиагентной системы с отдельным агентом-оркестратором. Для решения этой проблемы я применил подход с несколькими специализированными системными инструкциями (промпт-персонами) в рамках единой модели:

Реклама
  • Medical Assistant: поиск клинической информации и симптоматики.
  • Pharm 1: классификация лекарств, дозировки и межлекарственные взаимодействия.
  • Pharm 2: углубленная фармакокинетика и данные клинических испытаний.
  • Biochem: анализ молекулярных путей, биохимических показателей и метаболизма.
  • Search Engine: модуль точного извлечения цитат, первоисточников и текстовых описаний патологий.

Вместо тяжелого агента-рецензента была реализована состязательная концепция «адвоката дьявола» (агент-критик). Пользователь выступает в роли главного супервизора, самостоятельно управляющего ходом исследования и сопоставляющего ответы разных ролей.

Все промпты требуют строго научного, эмоционально нейтрального тона. Модели запрещено использовать эмпатичные фразы или лесть. Также модель обязана формировать краткую аннотацию первичного запроса — это позволяет сразу выявить галлюцинацию или неверную интерпретацию термина на раннем этапе.

Трехэтапный гибридный реранжинг без кросс-энкодера

Запуск отдельной нейросети для переранжирования (например, BGE-Reranker) неизбежно исчерпал бы 4 ГБ VRAM. Поэтому был внедрен изящный алгоритм переранжирования средствами FAISS и локальной LLM:

  1. Дублирование запроса: система обрабатывает оригинальный промпт пользователя и его автоматически переформулированную версию, где сложная терминология раскрывается простыми словами.
  2. Векторный выбор в FAISS: из базы извлекается топ-X чанков по исходному запросу и топ-Y по переформулированному.
  3. Синтез локальной LLM: текстовые фрагменты, попавшие в оба списка, получают двойной вес. Локальная LLM получает эти приоритетные чанки, устраняет дубли и формирует итоговый структурированный ответ.

5.0 Обработка медицинских изображений и интерактивная визуализация DICOM

Традиционные мультимодальные модели требуют значительных ресурсов VRAM. Чтобы извлекать ценную графическую информацию из монографий без тяжелых Vision-трансформеров, я задействовал библиотеку PyMuPDF (fitz).

Скрипт локализует рисунки в документах, извлекает подписи к ним, проверяет кросс-корреляцию с текстом на соседних страницах и выводит релевантные иллюстрации патологий (КТ, МРТ, УЗИ) вместе с названиями книг и номерами страниц.

Для работы со сканами исследований на стеке Python и JavaScript был написан встроенный DICOM-вьюер. Он поддерживает:

  • Отображение трех ортогональных проекций (аксиальная, корональная, сагиттальная);
  • Интерактивное перекрестие и навигацию по срезам;
  • Размещение окна вьюера бок о бок с найденными иллюстрациями из монографий для визуального сравнения.

Попытка реализовать 3D-рендеринг DICOM на связке Python/JS показала недостаточную производительность в рамках заданного железа, поэтому в будущем данный блок планируется переписать на C++.

6.0 Оценка эффективности, стресс-тесты и практическое применение

Стандартные медицинские тесты (board exams) непригодны для объективной оценки этой RAG-системы из-за проблемы загрязнения данных (data contamination) — правильные ответы уже содержатся в индексированных учебниках. Главным метрическим критерием является детерминированная проверяемость (deterministic auditability): возможность пользователя мгновенно подтвердить любой вывод модели точной ссылкой на монографию, автора и страницу.

В качестве ретроспективного стресс-теста я загрузил в систему обезличенные данные собственных медицинских анализов и обследований за много лет. Имея полные сведения об исходах, я смог убедиться в точности работы ассистента: система корректно подсветила нюансы взаимодействия систем организма, которые ранее оставались незамеченными.

Практическая польза архитектуры вымывает границы чисто клинического применения. В ходе разработки ПО для цифровой ангиографии при отсутствии подробного ТЗ и контакта с радиологом, система RAG за минуты нашла ключевую монографию по ангиографической визуализации. Ограничив контекст этой книгой, я быстро изучил предметную область, поняв логику специалистов и клинические требования к софту.

Заключение

Созданный инженерный концепт доказывает, что при грамотной архитектуре RAG, жестком отборе литературы и оптимизации конвейера поиска можно построить полнофункциональный автономный ИИ-поисковик на обычном ноутбуке с 4 ГБ VRAM. Отказ от шумной периодики в пользу проверенных монографий гарантирует высокую точность и безопасность извлекаемых знаний.

Источник: habr.com

01.