Мой блог
BentoPDF: локальный инструмент для работы с PDF прямо в браузере
Работа с электронными документами через сторонние веб-сервисы часто сопряжена с рисками утечки конфиденциальных данных и корпоративной информации. В качестве альтернативы классическим облачным сайтам разработчики предлагают открытый набор утилит BentoPDF, который выполняет все операции непосредственно внутри браузера пользователя без отправки файлов на удаленные серверы.
Проект унаследовал технологии WebAssembly и движок Tesseract.js, что позволяет обрабатывать тяжелые файлы и производить распознавание текста локально на аппаратной части вашего компьютера.


Обзор возможностей и архитектуры BentoPDF
Инструмент был создан независимым разработчиком из Индии по имени Алам (Alam). Изначально утилита задумывалась как внутренний скрипт для разделения и объединения PDF-страниц, однако позднее автор опубликовал исходный код на Reddit и GitHub. Проект распространяется под двойной лицензией: код доступен бесплатно по условиям AGPL-3.0 для свободного использования и форков, тогда как для закрытого коммерческого применения предусмотрена покупка разовой лицензии стоимостью 79 долларов США. Помимо основного редактора, разработчик развивает сопутствующие проекты Hyper Compress для сжатия файлов и Kura для конвертации документов в стандарты PDF/A и PDF/UA.

Редактирование текста, аннотации и водяные знаки
Интерфейс программы включает специализированный модуль редактирования текстовых блоков, которые выделяются пунктирной рамкой. При выборе фрагмента открывается боковая панель с параметрами настройки шрифта, размера, цвета, межсимвольного интервала и выравнивания, а также стандартными стилями вроде жирного или зачеркнутого начертания. Пользователи могут задействовать системные шрифты операционной системы Linux и просматривать метаданные документа с помощью информационной кнопки.
Режим аннотирования ориентирован на совместную работу и рецензирование: здесь доступны инструменты выделения маркером, зачеркивания, добавления комментариев, рисования от руки и вставки новых текстовых полей. Дополнительно предусмотрена функция нанесения защитных водяных знаков в виде текста или изображений с гибким выбором расположения и прозрачности. Поддерживаются привычные системные комбинации горячих клавиш для отмены действий, повтора, копирования и вставки.

Распознавание текста через OCR
Для работы со сканированными отчетами и документами, состоящими исключительно из растровых изображений или графиков, в системе предусмотрен модуль оптического распознавания символов. Процедура OCR запускается после загрузки файла и выбора необходимых языков. Обработка выполняется локально, после чего извлеченный текст можно скопировать в буфер обмена, сохранить в текстовом формате .txt или экспортировать как полноценный PDF-файл с возможностью поиска.

Конвертация файлов
Набор конвертеров позволяет преобразовывать страницы PDF в растровые изображения JPG с регулировкой качества сжатия с помощью ползунка. Обратная операция Images to PDF принимает на вход графику в форматах PNG, BMP, HEIC и PSD. Кроме того, поддерживается трансформация файлов в десятки других популярных форматов, включая Markdown, EPUB, JSON, CSV, WebP и ODP.

Быстрое сжатие документов
Ограничения почтовых сервисов на размер вложений часто требуют уменьшения объема отправляемых файлов. Встроенный инструмент сжатия предлагает два алгоритма: универсальный «Condense» и специализированный «Photon» для документов с большим количеством изображений. Пользователь может выбрать уровень компрессии от минимального («Light») до максимального («Extreme»). Тестирование показало значительное сокращение размера тяжелых многостраничных документов при сохранении читаемости основного содержимого.
Заключение и доступность проекта
Функционал платформы включает более сотни различных утилит для работы с документами, размещенных на главной странице сервиса. Исходный код проекта, подробности технического стека и инструкции по развертыванию доступны в официальном репозитории на GitHub для всех участников сообщества.
