LIVE
Новость

Интеллектуальный парсинг документов от Диасофт для подготовки данных к работе с LLM

«Диасофт» представил «Сервис интеллектуального паркинга документов» — продукт, который готовит неструктурированные данные для LLM-проектов и RAG-сценариев, сообщает ICT-Online.ru.

Фаина Королёва·обновлено 30 июля 2026 г.

Интеллектуальный парсинг документов от Диасофт для подготовки данных к работе с LLM

Для команд, запускающих ИИ-ассистентов на корпоративных массивах, это попытка закрыть конкретный затык: PDF со сложной вёрсткой и сканы, на которых модели галлюцинируют и теряют таблицы.

Где сейчас спотыкаются пайплайны

По данным издания, типовая картина при подготовке данных под RAG выглядит так: PDF с многоуровневыми таблицами превращаются в нечитаемую кашу, сканы без OCR-слоя уходят в эмбеддинги пустыми, объединённые ячейки ломают связи между сущностями. Поиск возвращает нерелевантные фрагменты, ассистент уверенно ссылается на несуществующие пункты регламента, и заказчик откладывает запуск ИИ-ассистента на неопределённый срок.

Руководитель продукта «Фабрика данных» Илья Шуйков в комментарии ICT-Online.ru описывает ситуацию прямо: заказчики часто отказываются от внедрения именно из-за «грязных» входных данных — PDF с таблицами или сканы плохо индексируются, нейросеть галлюцинирует. Сервис, по его словам, решает задачу «из коробки»: не просто распознаёт символы, а сохраняет логику документа и выдаёт готовый для RAG формат — Markdown или JSON.

Как устроен продукт

Сервис построен на микросервисной архитектуре и поддерживает контейнеризированное развёртывание в контуре заказчика. Это снимает классический вопрос безопасности: документы не покидают периметр компании, что критично для банков, госкомпаний и юридических подразделений. При росте нагрузок платформа масштабируется за счёт контейнеров — отдельные микросервисы можно разнести по разным нодам без переписывания пайплайна.

Дополнительный эффект — снижение зависимости от зарубежных библиотек: в источнике прямо упомянуты Docling и Apache Tika. Для команд, которым нужно уходить от иностранного стека, это прямой путь к импортозамещению без потери функциональности и без долгого переписывания собственных конвейеров конвертации.

Что проверить до пилота

Публикация ICT-Online.ru не содержит независимых бенчмарков качества — все оценки идут со слов вендора. Перед запуском имеет смысл запросить у «Диасофта» тестовый прогон на собственных документах со смешанной вёрсткой, сравнить выходные Markdown и JSON с текущим конвейером глазами предметного эксперта, а не только разработчика, и уточнить SLA по времени обработки на типичном объёме вместе со стоимостью при росте нагрузок. Отдельный пункт — проверить, как сервис ведёт себя на сканах с рукописными пометками и таблицах с объединёнными ячейками: именно эти кейсы чаще всего становятся точкой отказа у самописных решений.

На фоне общей волны инструментов для работы с документами и ИИ полезно отслеживать, как подобные сервисы встраиваются в реальные процессы — свежие разборы по теме регулярно публикуются в профильных разделах.