Блог

AI Document Processing: промышленный пайплайн от файла до данных в ERP

Архитектура IDP для счетов, договоров и сканов: ingestion, OCR, классификация, извлечение полей, валидация, confidence, human review и экспорт в CRM/ERP.

IDP — это workflow, а не одна модель

Intelligent Document Processing превращает неструктурированный файл в проверенные данные и бизнес-действие. Пайплайн включает приём документа, проверку типа и безопасности, OCR, классификацию, извлечение полей, правила валидации, human review и запись в CRM, ERP или систему документооборота.

LLM помогает с разными макетами и описательными полями, но не заменяет OCR и бухгалтерские правила. ИНН, сумма, валюта и согласованность позиций должны проходить детерминированные проверки. Система обязана уметь остановить документ, а не генерировать отсутствующее значение.

Ingestion и подготовка документа

Источниками служат upload, e-mail, сканер, API или папка обмена. Каждый файл получает document_id, checksum, tenant, источник и timestamp. Антивирусная проверка, лимит размера, определение MIME и дедупликация выполняются до основного процесса.

Preprocessing повышает качество: поворот страниц, deskew, удаление шума, разделение пакета и обнаружение пустых страниц. Оригинал остаётся неизменным в storage, а производные артефакты версионируются. Результат можно воспроизвести после смены модели или правил.

OCR, klasyfikacja i ekstrakcja

OCR возвращает текст вместе с координатами на странице и confidence. Классификатор определяет тип, а extractor применяет его схему: у счёта есть поставщик, даты, суммы и позиции; у договора — стороны, срок, обязательства и условия. Один универсальный prompt для всех документов трудно тестировать, и он обычно снижает качество.

Результат извлечения должен содержать значение, confidence, страницу и область источника. Рецензенту нужно видеть происхождение поля. Для таблиц сохраняют связь строк и контрольные суммы, а не рассматривают каждое число как независимый фрагмент текста.

Walidacja i human-in-the-loop

Валидация объединяет синтаксические и бизнес-правила: формат ИНН, сумма нетто + НДС = брутто, разрешённая валюта, поставщик в справочнике, заказ в ERP и отсутствие дубликата счёта. Confidence модели — лишь один сигнал; уверенно прочитанное значение может быть невозможно по бизнес-логике.

В очередь human review попадают документы с низким confidence, конфликтом правил или высоким финансовым риском. Интерфейс показывает изображение, выделенный источник и предлагаемое значение. Исправления сохраняются как evaluation data, но не должны автоматически обучать модель без контроля качества.

Eksport, audyt i metryki

После подтверждения adapter записывает данные в целевую систему с idempotency key. Статусы received, processing, review, approved, exported и failed позволяют продолжить pipeline после сбоя. Audit log связывает документ, версии моделей, правила, правки пользователя и идентификатор записи ERP.

Измеряйте field accuracy по типам полей, document straight-through-processing rate, долю review, время обработки, стоимость документа и ошибки экспорта. Одна точность OCR не описывает ценность: бизнесу нужна корректная запись в ERP и возможность быстро объяснить каждое значение.

Чек-лист IDP-пайплайна перед продакшеном

  • Каждый файл получает document_id, checksum, tenant и timestamp до основного процесса
  • Извлечённое значение хранит confidence, страницу и область источника — не только текст
  • Бизнес-правила проверяются отдельно от OCR: сумма нетто + НДС = брутто, валюта, поставщик в справочнике
  • Документы с низким confidence или конфликтом правил уходят в human review, а не проводятся автоматически
  • Экспорт в ERP/CRM идёт с idempotency key — сбой не создаёт задвоенную запись
  • Правки рецензента сохраняются как evaluation data, но не обучают модель автоматически без контроля качества

Подходы к извлечению данных из документов

Подход Точность на типовых формах Гибкость макета Стоимость поддержки
Regex / шаблон под конкретную формуВысокаяНизкая — ломается при смене макетаРастёт с числом форм
Классический OCR + бизнес-правилаСредняя–высокаяСредняяСтабильная
LLM-экстракция с confidence и reviewСредняя, растёт с reviewВысокая — разные макеты без переписывания правилНиже на старте, требует мониторинга дрейфа

FAQ

Может ли LLM заменить OCR?

Не в каждом pipeline. Мультимодальные модели помогают со сложными макетами, но промышленный IDP всё равно нужны координаты, confidence, валидация и воспроизводимое чтение.

Когда документ должен попасть к человеку?

При низкой уверенности, конфликте правил, неизвестном типе или высоком финансовом риске. Порог следует различать по полям и процессам.

Как предотвратить двойное проведение документа?

Использовать checksum, бизнес-ключи, проверку дубликатов в ERP и idempotency key при экспорте.

Связанные решения

Контакты

Ответим в течение 4 рабочих часов. После 30-минутного созвона пришлём предварительный план и вилку бюджета в течение 24 часов.

Напишите в свободной форме — что нужно сделать и как с вами связаться.

Telegram Позвонить