AI Document Processing: промышленный пайплайн от файла до данных в ERP
Архитектура IDP для счетов, договоров и сканов: ingestion, OCR, классификация, извлечение полей, валидация, confidence, human review и экспорт в CRM/ERP.
IDP — это workflow, а не одна модель
Intelligent Document Processing превращает неструктурированный файл в проверенные данные и бизнес-действие. Пайплайн включает приём документа, проверку типа и безопасности, OCR, классификацию, извлечение полей, правила валидации, human review и запись в CRM, ERP или систему документооборота.
LLM помогает с разными макетами и описательными полями, но не заменяет OCR и бухгалтерские правила. ИНН, сумма, валюта и согласованность позиций должны проходить детерминированные проверки. Система обязана уметь остановить документ, а не генерировать отсутствующее значение.
Ingestion и подготовка документа
Источниками служат upload, e-mail, сканер, API или папка обмена. Каждый файл получает document_id, checksum, tenant, источник и timestamp. Антивирусная проверка, лимит размера, определение MIME и дедупликация выполняются до основного процесса.
Preprocessing повышает качество: поворот страниц, deskew, удаление шума, разделение пакета и обнаружение пустых страниц. Оригинал остаётся неизменным в storage, а производные артефакты версионируются. Результат можно воспроизвести после смены модели или правил.
OCR, klasyfikacja i ekstrakcja
OCR возвращает текст вместе с координатами на странице и confidence. Классификатор определяет тип, а extractor применяет его схему: у счёта есть поставщик, даты, суммы и позиции; у договора — стороны, срок, обязательства и условия. Один универсальный prompt для всех документов трудно тестировать, и он обычно снижает качество.
Результат извлечения должен содержать значение, confidence, страницу и область источника. Рецензенту нужно видеть происхождение поля. Для таблиц сохраняют связь строк и контрольные суммы, а не рассматривают каждое число как независимый фрагмент текста.
Walidacja i human-in-the-loop
Валидация объединяет синтаксические и бизнес-правила: формат ИНН, сумма нетто + НДС = брутто, разрешённая валюта, поставщик в справочнике, заказ в ERP и отсутствие дубликата счёта. Confidence модели — лишь один сигнал; уверенно прочитанное значение может быть невозможно по бизнес-логике.
В очередь human review попадают документы с низким confidence, конфликтом правил или высоким финансовым риском. Интерфейс показывает изображение, выделенный источник и предлагаемое значение. Исправления сохраняются как evaluation data, но не должны автоматически обучать модель без контроля качества.
Eksport, audyt i metryki
После подтверждения adapter записывает данные в целевую систему с idempotency key. Статусы received, processing, review, approved, exported и failed позволяют продолжить pipeline после сбоя. Audit log связывает документ, версии моделей, правила, правки пользователя и идентификатор записи ERP.
Измеряйте field accuracy по типам полей, document straight-through-processing rate, долю review, время обработки, стоимость документа и ошибки экспорта. Одна точность OCR не описывает ценность: бизнесу нужна корректная запись в ERP и возможность быстро объяснить каждое значение.
Чек-лист IDP-пайплайна перед продакшеном
- — Каждый файл получает document_id, checksum, tenant и timestamp до основного процесса
- — Извлечённое значение хранит confidence, страницу и область источника — не только текст
- — Бизнес-правила проверяются отдельно от OCR: сумма нетто + НДС = брутто, валюта, поставщик в справочнике
- — Документы с низким confidence или конфликтом правил уходят в human review, а не проводятся автоматически
- — Экспорт в ERP/CRM идёт с idempotency key — сбой не создаёт задвоенную запись
- — Правки рецензента сохраняются как evaluation data, но не обучают модель автоматически без контроля качества
Подходы к извлечению данных из документов
| Подход | Точность на типовых формах | Гибкость макета | Стоимость поддержки |
|---|---|---|---|
| Regex / шаблон под конкретную форму | Высокая | Низкая — ломается при смене макета | Растёт с числом форм |
| Классический OCR + бизнес-правила | Средняя–высокая | Средняя | Стабильная |
| LLM-экстракция с confidence и review | Средняя, растёт с review | Высокая — разные макеты без переписывания правил | Ниже на старте, требует мониторинга дрейфа |
FAQ
Может ли LLM заменить OCR?
Не в каждом pipeline. Мультимодальные модели помогают со сложными макетами, но промышленный IDP всё равно нужны координаты, confidence, валидация и воспроизводимое чтение.
Когда документ должен попасть к человеку?
При низкой уверенности, конфликте правил, неизвестном типе или высоком финансовом риске. Порог следует различать по полям и процессам.
Как предотвратить двойное проведение документа?
Использовать checksum, бизнес-ключи, проверку дубликатов в ERP и idempotency key при экспорте.