OCR и распознавание документов для бизнеса — не одно и то же. OCR превращает изображение в текст и координаты. Производственный Document AI-процесс дополнительно определяет тип документа, извлекает поля и строки таблиц, нормализует значения, сверяет их с правилами и справочниками, направляет исключения человеку и только после подтверждения создаёт запись в 1С, ERP или СЭД.
Качество нельзя описать одной «точностью распознавания». Текст может быть прочитан верно, но сумма привязана не к тому полю; поле извлечено верно, но контрагент сопоставлен неверно; карточка корректна, но документ оказался дублем. Эти уровни проверяют отдельно.
Короткий ответ: выберите один тип документа и один downstream-процесс. Опишите обязательные поля, таблицы, справочники и правила записи, соберите реальные файлы по поставщикам и каналам, настройте field-level confidence и очередь исключений. Начинайте с черновика без автоматического проведения.
Главное за минуту
- OCR даёт текст; автоматизация требует структурированного и проверенного результата.
- У каждого поля есть тип, источник, правило, confidence и маршрут ошибки.
- Арифметика и справочники проверяются детерминированно.
- Низкий confidence — не всегда ошибка, высокий — не доказательство правильности.
- Таблицы и многостраничные комплекты тестируют отдельно.
- Запись в ERP отделяют от извлечения и защищают idempotency.
- Приёмка идёт по типам документов, поставщикам, каналам и критичным полям.
Содержание
- OCR, IDP и Document AI
- Метод ДОКУМЕНТ
- Как выбрать первый поток
- Контракт полей
- Захват и качество файла
- Классификация, layout и таблицы
- Нормализация и проверки
- Confidence и human review
- Интеграция с 1С, ERP и СЭД
- Как измерять качество
- Безопасность и хранение
- План пилота
- Что принять у подрядчика
- Частые вопросы
- Как AI рассвет автоматизирует документы
- Вывод
OCR, IDP и Document AI
Уровни полезно разделять:
| Уровень | Результат | Пример |
|---|---|---|
| OCR | текст, слова, координаты | «Итого 12 500,00» |
| layout | абзацы, таблицы, пары | строка и столбец суммы |
| classification | тип/комплект | счёт, акт, УПД, приложение |
| extraction | typed fields | номер, дата, ИНН, total |
| validation | бизнес-решение | сумма сходится, поставщик найден |
| workflow | запись/исключение | draft в ERP или очередь review |
Azure AI Document Intelligence описывает модели чтения, layout и извлечения полей как разные возможности. Поэтому «OCR поддерживается» ещё не отвечает на вопрос, готов ли результат к вашему процессу.
Метод ДОКУМЕНТ
ДОКУМЕНТ — восемь блоков контура:
- Д — Документ: тип, комплект, версия и канал.
- О — OCR/layout: текст, координаты, страницы и таблицы.
- К — Ключевые поля: schema, обязательность и источник.
- У — Условия: арифметика, даты, комплектность и policy.
- М — Мастер-данные: контрагент, договор, номенклатура и ставки.
- Е — Исключения: confidence, конфликт и human review.
- Н — Нормализация: типы, единицы, справочники и запись.
- Т — Трассировка: файл, поле, версия, решение и действие.
Ошибка локализуется по блоку. Неверный ИНН может возникнуть в OCR, extraction, нормализации или сопоставлении со справочником — исправления будут разными.
Как выбрать первый поток
Хороший кандидат: повторяемый тип, заметный объём, понятный владелец, ограниченный набор полей, доступный архив, ручная проверка уже существует, а запись можно сначала создавать как черновик.
Слабый старт: «вся входящая почта», десятки юридически разных форм, рукописные документы без стандарта, отсутствие справочников или процесс, где оператор принимает неформализованное решение.
Зафиксируйте baseline: документы/страницы, ручное время, cycle time, возвраты, исправления после записи, дубли и причины исключений. Объём и эффект для конкретной компании до измерения Unknown.
Контракт полей
Для каждого поля задайте:
- canonical name и тип;
- обязательность по document type;
- область/страница и возможные подписи;
- формат и нормализацию;
- business validation;
- источник master data;
- threshold/review rule;
- target field в учётной системе;
- masking и retention;
- владелец спорного решения.
Например, total_amount — decimal с валютой, проверяется по сумме строк и налогам; расхождение не исправляется генеративной догадкой, а уходит в exception с показом фрагмента.
Захват и качество файла
Каналы: e-mail, upload, scanner, mobile photo, ЭДО, API и папка обмена. На входе нужны file id, hash, sender/context, timestamp, MIME и malware scan.
Quality gate проверяет пустые/повреждённые файлы, разрешение, blur, skew, обрезку, glare, ориентацию, пароль, число страниц и дубликат. Плохой файл получает понятную причину пересъёмки; он не должен тихо проходить как документ с пустыми полями.
PDF с текстовым слоем и скан обрабатываются по-разному. Сохраняйте оригинал неизменным, а производные изображения и OCR связывайте версией pipeline.
Классификация, layout и таблицы
Сначала разделите пакет и определите document type. Неизвестный тип — самостоятельный исход, а не ближайший известный класс. Для многостраничного комплекта важны порядок, продолжение таблицы, приложения и повторяющиеся header/footer.
Таблица требует line-item schema: description, quantity, unit, price, tax, amount и связи между строками. Потерянная строка опаснее опечатки в описании, поэтому проверяйте количество строк, totals и визуальное соответствие.
Layout важен: одинаковое слово может быть поставщиком, покупателем или грузополучателем в зависимости от области документа.
Нормализация и проверки
После extraction применяйте детерминированные проверки:
- даты и допустимый период;
- ИНН/КПП и реквизиты;
- сумма строк, налог и итог;
- валюта и единицы;
- номер договора/заказа;
- поставщик и duplicate key;
- обязательные страницы/подписи по внутренней policy;
- соответствие purchase order и допустимым отклонениям.
LLM может помогать разобрать вариативную формулировку, но арифметика, форматы и права записи остаются в коде. Юридическую или налоговую значимость подтверждает ответственный специалист.
Confidence и human review
Confidence используется для маршрутизации, а не как печать качества. У каждого критичного поля может быть собственный threshold, дополненный business rules. Высокий score с нарушенной арифметикой всё равно уходит на review.
Интерфейс reviewer показывает оригинальный фрагмент, extracted value, нормализованное значение, правило и причину. Исправление сохраняется отдельно от вывода модели.
Google Document AI evaluation разделяет false positives, false negatives и threshold. Выбирайте threshold на своём test set и по цене ошибок, а не копируйте «оптимальное» значение без бизнес-контекста.
Интеграция с 1С, ERP и СЭД
Безопасные состояния:
received → parsed → extracted → validated → needs_review/approved → draft_created → posted_by_policy → reconciled.
Первый пилот обычно заканчивается draft, а проведение/платёж остаётся человеку. Endpoint проверяет schema, права, current state и idempotency key. Ответ содержит system record id; повторная доставка не создаёт дубль.
Microsoft Business Central показывает практическую границу: OCR-сервис создаёт электронный документ, который затем преобразуется в запись покупки. Для 1С аналогично отделяйте извлечение от контролируемого создания объекта. Нюансы REST-записи разобраны в статье об интеграции ИИ-агента с 1С.
Как измерять качество
Три уровня:
- OCR correctness: символы/слова и reading order.
- Extraction correctness: exact/normalized match поля и строки.
- Business correctness: верный тип, справочник, validation, duplicate и итоговый record.
Отчёт разбивают по document type, поставщику/template, каналу, качеству файла, полю и времени. Критичные поля оцениваются отдельно; средний F1 не должен скрыть систематическую ошибку total или ИНН.
Production-метрики: straight-through processing по принятому определению, review rate, correction rate, cycle time, duplicate prevention, write failures и post-entry corrections. Всегда смотрите парную guardrail-метрику качества.
Безопасность и хранение
Документы могут содержать персональные данные, банковские реквизиты, коммерческую тайну и вредоносные вложения. Нужны allowlist типов, size/page limits, malware scanning, изолированная обработка, encryption, RBAC, audit log, retention/deletion и masking в telemetry.
Извлечённый текст — недоверенный ввод. Инструкции внутри документа не должны менять system policy или разрешения агента. Доступ к оригиналу, preview и экспортам проверяется отдельно.
План пилота
- Один тип документа и один канал.
- Baseline и field contract.
- Архив с provenance и legal basis.
- Label guide и split по поставщикам/времени.
- Capture/OCR/layout baseline.
- Extraction и deterministic validation.
- Field-level eval и thresholds.
- Review UI и reason codes.
- Draft-only integration и reconciliation.
- Решение
scale / revise / stop.
Что принять у подрядчика
- карту потока и список поддерживаемых/неизвестных типов;
- field contract, label guide и validation rules;
- dataset register/split и отчёт по срезам;
- оригинал-to-field traceability;
- review queue с reason codes;
- API schema, idempotency и reconciliation;
- security/retention controls;
- monitoring, rollback и runbook;
- исходники, версии и процедуру передачи.
Частые вопросы
OCR и распознавание реквизитов — одно и то же?
Нет. OCR читает текст; extraction связывает фрагменты со схемой полей. Для автоматизации дополнительно нужны validation, master data и workflow.
Можно ли распознавать фото с телефона?
Да, если quality gate контролирует обрезку, blur, блики, перспективу и разрешение. Плохой кадр отправляется на пересъёмку.
Нужна ли ручная проверка?
На старте — да. Далее её объём зависит от field-level качества, цены ошибки и policy. Критичные операции могут всегда требовать подтверждения.
Можно ли автоматически проводить документ в 1С?
Технически возможно, но начинайте с черновика. Автопроведение требует отдельных правил, прав, idempotency, reconciliation и приёмки владельцем процесса.
Как тестировать новые шаблоны поставщиков?
Выделяйте template/supplier holdout и production sampling. Новый layout может изменить extraction даже при хорошем OCR.
Как оценить стоимость?
Считайте capture, разметку, OCR/extraction, review UI, validation, master data, integration, storage и поддержку. Модель CAPEX/OPEX приведена в статье о стоимости внедрения ИИ.
Как AI рассвет автоматизирует документы
AI рассвет может провести аудит документного потока, собрать field contract и dataset, настроить OCR/Document AI, validation и human review, интегрировать решение с 1С, ERP или СЭД, провести eval, запуск, обучение и поддержку.
Безопасный первый шаг — выбрать один тип документа, зафиксировать baseline, поля, источники, ограничения и критерий приёмки, а запись выполнять только в draft. Обсудить задачу.
Вывод
OCR — начало, а не итог автоматизации. Метод ДОКУМЕНТ связывает тип файла, распознавание, поля, условия, master data, исключения, нормализацию и traceability.
Начните с одного потока и field contract. Оценивайте текст, extraction и бизнес-корректность отдельно, маршрутизируйте сомнения человеку и отделяйте запись в учётную систему от вывода модели. Так автоматизация остаётся проверяемой и обратимой.