OCR квитанций из WhatsApp — как ИИ читает платежный чек и где ошибается
Квитанция приходит в WhatsApp, и ее нужно вводить вручную. ИИ может извлечь сумму и номер операции, но ошибается на критичных цифрах. Как держать результат проверяемым и недорогим.
Самый большой ежедневный объем работы в обменном пункте — ручной ввод квитанций. Клиент присылает фото в WhatsApp, оператор смотрит и вручную заносит в документ сумму, дату, номер операции и банк. Сто квитанций в день — значит сто раз одна и та же рутина. И каждый раз — шанс на опечатку.
ИИ может убрать этот ручной ввод: прочитать фото квитанции и сам заполнить поля. Но «чтение квитанции с помощью ИИ» настолько же полезно, насколько и опасно, если доверять ему вслепую. Эта статья о том, как именно работает такое чтение, где оно ошибается и почему результат всегда должен оставаться проверяемым.
Эта статья дополняет материал проверка квитанции о зачислении. Там речь о том, «деньги действительно пришли или нет»; здесь — о том, «как читается квитанция». Извлечение и проверка — две разные задачи, и ни одна не заменяет другую.
Два этапа: сначала дешевая классификация, потом полное извлечение
Типичная ошибка — думать, что ИИ должен за один проход полностью читать каждую входящую картинку. На практике правильный пайплайн состоит из двух этапов, и порядок важен.
Первый этап — дешевая классификация: до любого извлечения легкая и недорогая проверка решает, является ли эта картинка «вообще финансовым документом». В WhatsApp-группе обменного пункта пересылают все подряд: селфи, стикеры, фото коллеги, нерелевантные скриншоты. Если запускать полное извлечение на каждой картинке, вы будете тратить стоимость ИИ на мусор.
Второй этап — полное извлечение: только те изображения, которые первый этап распознал как «финансовый документ», идут в полную модель, чтобы извлечь поля: сумму, дату, номер операции, банк отправителя и банк получателя.
Почему это разделение важно? Из-за стоимости. Одно полное извлечение моделью GPT стоит примерно 1,5–3 цента. Если за день в группах приходит 300 изображений, а настоящих квитанций среди них только 100, без дешевой классификации вы платите еще и за 200 нерелевантных картинок.
| Подход | Изображения, обработанные полной моделью | Относительная дневная стоимость |
|---|---|---|
| Полное извлечение на всех | 300 | 100% (база) |
| Сначала дешевая классификация, потом извлечение | 100 | около 35% |
В Nexto этот этап предварительной классификации делает именно это: нефинансовые изображения локально и бесплатно пропускаются (с локальным инструментом вроде tesseract), а не отправляются в платную модель. В итоге вы платите только за то, что действительно является квитанцией.
Где ИИ ошибается
Самая важная часть — здесь. ИИ хорошо читает текст, но он не безошибочен. И его ошибки попадают ровно в самые чувствительные места: в цифры.
- Похожие буквы и цифры: буква
l(эль) и цифра1(один), или букваOи цифра0. В длинном номере операции одной подмены достаточно, чтобы автоматическое сопоставление развалилось. - Неясные цифры: 1 и 7, 0 и 5, 3 и 8 на квитанции низкого качества или на размытом фото легко читаются наоборот.
- Разделитель тысяч: иногда точка или запятая в сумме исчезает или добавляется, и 1 200 000 превращается в 120 000 — минус один ноль, ошибка в десять раз.
- Дата: разные форматы (солнечный хиджра/григорианский календарь, рукописный ввод) — частый источник ошибок в датах.
Простой числовой пример показывает, почему это важно. Допустим, реальная сумма квитанции — 48 500 000 риалов, а ИИ читает пятую цифру как 8 вместо 5: 48 800 000. Разница — 300 000 риалов. Если это число без прямого подтверждения попадет в документ, расхождение по кассе найдется позже — когда искать его уже сложнее.
Практический вывод из этих фактов один: результат ИИ — это предложение, а не истина.
Почему результат должен быть проверяемым и исправляемым
Если ИИ иногда ошибается, правильный дизайн не в том, чтобы сделать его настолько точным, чтобы он никогда не ошибался. Это невозможно. Правильный дизайн — показать результат так, чтобы оператор с одного взгляда видел его и мог исправить.
То есть форма документа должна показывать предложенные поля уже заполненными и готовыми, рядом с самой фотографией квитанции, чтобы оператор мог сравнить сумму на экране с суммой на фото. Подтверждение должно быть одним взглядом и одним кликом; исправление одной неправильной цифры — тоже одним взглядом и коротким вводом.
Это совсем не то же самое, что «ИИ сам зарегистрировал и ушел». Разница — в ответственности:
- В полностью автоматическом режиме ошибка ИИ напрямую попадает в учет, и никто не замечает ее до расхождения.
- В режиме предложение-и-подтверждение ИИ забирает утомительную работу (ввод), а человек сохраняет важную работу (суждение и контроль).
Оператор больше не вводит сто квитанций; он подтверждает сто предложений. Это и быстрее, и безопаснее.
В Nexto входящие квитанции из WhatsApp читаются ИИ, а поля предлагаемого документа — сумма, дата, номер операции, банк — заполняются автоматически, но финальная регистрация идет через подтверждение оператора. Поэтому программа учета обменного пункта с ИИ должна относиться к проверке и исправлению так же серьезно, как к самому извлечению.
Извлечение — это не проверка
Последний момент, в котором часто ошибаются: если ИИ «правильно прочитал» сумму в квитанции, это не значит, что «деньги пришли». Извлечение означает, что число на картинке увидели правильно; проверка означает, что это зачисление действительно село в вашу банковскую выписку и не откатывается.
Поддельная квитанция, сделанная в графическом редакторе, может быть совершенно чистой и читаемой — и ИИ извлечет ее без ошибок. Чистое извлечение ничего не говорит о реальности денег. Поэтому после извлечения нужно сопоставление с реальным движением по счету — то самое разделение извлечения и проверки, о котором говорилось в начале статьи.
Чек-лист: что есть в правильном OCR-пайплайне
- Этап дешевой классификации до полного извлечения, чтобы стоимость не тратилась на нерелевантные изображения.
- Локальный и бесплатный skip для нефинансовых изображений.
- Структурированное извлечение в конкретные поля (сумма, дата, референс, банк), а не сырой текст.
- Показ предложения рядом с фото для быстрого визуального сравнения.
- Возможность исправить одно поле до регистрации — результат является предложением, а не истиной.
- Сопоставление с движением по счету после извлечения — потому что извлечение не является проверкой.
Кратко
ИИ может убрать ручной ввод квитанций, и это реальная экономия. Но сделать это правильно значит: сначала дешевая классификация, чтобы не сжигать бюджет, потом полное извлечение; принять, что на чувствительных цифрах будут ошибки; и спроектировать результат так, чтобы он всегда был проверяемым и исправляемым. ИИ забирает утомительную работу, но ответственность за финальное число остается у человека.
Хотите увидеть, как автоматическое чтение квитанции из WhatsApp и ее подтверждение работают на практике? Соберите персональную демоверсию программы учета обменного пункта Nexto и пройдите путь одной квитанции от сообщения в WhatsApp до подтвержденного документа.
Посмотрите всё это в Nexto
Полноценный приватный экземпляр с демо-данными — без установки, без банковской карты.