Nexto
ГлавнаяБлогПереводы и банки
Переводы и банки

OCR квитанций из WhatsApp — как ИИ читает платежный чек и где ошибается

Квитанция приходит в WhatsApp, и ее нужно вводить вручную. ИИ может извлечь сумму и номер операции, но ошибается на критичных цифрах. Как держать результат проверяемым и недорогим.

6 мин чтения · Команда Nexto · Последнее обновление: 3 августа 2026 г.

Самый большой ежедневный объем работы в обменном пункте — ручной ввод квитанций. Клиент присылает фото в WhatsApp, оператор смотрит и вручную заносит в документ сумму, дату, номер операции и банк. Сто квитанций в день — значит сто раз одна и та же рутина. И каждый раз — шанс на опечатку.

ИИ может убрать этот ручной ввод: прочитать фото квитанции и сам заполнить поля. Но «чтение квитанции с помощью ИИ» настолько же полезно, насколько и опасно, если доверять ему вслепую. Эта статья о том, как именно работает такое чтение, где оно ошибается и почему результат всегда должен оставаться проверяемым.

Эта статья дополняет материал проверка квитанции о зачислении. Там речь о том, «деньги действительно пришли или нет»; здесь — о том, «как читается квитанция». Извлечение и проверка — две разные задачи, и ни одна не заменяет другую.

Два этапа: сначала дешевая классификация, потом полное извлечение

Типичная ошибка — думать, что ИИ должен за один проход полностью читать каждую входящую картинку. На практике правильный пайплайн состоит из двух этапов, и порядок важен.

Фото квитанции Изображение, отправленное клиентом Классифицировать Это финансовый документ? ↓ Недорого Извлечение Сумма, дата, IBAN, банк ↑ Дороже Предлагаемая проводка Подтверждение человеком
ИИ считывает квитанцию в два этапа — сначала недорого определяет, что это финансовый документ, затем извлекает сумму, дату, IBAN и банк, а итоговую запись подтверждает человек.

Первый этап — дешевая классификация: до любого извлечения легкая и недорогая проверка решает, является ли эта картинка «вообще финансовым документом». В WhatsApp-группе обменного пункта пересылают все подряд: селфи, стикеры, фото коллеги, нерелевантные скриншоты. Если запускать полное извлечение на каждой картинке, вы будете тратить стоимость ИИ на мусор.

Второй этап — полное извлечение: только те изображения, которые первый этап распознал как «финансовый документ», идут в полную модель, чтобы извлечь поля: сумму, дату, номер операции, банк отправителя и банк получателя.

Почему это разделение важно? Из-за стоимости. Одно полное извлечение моделью GPT стоит примерно 1,5–3 цента. Если за день в группах приходит 300 изображений, а настоящих квитанций среди них только 100, без дешевой классификации вы платите еще и за 200 нерелевантных картинок.

Подход Изображения, обработанные полной моделью Относительная дневная стоимость
Полное извлечение на всех 300 100% (база)
Сначала дешевая классификация, потом извлечение 100 около 35%

В Nexto этот этап предварительной классификации делает именно это: нефинансовые изображения локально и бесплатно пропускаются (с локальным инструментом вроде tesseract), а не отправляются в платную модель. В итоге вы платите только за то, что действительно является квитанцией.

Где ИИ ошибается

Самая важная часть — здесь. ИИ хорошо читает текст, но он не безошибочен. И его ошибки попадают ровно в самые чувствительные места: в цифры.

  • Похожие буквы и цифры: буква l (эль) и цифра 1 (один), или буква O и цифра 0. В длинном номере операции одной подмены достаточно, чтобы автоматическое сопоставление развалилось.
  • Неясные цифры: 1 и 7, 0 и 5, 3 и 8 на квитанции низкого качества или на размытом фото легко читаются наоборот.
  • Разделитель тысяч: иногда точка или запятая в сумме исчезает или добавляется, и 1 200 000 превращается в 120 000 — минус один ноль, ошибка в десять раз.
  • Дата: разные форматы (солнечный хиджра/григорианский календарь, рукописный ввод) — частый источник ошибок в датах.

Простой числовой пример показывает, почему это важно. Допустим, реальная сумма квитанции — 48 500 000 риалов, а ИИ читает пятую цифру как 8 вместо 5: 48 800 000. Разница — 300 000 риалов. Если это число без прямого подтверждения попадет в документ, расхождение по кассе найдется позже — когда искать его уже сложнее.

Практический вывод из этих фактов один: результат ИИ — это предложение, а не истина.

Почему результат должен быть проверяемым и исправляемым

Если ИИ иногда ошибается, правильный дизайн не в том, чтобы сделать его настолько точным, чтобы он никогда не ошибался. Это невозможно. Правильный дизайн — показать результат так, чтобы оператор с одного взгляда видел его и мог исправить.

То есть форма документа должна показывать предложенные поля уже заполненными и готовыми, рядом с самой фотографией квитанции, чтобы оператор мог сравнить сумму на экране с суммой на фото. Подтверждение должно быть одним взглядом и одним кликом; исправление одной неправильной цифры — тоже одним взглядом и коротким вводом.

Это совсем не то же самое, что «ИИ сам зарегистрировал и ушел». Разница — в ответственности:

  • В полностью автоматическом режиме ошибка ИИ напрямую попадает в учет, и никто не замечает ее до расхождения.
  • В режиме предложение-и-подтверждение ИИ забирает утомительную работу (ввод), а человек сохраняет важную работу (суждение и контроль).

Оператор больше не вводит сто квитанций; он подтверждает сто предложений. Это и быстрее, и безопаснее.

В Nexto входящие квитанции из WhatsApp читаются ИИ, а поля предлагаемого документа — сумма, дата, номер операции, банк — заполняются автоматически, но финальная регистрация идет через подтверждение оператора. Поэтому программа учета обменного пункта с ИИ должна относиться к проверке и исправлению так же серьезно, как к самому извлечению.

Извлечение — это не проверка

Последний момент, в котором часто ошибаются: если ИИ «правильно прочитал» сумму в квитанции, это не значит, что «деньги пришли». Извлечение означает, что число на картинке увидели правильно; проверка означает, что это зачисление действительно село в вашу банковскую выписку и не откатывается.

Поддельная квитанция, сделанная в графическом редакторе, может быть совершенно чистой и читаемой — и ИИ извлечет ее без ошибок. Чистое извлечение ничего не говорит о реальности денег. Поэтому после извлечения нужно сопоставление с реальным движением по счету — то самое разделение извлечения и проверки, о котором говорилось в начале статьи.

Чек-лист: что есть в правильном OCR-пайплайне

  1. Этап дешевой классификации до полного извлечения, чтобы стоимость не тратилась на нерелевантные изображения.
  2. Локальный и бесплатный skip для нефинансовых изображений.
  3. Структурированное извлечение в конкретные поля (сумма, дата, референс, банк), а не сырой текст.
  4. Показ предложения рядом с фото для быстрого визуального сравнения.
  5. Возможность исправить одно поле до регистрации — результат является предложением, а не истиной.
  6. Сопоставление с движением по счету после извлечения — потому что извлечение не является проверкой.

Кратко

ИИ может убрать ручной ввод квитанций, и это реальная экономия. Но сделать это правильно значит: сначала дешевая классификация, чтобы не сжигать бюджет, потом полное извлечение; принять, что на чувствительных цифрах будут ошибки; и спроектировать результат так, чтобы он всегда был проверяемым и исправляемым. ИИ забирает утомительную работу, но ответственность за финальное число остается у человека.

Хотите увидеть, как автоматическое чтение квитанции из WhatsApp и ее подтверждение работают на практике? Соберите персональную демоверсию программы учета обменного пункта Nexto и пройдите путь одной квитанции от сообщения в WhatsApp до подтвержденного документа.

Посмотрите всё это в Nexto

Полноценный приватный экземпляр с демо-данными — без установки, без банковской карты.

Создать бесплатное демо Связанные функции ←
Написать в WhatsApp