Поддерживаемые языки

Перечень языков, поддерживаемых модулями извлечения печатного (OCR) и рукописного (ICR) текста.

Печатный текст (OCR)

Для печатного текста поддерживается более 40 языков:

  • Основные европейские языки: английский, немецкий, французский, испанский, итальянский, португальский, нидерландский.
  • Восточно-европейские и скандинавские: болгарский, боснийский, венгерский, греческий, датский, латвийский, литовский, норвежский, польский, румынский, сербский, словацкий, словенский, финский, хорватский, чешский, шведский, эстонский.
  • Языки СНГ и Центральной Азии: русский, азербайджанский, армянский, башкирский, грузинский, казахский, киргизский, таджикский, татарский, узбекский, чувашский, якутский.
  • Языки Ближнего Востока и Азии: арабский, вьетнамский, иврит, индонезийский, китайский (упрощенный и традиционный), корейский, мальтийский, тайский, турецкий, японский.

Рукописный текст (ICR)

Система уверенно распознает связный рукописный текст (скоропись) на русском и английском языках. Это позволяет эффективно извлекать данные из произвольных заявлений, справок и резолюций, написанных от руки.

Примечание: Распознавание рукописного текста доступно только при использовании облачной версии (SaaS) или при развертывании в Yandex Cloud. При установке в полностью закрытый On-premise контур без доступа к облачным сервисам извлечение рукописного текста не поддерживается.