Отказ в обслуживании OOM через предварительное определение размера неограниченной карты в Apache OpenNLP SymSpellModelSerializer
Затронутые версии:
- 3.0.0-М4
- 3.0.0-М5
(Расширение opennlp-spellcheck было представлено в версии 3.0.0-M4. Выпуски 1.x и 2.x не содержат затронутого кода.)
Описание:
Метод SymSpellModelSerializer.create() считывает два 32-битных поля числа целых чисел со знаком (unigramCount и bigramCount) из потока двоичной модели SymSpell и передает каждое значение непосредственно в LinkedHashMap.newLinkedHashMap() после проверки только того, что оно неотрицательно. Верхняя граница не применяется, поэтому подсчет полностью контролируется злоумышленником, если файл модели получен из ненадежного источника.
Созданный файл модели .bin, в котором для любого поля счетчика установлено значение Integer.MAX_VALUE (или любое значение, достаточно большое, чтобы исчерпать доступную кучу), приводит к предварительному изменению размера карты до емкости 2^30 записей. Резервный массив увеличенного размера выделяется при первом вызове put() на эту карту, запрашивая 4–8 ГБ в зависимости от того, действуют ли сжатые ошибки, и загрузка завершается с ошибкой OutOfMemoryError. Поскольку поля счетчика располагаются сразу после заголовка фиксированного размера (магический, версия формата, три строки UTF, поля конфигурации и идентификатор расстояния редактирования), злоумышленник не платит никакой значимой стоимости размера, чтобы использовать полезную нагрузку в качестве оружия: файла размером менее 100 байт плюс одна реальная запись достаточно, чтобы привести к сбою JVM, которая его загружает.
Затрагивается любой путь кода, который десериализует модель SymSpell, включая SymSpellModels.deserialize(InputStream), SymSpellModels.fromBytes(byte[]), загрузку модели пути к классам через SymSpellModelResolver.resolveByLanguage(String), инструмент командной строки CorrectTextTool и загрузку архива модели через зарегистрированный ArtifactSerializer. Расширение opennlp-spellcheck входит в официальный бинарный дистрибутив OpenNLP. Практическим результатом является отказ в обслуживании процессов, которые загружают файлы моделей SymSpell из ненадежных или полудоверенных источников.
Смягчение:
- Пользователям 3.x следует обновиться до 3.0.0-M6. Примечание. Исправление применяет верхнюю границу к обоим полям количества, которая проверяется перед предварительным изменением размера карты; счетчики, которые являются отрицательными или превышают границу, приводят к выдаче исключения IOException и быстрому сбою чтения без большого выделения памяти.
Границей является существующее ограничение AbstractModelReader.MAX_ENTRIES, введенное ранее, которое текущее изменение делает общедоступным, чтобы сериализаторы, реализующие свой собственный двоичный формат, могли его использовать. Граница по умолчанию равна 10 000 000, что значительно превышает количество записей в законных словарях SymSpell, но намного ниже любого значения, которое могло бы угрожать исчерпанием кучи. Развертывания, которым по закону необходимо загружать более крупные словари, могут увеличить предел при запуске JVM, установив для системного свойства OPENNLP_MAX_ENTRIES желаемое положительное целое число (например, -DOPENNLP_MAX_ENTRIES=50000000); недопустимые или неположительные значения возвращаются к значениям по умолчанию.
Обратите внимание, что это свойство является общим с пределом чтения модели, и его повышение ослабляет оба параметра. Пользователи, которые не могут выполнить обновление немедленно, должны рассматривать все файлы моделей SymSpell .bin как ненадежные входные данные, если их происхождение не проверено, и должны избегать загрузки моделей, предоставленных конечными пользователями или полученных из сторонних репозиториев без проверки целостности.
Показать оригинальное описание (EN)
OOM Denial of Service via Unbounded Map Pre-Sizing in Apache OpenNLP SymSpellModelSerializer Versions Affected: - 3.0.0-M4 - 3.0.0-M5 (The opennlp-spellcheck extension was introduced in 3.0.0-M4. Releases 1.x and 2.x do not contain the affected code.) Description: The SymSpellModelSerializer.create() method reads two 32-bit signed integer count fields (unigramCount and bigramCount) from a binary SymSpell model stream and passes each value directly to LinkedHashMap.newLinkedHashMap() after validating only that it is non-negative. No upper bound is applied, so the count is fully attacker-controlled when the model file originates from an untrusted source. A crafted .bin model file in which either count field is set to Integer.MAX_VALUE (or any value large enough to exhaust the available heap) causes the map to be pre-sized to a capacity of 2^30 entries. The oversized backing array is allocated on the first put() into that map, requesting 4–8 GB depending on whether compressed oops are in effect, and the load fails with an OutOfMemoryError. Because the count fields sit immediately after a fixed-size header (magic, format version, three UTF strings, the configuration fields, and the edit-distance identifier) the attacker pays no meaningful size cost to weaponize a payload: a file of well under 100 bytes plus a single real entry is sufficient to crash a JVM that loads it. Any code path that deserializes a SymSpell model is affected, including SymSpellModels.deserialize(InputStream), SymSpellModels.fromBytes(byte[]), classpath model loading via SymSpellModelResolver.resolveByLanguage(String), the CorrectTextTool command-line tool, and model-archive loading through the registered ArtifactSerializer. The opennlp-spellcheck extension ships in the official OpenNLP binary distribution. The practical impact is denial of service against processes that load SymSpell model files from untrusted or semi-trusted origins. Mitigation: - 3.x users should upgrade to 3.0.0-M6. Note: The fix applies an upper bound to both count fields, checked before the map is pre-sized; counts that are negative or exceed the bound cause an IOException to be thrown and the read to fail fast with no large allocation. The bound is the existing AbstractModelReader.MAX_ENTRIES limit introduced earlie, which the current change promotes to public visibility so that serializers implementing their own binary format can share it. The default bound is 10,000,000, which is well above the entry counts of legitimate SymSpell dictionaries but far below any value that would threaten heap exhaustion. Deployments that legitimately need to load larger dictionaries can raise the limit at JVM startup by setting the OPENNLP_MAX_ENTRIES system property to the desired positive integer (e.g. -DOPENNLP_MAX_ENTRIES=50000000); invalid or non-positive values fall back to the default. Note that this property is shared with the model-reader limit and raising it relaxes both. Users who cannot upgrade immediately should treat all SymSpell .bin model files as untrusted input unless their provenance is verified, and should avoid loading models supplied by end users or fetched from third-party repositories without integrity checks.