CVE-2026-67211
WysokieCVSS 7.5Prawdopodobieństwo exploitacji (EPSS)
Niskie ryzykoPercentyl 25 - wyżej niż 25% wszystkich znanych CVE
Streszczenie
Podatność w Apache OpenNLP (rozszerzenie opennlp-spellcheck, wersje 3.0.0-M4 i 3.0.0-M5) pozwala na atak typu Denial of Service poprzez wyczerpanie pamięci. Metoda SymSpellModelSerializer.create() odczytuje pola liczby unigramów i bigramów z pliku modelu i przekazuje je bezpośrednio do wstępnego rozmiarowania mapy bez górnego limitu, co przy spreparowanym pliku .bin powoduje próbę alokacji 4–8 GB i błąd OutOfMemoryError.
Ocena ryzyka
Atakujący może dostarczyć złośliwy plik modelu SymSpell (poniżej 100 bajtów), który po wczytaniu przez aplikację spowoduje awarię JVM i niedostępność usługi. Ryzyko dotyczy każdego procesu, który deserializuje modele SymSpell z niezaufanych źródeł.
Rekomendacja
Zaktualizuj OpenNLP do wersji 3.0.0-M6, która wprowadza górny limit liczby wpisów (domyślnie 10 000 000, konfigurowalny przez właściwość OPENNLP_MAX_ENTRIES). Jeśli aktualizacja nie jest możliwa, traktuj wszystkie pliki .bin modeli SymSpell jako niezaufane i nie ładuj modeli z niezweryfikowanych źródeł.
Inne podatności w Apache OpenNLP
Zobacz wszystkie- CVE-2026-82617Krytyczne
Wbudowane wzorce wyszukiwania nazw EMAIL i URL w Apache OpenNLP zawierają niejednoznaczne zagnieżdżone kwantyfikatory, co umożliwia atak ReDoS. Przygotowany tekst wejściowy może wywołać superliniowe cofanie (backtracking) lub rekurencję matchera, prowadząc do wyczerpania CPU lub błędu StackOverflowError. Podatność dotyczy wersji od 2.0.0 do 2.5.11 oraz od 3.0.0-M1 do 3.0.0-M5.
- CVE-2026-43825Wysokie
W Apache OpenNLP w module libsvm dokumentacji kategorii (linia 3.x) wykryto podatność na niezaufaną deserializację Java. Metoda SvmDoccatModel.deserialize(InputStream) używa java.io.ObjectInputStream bez filtra, co pozwala atakującemu na zdalne wykonanie kodu poprzez spreparowany strumień.
- CVE-2026-42027Krytyczne
W Apache OpenNLP przed wersjami 1.9.5, 2.5.9 i 3.0.0-M3, metoda ExtensionLoader.instantiateExtension() ładuje klasę na podstawie nazwy z pliku manifest.properties archiwum modelu za pomocą Class.forName() przed sprawdzeniem, czy klasa jest zgodna z oczekiwanym interfejsem. Pozwala to atakującemu na wykonanie statycznego inicjalizatora dowolnej klasy dostępnej w classpath podczas ładowania modelu, co może prowadzić do niepożądanych efektów ubocznych.
- CVE-2026-40682Krytyczne
W bibliotece Apache OpenNLP wykryto podatność XML External Entity (XXE) w klasie DictionaryEntryPersistor. Klasa ta inicjalizuje parser SAX bez włączenia bezpiecznego przetwarzania (FEATURE_SECURE_PROCESSING) i bez wyłączenia obsługi DTD, co pozwala atakującemu na wstrzyknięcie złośliwej deklaracji DOCTYPE w pliku słownika. Skutkuje to możliwością ujawnienia lokalnych plików (file://) lub wykonania żądań po stronie serwera (SSRF) przez referencje http:// podczas parsowania XML.
- CVE-2026-63317Średnie
W Apache OpenNLP przed wersjami 2.5.10 i 3.0.0-M5 wykryto podatność umożliwiającą dowolną instancję klas. Atakujący może dostarczyć spreparowany model lub nazwę formatu, co prowadzi do załadowania i wykonania kodu z niebezpiecznych klas.
- CVE-2026-42440Wysokie
W Apache OpenNLP przed wersjami 1.9.5, 2.5.9 i 3.0.0-M3 odkryto podatność na atak DoS polegający na wyczerpaniu pamięci (OOM). Metody getOutcomes(), getOutcomePatterns() i getPredicates() w klasie AbstractModelReader alokują tablice na podstawie 32-bitowej liczby całkowitej z pliku modelu bez walidacji, co pozwala atakującemu na podanie wartości Integer.MAX_VALUE i spowodowanie natychmiastowego błędu OutOfMemoryError.
Oryginalny opis (angielski, źródło NVD)
OOM Denial of Service via Unbounded Map Pre-Sizing in Apache OpenNLP SymSpellModelSerializer Versions Affected: - 3.0.0-M4 - 3.0.0-M5 (The opennlp-spellcheck extension was introduced in 3.0.0-M4. Releases 1.x and 2.x do not contain the affected code.) Description: The SymSpellModelSerializer.create() method reads two 32-bit signed integer count fields (unigramCount and bigramCount) from a binary SymSpell model stream and passes each value directly to LinkedHashMap.newLinkedHashMap() after validating only that it is non-negative. No upper bound is applied, so the count is fully attacker-controlled when the model file originates from an untrusted source. A crafted .bin model file in which either count field is set to Integer.MAX_VALUE (or any value large enough to exhaust the available heap) causes the map to be pre-sized to a capacity of 2^30 entries. The oversized backing array is allocated on the first put() into that map, requesting 4–8 GB depending on whether compressed oops are in effect, and the load fails with an OutOfMemoryError. Because the count fields sit immediately after a fixed-size header (magic, format version, three UTF strings, the configuration fields, and the edit-distance identifier) the attacker pays no meaningful size cost to weaponize a payload: a file of well under 100 bytes plus a single real entry is sufficient to crash a JVM that loads it. Any code path that deserializes a SymSpell model is affected, including SymSpellModels.deserialize(InputStream), SymSpellModels.fromBytes(byte[]), classpath model loading via SymSpellModelResolver.resolveByLanguage(String), the CorrectTextTool command-line tool, and model-archive loading through the registered ArtifactSerializer. The opennlp-spellcheck extension ships in the official OpenNLP binary distribution. The practical impact is denial of service against processes that load SymSpell model files from untrusted or semi-trusted origins. Mitigation: - 3.x users should upgrade to 3.0.0-M6. Note: The fix applies an upper bound to both count fields, checked before the map is pre-sized; counts that are negative or exceed the bound cause an IOException to be thrown and the read to fail fast with no large allocation. The bound is the existing AbstractModelReader.MAX_ENTRIES limit introduced earlie, which the current change promotes to public visibility so that serializers implementing their own binary format can share it. The default bound is 10,000,000, which is well above the entry counts of legitimate SymSpell dictionaries but far below any value that would threaten heap exhaustion. Deployments that legitimately need to load larger dictionaries can raise the limit at JVM startup by setting the OPENNLP_MAX_ENTRIES system property to the desired positive integer (e.g. -DOPENNLP_MAX_ENTRIES=50000000); invalid or non-positive values fall back to the default. Note that this property is shared with the model-reader limit and raising it relaxes both. Users who cannot upgrade immediately should treat all SymSpell .bin model files as untrusted input unless their provenance is verified, and should avoid loading models supplied by end users or fetched from third-party repositories without integrity checks.
Dane podatności pochodzą z NVD (NIST) · CISA KEV · EPSS

