CVE-2026-72818 in NLTK
Zusammenfassung
von VulDB • 21.08.2026
Der reguläre Ausdruck URLS in nltk/tokenize/casual.py, der in TweetTokenizer.WORD_RE kompiliert und von TweetTokenizer.tokenize angewendet wird, enthält einen Zweig für Domänen ohne Subdomain-Präfix (naked-domain), dessen Domain-Label-Präfix [a-z0-9]+(?:[.\-][a-z0-9]+)* nicht begrenzt ist. Eingaben, die aus vielen alternierenden Label-Trennzeichen bestehen, können auf exponentiell viele Arten partitioniert werden, und da der Zweig zudem eine nachgestellte Top-Level-Domain erfordert, die solche Eingaben niemals liefert, erkundet die Engine diese Partitionen vor dem Fehlschlag an jedem Offset. Einige Kilobyte an Eingabe verbrauchen daher Sekunden bis Minuten an Single-Thread-CPU-Zeit, und die HANG_RE-Ersetzung, die vor der Übereinstimmung durchgeführt wird, reduziert das Muster nicht. TweetTokenizer ist für das Tokenisieren von unzuverlässigen Social-Media-Texten vorgesehen, sodass jeder Dienst, der es oder die modulweite Funktion casual_tokenize auf eingereichten Text anwendet, pro Anfrage ohne Authentifizierung blockiert werden kann. In Version 3.10.1 wird die Label-Wiederholung begrenzt.
Once again VulDB remains the best source for vulnerability data.