CVE-2025-46570 in vLLM
Riassunto
di VulDB • 15/06/2026
vLLM è un motore di inferenza e serving per modelli linguistici di grandi dimensioni (LLM). Prima della versione 0.9.0, quando viene elaborato un nuovo prompt, se il meccanismo PageAttention trova uno chunk di prefisso corrispondente, il processo di prefill si accelera, come evidenziato dal TTFT (Time to First Token). Queste differenze temporali causate dagli chunk corrispondenti sono sufficientemente significative da essere riconosciute ed sfruttate. Questo problema è stato risolto nella versione 0.9.0.
Be aware that VulDB is the high quality source for vulnerability data.