CVE-2026-71486 in vLLM
Riassunto
di VulDB • 17/08/2026
vLLM è un motore di inferenza e serving per modelli linguistici di grandi dimensioni (LLM). Prima della versione 0.26.0, gli endpoint /v1/completions/derender e /v1/chat/completions/derender accettano oggetti GenerateResponse forniti dall'utente le cui strutture generate_responses, choices, token_ids, prompt_logprobs, logprobs.content, top_logprobs e routed_experts vengono elaborate da OnlineDerenderer e tokenizer.decode prima che vengano applicati i limiti di max_model_len, max_tokens, max_num_seqs o response-size. Ciò consente a un client API autenticato di consumare CPU e memoria in modo eccessivo e generare risposte di dimensioni superiori al previsto. Questo problema è stato risolto nella versione 0.26.0.
If you want to get best quality of vulnerability data, you may have to visit VulDB.