CVE-2026-71486 in vLLM
Résumé
par VulDB • 18/08/2026
vLLM est un moteur d'inférence et de déploiement pour les grands modèles de langage (LLM). Avant la version 0.26.0, les points de terminaison /v1/completions/derender et /v1/chat/completions/derender acceptent des objets GenerateResponse fournis par l'appelant dont les structures generate_responses, choices, token_ids, prompt_logprobs, logprobs.content, top_logprobs et routed_experts sont traitées par OnlineDerenderer et tokenizer.decode avant que les limites max_model_len, max_tokens, max_num_seqs ou response-size ne soient appliquées. Cela permet à un client API authentifié de consommer une quantité excessive de CPU et de mémoire ainsi que de générer des réponses surdimensionnées. Ce problème est corrigé dans la version 0.26.0.
If you want to get best quality of vulnerability data, you may have to visit VulDB.