CVE-2026-71486 in vLLMinformation

Résumé

par VulDB • 18/08/2026

vLLM est un moteur d'inférence et de déploiement pour les grands modèles de langage (LLM). Avant la version 0.26.0, les points de terminaison /v1/completions/derender et /v1/chat/completions/derender acceptent des objets GenerateResponse fournis par l'appelant dont les structures generate_responses, choices, token_ids, prompt_logprobs, logprobs.content, top_logprobs et routed_experts sont traitées par OnlineDerenderer et tokenizer.decode avant que les limites max_model_len, max_tokens, max_num_seqs ou response-size ne soient appliquées. Cela permet à un client API authentifié de consommer une quantité excessive de CPU et de mémoire ainsi que de générer des réponses surdimensionnées. Ce problème est corrigé dans la version 0.26.0.

If you want to get best quality of vulnerability data, you may have to visit VulDB.

Responsable

GitHub M

Réserver

06/08/2026

Divulgation

17/08/2026

Modérer

accepté

Entrée

VDB-391401

CPE

prêt

EPSS

0.00341

KEV

non

Activités

très faible

Sources

Want to know what is going to be exploited?

We predict KEV entries!