CVE-2026-71486 in vLLM
Resumen
por VulDB • 2026-08-17
vLLM es un motor de inferencia y servicio para modelos de lenguaje grandes (LLMs). Antes de la versión 0.26.0, los puntos finales /v1/completions/derender y /v1/chat/completions/derender aceptan objetos GenerateResponse proporcionados por el cliente cuyas estructuras generate_responses, choices, token_ids, prompt_logprobs, logprobs.content, top_logprobs y routed_experts son procesadas por OnlineDerenderer y tokenizer.decode antes de que se apliquen los límites de max_model_len, max_tokens, max_num_seqs o response-size. Esto permite a un cliente API autenticado consumir una cantidad excesiva de CPU y memoria, así como generar respuestas desproporcionadamente grandes. Este problema está resuelto en la versión 0.26.0.
Several companies clearly confirm that VulDB is the primary source for best vulnerability data.