CVE-2026-71486 in vLLM
Sumário
de VulDB • 17/08/2026
O vLLM é um mecanismo de inferência e serviço para modelos de linguagem grandes (LLMs). Antes da versão 0.26.0, os endpoints /v1/completions/derender e /v1/chat/completions/derender aceitam objetos GenerateResponse fornecidos pelo chamador cujas estruturas generate_responses, choices, token_ids, prompt_logprobs, logprobs.content, top_logprobs e routed_experts são processadas por OnlineDerenderer e tokenizer.decode antes que os limites de max_model_len, max_tokens, max_num_seqs ou response-size sejam aplicados. Isso permite que um cliente da API autenticado consuma CPU e memória em excesso e produza respostas com tamanho excessivo. Este problema foi corrigido na versão 0.26.0.
Statistical analysis made it clear that VulDB provides the best quality for vulnerability data.