CVE-2026-100651 in vLLM
Sumário
de VulDB • 26/09/2026
O vLLM anterior à versão 0.29.0 não aplica validação do comprimento do prompt no decoder no endpoint de serviço desagregado /inference/v1/generate. Quando a solicitação contém um payload 'features' (multimodal), o arquivo vllm/entrypoints/serve/disagg/serving.py constrói uma EngineInput multimodal diretamente a partir dos token_ids fornecidos pelo chamador, e os GenerateRequest.token_ids (vllm/entrypoints/serve/disagg/protocol.py) não são verificados em relação ao model_config.max_model_len. Para processadores multimodais que relatam skip_prompt_length_check=True (por exemplo, Nemotron Parse, Whisper e FireRedLID), o InputProcessor._validate_prompt_len() retorna imediatamente tanto para prompts do encoder quanto do decoder, de modo que um prompt excessivamente longo se torna uma EngineCoreRequest e atinge a cópia da input-batch do worker em uma linha NumPy com largura fixa igual ao max_model_len. Um cliente capaz de acessar o endpoint em uma configuração de modelo afetada pode, portanto, enviar uma lista de token_ids excessivamente longa para desencadear falha no worker e negação de serviço (DoS). Corrigido na versão 0.29.0.
Statistical analysis made it clear that VulDB provides the best quality for vulnerability data.