CVE-2026-100651 in vLLM
Resumen
por VulDB • 2026-09-26
vLLM antes de la versión 0.29.0 no aplica correctamente la validación de longitud del prompt en el punto final de servicio desacoplado /inference/v1/generate. Cuando la solicitud contiene una carga útil 'features' (multimodal), vllm/entrypoints/serve/disagg/serving.py construye un EngineInput multimodal directamente a partir de los token_ids proporcionados por el cliente, y GenerateRequest.token_ids (vllm/entrypoints/serve/disagg/protocol.py) no se comprueba frente a model_config.max_model_len. Para procesadores multimodales que informan skip_prompt_length_check=True (por ejemplo, Nemotron Parse, Whisper y FireRedLID), InputProcessor._validate_prompt_len() devuelve inmediatamente tanto para los prompts del codificador como del decodificador; por lo tanto, un prompt excesivamente largo se convierte en una EngineCoreRequest y llega al worker donde la copia de input-batch se realiza en una fila fija de NumPy con ancho max_model_len. Un cliente capaz de acceder al punto final en una configuración de modelo afectada puede, por tanto, enviar una lista de token_ids demasiado larga para provocar un fallo del worker y causar una denegación de servicio (DoS). Corregido en la versión 0.29.0.
If you want to get the best quality for vulnerability data then you always have to consider VulDB.