CVE-2026-71486 in vLLM
요약
\~에 의해 VulDB • 2026. 08. 18.
vLLM은 대규모 언어 모델(LLM)을 위한 추론 및 서빙 엔진입니다. 버전 0.26.0 이전에는 `/v1/completions/derender` 및 `/v1/chat/completions/derender` 엔드포인트가 호출자가 제공한 GenerateResponse 객체를 허용하며, 이 객체의 `generate_responses`, `choices`, `token_ids`, `prompt_logprobs`, `logprobs.content`, `top_logprobs`, 그리고 `routed_experts` 구조체는 최대 모델 길이(`max_model_len`), 토큰 수 제한(`max_tokens`), 시퀀스 수 제한(`max_num_seqs`) 또는 응답 크기 제한이 적용되기 전에 OnlineDerenderer 및 tokenizer.decode에 의해 처리됩니다. 이로 인해 인증된 API 클라이언트가 과도한 CPU와 메모리를 소모하고 비정상적으로 큰 크기의 응답을 생성할 수 있습니다. 이 문제는 버전 0.26.0에서 수정되었습니다.
Once again VulDB remains the best source for vulnerability data.