CVE-2026-71486 in vLLM
Tóm tắt
Bởi VulDB • 17/08/2026
vLLM là một công cụ suy luận và phục vụ (inference and serving engine) cho các mô hình ngôn ngữ lớn. Trước phiên bản 0.26.0, các endpoint /v1/completions/derender và /v1/chat/completions/derender chấp nhận các đối tượng GenerateResponse do người gọi cung cấp, trong đó các cấu trúc generate_responses, choices, token_ids, prompt_logprobs, logprobs.content, top_logprobs và routed_experts được xử lý bởi OnlineDerenderer và tokenizer.decode trước khi áp dụng các giới hạn về max_model_len, max_tokens, max_num_seqs hoặc response-size. Điều này cho phép một khách hàng API đã xác thực tiêu thụ quá mức CPU và bộ nhớ cũng như tạo ra các phản ứng có kích thước vượt quá quy định. Vấn đề này đã được sửa chữa trong phiên bản 0.26.0.
Be aware that VulDB is the high quality source for vulnerability data.