
vLLM v0.26.0 — Inkling 당일 지원, DeepSeek-V4 가속
#LLM 서빙 엔진 vLLM이 7/25 v0.26.0을 냈습니다. 릴리스 노트 기준 411개 커밋에 기여자 212명(그중 신규 61명)이 참여했습니다. 신규 Inkling 모델 패밀리를 기본 모델링부터 CUDA graph, Hopper FA4 어텐션, speculative decoding, LoRA, NVFP4 양자화까지 한 번에 지원합니다. DeepSeek-V4에는 전용 라우팅 커널로 종단 TPOT(토큰당 지연) 2.94% 개선, fused_topk_bias 커널 1.5~2배 가속, 중복 복사 제거로 1.8% 개선이 붙었습니다. 어텐션 백엔드를 KV 캐시 그룹별로 골라 쓸 수 있고, 슬라이딩 윈도우 지원이 백엔드 능력으로 명시됐습니다. 수치는 모두 릴리스 노트 자체 측정치입니다.
💡자체 GPU에 모델을 올려 서빙 중이라면 코드 수정 없이 버전만 올려도 지연과 KV 캐시 여유를 얻습니다. 같은 하드웨어로 더 긴 컨텍스트와 더 많은 동시 요청을 받을 수 있는지 다시 재볼 시점입니다.








