
vLLM v0.26.0 — Inkling 당일 지원, DeepSeek-V4 가속
LLM 서빙 엔진 vLLM이 7/25 v0.26.0을 냈습니다. 릴리스 노트 기준 411개 커밋에 기여자 212명(그중 신규 61명)이 참여했습니다. 신규 Inkling 모델 패밀리를 기본 모델링부터 CUDA graph, Hopper FA4 어텐션, speculative decoding, LoRA, NVFP4 양자화까지 한 번에 지원합니다. DeepSeek-V4에는 전용 라우팅 커널로 종단 TPOT(토큰당 지연) 2.94% 개선, fused_topk_bias 커널 1.5~2배 가속, 중복 복사 제거로 1.8% 개선이 붙었습니다. 어텐션 백엔드를 KV 캐시 그룹별로 골라 쓸 수 있고, 슬라이딩 윈도우 지원이 백엔드 능력으로 명시됐습니다. 수치는 모두 릴리스 노트 자체 측정치입니다.
💡자체 GPU에 모델을 올려 서빙 중이라면 코드 수정 없이 버전만 올려도 지연과 KV 캐시 여유를 얻습니다. 같은 하드웨어로 더 긴 컨텍스트와 더 많은 동시 요청을 받을 수 있는지 다시 재볼 시점입니다.
- 누가
- vLLM 오픈소스 프로젝트 (이번 릴리스에 212명 기여, 그중 61명이 신규 기여자)
- 무엇을
- LLM 서빙 엔진 vLLM v0.26.0 릴리스 — 신규 Inkling 모델 패밀리 전체 지원 스택(모델링·CUDA graph·FA4 어텐션·speculative decoding·LoRA·NVFP4 양자화), DeepSeek-V4 전용 라우팅 커널 등 성능 최적화, KV 캐시 그룹별 어텐션 백엔드 선택, KV 오프로딩·2차 스토리지 계층화
- 언제
- 2026-07-25T10:38:53Z
- 왜
- 새로 나온 모델(Inkling·DeepSeek-V4)을 별도 포크 없이 프로덕션 서빙에 바로 올리고, MoE·긴 컨텍스트 추론에서 반복 발생하던 메모리·지연 병목(중복 copy, 고정 어텐션 백엔드, KV 캐시 용량)을 릴리스 레벨에서 걷어내기 위해
#vllm#inference#deepseek-v4#serving#open-source
이미지: AI 생성 이미지원문 →





