vLLM v0.31.0 출시…DeepSeek-V4.1-Flash 추론 성능 최적화 집중
발표 2026년 10월 6일
무슨 일인가
vLLM v0.31.0에는 기여자 307명(신규 96명)의 커밋 717개가 반영됐다. 주요 변경은 DeepSeek-V4.1-Flash 성능 개선으로, SM100에서 V4.1 NVFP4 압축 KV 캐시를 쓰는 FlashMLA mega attention을 기본값으로 했다. 인덱서용 DeepGEMM sparse MQA logits, 게이트 GEMM과 전문가 선택을 합친 Mega-Gate 같은 커널 융합도 들어갔다.
의미
Blackwell(SM100) 환경에서 DeepSeek 계열 모델을 서빙하는 팀은 업그레이드만으로 성능 개선을 기대할 수 있다. 실제 개선 폭은 자료에 나오지 않는다.
출처
- 공식 v0.31.0 vLLM