← 2026년 10월 7일 브리핑

P2 오픈소스 일반 공개 vLLM

vLLM v0.31.0 출시…DeepSeek-V4.1-Flash 추론 성능 최적화 집중

발표 2026년 10월 6일

무슨 일인가

vLLM v0.31.0에는 기여자 307명(신규 96명)의 커밋 717개가 반영됐다. 주요 변경은 DeepSeek-V4.1-Flash 성능 개선으로, SM100에서 V4.1 NVFP4 압축 KV 캐시를 쓰는 FlashMLA mega attention을 기본값으로 했다. 인덱서용 DeepGEMM sparse MQA logits, 게이트 GEMM과 전문가 선택을 합친 Mega-Gate 같은 커널 융합도 들어갔다.

의미

Blackwell(SM100) 환경에서 DeepSeek 계열 모델을 서빙하는 팀은 업그레이드만으로 성능 개선을 기대할 수 있다. 실제 개선 폭은 자료에 나오지 않는다.

출처