Strata 스트라타
Strata는 큰 LLM을 게이밍 PC에서 직접(로컬로) 돌리게 해 주는 AI 실행 애플리케이션이다. 2026년 10월 초 보도에 따르면 파라미터 1,250억(125B) 개 규모인 Qwen3.8-Flash-Next의 양자화 버전을 게이밍 GPU 한 대로 빠르게 돌릴 수 있다고 한다.
무엇인가
Strata는 AI 모델을 만드는 도구가 아니라, 이미 만들어진 모델을 내 컴퓨터에서 돌리는 실행 프로그램이다. 보도에서는 Qwen3.8-Flash-Next(125B)의 양자화 버전을 게이밍 PC에서 빠르게 돌리는 도구로 소개됐다. 보통 이 정도 크기의 모델은 데이터센터 GPU나 클라우드 API로 쓴다. Strata는 이런 모델을 일반 소비자용 그래픽카드에서도 돌릴 수 있다는 점을 내세운다.
어떻게 작동하나
공개된 자료에는 Strata의 내부 구조가 자세히 나와 있지 않다. 일반적으로 큰 모델을 작은 GPU에서 돌릴 때는 두 가지를 함께 쓴다. 하나는 양자화로, 모델 숫자를 더 적은 비트로 줄여 메모리를 아끼는 방법이다. 다른 하나는 GPU 메모리(VRAM)에 다 들어가지 않는 부분을 일반 메모리(RAM)나 SSD에 나눠 두는 방법이다. Strata도 양자화된 모델을 쓴다는 점은 보도에 나와 있지만, 나머지 방식은 확인되지 않았다.
왜 주목받나
큰 모델을 내 PC에서 돌리면 데이터를 밖으로 보내지 않아도 되고, 사용료도 들지 않는다. 그래서 로컬 LLM 커뮤니티에서는 '얼마나 큰 모델을 얼마나 빠르게 돌리나'가 큰 관심사다. Strata는 125B급 모델을 게이밍 GPU에서 돌린다는 점으로 화제가 됐다. 커뮤니티에서는 Strata를 기준으로 다른 실행 도구의 속도를 비교하는 글도 올라오고 있다.
알아 둘 점(한계)
속도 수치는 대부분 커뮤니티 사용자가 직접 재 본 값이다. 하드웨어 구성, 양자화 방식, 출력 종류(구조화된 출력인지 일반 글인지)에 따라 크게 달라진다. 양자화를 강하게 할수록 메모리는 덜 쓰지만 답의 품질이 떨어질 수 있다. 한편 Strata가 GitHub 기록을 다시 쓰면서 커밋에 붙어 있던 Claude 공동 작성자 표기가 사라졌다는 보도도 있었다. AI의 도움을 받아 만든 코드를 어떻게 투명하게 밝힐지에 대한 논의로 이어질 수 있는 일이다.
예시
GPU 한 대짜리 게이밍 PC를 가진 개발자가 Strata로 Qwen3.8-Flash-Next의 양자화 버전을 내려받아 실행하면, 클라우드에 접속하지 않고 내 컴퓨터 안에서 코딩 도움이나 문서 요약을 받을 수 있다. 실제로 로컬 LLM 커뮤니티에는 이렇게 Strata로 모델을 돌려 본 사용 후기와 다른 실행 도구와의 속도 비교 글이 올라오고 있다.
함께 보면 좋은 용어
참고
- Strata lets a 125 billion parameter model run on a gaming GPU (Startup Fortune)
- 'Strata' is an AI execution application that enables high-speed local execution of the quantized version of 125B's 'Qwen3.8-Flash-Next' on gaming PCs. (GIGAZINE)
- Strata rewrites its GitHub history, 595 Claude co-author tags vanish (Pasquale Pillitteri)