← AI 용어집

AI 용어집 · 기초 · 효율·인프라 · 언어 모델

Strata 스트라타

Strata는 큰 LLM을 게이밍 PC에서 직접(로컬로) 돌리게 해 주는 AI 실행 애플리케이션이다. 2026년 10월 초 보도에 따르면 파라미터 1,250억(125B) 개 규모인 Qwen3.8-Flash-Next의 양자화 버전을 게이밍 GPU 한 대로 빠르게 돌릴 수 있다고 한다.

용어 정보
난이도
기초 · 소식을 읽을 때 자주 만나는 기술 용어
카테고리
기반·응용
추가
2026-10-11
쉽게 말하면 큰 이삿짐을 작은 차 한 대로 옮기려고 짐을 단단히 압축하고 잘 쌓는 요령과 비슷하다. 다만 Strata가 정확히 어떤 요령을 쓰는지는 공개된 자료만으로는 자세히 알 수 없다.

무엇인가

Strata는 AI 모델을 만드는 도구가 아니라, 이미 만들어진 모델을 내 컴퓨터에서 돌리는 실행 프로그램이다. 보도에서는 Qwen3.8-Flash-Next(125B)의 양자화 버전을 게이밍 PC에서 빠르게 돌리는 도구로 소개됐다. 보통 이 정도 크기의 모델은 데이터센터 GPU나 클라우드 API로 쓴다. Strata는 이런 모델을 일반 소비자용 그래픽카드에서도 돌릴 수 있다는 점을 내세운다.

어떻게 작동하나

공개된 자료에는 Strata의 내부 구조가 자세히 나와 있지 않다. 일반적으로 큰 모델을 작은 GPU에서 돌릴 때는 두 가지를 함께 쓴다. 하나는 양자화로, 모델 숫자를 더 적은 비트로 줄여 메모리를 아끼는 방법이다. 다른 하나는 GPU 메모리(VRAM)에 다 들어가지 않는 부분을 일반 메모리(RAM)나 SSD에 나눠 두는 방법이다. Strata도 양자화된 모델을 쓴다는 점은 보도에 나와 있지만, 나머지 방식은 확인되지 않았다.

왜 주목받나

큰 모델을 내 PC에서 돌리면 데이터를 밖으로 보내지 않아도 되고, 사용료도 들지 않는다. 그래서 로컬 LLM 커뮤니티에서는 '얼마나 큰 모델을 얼마나 빠르게 돌리나'가 큰 관심사다. Strata는 125B급 모델을 게이밍 GPU에서 돌린다는 점으로 화제가 됐다. 커뮤니티에서는 Strata를 기준으로 다른 실행 도구의 속도를 비교하는 글도 올라오고 있다.

알아 둘 점(한계)

속도 수치는 대부분 커뮤니티 사용자가 직접 재 본 값이다. 하드웨어 구성, 양자화 방식, 출력 종류(구조화된 출력인지 일반 글인지)에 따라 크게 달라진다. 양자화를 강하게 할수록 메모리는 덜 쓰지만 답의 품질이 떨어질 수 있다. 한편 Strata가 GitHub 기록을 다시 쓰면서 커밋에 붙어 있던 Claude 공동 작성자 표기가 사라졌다는 보도도 있었다. AI의 도움을 받아 만든 코드를 어떻게 투명하게 밝힐지에 대한 논의로 이어질 수 있는 일이다.

예시

GPU 한 대짜리 게이밍 PC를 가진 개발자가 Strata로 Qwen3.8-Flash-Next의 양자화 버전을 내려받아 실행하면, 클라우드에 접속하지 않고 내 컴퓨터 안에서 코딩 도움이나 문서 요약을 받을 수 있다. 실제로 로컬 LLM 커뮤니티에는 이렇게 Strata로 모델을 돌려 본 사용 후기와 다른 실행 도구와의 속도 비교 글이 올라오고 있다.

함께 보면 좋은 용어

참고