← 스터디

스터디 · 2026-10-10 · 심화

루프 트랜스포머: 같은 층을 여러 번 돌려 더 깊게 생각하기

루프 트랜스포머는 파라미터를 늘리는 대신 같은 트랜스포머 블록을 여러 번 반복해 계산 깊이를 키우는 구조다. 다만 반복 횟수를 늘리면 학습이 불안정해지고 메모리 사용량이 커지는 문제가 있다. 최근 연구는 대부분 이 두 문제를 푸는 데 집중하고 있다.

핵심 정리

왜 필요했나: 모델을 키우지 않고 더 깊게

보통 모델 성능을 올리려면 모델을 키워야 한다. 층을 더 쌓고 파라미터(모델이 학습하는 숫자)를 늘리는 방식인데, 그만큼 저장 공간과 학습 비용이 커진다. 완전 루프 트랜스포머 연구논문는 루프 트랜스포머가 이 공식의 대안이라고 설명한다. 같은 트랜스포머 블록을 반복해서 다시 쓰는 방식이라, 파라미터 수나 컨텍스트 길이는 그대로 두고 계산을 더 해서 성능을 얻는다.

또 하나의 장점은 루프 횟수를 추론 시점에 바꿀 수 있다는 점이다. 어려운 문제에는 더 많이 돌리고 쉬운 문제에는 덜 돌리는 식으로, 성능과 테스트 타임 컴퓨트(답을 낼 때 쓰는 계산량) 사이에서 균형을 고를 수 있다논문.

일반 트랜스포머는 토큰 하나에 적용하는 깊이(층 수)가 고정돼 있다. 순환 루프 트랜스포머논문는 이 점을 지적한다. 입력이 들어올 때마다 상태를 갱신해야 하는 상태 추적 문제에서는 시퀀스가 길어져도 깊이가 그대로라 한계가 생긴다는 것이다. 이렇게 '계산 깊이를 유연하게 늘릴 수 있는가'라는 질문이 루프 구조 연구를 이끌고 있다.

핵심 아이디어: 같은 편집자에게 원고를 여러 번 맡기기

비유하자면, 일반 트랜스포머는 원고를 편집자 24명이 한 번씩 차례로 고치는 방식이다. 편집자마다 고유한 기술(파라미터)이 있으니 사람이 늘수록 인건비(파라미터 수)도 늘어난다. 루프 트랜스포머는 편집자 몇 명으로 팀을 짜고, 이 팀에게 같은 원고를 여러 번 돌려 다듬게 한다. 인원은 그대로인데 손을 보는 횟수, 곧 '펼친 깊이(unrolled depth)'가 늘어난다.

DeepLoop논문은 이것을 '압축된 물리적 블록 묶음을 여러 라운드 적용해, 저장하는 파라미터를 늘리지 않고 펼친 깊이를 키우는 것'이라고 정리한다. 여러 연구가 이를 '반복 깊이(recurrent depth)'라는 새로운 스케일링 축으로 본다. 모델 크기와 데이터 양 외에, 같은 블록을 몇 번 돌리느냐가 또 하나의 성능 손잡이가 된다는 뜻이다.

다만 같은 편집자가 같은 원고를 여러 번 고치다 보면 이전에 잘 고친 부분을 다시 망치는 일도 생긴다. 루프 트랜스포머 연구의 상당 부분은 '반복을 늘려도 상태가 무너지지 않게 하는 법'에 관한 것이다.

일반 트랜스포머 대 루프 트랜스포머

일반 트랜스포머층마다 다른 가중치

  • 깊이를 늘리면 파라미터도 늘어남
  • 토큰당 깊이가 고정
  • 학습 규칙이 잘 정립됨

루프 트랜스포머같은 블록을 반복

  • 파라미터를 그대로 두고 깊이를 늘림
  • 추론 때 루프 횟수 조절 가능
  • 반복이 늘면 학습 불안정·메모리 증가

공통 둘 다 어텐션과 잔차 연결로 된 트랜스포머 블록을 쓴다

깊이를 얻는 방식이 다르다. 루프 방식은 파라미터 대신 반복 횟수로 깊이를 늘린다.

어떻게 작동하나: 블록 하나를 N번 통과

작동 과정을 단계로 나누면 다음과 같다. 1) 입력 토큰을 임베딩(숫자 벡터)으로 바꾼다. 2) 몇 개 층으로 이뤄진 공유 블록에 이 Representation(모델 내부의 중간 표현)을 통과시킨다. 3) 나온 결과를 같은 블록에 다시 넣는다. 이것을 정해진 루프 횟수만큼 반복한다. 4) 마지막 루프의 Representation으로 다음 토큰을 예측한다. 블록 안의 어텐션과 잔차 연결(입력에 변화량을 더해 넘기는 통로)은 일반 트랜스포머와 같다. 같은 가중치가 여러 번 쓰인다는 점만 다르다.

이 반복 때문에 두 가지 부담이 생긴다. 첫째는 학습이다. DeepLoop논문에 따르면, 일반 트랜스포머에서는 층마다 자기 파라미터가 따로 업데이트된다. 루프 구조에서는 공유된 하나의 업데이트가 여러 번의 방문에서 나온 그래디언트를 모으고, 다음 순전파에서 그 방문들이 같은 업데이트를 다시 읽는다. 그래서 잔차 크기를 정하는 규칙이 달라져야 한다.

둘째는 메모리다. 대표적인 루프 언어 모델인 Ouro는 루프마다 표준 KV 캐시(이전 토큰의 키·값을 저장해 두는 메모리)를 유지한다. MELT논문는 이 때문에 추론 깊이에 비례해 메모리가 선형으로 늘어난다고 지적한다. 실제 배포에서도 이 문제가 드러났다. Nanbeige4.2-3B 분석논문에 따르면, 한 층 묶음을 두 번 통과시키는 이 모델은 층 재사용 때문에 최대 어텐션 메모리가 사실상 두 배가 된다.

루프 트랜스포머의 처리 과정입력 토큰 → 임베딩; 임베딩 → 공유 블록; 공유 블록 → 루프 횟수 확인; 루프 횟수 확인 → 공유 블록(다시); 공유 블록 → KV 캐시(기록); 루프 횟수 확인 → 다음 토큰 예측(끝)입력 토큰임베딩공유 블록같은 가중치 재사용루프 횟수 확인추론 때 조절 가능KV 캐시루프마다 늘어남다음 토큰 예측다시기록끝
루프 트랜스포머의 처리 과정 입력이 공유 블록을 정해진 횟수만큼 반복 통과한 뒤 출력된다. 점선은 루프마다 KV 캐시가 쌓이는 메모리 부담을 나타낸다.

발전 흐름: 안정화, 메모리, 원리 분석

출발점 연구들은 크게 세 갈래로 나눌 수 있다. 첫째 갈래는 학습 안정화다. 완전 루프 트랜스포머논문는 루프가 늘 때 생기는 불안정의 원인을 그래디언트 진동과 잔차 폭주로 진단했다. 그리고 파라미터를 추가하지 않는 두 가지 수정을 제안했다. 루프 사이의 신호를 모든 층에 나눠 전달하는 구조와, 기존 어텐션 블록을 재사용하는 어텐션 주입이다. 그 결과 다른 루프 모델이 무너지는 12회 루프까지 안정적으로 학습했다. 루프 모델이 무너지지 않는 조건에서도 다운스트림 과제 평균 성능을 최대 13.2% 높였다. DeepLoop논문은 잔차 크기를 정하는 DeepNorm 규칙을 루프 구조에 맞게 고쳤다. GPT-2 small·medium 규모에서 같은 블록을 다시 방문할 때 검증 손실과 정확도가 좋아졌다. 이 연구는 '안정적인 반복 깊이에는 명목상의 층 수가 아니라 파라미터 방문 횟수를 고려한 규칙이 필요하다'고 결론짓는다.

둘째 갈래는 메모리와 배포다. MELT논문는 층마다 루프 수만큼 KV 캐시를 두는 대신, 층마다 캐시 하나를 루프끼리 공유하고 학습 가능한 게이트로 갱신한다. 사전학습된 Ouro 파라미터에서 시작해 Distillation(지식 증류)을 포함한 2단계로 학습했다. 그 결과 비슷한 크기의 일반 LLM과 비슷한 메모리를 쓰면서 성능은 더 높았다. Nanbeige4.2-3B 분석논문은 Apple Silicon에서 공개 체크포인트가 바로 돌아가지 않게 만든 버그 다섯 개를 찾아냈다. 또 청크 단위 프리필로 32GiB 공유 메모리에서 쓸 수 있는 컨텍스트를 2.7배 늘렸다. 학습 없는 루프 트랜스포머논문는 이미 학습된 모델의 중간 층 묶음을 추론 때만 반복시키는 방법이다. 단순히 블록을 다시 적용하면 대개 성능이 떨어진다. 그래서 한 번의 큰 업데이트를 감쇠된 작은 단계 여러 개로 나눠 적용했고, Qwen3-4B-Instruct의 MMLU-Pro 점수를 2.64%p 올렸다.

셋째 갈래는 원리 분석이다. 순환 루프 트랜스포머논문는 층을 병렬 인코더와 순환 디코더로 나누고, 이전 토큰의 디코더 상태를 다음 토큰에 되먹인다. 최대 40비트로 학습하고도 패리티(1의 개수가 홀수인지 짝수인지 판별하는 과제)를 256비트까지 100% 정확도로 풀었다. 같은 조건에서 일반 트랜스포머는 우연 수준에 머물렀다. 길이 일반화 메커니즘 연구논문는 학습 때보다 긴 추론 사슬을 루프 모델이 어떻게 푸는지 내부를 들여다봤다. 순환 상태에는 과제 내용뿐 아니라 그 내용이 '다음 계산에 쓸 수 있는 상태인지'도 함께 담긴다는 공통 원리를 찾았다. 에너지-엔트로피 정규화 연구논문는 손실 지형이 험해 학습이 어려운 단일 헤드 루프 모델을 물리 흐름처럼 다루는 학습법으로 학습시켰다. 모델 차원 8인 모델이 길이 1000 토큰의 induction head 과제를 풀었다.

루프 트랜스포머 연구 지도 같은 열은 같은 관심사로 묶은 연구다. 상자를 누르면 원문으로 이동한다.

요즘 어디로 가고 있나: 더 많이, 더 싸게 돌리기

최근 연구의 방향은 '루프를 훨씬 더 많이 돌려도 버티게 하기'다. InfiLoop논문은 루프를 늘리면 오히려 추론 정확도가 떨어진다는 관찰에서 출발했다. 잡음이 섞인 상태 업데이트가 맞게 추론해 둔 중간 결과를 덮어쓰고, 이미 푼 답을 되돌리기도 한다는 것이다. 이를 막기 위해 과거 계산 중 무엇을 남기고 새 업데이트를 얼마나 받아들일지 학습하는 루프 전용 잔차 연결을 만들었다. 파라미터 7M의 작은 모델로 Sudoku-Extreme에서 97.9% 정확도를 냈고, 유효 스텝이 2만 번을 넘어서도 계속 성능이 올랐다.

대형 MoE(전문가 혼합) 모델로 루프를 넓히는 연구도 있다. LOOM논문에 따르면 그동안은 루프를 늘려도 이득이 빨리 줄거나 오히려 나빠져서, 기존 연구는 대개 루프 2회에 머물렀다. 원인으로는 두 가지를 짚었다. 반복마다 은닉 상태의 분산이 커지는 문제, 그리고 라우터가 루프마다 같은 전문가만 고르는 '전문가 선택 붕괴'다. 잔차 업데이트 크기 조절, 루프마다 입력 임베딩 다시 넣기, 루프별 라우터 같은 방법으로 100M~1.7B 모델에서 9~12회 루프까지 안정적으로 확장했다.

추론 비용을 줄이는 방향도 있다. LoopCD논문는 앞쪽 루프의 예측이 '덜 계산한 약한 예측'이라는 점을 이용한다. 마지막 루프의 예측과 대비시켜 다음 토큰을 고르는데, 추가 학습이 필요 없다. Ouro-2.6B-Thinking의 AIME 2024 pass@1을 61.88%에서 73.33%로 올렸다. 루프 수를 절반으로 줄여도 전체 깊이 기준선과 같거나 더 나은 성능을 내서, 순전파 FLOPs를 22.5~48.2% 줄였다.

최근 연구의 눈에 띄는 수치

2만 스텝 이상InfiLoop: 반복할수록 성능 향상
9~12회LOOM: MoE 안정 루프 수
22.5~48.2%LoopCD: 순전파 FLOPs 절감
각 수치는 본문에서 소개한 최근 연구 한 편씩의 결과다.

한계와 쟁점

가장 큰 쟁점은 반복이 깊어질수록 생기는 불안정성이다. 안정화 기법이 여럿 나왔지만, 보고된 안정 범위는 대체로 9~12회 루프 수준이다논문논문. 길이 일반화 메커니즘 연구논문는 두 가지 루프 설정 모두 깊이가 커지면 내부 메커니즘을 믿기 어려워진다고 보고했다. 상태를 읽는 지점이나 진행 신호가 흐려지고, 상태 전파의 신뢰도가 떨어진다. 스스로 고치는 능력도 제한적이어서, 한 번 생긴 국소 오류가 남아 계속 쌓인다.

두 번째 쟁점은 '파라미터가 적다'는 장점이 비용 전체를 줄여 주지는 않는다는 점이다. 계산은 루프 수만큼 늘고, KV 캐시도 따로 손보지 않으면 함께 늘어난다논문. Nanbeige4.2-3B 분석논문은 실제 배포에서 겪는 어려움을 보여 준다. 버그와 메모리 문제를 고친 뒤에야 에이전트 과제를 평가할 수 있었다. 그 뒤에도 MCPMark 일부 과제 완료율은 최대 30%였고, BFCL에서는 여러 도구를 함께 쓰는 테스트 대부분을 통과하지 못했다.

세 번째로, 이득은 과제에 따라 다르다. 순환 루프 트랜스포머논문에서는 피드백을 네 토큰마다 한 번만 갱신해도 64비트 패리티 정확도가 99%로 유지됐다. 반면 순열 추적 과제의 정확도는 100%에서 20%로 떨어졌다. 학습 없는 루프논문에서도 블록을 그냥 반복하면 대개 성능이 나빠졌다. '루프만 늘리면 좋아진다'는 단순한 기대는 맞지 않는다.

더 공부하려면

처음이라면 완전 루프 트랜스포머논문부터 읽기를 권한다. 루프 트랜스포머의 장점과 대표적인 실패 원인(그래디언트 진동, 잔차 폭주)을 한 편에서 함께 정리해 준다. 이어서 DeepLoop논문을 읽으면, 파라미터를 공유할 때 잔차 크기를 다르게 잡아야 하는 이유를 이론적으로 이해할 수 있다.

메모리와 배포에 관심이 있다면 MELT논문와 Nanbeige4.2-3B 분석논문이 좋다. 앞의 것은 KV 캐시를 루프끼리 공유하는 설계를, 뒤의 것은 실제 기기에서 부딪히는 문제를 다룬다. 이미 가진 모델로 바로 실험해 보고 싶다면 학습 없는 루프 트랜스포머논문가 진입 장벽이 가장 낮다.

왜 루프가 추론에 도움이 되는지 궁금하다면 순환 루프 트랜스포머논문와 길이 일반화 메커니즘 연구논문를 함께 읽는다. 최근 방향을 보려면 InfiLoop논문, LOOM논문, LoopCD논문 순서로 읽으면 각각 '깊게', '크게', '싸게'라는 흐름이 잡힌다.

관련 용어

트랜스포머 테스트 타임 컴퓨트 KV 캐시 MoE 스케일링 법칙 CoT 추론 모델 양자화

참고 문헌

핵심 논문

최근 연구

AI가 참고 문헌을 바탕으로 작성하고 검수를 거친 해설입니다. 정확한 내용은 원문을 확인해 주세요.