AI 용어집 · 기초 · 언어 모델
활성화 함수 Activation Function
활성화 함수는 인공 신경망의 각 뉴런이 받은 신호를 다음 층으로 얼마나, 어떤 모양으로 넘길지 정하는 작은 변환 규칙입니다. 이 함수가 있어야 신경망이 단순한 직선 관계를 넘어 복잡한 패턴을 배울 수 있습니다.
어떻게 작동하나
신경망의 뉴런 하나는 여러 입력값에 각각 가중치(중요도)를 곱한 뒤 모두 더합니다. 이 합계를 그대로 넘기지 않고 활성화 함수에 한 번 통과시킨 결과를 다음 층으로 보냅니다. 많이 쓰는 ReLU는 음수면 0으로 바꾸고 양수면 그대로 두는 아주 단순한 규칙입니다. 시그모이드는 어떤 값이든 0과 1 사이로 눌러 주고, tanh는 -1과 1 사이로 바꿉니다. 최근 대형 언어 모델에서는 GELU나 SwiGLU처럼 ReLU를 부드럽게 다듬은 함수도 많이 씁니다.
왜 중요한가
활성화 함수가 없으면 층을 아무리 많이 쌓아도 결국 하나의 단순한 곱셈·덧셈 계산과 같아집니다. 그러면 직선 하나로 나눌 수 있는 문제밖에 풀지 못합니다. 활성화 함수가 중간중간 '꺾임'을 넣어 주기 때문에 신경망이 이미지, 언어처럼 복잡하고 굽은 관계를 표현할 수 있습니다. 즉, 딥러닝이 '깊이'의 효과를 얻는 데 꼭 필요한 부품입니다.
알아 둘 점
어떤 활성화 함수를 고르느냐에 따라 학습 속도와 안정성이 달라집니다. 시그모이드처럼 출력이 양 끝에서 납작해지는 함수는 층이 깊어질수록 학습 신호가 거의 사라지는 문제(기울기 소실)를 일으키기 쉽습니다. ReLU는 이 문제를 줄여 널리 쓰이게 되었지만, 일부 뉴런이 계속 0만 내보내며 학습에서 빠져 버리는 일도 생길 수 있습니다. 그래서 용도에 따라 변형된 함수들이 계속 쓰이고 연구됩니다.
예시
ChatGPT나 Claude 같은 LLM의 기반인 트랜스포머 안에는 각 층마다 작은 신경망(피드포워드 층)이 들어 있고, 여기에 GELU나 SwiGLU 같은 활성화 함수가 쓰입니다. 이미지 분류 모델에서는 마지막에 시그모이드나 소프트맥스를 붙여 '고양이일 가능성'처럼 0과 1 사이의 확률 값으로 결과를 내놓습니다.