← AI 용어집

AI 용어집 · 기초 · 언어 모델

활성화 함수 Activation Function

활성화 함수는 인공 신경망의 각 뉴런이 받은 신호를 다음 층으로 얼마나, 어떤 모양으로 넘길지 정하는 작은 변환 규칙입니다. 이 함수가 있어야 신경망이 단순한 직선 관계를 넘어 복잡한 패턴을 배울 수 있습니다.

쉽게 말하면 수도꼭지 밸브와 비슷합니다. 물(신호)이 약하면 거의 막고, 세지면 열어서 흘려보내는 식으로 흐름을 조절합니다. 다만 실제 활성화 함수는 정해진 계산 규칙일 뿐이고, 상황을 보고 판단하지는 않습니다.

어떻게 작동하나

신경망의 뉴런 하나는 여러 입력값에 각각 가중치(중요도)를 곱한 뒤 모두 더합니다. 이 합계를 그대로 넘기지 않고 활성화 함수에 한 번 통과시킨 결과를 다음 층으로 보냅니다. 많이 쓰는 ReLU는 음수면 0으로 바꾸고 양수면 그대로 두는 아주 단순한 규칙입니다. 시그모이드는 어떤 값이든 0과 1 사이로 눌러 주고, tanh는 -1과 1 사이로 바꿉니다. 최근 대형 언어 모델에서는 GELU나 SwiGLU처럼 ReLU를 부드럽게 다듬은 함수도 많이 씁니다.

뉴런 하나 안에서 일어나는 일입력값들 → 가중합; 가중합 → 활성화 함수; 활성화 함수 → 출력입력값들앞 층의 신호가중합입력×가중치를 모두 더함활성화 함수ReLU·시그모이드 등출력다음 층으로
뉴런 하나 안에서 일어나는 일 왼쪽에서 오른쪽으로 읽습니다. 입력에 가중치를 곱해 더한 값이 활성화 함수를 거쳐 다음 층으로 전달됩니다.

왜 중요한가

활성화 함수가 없으면 층을 아무리 많이 쌓아도 결국 하나의 단순한 곱셈·덧셈 계산과 같아집니다. 그러면 직선 하나로 나눌 수 있는 문제밖에 풀지 못합니다. 활성화 함수가 중간중간 '꺾임'을 넣어 주기 때문에 신경망이 이미지, 언어처럼 복잡하고 굽은 관계를 표현할 수 있습니다. 즉, 딥러닝이 '깊이'의 효과를 얻는 데 꼭 필요한 부품입니다.

알아 둘 점

어떤 활성화 함수를 고르느냐에 따라 학습 속도와 안정성이 달라집니다. 시그모이드처럼 출력이 양 끝에서 납작해지는 함수는 층이 깊어질수록 학습 신호가 거의 사라지는 문제(기울기 소실)를 일으키기 쉽습니다. ReLU는 이 문제를 줄여 널리 쓰이게 되었지만, 일부 뉴런이 계속 0만 내보내며 학습에서 빠져 버리는 일도 생길 수 있습니다. 그래서 용도에 따라 변형된 함수들이 계속 쓰이고 연구됩니다.

예시

ChatGPT나 Claude 같은 LLM의 기반인 트랜스포머 안에는 각 층마다 작은 신경망(피드포워드 층)이 들어 있고, 여기에 GELU나 SwiGLU 같은 활성화 함수가 쓰입니다. 이미지 분류 모델에서는 마지막에 시그모이드나 소프트맥스를 붙여 '고양이일 가능성'처럼 0과 1 사이의 확률 값으로 결과를 내놓습니다.

함께 보면 좋은 용어