AI 용어집 · 기초 · MLOps·LLMOps
실험 추적 Experiment Tracking
실험 추적은 AI 모델을 학습할 때마다 어떤 데이터·코드·설정을 썼고 결과가 어땠는지를 자동으로 기록해, 나중에 비교하고 똑같이 재현할 수 있게 하는 작업이다.
어떻게 작동하나
학습 코드에 기록용 몇 줄을 넣으면, 학습이 한 번 돌 때마다(이를 '런'이라 부른다) 정보가 자동으로 저장된다. 주로 하이퍼파라미터(학습률 같은 설정값), 코드 버전, 데이터 버전, 학습 중 손실 함수 값의 변화, 최종 평가 지표, 결과 모델 파일 등을 남긴다. 기록은 웹 화면에서 표나 그래프로 볼 수 있어 여러 런을 나란히 비교하기 쉽다.
한 번의 런에서 남길 것
입력
- 코드 버전
- 데이터 버전
- 하이퍼파라미터(학습률 등)
결과
- 손실 함수 값의 변화
- 최종 평가 지표
- 결과 모델 파일
왜 중요한가
모델 개발은 설정을 조금씩 바꿔 수십, 수백 번 돌려 보는 과정이라 기록이 없으면 '어제 잘 나온 그 설정'을 금세 잃어버린다. 실험 추적은 좋은 결과를 재현하고, 무엇을 바꿨을 때 성능이 좋아졌는지 원인을 찾는 데 도움을 준다. 팀원끼리 결과를 공유하기도 쉬워 같은 실험을 중복해서 돌리는 낭비를 줄인다. 가장 좋은 런의 모델은 모델 레지스트리에 등록되어 배포 단계로 넘어간다.
알아 둘 점
코드와 설정만 기록하고 데이터 버전을 빠뜨리면 재현이 안 되는 경우가 많다. 기록을 너무 많이 남기면 저장 공간이 빠르게 늘어나니 무엇을 남길지 정해 두는 것이 좋다. LLM 시대에는 학습뿐 아니라 프롬프트를 바꿔 가며 Evals 점수를 비교하는 일에도 같은 방식이 쓰인다.
예시
MLflow, Weights & Biases 같은 도구가 대표적인 실험 추적 도구다. 예를 들어 연구자가 파인튜닝 설정을 바꿔 가며 여러 번 학습하면, 각 런의 손실 곡선과 평가 점수가 대시보드에 쌓인다. 그중 가장 나은 런을 골라 어떤 설정이 달랐는지 비교한 뒤, 그 모델을 레지스트리에 올린다.