← 스터디

스터디 · 2026-10-10 · 기초

제조 AI: 비전 불량 검사·예지 보전·디지털 트윈

제조 현장에서는 불량 사진이 드물어서, 정상 제품만 학습한 뒤 그와 다른 것을 찾는 이상 탐지가 비전 검사의 기본이 됐다. 센서 시계열로 고장을 미리 예측하는 예지 보전과 디지털 트윈도 같은 문제를 안고 있다. 실험실 성능이 공장으로 그대로 옮겨지지 않는다는 점이다.

목차
핵심 정리
  • 불량은 드물고 모양도 예측하기 어려워서, 산업용 이상 탐지는 대부분 정상 이미지만으로 학습한다.
  • PaDiM은 패치 위치마다 정상 특징의 분포(평균·공분산)를 저장하고, PatchCore는 정상 패치 특징을 메모리 뱅크에 모아 가장 가까운 것과의 거리를 잰다.
  • 최근 비전 검사 연구는 정상 샘플 몇 장으로 맞추기, 합성 불량 만들기, VLM(비전-언어 모델)으로 불량 설명하기 쪽으로 넓어지고 있다.
  • 예지 보전 연구는 센서 잡음, 다른 기계로 옮겼을 때의 성능 저하, 남은 수명(RUL) 예측의 어려움을 핵심 과제로 꼽는다.
  • 벤치마크 점수는 실제 라인 성능이 아니다. 판정 기준값 조정과 사람의 최종 확인이 운영의 핵심이다.

왜 필요했나: 불량은 드물고, 사람의 눈은 지친다

제조 라인의 품질 검사는 오랫동안 사람의 눈에 의존했다. PaDiM논문 논문은 서론에서 이 문제를 짚는다. 생산 라인에서 불량은 아주 드물게 나오는 사건이라 사람이 일일이 찾아내기 번거롭다. 자동화하면 집중력이 떨어져도 검사 품질을 일정하게 유지할 수 있고 작업자의 부담도 줄일 수 있다.

그렇다고 일반적인 이미지 분류처럼 '정상'과 '불량' 사진을 잔뜩 모아 지도 학습(정답이 붙은 데이터로 배우는 방식)을 하기도 어렵다. 같은 논문은 두 가지 이유를 든다. 불량 예시가 늘 부족하고, 불량이 예상하지 못한 모양으로 나타날 수 있다는 점이다. 정상 데이터는 넘치고 불량 데이터는 극히 적은 상태, 곧 클래스 불균형이 극단적인 경우다.

PatchCore논문 논문은 이를 '콜드 스타트(cold-start)' 문제라고 부른다. 정상 제품 사진은 얻기 쉽지만, 앞으로 나올 수 있는 불량을 미리 다 정의하기는 비용이 크고 복잡하다. 불량도 얇은 긁힘처럼 미세한 것부터 부품 누락 같은 큰 구조 결함까지 다양하다. 그래서 '정상만 보고 배운 뒤, 정상과 다른 것을 찾는' 방식이 산업용 이상 탐지의 출발점이 됐다.

핵심 아이디어: 정상을 깊이 알면 이상이 보인다

비유하면 숙련 검사원과 같다. 이 검사원은 불량 사례집을 외우지 않는다. 정상 제품을 수천 개 본 덕분에 처음 보는 결함이라도 '어딘가 다르다'는 것을 알아챈다. 이런 설정을 One-class 학습이라고 한다. 학습 데이터에는 정상 클래스만 있고, 시험할 때 정상과 다른 샘플을 이상으로 분류한다.

여기서 이상 탐지는 두 가지 일로 나뉜다. 이미지 한 장 전체에 이상 점수를 매기는 '탐지'와, 픽셀이나 작은 조각(패치)마다 점수를 매겨 이상 지도(히트맵)를 만드는 '위치 찾기'다. PaDiM논문 논문은 위치 찾기가 더 정밀하고 해석하기 쉬운 결과를 준다고 설명한다. 현장 작업자에게는 '불량'이라는 판정만큼이나 '어디가' 문제인지가 중요하기 때문이다.

두 출발점 논문이 공통으로 기댄 것은 사전학습된 CNN(합성곱 신경망)이다. 이미 대규모 일반 이미지로 학습한 모델에서 특징을 꺼내 쓰기만 하고, 신경망을 새로 무겁게 학습시키지는 않는다. '정상이란 무엇인가'를 모델의 가중치가 아니라 정상 특징을 모아 둔 통계나 목록으로 표현하는 것이다.

어떻게 작동하나: PaDiM과 PatchCore

PaDiM논문의 순서는 이렇다. 1) 정상 이미지를 사전학습된 CNN에 넣는다. 2) 이미지의 각 패치 위치에 해당하는 활성화 값을 여러 층에서 꺼내 이어 붙여 패치 임베딩(숫자 벡터)을 만든다. 얕은 층은 세밀한 질감을, 깊은 층은 더 추상적인 의미를 담기 때문에 여러 층을 섞는다. 3) 같은 위치에 있는 정상 패치들의 평균과 공분산을 구해 위치마다 다변량 가우시안 분포로 표현한다. 4) 검사할 때는 새 패치가 그 위치의 정상 분포에서 얼마나 떨어져 있는지를 마할라노비스 거리(분포의 퍼진 모양까지 고려한 거리)로 재서 이상 점수로 쓴다. 논문은 시험 단계의 시간·공간 복잡도가 학습 데이터 크기와 무관하게 낮다는 점을 산업 적용의 장점으로 내세운다.

PatchCore논문는 다른 길을 택한다. 1) CNN의 중간층 패치 특징을 쓰고, 주변 이웃과 묶어 공간적인 맥락을 살린다. 중간층을 쓰는 이유는 일반 이미지 분류용으로 학습된 깊은 층의 특징이 공장 이미지와 잘 맞지 않는 치우침을 줄이기 위해서다. 2) 정상 패치 특징을 모두 메모리 뱅크(정상 특징 저장소)에 모은다. 3) 비슷한 특징이 중복되므로, 탐욕적 코어셋 서브샘플링(전체를 잘 대표하는 일부만 골라 남기기)으로 뱅크를 줄여 저장 공간과 추론 시간을 낮춘다. 4) 검사할 때는 각 패치와 뱅크 안 가장 가까운 정상 패치 사이의 거리를 이상 점수로 쓴다. 패치 하나만 이상해도 이미지 전체를 이상으로 볼 수 있다는 점을 활용한다.

PatchCore 논문은 널리 쓰이는 MVTec AD 벤치마크에서 이미지 단위 탐지 AUROC(판별 성능 지표, 1에 가까울수록 좋음)가 최대 99.6%라고 보고했다. 직전 최고 방법보다 오류를 절반 넘게 줄였다고도 밝혔다. 두 방법 모두 대상 데이터로 신경망을 다시 학습할 필요가 없다는 점이 현장에서 매력적이다.

정상만으로 하는 비전 이상 탐지정상 이미지 → 사전학습 CNN(미리); 사전학습 CNN → 패치 특징; 패치 특징 → 정상 기준(요약·저장); 검사 이미지 → 사전학습 CNN; 패치 특징 → 거리 계산(검사 특징); 정상 기준 → 거리 계산; 거리 계산 → 이상 지도·판정정상 이미지불량 없이 학습사전학습 CNN새로 학습하지 않음패치 특징여러 층·이웃 묶기정상 기준PaDiM: 가우시안PatchCore: 메모리 뱅크검사 이미지거리 계산마할라노비스 / 최근접이상 지도·판정히트맵 + 이미지 점수미리요약·저장검사 특징
정상만으로 하는 비전 이상 탐지 윗줄은 정상 이미지로 '정상 기준'을 만드는 준비 단계다. 검사 이미지는 같은 CNN과 특징 추출을 거친 뒤 정상 기준과의 거리로 판정된다.

발전 흐름: 재구성에서 특징 비교로

PaDiM논문 논문은 기존 방법을 두 갈래로 정리한다. 첫째는 재구성 방식이다. 오토인코더나 GAN을 정상 이미지로만 학습시켜, 잘 복원되지 않는 부분을 이상으로 본다. 직관적이고 해석하기 쉽지만, 오토인코더가 이상 이미지까지 잘 복원해 버리는 경우가 있어 성능에 한계가 있다고 논문은 지적한다.

둘째는 임베딩 유사도 방식이다. 사전학습 모델의 특징을 정상 기준과 비교한다. 그중 모든 정상 패치와 KNN(k-최근접 이웃)으로 비교하는 방식은 위치 찾기 성능이 좋았다. 하지만 시험할 때 학습 데이터 전체를 뒤져야 해서 데이터가 늘수록 계산이 선형으로 커지는 문제가 있었다. PaDiM은 위치별 가우시안 분포로 정상을 요약해서 이 확장성 문제를 피했다. 또 실제 검사 환경에 가깝게, 제품 위치가 정렬되지 않은 데이터에서도 평가하도록 실험 방식을 넓혔다.

PatchCore논문는 같은 특징 비교 계열이다. 일반 이미지로 학습한 깊은 층 특징이 공장 이미지와 잘 맞지 않는다는 점, 그리고 시험 때 쓸 수 있는 정상 정보가 적다는 점을 한계로 짚었다. 그 해법으로 중간층 패치 특징, 이웃 묶기, 코어셋으로 압축한 메모리 뱅크를 내놓았다. 정상 데이터의 일부만 써도 기존 방법과 비슷한 성능을 낸다고 보고해서, 샘플이 적은 상황에서의 가능성도 보였다.

요즘 어디로 가고 있나: 적은 샘플, 합성 불량, 설명하는 검사

첫 번째 흐름은 새 제품의 정상 사진이 몇 장뿐일 때다. Anchor and Adapt논문는 VLM 계열의 프롬프트 학습 방식이다. 먼저 다른 제품의 라벨 데이터로 '정상'과 '이상'의 기준점(앵커)을 학습해 고정한다. 그다음 대상 제품의 정상 샘플 몇 장으로 정상 쪽만 추가로 맞춘다. 제품마다 불량 설명 문장을 사람이 따로 써야 하는 부담을 줄이려는 시도다. MVTec-AD와 VisA를 오가는 1·2·4장 설정에서 경쟁력 있는 탐지·위치 찾기 성능을 보고했다.

두 번째는 합성 불량이다. FLASH논문는 정상 이미지만 주어졌을 때 VLM의 안내와 이미지 생성 모델로 소수의 불량 이미지를 만든다. 거기서 불량 조각을 떼어 저장해 두고, 새 정상 이미지에 반복해서 합성한다('한 번 생성하고 여러 번 합성'). 합성 데이터의 쓰임새는 판정 기준값 보정(calibration)이다. MVTec AD 2에서 실제 불량으로 보정했을 때의 상한(이미지 단위 F1 83.6%)에 가까운 78.1%를 보고했다.

세 번째는 불량을 설명하고 추론하는 검사다. Anomaly-LR논문은 산업 이상 탐지가 탐지·위치 찾기를 넘어 불량을 설명하고 추론하는 멀티모달 검사로 가고 있다고 진단한다. 그리고 이미지의 시각 표현 공간 안에서 불량 근거를 단계적으로 다듬는 방식을 제안했다. 이를 위해 산업 이미지 4,523장에서 이미지-질문 22,228개로 이뤄진 학습 데이터 IAD-LR-22K를 만들었다.

산업용 이상 탐지 연구 지도재구성 방식 → PaDiM(한계 보완); 전체 KNN 비교 → PaDiM(확장성); 전체 KNN 비교 → PatchCore(압축·확장)출발점요즘 방향재구성 방식오토인코더·GAN이상도 복원하는 한계전체 KNN 비교데이터 늘면 계산 증가PaDiM 논문 보기PaDiM2020위치별 가우시안↗PatchCore 논문 보기PatchCore2021코어셋 메모리 뱅크↗Anchor and Adapt 논문 보기Anchor and Adapt2026정상 몇 장으로 적응↗FLASH 논문 보기FLASH2026합성 불량으로 보정↗Anomaly-LR 논문 보기Anomaly-LR2026불량 설명·추론↗한계 보완확장성압축·확장
산업용 이상 탐지 연구 지도 왼쪽은 출발점 논문들이 극복하려 한 이전 방식, 가운데는 출발점, 오른쪽은 2026년 연구 방향이다. 오른쪽은 같은 시기 연구라 묶음으로만 표시했다.

센서 시계열로 하는 예지 보전과 디지털 트윈

예지 보전(PdM)은 센서·기계·생산 시스템 데이터로 장비가 언제 고장 날지 추정해서, 고장 전에 정비를 계획하는 일이다. 하이브리드 구조 벤치마크 연구논문는 6가지 딥러닝 구조를 700회 넘게 실험했다. 트랜스포머는 안정적이고 느리게 변하는 과정은 잘 따라갔지만, 혼란스러운 데이터에서는 센서 잡음을 의미 있는 신호로 오해하는 경향을 보였다. 반면 LSTM(RNN의 한 종류) 층과 트랜스포머 층을 결합한 하이브리드가 공장 잡음에 더 강했다고 보고했다. LSTM이 잡음 필터 역할을 한다는 해석이다.

예측 기간도 중요하다. TQRNN30d논문는 9개 제조 시설의 기계 72대를 대상으로 했다. 학습·검증·시험을 43/14/15대로 기계 단위로 나눠, 학습에 쓰지 않은 기계에서 평가했다. 30일 앞을 내다보는 예측에서 F1 79.97%를 보고했다.

다른 기계·조건으로 옮기는 문제도 크다. FreqCondNorm논문은 샘플링 주파수가 1Hz에서 약 100kHz까지 다른 신호를 하나의 트랜스포머 파운데이션 모델로 묶으려 했다. 고장 진단에서는 CWRU 데이터에서 99.2%, 학습하지 않은 MFPT 데이터에서 82.1% 정확도를 보고했다. 하지만 남은 수명(RUL) 예측은 개선하지 못했다고 스스로 밝혔다.

디지털 트윈은 실제 설비의 구조와 상태를 데이터로 비춰 두는 가상 복제본이다. 디지털 트윈 연구논문는 C-MAPSS 데이터의 RUL 예측에서 시계열 파운데이션 모델 5종을 비교했다. 여러 센서를 함께 보는 다변량 구조가 단일 변수 구조보다 크게 앞섰고, 운전 조건이 바뀔 때 차이가 특히 컸다. 이어서 디지털 트윈에 저장된 설비 구조(어떤 부품이 어디에 연결되는지)로 어텐션이 볼 범위를 제한하는 융합 방식을 제안했다. 사전학습 가중치, 대상 작업 적응, 디지털 트윈 정보가 서로 보완적이라고 보고했다.

예지 보전 연구의 숫자들

700회 이상6가지 구조 비교 실험
72대·9개 시설기계 단위로 나눈 평가
79.97%30일 앞 예측 F1(TQRNN30d)
1Hz~100kHz하나로 묶은 샘플링 주파수 범위
본문에 나온 연구별 실험 규모와 결과다. 서로 다른 데이터·조건이라 직접 비교하지 않는다.

현장 적용의 데이터·운영 문제와 한계

가장 자주 나오는 경고는 '실험실에서는 되는데 공장에서는 안 된다'는 것이다. 하이브리드 구조 벤치마크 연구논문는 실험실에서 완벽해 보이던 예지 보전 모델이 실제 공장 데이터에서 예기치 않게 실패할 수 있다는 '신뢰성 격차'를 연구 동기로 든다. 비전 검사도 마찬가지다. PaDiM논문이 정렬되지 않은 데이터로 평가를 넓힌 것도 실제 검사 조건은 벤치마크보다 거칠기 때문이다. MVTec AD의 99.6% 같은 점수를 실제 라인의 불량 검출률로 읽으면 안 된다.

두 번째는 데이터 변화다. 조명, 카메라 위치, 원자재 로트, 설비 노후화가 바뀌면 '정상'의 모습 자체가 바뀐다. 정상만 배운 모델은 새 정상을 이상으로 오판하기 쉽다. 이런 데이터 드리프트를 감시하고 정상 기준을 다시 만드는 운영 절차가 필요하다. FreqCondNorm논문이 보여 주듯 기계나 조건이 다른 곳으로 옮기는 일은 아직 쉽지 않다.

세 번째는 판정 기준값이다. 이상 점수는 연속값이라 어디서 자를지 정해야 한다. 그런데 실제 불량 샘플이 거의 없으니 기준값을 맞추기도 어렵다. FLASH논문가 합성 불량을 기준값 보정에 쓰는 이유가 여기에 있다. 다만 합성 결과도 실제 불량 기준의 상한에는 못 미쳤다.

마지막으로 책임 문제다. 놓친 불량은 고객의 안전 문제로 이어질 수 있고, 과도한 오경보는 라인을 멈추게 한다. 모델은 의심 구간을 좁혀 주는 도구로 두고, 최종 출하·정비 판단과 판정 기준 변경은 사람이 맡는 휴먼 인 더 루프 구조가 현실적이다. 이 글의 근거 자료에는 제조 AI에 관한 특정 국가·기관의 규제 내용이 없다. 따라서 규제 요건은 각 산업·국가의 공식 지침을 따로 확인해야 한다.

제조 AI 도입 전 점검

데이터

  • 정렬·조명이 다른 실제 라인 이미지로 평가했는가
  • 학습에 안 쓴 기계·라인에서 따로 시험했는가
  • 센서 잡음이 많은 구간을 따로 확인했는가

운영

  • 판정 기준값을 어떤 데이터로 정했는가
  • 정상의 변화(드리프트)를 감시하는가
  • 정상 기준을 다시 만드는 절차가 있는가

책임

  • 최종 출하·정비 판단을 사람이 하는가
  • 놓친 불량과 오경보의 비용을 따져 봤는가
본문에서 다룬 데이터·운영·책임 문제를 점검 항목으로 정리했다.

더 공부하려면

비전 검사는 PaDiM논문부터 읽는 것이 좋다. 서론과 관련 연구 절이 재구성 방식과 특징 비교 방식의 차이를 짧게 정리해 준다. 이어서 PatchCore논문를 읽으면 메모리 뱅크와 코어셋이 왜 필요한지 자연스럽게 이해된다. 두 논문 모두 MVTec AD를 쓰므로 벤치마크 그림을 함께 보면 이해가 쉽다.

그다음 관심사에 따라 고른다. 새 제품의 샘플이 적다면 Anchor and Adapt논문를, 불량 데이터가 없어 기준값을 정하기 어렵다면 FLASH논문를 본다. 불량을 말로 설명하는 검사가 궁금하면 Anomaly-LR논문을 읽는다.

예지 보전은 하이브리드 구조 벤치마크 연구논문로 잡음 문제를 먼저 이해하는 것이 좋다. 그다음 TQRNN30d논문로 기계 단위 분리 평가와 장기 예측을 보고, FreqCondNorm논문으로 다른 기계로 옮기는 문제를 살핀다. 디지털 트윈과 시계열 파운데이션 모델의 결합은 디지털 트윈 연구논문가 출발점이다.

관련 용어

이상 탐지 CNN 임베딩 KNN 클래스 불균형 시계열 예측 데이터 드리프트 휴먼 인 더 루프

참고 문헌

핵심 논문

최근 연구

AI가 참고 문헌을 바탕으로 작성하고 검수를 거친 해설입니다. 정확한 내용은 원문을 확인해 주세요.