스터디 · 2026-10-10 · 기초
금융 AI: 사기 탐지·신용평가에서 금융 LLM까지
금융 AI의 중심에는 여전히 표 데이터를 다루는 그래디언트 부스팅 모델이 있고, 그 옆에서 공시·규제 문서 같은 글을 다루는 금융 특화 LLM이 자라고 있다. 신용평가는 EU에서 고위험 AI로 분류되므로 설명 가능성·공정성·모델 리스크 관리와 사람의 최종 책임이 함께 다뤄져야 한다.
목차
- 사기 탐지·신용평가처럼 행과 열로 된 정형 데이터 문제에서는 XGBoost 같은 그래디언트 부스팅이 오래 쓰여 온 기본 도구다.
- 금융 특화 LLM은 BloombergGPT처럼 독점 데이터로 크게 학습하는 길과, FinGPT처럼 공개 데이터와 LoRA로 가볍게 맞추는 오픈소스 길로 나뉘어 발전했다.
- EU AI법은 개인의 신용도 평가·신용점수 산정을 고위험 AI로 분류하되, 금융 사기 탐지 목적의 AI는 이 항목에서 제외한다.
- 영국 조사에서 AI 사용 사례 중 완전 자율 결정은 2%뿐이었고, 금융안정위원회(FSB)는 제3자 의존·시장 상관관계·사이버·모델 리스크를 시스템 위험 요인으로 꼽았다.
- 최근 연구는 LLM이 근거 없는 인용을 만들거나, 재무 정보가 부족할 때 투자자의 신원으로 조언을 바꾸는 문제를 보여 준다.
왜 필요했나: 금융은 원래 데이터로 판단하는 일
은행과 카드사는 매일 수많은 판단을 한다. 이 결제를 승인할지, 이 사람에게 돈을 빌려줄지, 이 송금이 자금세탁은 아닌지. 예전에는 사람이 만든 규칙(금액이 얼마 이상이면 확인, 연체 이력이 있으면 거절)으로 걸렀지만, 규칙은 새로운 수법을 따라잡기 어렵고 많아질수록 서로 충돌한다. 그래서 과거 데이터에서 패턴을 배우는 머신러닝이 일찍부터 금융에 들어왔다.
XGBoost 논문논문도 서론에서 머신러닝이 중요한 이유를 설명하며 '사기 탐지 시스템이 악의적인 공격자로부터 은행을 지킨다'는 예를 든다. 영국 중앙은행(BoE)과 금융감독청(FCA)의 2024년 조사글에서도 금융회사들이 현재 가장 크게 느끼는 AI의 이익으로 데이터·분석 인사이트, 자금세탁방지(AML)·사기 대응, 사이버보안을 꼽았다.
최근에는 숫자 표만이 아니라 글을 다루는 일도 AI의 몫이 되었다. BloombergGPT논문는 금융 분야의 자연어 처리 과제로 감성 분석, 개체명 인식(문장 속 회사·인물 이름 찾기), 뉴스 분류, 질의응답을 들며, 금융 용어와 문맥이 복잡해 금융에 맞춘 시스템이 필요하다고 설명한다. 그래서 금융 AI는 '표 데이터 모델'과 '금융 LLM'이라는 두 축으로 보면 이해하기 쉽다.
핵심 아이디어: 표 데이터에는 나무 여러 그루
사기 탐지와 신용평가의 데이터는 대개 정형 데이터다. 한 행이 거래 하나 또는 고객 한 명이고, 열에는 금액·시간·가맹점·소득·연체 횟수 같은 값이 들어간다. 이런 데이터에서 오래 쓰여 온 방법이 결정 트리를 여러 그루 쌓는 그래디언트 부스팅이다.
비유하면 '오답 노트'다. 첫 번째 나무가 대충 예측하면, 두 번째 나무는 첫 번째가 틀린 만큼을 바로잡는 쪽으로 배우고, 세 번째는 남은 오차를 또 줄인다. XGBoost 논문논문의 설명대로, 예시 하나는 각 나무의 규칙을 따라 내려가 잎(leaf)에 도착하고, 그 잎들에 적힌 점수를 모두 더한 값이 최종 예측이 된다. 나무가 지나치게 복잡해지지 않게 잎 개수와 잎 점수 크기에 벌점을 주는 정규화도 목표 함수에 넣었다.
이 방법이 얼마나 널리 쓰였는지 논문은 대회 결과로 보여 준다. 2015년 Kaggle 블로그에 실린 우승 솔루션 29개 중 17개가 XGBoost를 썼고, 두 번째로 많이 쓰인 심층 신경망은 11개였다. KDDCup 2015에서는 상위 10개 팀이 모두 XGBoost를 썼다고 밝혔다. 다만 논문도 이런 문제에서 도메인 분석과 피처 엔지니어링이 중요한 역할을 했다고 덧붙인다.
어떻게 작동하나: 사기 탐지·신용평가의 흐름
실무 흐름은 대략 이렇다. 첫째, 거래 기록이나 대출 신청서 같은 원본 데이터를 모은다. 둘째, 피처 엔지니어링으로 '최근 1시간 결제 횟수', '평소 결제 지역과의 거리'처럼 판단에 쓸 열을 만든다. 셋째, 과거에 사기로 확정된 거래나 실제로 연체한 대출을 정답(라벨)으로 붙여 지도 학습을 한다. 넷째, 학습된 모델이 새 거래·신청마다 위험 점수를 낸다. 다섯째, 점수가 기준선을 넘으면 차단·보류하거나 사람 심사로 넘긴다.
금융 데이터에는 독특한 어려움이 있다. 사기는 전체 거래 중 아주 드물어 클래스 불균형이 심하고, 빈칸이 많다. XGBoost논문는 빈 값이 많은 희소 데이터를 다루는 알고리즘(sparsity-aware)과, 메모리에 다 올라가지 않는 데이터를 디스크에서 나눠 읽는 구조를 제안했다. 논문은 단일 머신에서 기존 인기 솔루션보다 10배 이상 빠르고, 분산 환경에서 수십억 개 예시까지 확장된다고 밝혔다.
중요한 점은 모델이 '결정'이 아니라 '점수'를 낸다는 것이다. 어느 점수에서 막을지, 누가 최종 판단을 할지, 거절당한 고객에게 무엇을 설명할지는 사람과 조직이 정해야 하는 운영 설계다.
발전 흐름: 금융 특화 LLM의 두 갈래
표 데이터 모델이 숫자를 다룬다면, 금융 LLM은 공시·뉴스·보고서 같은 글을 다룬다. 첫 대표 사례가 BloombergGPT논문다. 블룸버그는 500억 파라미터 모델을 만들면서, 40년 가까이 모으고 정리한 금융 문서로 3,630억 토큰의 금융 데이터셋을 만들고 여기에 3,450억 토큰의 일반 데이터를 섞었다. 금융 데이터만 쓰지도, 일반 모델을 그대로 쓰지도 않은 '혼합 학습'이 핵심이다. 저자들은 이 방식으로 금융 과제에서 기존 모델을 크게 앞서면서 일반 벤치마크 성능도 유지했다고 보고했다. 데이터 출처와 사용 권한을 꼼꼼히 추적했다는 점도 금융권에서는 눈여겨볼 대목이다.
FinGPT논문는 그 반대편에서 출발했다. 이 연구는 BloombergGPT 같은 독점 모델이 남다른 데이터 축적에 기대고 있다고 보고, 누구나 쓸 수 있는 오픈소스 대안이 필요하다고 주장한다. 그래서 거대한 모델을 처음부터 학습하는 대신 데이터 중심 접근을 택해, 인터넷의 금융 데이터를 자동으로 모으고 정리하는 파이프라인과 가벼운 LoRA(저랭크 적응) 파인튜닝을 강조했다. 활용 예로는 로보어드바이저, 알고리즘 트레이딩, 로우코드 개발을 들었다.
두 흐름은 서로를 대체한다기보다 다루는 데이터가 다르다. 대출 승인 같은 판단의 중심에는 여전히 표 데이터 모델이 있고, LLM은 문서를 읽고 요약하고 질문에 답하는 쪽에서 쓰임새를 넓혀 가고 있다.
요즘 어디로 가고 있나
첫째, 신용평가 모델에 외부 지식을 넣는 연구다. 새 대출 상품을 내놓으면 연체 데이터가 거의 없는 '콜드 스타트' 문제가 생긴다. Ranking Prior Alignment논문는 전문가나 Teacher 모델, LLM이 매긴 순위 정보를 점수 모델에 Distill하는 방법이다. 신경망뿐 아니라 XGBoost의 사용자 정의 목적 함수에도 같은 식으로 붙일 수 있고, 실제 예측할 때는 외부 모델이 필요 없다. 150만 개가 넘는 가맹점의 산업 데이터로 실험했고, 공개 Amex 데이터에서 5개 폴드 모두 AUC가 올랐다(평균 +0.041)고 보고했다.
둘째, 금융 LLM의 '근거'를 검증하는 연구다. FinRegQA-EU논문는 유럽은행감독청(EBA)·유럽증권시장감독청(ESMA)의 공식 Q&A로 규제 질의응답 데이터를 만들었다. SFT(지도 미세조정)로 학습한 모델은 LLM 평가자 점수가 가장 높았지만 인용 정확도(Citation F1)는 가장 낮았다. 인용을 세 배 많이 달았는데 대부분 근거가 없었던 것이다. DPO·GRPO가 더 간결하고 인용 정확도가 높은 절충점을 보였고, 연구진은 LLM-as-a-Judge가 인용이 많으면 근거가 있다고 보고 점수를 주어 지어낸 인용을 잡지 못한다고 지적했다.
셋째, 공정성 문제다. 재무 정보 부족 연구논문는 Llama-3.1-8B-Instruct에 9만 6,600개 프롬프트를 넣어, 재무 조건은 같고 투자자의 신원만 바꿨을 때 권하는 주식 비중이 얼마나 달라지는지 쟀다. 두 신원 사이의 평균 차이는 재무 정보를 모두 줬을 때 4.78%p에서 하나도 주지 않았을 때 10.34%p로 커졌다. 정보가 없을 때 모델은 듣지도 않은 소득·부채·저축을 근거로 들었고, 정보를 다 줘도 성별에 따른 작은 차이는 남았다.
규제와 책임: 신용평가는 고위험 AI
EU AI법 부속서 III글은 고위험 AI 분야 중 '필수 민간·공공 서비스 접근'에서 개인의 신용도를 평가하거나 신용점수를 매기는 AI를 고위험으로 명시한다. 단, 금융 사기 탐지 목적의 AI는 이 항목에서 제외된다. 생명·건강보험에서 개인의 위험을 평가하고 보험료를 정하는 AI도 같은 항목에 들어 있다. 같은 그래디언트 부스팅 모델이라도 사기 탐지에 쓰느냐 신용평가에 쓰느냐에 따라 규제상 지위가 달라지는 셈이다.
영국 BoE·FCA 조사글(118개사 응답)를 보면 응답 기업의 75%가 이미 AI를 쓰고 있었다(2022년 58%). 사용 사례의 55%에 어느 정도 자동 의사결정이 들어 있지만, 완전 자율 결정은 2%뿐이었다. 한편 46%의 기업이 자신이 쓰는 AI 기술을 '부분적으로만 이해한다'고 답했는데, 주로 외부 업체 모델 때문이었다. 84%는 AI 체계를 책임지는 담당자를 두고 있었다. 현재 위험으로 꼽힌 상위 5개 중 4개가 개인정보 보호, 데이터 품질, 데이터 보안, 데이터 편향·대표성처럼 데이터와 관련된 것이었다.
금융안정위원회(FSB) 보고서글는 개별 회사를 넘어 금융 시스템 전체를 본다. 시스템 위험을 키울 수 있는 AI 관련 취약점으로 제3자 의존과 서비스 업체 집중, 시장 상관관계(같은 모델이 같은 방향으로 움직이는 문제), 사이버 위험, 모델 리스크·데이터 품질·거버넌스를 꼽았다. 생성형 AI가 금융 사기와 시장 허위 정보의 가능성을 키운다는 점도 짚고, 각국 당국에 AI 동향 모니터링 강화와 규제 체계 점검을 요청했다.
이 모든 내용이 가리키는 결론은 같다. 대출 거절이나 계좌 정지는 사람의 삶에 직접 영향을 준다. 모델은 판단을 돕는 도구이고, 결정과 그 결과에 대한 책임은 금융회사와 그 안의 사람이 진다.
영국 금융권 AI 사용 현황(2024)
한계와 쟁점: 설명·공정성·모델 리스크
설명 가능성: 결정 트리 하나는 규칙을 그대로 읽을 수 있지만, 수백 그루의 점수를 더한 앙상블은 '왜 이 사람이 거절됐는지'를 한눈에 보여 주지 않는다. LLM은 더 어렵다. FinRegQA-EU논문가 보여 주듯 그럴듯한 인용이 실제 근거라는 보장이 없고, 재무 정보 부족 연구논문에서는 모델이 듣지도 않은 사실을 이유로 댔다. 모델이 내놓는 설명 자체도 검증 대상이다.
공정성: 과거 데이터에 쌓인 편향은 모델이 그대로 배운다. BoE·FCA 조사글에서도 데이터 편향과 대표성이 상위 위험으로 꼽혔다. 신원만 바꿨는데 조언이 달라지는 현상논문은 금융 상담에 LLM을 쓸 때 정보를 충분히 받은 뒤에 답하게 설계해야 하는 이유다.
모델 리스크 관리: 사기 수법과 경제 상황이 바뀌면 데이터 드리프트로 모델 성능이 떨어진다. 외부 업체 모델에 기대면 이해도는 낮아지고글, 많은 회사가 같은 업체에 몰리면 시스템 위험이 커진다글. 이 글에 나온 성능 수치는 모두 연구 환경의 결과이며, 실제 운영 성능을 그대로 보장하지 않는다는 점도 기억해야 한다.
금융 AI 도입 전 점검 목록
규제·책임
- 신용평가·보험료 산정처럼 고위험 용도인가
- 최종 결정과 책임을 맡는 사람이 정해져 있는가
- AI 체계 담당자가 지정되어 있는가
설명·공정성
- 거절 사유를 고객에게 설명할 수 있는가
- 신원만 바꿨을 때 결과가 달라지는지 시험했는가
- LLM이 단 인용이 실제 근거와 맞는가
모델 리스크
- 데이터 드리프트를 감시하는가
- 외부 업체 모델을 충분히 이해하는가
- 특정 업체에 지나치게 기대고 있지 않은가
더 공부하려면
표 데이터 모델부터 보려면 XGBoost논문의 2장 'Tree Boosting in a NutShell'이 좋다. 나무 여러 그루의 점수를 더하는 구조와 정규화 목표 함수가 짧게 정리되어 있다. 이어서 Ranking Prior Alignment논문를 읽으면 같은 XGBoost에 외부 지식을 넣어 콜드 스타트 신용평가를 다루는 최근 방식을 볼 수 있다.
금융 LLM은 BloombergGPT논문의 서론과 데이터 구성 부분, 그리고 오픈소스 쪽 시각인 FinGPT논문를 함께 읽으면 두 갈래의 차이가 분명해진다. 평가와 위험 쪽은 FinRegQA-EU논문와 재무 정보 부족 연구논문가 좋다.
규제와 산업 현황은 EU AI법 부속서 III글의 5번 항목, BoE·FCA 2024 조사글의 요약, FSB 보고서글 요약 순서로 읽으면 개별 모델 → 회사 → 금융 시스템으로 시야가 넓어진다.
관련 용어
참고 문헌
참고 자료(공식 문서·엔지니어링 글)
- Annex III: High-Risk AI Systems Referred to in Article 6(2) | EU Artificial Intelligence Act (artificialintelligenceact.eu)
- Artificial intelligence in UK financial services - 2024 | Bank of England – the UK's central bank (bankofengland.co.uk)
- The Financial Stability Implications of Artificial Intelligence - Financial Stability Board (fsb.org)
핵심 논문
- XGBoost: A Scalable Tree Boosting System (2016)
- BloombergGPT: A Large Language Model for Finance (2023)
- FinGPT: Open-Source Financial Large Language Models (2023)
최근 연구
AI가 참고 문헌을 바탕으로 작성하고 검수를 거친 해설입니다. 정확한 내용은 원문을 확인해 주세요.