← 스터디

스터디 · 2026-10-07 · 심화

의사결정 모델: 글을 쓰지 않고 선택지에 답하는 AI

의사결정 모델(Decision model)은 미리 정한 선택지마다 확률을 매겨 한 번에 답하는 모델로, 생성형 LLM보다 훨씬 싸고 빠르다. 다만 2026년에 나온 평가 연구들은 정확도, 확신도 신뢰성, 긴 작업에서의 오류 누적에 분명한 한계가 있다는 점을 함께 보여 준다.

핵심 정리

왜 필요했나: '답은 하나만 고르면 되는데'

많은 소프트웨어는 AI에게 긴 글을 바라지 않는다. 이 문의를 어느 부서로 보낼지, 이 댓글이 혐오 표현인지, 이 문장이 어떤 감정 범주에 속하는지처럼 정해진 선택지 가운데 하나를 고르는 판단이 필요할 뿐이다. 그런데 이런 일에 생성형 LLM(대규모 언어 모델)을 쓰면, 모델은 토큰(Token, 글자 조각)을 하나씩 만들어 답을 쓰고 프로그램은 그 글을 다시 해석해야 한다. 느리고 비싸며, 엉뚱한 형식으로 답할 위험도 따른다.

확신의 정도도 문제다. 분류 결과를 기준값(threshold)으로 걸러 쓰려면 '얼마나 확실한가'를 숫자로 알아야 한다. 생성형 모델에게 확신도를 물으면 말로 답하는데(언어화된 확신도), 이 값이 실제 정답률과 잘 맞는다는 보장이 없다.

의사결정 모델(Decision model)은 이 빈틈을 겨냥한 모델 유형이다. 사회과학 텍스트 주석 연구(2609.24574)는 이를 '범주형 질의응답을 위해 만든 새로운 모델 유형'으로 소개하며, 자유 텍스트 대신 선택지, 라벨 집합 전체의 확률 분포, 확신도 점수를 돌려주고 비용은 최전선(frontier) 모델의 아주 작은 일부라고 설명한다. 참고로 '의사결정 모델'이라는 말은 법률 정보학이나 위험 분석에서도 전혀 다른 뜻으로 쓰인다. 이 노트는 AI 모델 유형인 의사결정 모델만 다룬다.

핵심 아이디어: 서술형 시험 대신 객관식 답안지

생성형 LLM이 서술형 답안을 쓰는 수험생이라면, 의사결정 모델은 객관식 답안지에 칸마다 '이 답일 확률'을 적어 내는 수험생이다. 질문과 보기는 출제자(개발자)가 정하고, 모델은 보기마다 점수만 매긴다. 답안을 채점하는 프로그램은 글을 읽을 필요 없이 가장 높은 확률을 고르거나, 확률이 기준에 못 미치면 사람에게 넘기면 된다.

관련 연구들은 이것을 '타입이 정해진(typed)' 결정이라고 부른다. 질문마다 답의 형태가 미리 선언된다. 예/아니오, 여러 보기 중 하나, 순서가 있는 등급 같은 식이다. Jev(제브, TypeSafe AI의 System One 의사결정 모델)가 라우팅, 콘텐츠 검수, 분류(트리아지)용으로 이 인터페이스를 처음 내놓았고, 이후 공개 구현들이 뒤따랐다(2610.02586).

'System One'이라는 이름은 빠르고 직관적인 사고를 뜻하는 '시스템 1'에서 왔다. 한 번 훑어보고 바로 답하는 방식이라는 뜻이다. SanSi 연구(2610.07730)도 한 번의 순전파를 '빠르고 직관적인 System 1 사고'로 묘사한다.

어떻게 작동하나: 한 번 읽고 보기마다 점수 매기기

첫째, 개발자가 질문과 선택지를 선언한다. 선택지에는 보통 짧은 라벨과 그 라벨을 언제 골라야 하는지 적은 정의가 붙는다(2610.02586). 예를 들어 라벨이 '긴급', 정의가 '24시간 안에 조치가 필요한 장애 신고'인 식이다.

둘째, 모델이 입력 글과 질문, 선택지를 한꺼번에 읽는다. 생성형 모델은 답을 한 토큰씩 이어 쓰는 '디코딩' 단계를 거치지만, 의사결정 모델은 입력을 처리하는 '프리필(prefill)' 단계만 거친다. 프리필 전용 모델 연구(2610.07716)는 이렇게 메뉴의 모든 후보를 한 번의 순전파로 점수 매기고 디코딩을 하지 않기 때문에, 한 번 호출 비용이 같은 규모 생성형 모델보다 10~100배 싸다고 설명한다.

셋째, 모델 끝에 달린 '결정 헤드'가 선택지마다 확률을 낸다(2610.07730). 프로그램은 이 확률 분포를 그대로 받아 가장 높은 답을 고르거나, 확신도가 낮을 때 더 강한 모델이나 사람에게 넘기는 단계적 처리(cascade)를 짤 수 있다.

한 번 읽고 보기마다 점수 매기기질문 + 선택지 선언 → 의사결정 모델; 판단할 입력 글 → 의사결정 모델; 의사결정 모델 → 결정 헤드; 결정 헤드 → 확신 높음; 결정 헤드 → 확신 낮음(단계적 처리)질문 + 선택지 선언라벨 + 정의 (개발자)판단할 입력 글의사결정 모델프리필만 · 순전파 한 번디코딩 없음호출 비용 10~100배 낮음결정 헤드선택지별 확률 분포확신 높음가장 높은 답으로 바로처리확신 낮음더 강한 모델·사람에게단계적 처리
한 번 읽고 보기마다 점수 매기기 개발자가 선언한 선택지와 입력 글을 한꺼번에 읽고(프리필), 결정 헤드가 선택지마다 확률을 낸다. 프로그램은 확신도에 따라 바로 처리하거나 더 강한 모델·사람에게 넘긴다.

발전 흐름: 2026년 가을의 평가 연구들

Jev가 등장하자 짧은 기간에 '정말 쓸 만한가'를 따지는 평가 연구가 잇따랐다. 계산사회과학 연구(2609.24574)는 18개 분류 과제(7,977개 항목)에서 첫 상용 의사결정 모델과 오픈웨이트(Open weights, 가중치가 공개된) 모델 둘을 LLM 19개와 비교했다. 의사결정 모델은 15개 평가 과제 중 14개에서 과제별 최고 LLM에 뒤졌고, 격차의 중앙값은 macro-F1(범주별 정확도를 고르게 평균한 점수) 11.6점이었다. 대신 측정 비용은 중앙값 기준 44배 낮았다. 확신도는 LLM 19개 중 16개의 언어화된 확신도보다 잘 보정(calibration)되어 있었다. 보정이 잘됐다는 것은 '90% 확신'이라고 한 답이 실제로 90% 가까이 맞는다는 뜻이다. 그러나 동료 상담 대화의 공감 판정 과제에서는 높은 확신을 보이면서도 성능이 나빴다.

혐오 표현 검수 연구 HATEDECIDE(2610.03324)는 결과가 좀 더 우호적이었다. 데이터셋 4개 중 상용 LLM이 모든 의사결정 모델을 통계적으로 유의하게 앞선 경우는 하나뿐이었고, 진단용 테스트에서는 가장 좋은 호스팅형 의사결정 모델이 최고 상용 LLM과 1.6 macro-F1점 차이까지 따라붙으면서 추론 비용은 약 97% 낮았다. 다만 혐오 표현의 정의를 함께 주면 예측의 최대 28%가 바뀌었는데도 성능이 꾸준히 좋아지지는 않았고, 질문을 여러 개로 쪼갠 경우 유의한 향상은 비교의 20%에서만 나왔다.

가장 넓은 평가는 JEVal(2610.03935)이다. 10개 응용 분야, 36개 데이터셋에서 모은 11,257개 사례로 25개 모델 구성을 평가했다. 의사결정 모델은 주어진 근거만으로 판단할 수 있는 과제에서 가장 경쟁력이 있었고, 전문 지식이나 정직한 불확실성 추정이 필요한 과제에서는 약했다. 가장 그럴듯한 답은 맞히면서도 그 확률을 크게 부풀리는 경향이 있었다. 같은 연구는 오픈웨이트 모델을 바탕으로 한 InnerJev-4B와 InnerJev-27B도 제안했다.

같은 시기에 구조를 바꾼 시도도 나왔다. SanSi(2610.07730)는 같은 층을 여러 번 반복해 적용하는 '루핑'으로, 토큰을 생성하지 않고도 답을 정하기 전에 내부 상태를 고칠 수 있게 했다. 연구진은 이를 'System 1.5 사고'라고 부른다. 59개 출처의 10,027개 결정에서 정확도 72.0%를 기록해 같은 구조의 비반복 모델보다 13.5점 높았고, 파라미터(Parameter, 모델 크기를 나타내는 매개변수)가 3배인 모델과는 1.8점 차이였다.

요즘 어디로 가고 있나

첫째, '선택지를 어떻게 적느냐'가 연구 주제가 됐다. 2610.02586은 공개 의사결정 모델들이 선택지 정의보다 라벨 이름을 따라 답한다는 점(option-label bias)을 보였다. 정의를 모두 지워도 정확도가 거의 그대로였고(0.8559 대 0.8487), 선택지 이름을 A와 B로 바꾸자 오히려 정확도가 0.1511 올랐다. 두 코드베이스의 차이는 선택지를 '{라벨}: {정의}'로 쓰느냐, 정의만 쓰느냐 하나였고, 이 표현만 바꾸면 가중치를 건드리지 않고도 이 편향을 없앨 수 있었다. 프롬프트(Prompt) 형식의 작은 차이가 판단 규칙 자체를 바꾼다는 뜻이다.

둘째, 계산 자원을 어디에 쓸지를 배포 전에 정하려는 연구다. 2610.07716은 입력 글은 그대로 두고 후보 목록(메뉴)만 바꾸는 경우, 첫 계산에서 나온 확률을 새 메뉴에 맞게 다시 정규화하기만 해도 바뀐 정확도를 4.2점 이내로 예측할 수 있음을 보였다. 이 성질은 확률값 자체가 아니라 순위에 있었고, 같은 규모의 생성형 모델에는 없었다. 같은 비용이라면 같은 모델에 다시 묻는 것보다 확신도 기반 단계적 처리가 낫고, 모델을 키우기보다 메뉴를 다듬는 편이 나았다.

셋째, '굳이 별도 모델이 필요한가'라는 질문이다. LLM-as-Jev(2610.02076)는 일반 LLM의 다음 토큰 확률을 괄호 안의 숫자 번호에 대해 읽어 내기만 해도 보정된 결정을 뽑을 수 있다고 보였다. 학습하지 않은 4B 모델이 같은 백본으로 만든 커뮤니티 Jev형 모델과 비슷한 성능을 냈고, 이미지가 들어간 멀티모달(Multimodal) 결정도 처리했다. 파인튜닝(Fine-tuning)은 약한 모델이나 선택지가 아주 많은 의도 분류처럼 특정 상황에서만 효과가 컸다.

연구 흐름 지도Jev → 사회과학 주석; Jev → HATEDECIDE; Jev → JEVal평가 연구구조 개선요즘 방향JevTypeSafe AI첫 인터페이스사회과학 주석2609.24574비용 44배 낮음HATEDECIDE2610.03324혐오 표현 검수JEVal2610.0393536개 데이터셋SanSi2610.07730루핑(System 1.5)라벨 vs 정의2610.02586표현이 판단을 바꿈메뉴 설계2610.07716후보 목록·자원 배분LLM-as-Jev2610.02076범용 LLM으로 대신
연구 흐름 지도 Jev가 나온 뒤 평가 연구들이 실용성을 따졌고(화살표 = Jev를 평가), 같은 시기 구조를 바꾼 SanSi가 나왔다. 오른쪽은 지금 연구가 퍼지는 세 방향이다.

한계와 쟁점

가장 큰 쟁점은 확신도를 얼마나 믿을 수 있느냐다. 의사결정 모델은 확신도를 숫자로 낸다는 점이 장점이지만, JEVal(2610.03935)은 확률을 부풀리는 경향을, 사회과학 연구(2609.24574)는 높은 확신 아래 낮은 성능이 숨어 있는 과제를 보고했다. 확신도를 기준값으로 걸러 쓰는 시스템이라면 과제마다 따로 검증해야 한다.

둘째, 작은 판단이 쌓이는 시스템에서의 오류 누적이다. JEVal은 여러 단계를 오가는 τ-bench 환경에서 빠른 판단이 에피소드 시간의 중앙값은 줄였지만, 판단 오류가 긴 경로를 따라 쌓이면서 과제 성공률은 떨어졌다고 밝혔다. 대규모 사회 시뮬레이션에서도 개인 응답 예측은 강한 LLM에 가까웠지만, 사용자 프로파일링에서는 약했고 집계 추정 오차와 체계적 편향이 더 컸다. AI 에이전트(AI Agent)의 부품으로 쓸 때 특히 주의할 대목이다.

셋째, 인터페이스가 직관과 다르게 움직인다. 정의를 써 주면 모델이 그 규칙을 따를 것 같지만, 실제로는 라벨을 따르거나(2610.02586), 정의를 줘도 예측만 흔들리고 성능은 나아지지 않는 경우가 있었다(2610.03324). 개발자 입장에서는 '정의를 잘 써 두면 된다'는 가정을 테스트로 확인해야 한다.

더 공부하려면

전체 그림부터 잡으려면 JEVal(2610.03935)을 먼저 읽는 것이 좋다. 어떤 결정에 강하고 어디서 무너지는지를 여러 분야에 걸쳐 정리한다. 이어서 실제 적용 사례로 계산사회과학 주석 연구(2609.24574)와 혐오 표현 검수 연구 HATEDECIDE(2610.03324)를 함께 읽으면, 정확도와 비용과 확신도 사이의 맞교환을 구체적인 숫자로 볼 수 있다.

개발자라면 실무에 바로 닿는 두 편을 권한다. 선택지 라벨과 정의를 적는 방식의 함정을 다룬 2610.02586, 후보 메뉴 설계와 계산 자원 배분을 다룬 2610.07716이다. 마지막으로 구조 측면에 관심이 있다면 반복 연산으로 생각할 시간을 늘린 SanSi(2610.07730)와, 일반 LLM을 그대로 의사결정 모델처럼 쓰는 LLM-as-Jev(2610.02076)를 비교해 읽어 보면 '전용 모델과 범용 LLM 중 무엇을 쓸까'라는 질문을 스스로 판단해 볼 수 있다.

관련 용어

Jev LLM 토큰 프롬프트 파인튜닝 오픈웨이트 AI 에이전트 환각

참고 문헌

핵심 논문

최근 연구

AI가 참고 문헌을 바탕으로 작성하고 검수를 거친 해설입니다. 정확한 내용은 원문을 확인해 주세요.