본 블로그는 Evolving LLM-Generated Features for Interpretable Classification 논문을 요약하였습니다.
생성형 AI에 고객의 신용정보를 입력하고 “대출 위험이 높은가요?”라고 질문하면 그럴듯한 답변을 받을 수 있습니다. 하지만 그 답변은 얼마나 정확하며, 어떤 정보가 판단을 좌우했는지 확인할 수 있을까요?
AWS 소속 연구진 Jack Butler, Zainab Afolabi, Nikita Kozodoi가 발표한 논문 「해석 가능한 분류를 위한 LLM 생성 특징의 진화(Evolving LLM-Generated Features for Interpretable
Classification)」는 이 문제를 다룹니다. 연구진은 대규모 언어모델(LLM)이 평가에 사용할 기준을 만들고 개선하며, 최종 분류는 로지스틱 회귀모형이 수행하는 구조를 제안했습니다.
핵심은 AI의 언어 이해 능력을 사람이 검토할 수 있는 평가변수로 연결하는 것이다.
AI가 만든 평가기준을 0과 1로 바꾸다
연구에서 말하는 ‘루브릭(rubric)’은 평가기준 목록이다. 각 기준은 사람이 읽고 이해할 수 있는 문장으로 작성되며, 개별 데이터가 그 조건에 해당하면 1, 해당하지 않으면 0으로 표시합니다.
뉴스 분류라면 “스포츠 관련 전문용어가 포함되어 있는가?”라는 기준을 만들 수 있습니다. 신용위험 평가에서는 “회전성 신용의 부채 부담 지표가 40을 초과하는가?”처럼 수치 조건을 사용할 수 있습니다.
LLM은 입력 데이터를 읽고 각 조건의 충족 여부를 추출한다. 로지스틱 회귀모형은 이렇게 만들어진 변수들을 학습해 최종 결과를 산출합니다. 따라서 검토자는 평가기준의 정의, 고객별 변수값, 변수별 회귀계수를 확인할 수 있다. 어떤 조건이 충족됐고 그 조건이 분류에 어떻게 기여했는지 추적할 수 있는 구조입니다.
한 번 만든 기준을 실제 오류에 맞춰 개선한다
이 연구의 차별점은 평가기준을 반복적으로 개선한다는 데 있습니다.
먼저 LLM이 10개의 이진 평가기준을 생성한다. 이후 해당 기준으로 변수를 추출하고 모형을 학습한 뒤, 교차검증 결과를 분석한다. 연구진은 다음 정보를 LLM에 다시 전달했다.
- 잘못 분류된 사례와 자주 혼동하는 범주
- 범주별로 각 조건이 충족되는 비율
- 특정 변수를 제거했을 때 정확도가 얼마나 달라지는지
LLM은 이 피드백을 바탕으로 유용한 기준을 유지하고, 도움이 적은 기준을 수정하거나 교체합니다. 새로운 기준의 교차검증 점수가 기존 최선의 점수를 넘을 때 채택합니다.
예를 들어 감정 분류에서 “느낌표가 있는가?”는 여러 감정에 공통으로 나타나 구분력이 낮을 수 있다. 반면 “구체적인 위협이나 공격적 행동 표현이 있는가?”는 분노를 식별하는 데 더 유용할 수 있다. 실제 오류를 보면서 포괄적인 기준을 더 구체적인 기준으로 바꾸는 방식입니다.
실험 결과: 모든 과제에서 더 좋은 것은 아니다
연구진은 뉴스 분류, 감정 분류, 신용위험 분류의 세 과제에서 성능을 비교했습니다. 데이터셋마다 500개 표본을 사용하고, 학습·시험 데이터를 80:20으로 나눴다. 변수 생성과 추출에는 Claude Haiku 4.5를 사용했다.
아래 수치는 세 번의 데이터 분할에서 측정한 평균 시험 정확도다.
| 평가 과제 | 단어 기반 모형¹ | 최초 생성 기준 | 반복 개선 기준 | LLM 직접 분류 |
|---|---|---|---|---|
| 뉴스 분류: AG News | 80.0% | 82.7% | 81.3% | 89.7% |
| 감정 분류: GoEmotions | 31.3% | 34.7% | 41.0% | 38.7% |
| 신용위험 분류: HELOC | 62.3% | 65.3% | 69.0% | 50.7% |
¹ TF-IDF와 로지스틱 회귀를 결합한 비교모형.
평가기준을 반복 개선한 방식은 최초 기준 대비 세 과제 평균 2.9%포인트 높은 정확도를 기록했습니다. 감정 분류에서는 6.3%포인트, 신용위험 분류에서는 3.7%포인트 개선됐습니다. 반면 뉴스 분류에서는 최초 기준보다 정확도가 낮아졌다. 세계·스포츠·경제·과학기술처럼 범주가 비교적 명확한 과제에서는 LLM 직접 분류가 가장 좋은 성능을 보였다.
이 결과는 평가기준의 반복 개선이 특히 범주 간 경계가 모호하거나 전문적인 판단이 필요한 과제에서 유용할 수 있음을 보여준다.
신용평가에서 드러난 문제: 한쪽으로 쏠린 판단
가장 주목할 결과는 주택담보 신용한도대출 관련 HELOC 데이터 실험입니다.
LLM 직접 분류의 정확도는 50.7%였다. 그런데 문제는 낮은 정확도에만 있지 않았습니다. 위험·비위험 고객이 균형을 이루는 시험 데이터에서, LLM은 데이터 분할에 따라 전체 고객의 77~85%를 위험 고객으로 분류했습니다.
위험 고객을 찾아내는 재현율은 0.80~0.84였지만, 비위험 고객을 찾아내는 재현율은 0.14~0.26에 그쳤습니다. 특정 범주에 판단이 크게 쏠린 것입니다. 반복 개선 기준을 사용한 모형은 정확도 69.0%를 기록했고, 두 범주의 F1 점수도 각각 0.64~0.71 범위로 상대적으로 균형적이었습니다.
실무적으로는 전체 정확도와 함께 정상·부실 각각의 재현율, F1 점수, 혼동행렬, 예측 비중을 확인해야 한다는 의미입니다. 하나의 평균 지표만으로는 어떤 고객군에서 실패하는지 충분히 알기 어렵습니다.
설명 가능한 구조도 입력 오류를 해결해 주지는 않는다
이 방법은 사람이 읽을 수 있는 변수와 회귀계수를 제공합니다. 그러나 변수값을 추출하는 주체는 여전히 LLM입니다. LLM이 입력 정보를 잘못 읽어 0을 1로 바꾸면, 이후 계산이 투명하더라도 결과는 잘못될 수 있습니다. 따라서 최종 분류 성능과 변수 추출의 정확도를 별도로 검증해야 합니다.
연구 규모와 비교 대상에도 한계가 있습니다. 단일 LLM과 소규모 표본을 사용했으며, 신용평가에서 널리 활용되는 다양한 모형과 폭넓게 비교한 연구는 아닙니다. 이 결과만으로 기존 CSS나 신용평가모형보다 우수하다고 판단할 수 없습니다.
또한 사람이 이해할 수 있는 설명을 제공한다는 사실이 규제 적합성을 자동으로 보장하지는 않습니다. 연구진 역시 공정성, 대리변수를 통한 차별 가능성, 도메인 전문가 검토는 추가로 필요하다고 밝혔습니다.
금융 실무에는 어떻게 연결할 수 있을까?
다음은 논문 결과를 바탕으로 한 실무적 해석입니다. 우선 검토할 분야는 상담 기록, 심사 의견, 사업 설명 같은 비정형 정보에서 평가 후보변수를 발굴하는 작업입니다.
LLM으로 조건을 제안하고, 전문가가 정의를 검토한 뒤, 실제 데이터에서 구분력과 안정성을 확인하는 흐름을 구성할 수 있습니다.
수치가 이미 정형 데이터로 존재한다면 조건 충족 여부는 코드로 계산하는 편이 재현성과 정확성 확보에 유리합니다. LLM은 문맥을 읽어야 하는 정보의 구조화와 새로운 변수 가설 제안에 활용할 수 있습니다.
이때 중요한 관리 대상은 변수 정의의 버전, 원문 근거, 추출 오류율, 고객군별 성능, 시간에 따른 안정성입니다. 평가기준을 개선하는 과정까지 기록해야 모형 변경의 이유를 설명할 수 있습니다.
이 논문이 보여주는 가능성은 LLM이 제안한 평가기준을 실제 데이터로 검증하고, 그 기준이 최종 판단에 미친 영향을 추적하는 방식입니다. 금융 AI의 실무 가치는 정답을 맞히는 능력과 함께, 그 판단을 재현하고 검토할 수 있는 능력에서 나옵니다.