중학생 수학 서술형 평가의 자동 피드백: 비지도 학습과 거대언어모델의 만남
의미 기반 클러스터링을 활용해 학생들의 수학 풀이를 분석하고, 대규모 언어모델(LLM)이 맞춤형 피드백을 생성하는 과정을 개념적으로 표현한 이미지. 교실에서 학생들이 작성한 수학 서술형 답안을 하나씩 읽고 맞춤형 피드백을 건네는 일은 상당한 시간이 소요되는 과정이다. 최근 거대언어모델(LLM)이 교육 현장의 이러한 평가 부담을 덜어줄 대안으로 주목받고 있지만, 인공지능이 참고할 모범 답안이나 예시를 사람이 직접 일일이 골라 프롬프트에 입력해야 하는 번거로움이 여전히 실무적 걸림돌로 남아 있다. 이러한 문제를 해결하기 위해 연구진은 비지도 의미론적 군집화 기법을 활용해 LLM 피드백용 예시를 자동으로 선별하는 방법론을 연구했다. 중학교 7학년 수학 부등식 문제를 바탕으로 100개의 모의 학생 응답을 생성하고 분석한 결과, 인공지능이 생성한 피드백의 96.42%가 교사 평가에서 수용 가능한 수준을 기록했다. 이 연구는 자동화된 군집화가 프롬프트 엔지니어링의 수고를 덜면서도 교육적으로 활용 가능한 피드백을 만들어낼 수 있음을 보여준다. 시맨틱 클러스터링으로 학생들의 논리 구조를 읽어내다 연구진은 학생들의 서술형 답안을 그대로 대입하는 대신, 문장 임베딩 모델인 Sentence-BERT를 이용해 텍스트를 고차원 벡터로 변환했다. 이어 UMAP을 통해 차원을 축소하고, 밀도 기반 군집화 알고리즘인 HDBSCAN을 적용해 학생들의 풀이 과정에 담긴 공통된 추론 패턴을 그룹화했다. 이 과정에서 기계는 정답 여부라는 기계적 분류를 넘어, 학생들이 공유하는 대수적 논리 구조를 중심 기준으로 삼았다. 예를 들어, 올바른 풀이를 상세하게 적은 집단과 핵심만 간결하게 적은 집단은 의미론적 유사성에 따라 하나의 큰 군집으로 묶였다. 이는 인공지능이 표면적인 글자 배열이 아니라 학생들이 문제를 해결하기 위해 거친 사고의 흐름 자체를 포착해 낸다는 점을 시사한다. 중심값과 경계값 예시가 이끌어낸 높은 피드백 품질 군집화된 데이터 속에서 연구진은 각 그룹의 중심에...