A Study on a Classification Algorithm-based Readability Prediction Model for L2 Korean Reading Texts
연구 목적: 본 연구 목적은 머신러닝 분류 알고리즘을 활용하여 L2 한국어 읽기 텍스트의 난이도를 예측하는 모델을 구성하고 그 성능을 살펴보는 데 있다.연구 방법: 자질의 클래스 판별력과 자질 중요도를 분석하여 문장 길이, 어려운 문법 비율, 단문 비율, 어려운 단어 비율을 예측 자질로 선정하였다. 선정된 예측 자질을 활용하여 랜덤 포레스트, 그라디언트 부스팅, 로지스틱 회귀, 서포트 벡터 머신 모델을 만들어 성능을 분석하였다.연구 내용: 첫째, 랜덤 포레스트 모델의 정확도가 0.786으로 가장 성능이 높은 것으로 나타났다. 둘째, 선행연구의 결과와 비교하여 볼 때 선형회귀 기반 텍스트 난이도 측정 방식보다 분류 알고리즘 기반 접근이 더 효율적이고 정확도를 높일 수 있다고 나타났다.결론 및 제언: 머신러닝 분류 알고리즘을 활용할 때 L2 한국어 읽기 텍스트의 난이도를 효율적으로 측정할 수 있음을 확인할 수 있었다. 이러한 난이도 예측 모델의 성능을 높이기 위해서는 보다 정교한 어휘 및 문법 목록, 최신 한국어 교재의 텍스트를 활용하여 모델을 구성할 필요성이 제기된다.
Paper
The full text of this publication is not hosted on 44B due to licensing.
Read it at OpenAlex