객관적 채점기준 확보가 가능할지 의심이 됩니다. 매번 ai채점을 돌릴 때마다 다른 결과값과 채점값이 나오는데 여기에 순응할 학부모와 학생들이 얼마나 될지...
절대평가와 서논술형 평가를 동시에 진행하게 되었을 시 등급컷 근방에 있는 학생들의 무차별적인 이의제기, 모든 문항에 대해서 점수를 받을 수 있는지 확인하고자 하는 이의제기 등 다양한 상황을 배제할 수 없을 것입니다. (당장 학교 내신 시험에서만 봐도 항상 인문계 선생님들께 엄청난 이의제기가 들어옴.) 그러면 그 이의제기는 누가 검토하고 재채점을 할 수 있을까요? 만약 AI에게 맡긴다고 하면 채점도 AI, 검토도 AI일 경우 오류가 발생했을 시 수능에 대한 신뢰도는 더욱 떨어지게 될 수도 있고 학교에서도 많은 혼란을 가질 수 밖에 없을 것이라 생각이 되네요 ㅠㅠ
서논술형의 본래 취지는 개방적인 사고일 텐데.... 그걸 어디까지 품을 수 있을까 싶기는 하고, 사람이 하는데 또 하려면 하지 않을까 싶기도 하고, 하지만 그는 변수까지 품을 그릇은 못 되는데 싶기도 하고... 한 치 앞 주식도 모르겠는데 이걸 어떻게 알겠냐 싶기도 하고...ㅠ
서논술형문제의 출제 의도 자체가, 학생의 개방적인 사고를 촉진하기 위함인데, 그와 동시에 변별을 할 수 있는 평가라거나, 혹은 교육과정 성취기준 및 성취수준에 맞게 채점을 해야 하는 상황이라면, 실제 교육 현실 내에서는 결국 평가요소와 루브릭에 따라 완벽한 개방형 서논술형은 불가할 것 같습니다. 차라리, 서논술형 지필평가라거나 수행평가임에도 모든 학생이 동시에 평가에 임할 수 있는 환경에서 주어진 자료와 제시문만 활용한다면 모를까요.
최근, 수능에도 서술형·논술형 평가를 도입하겠다는 이야기도 나오는데요. 정답을 고르는 시험이 아닌 학생들이 생각을 표현하는 시험으로 바꾸겠다는 말을 들으면, 취지는 너무나도 좋으나 현실적으로 "그게 가능한가?"라는 의문이 드네요. 학교단위에서 실시하는 정기시험에 포함된 논술형평가조차 현실적으로 부딪히는 어려움들이 정말 많은데, 과연 수능에 이걸 적용할 수 있을지요. 당연히 여러 우려의 목소리가 나오고 있는데, 특히 채점의 공정성에 대한 해법이 'AI를 활용하면 된다.'라는, 거의 AI 딸깍하면 다 해결될 것이다 정도의 대안이라 걱정만 생깁니다. 아직 AI를 제대로 써 보지 못해서 드는 생각일 수도 있겠네요.
서논술형평가를 AI를 통해 실시하는 경우, 국어과 채점시에는 같은 내용을 다른 문장으로 반복하거나 하는 경우에 점수를 잘 받는 경우가 있다고 들었습니다. 국어과에서는 문장의 유려함과 더불어 단락의 구조, 글 전체의 내용 구조, 논증구조를 따져 채점해야 하는 경우가 많을 것 같은데, 이에 대한 주관적 평가를 AI에게만 맡겨도 되는지 불안하네요...
모르는 것을 모른다고 하지 않고 계속 답하게 하면, LLM의 할루시네이션은 구조적으로 반드시 발생한다. Kalai & Vempala의 Calibrated Language Models Must Hallucinate는 컴퓨터 과학 분야 최상위 학회 중 하나인 STOC 2024에 정식 채택된 논문입니다.
arxiv.org · 원문 보기연수 다닐 때 소개드리는 논문인데요. LLM의 할루시네이션은 아무리 모델이 발전해도 구조적으로 반드시 발생할 수 밖에 없다는 것을 수학적으로 증명하는 논문입니다. (단, 전제조건은 모르는 것을 모른다고 대답하지 말라고 하는 지시하는 것입니다.) 모델이 아무리 발전해도 LLM이 가진 본질적인 한계들은 계속 존재할 것입니다. 저희는 기술을 잘 이용해먹으면서도 그것을 맹신하기보다는 한계점을 명확히 인지해야겠습니다. AI 서논술형 채점이라는 것은 LLM에게 반드시 학생 서술에 대해 점수를 출력하도록 요구합니다. 몇 점을 메길지 모르겠다고 말할 수 없는 구조이죠. 그런데 저희가 이 채점 결과를 신뢰할 수 있을까요? 선생님들의 의견이 궁금합니다.
서논술형 시험의 대표적인 예가 교원 임용시험이라, '서논술형 전환의 답을 교원 임용시험에서 찾다!' 이런 글들이 인스타에서 심심치 않게 보이고는 합니다. 하지만 저희는 알잖아요..? 정답 공개가 없는,,, 그때문에 매번 말이 너무나도 많은,,, 분명 답이 있을텐데 왜 .33, .67로 나오는가에 대한 의문도... (3인 채점이라 그렇긴하지만 답은 있을텐데 왜 정답 여하가 갈리는지..?) AI가 과연 다를까? 하는 의문이 들긴 합니다.. 물론 AI 활용한 채점 도구를 만드려는 목표가 있었고, 일부 만들어 보기는 했지만, 같은 파일을 업로드해도 매번 그 결과가 다른 지 멋대로인 상황에서 과연 교육 공동체 구성원이 신뢰할 수 있을지, 타당하다고 생각할지는 정말 의문입니다. 그런 의미에서 마지막 채점은 교사가 해야한다고 생각하고, 보조 도구 정도가 적당하지 않나 생각해봅니다..
ai 서논술형 채점의 가장 큰 문제는 그 과정을 인간이 통제하기가 어렵다는 것이라 생각합니다. llm은 본질적으로 확률 통계적 계산에 따른 답변을 내놓고, 이 과정에 대해 한 개인의 교사가 완전히 통제하기는 어렵다고 생각합니다. 서논술형 채점에서 가장 중요한것은 채점을 하는 평가자의 전문성에서 기반합니다. 현단계에서는 왜 이것을 이렇게 평가했는지에 대한 완벽한 통제가 어렵고 이는 전문성에 기반한 평가라는 측면을 약화시키 수 있다고 생각합니다
토요일에 성취도평가 관련 연수를 다녀왔는데 ai채점에 대한 이야기가 나왔었어요. 직접 서술형 문제 모의 채점을 해봤는데, 채점기준대로 채점하면 0점이지만 맥락과 과정을 보면 2점을 줄 수 있겠더라고요. 과목마다 ai채점의 효과가 다르겠지만, 수학과에서는 채점기준이 명확해야지만 가능할 것 같아요. 근데 이 부분이 문제죠. 수학적 풀이는 다양할 수 있는데 이 부분을 모두 ai에게 알려주고 채점을 시킬 수 있을지. 쉽지는 않을 것 같습니다. 정해진 채점기준, 사고의 확장. 이 두가지를 동시에 만족 시킬 수 있을까요?
어쩌면 사람보다 더 객관적이고 정확할수 있지만 절대 독자적일수는 없습니다. 사람이 검수는 꼭 해야합니다
지금 당장은 ai모델의 태생적인 한계로 어렵겠지만 언젠가는 가능할 것이고 그러한 방향으로 나아갈 것이라고 생각합니다
AIDT의 도입과 AI 기술의 발전 속도를 고려하면, 어렵지 않게 조만간 전면 도입되리라 생각됩니다. 교실에서도 아이들이 테블릿에 필기로 작성한 답안, 수학 문제 풀이 과정 등을 전부 데이터화 해서 관리되고 AI에 의해 채점 및 피드백이 되리라 생각합니다. 그렇게 되면, 교사의 본질은 무엇에 남을까요? 그래서 요즘 사회정서교육이 핫한것 같습니다.
제가 서논술형 평가 도입에 걸었던 기대는 기존의 선다형 위주의 시험과 달리 글쓰기는 가상의 독자를 상정하고 이루어지는 행위라는 점이었어요 비에스타가 교육의 기능을 자격롸, 사회화, 주체화로 나누었는데 이때의 주체화는 내가 바라는 것이 과연 세계와의 관계 속에서 정말 바람직한 것인가?를 묻는 행위를 의미해요 글쓰기는 반드시 독자(글쓴이도 포함)가 있기 때문에 자연스럽게 주체회를 유도할 수 있죠 그런데 교육부에서 생각하는 서논술형 평가 도입의 목적에는 이런 관점이 전혀 없어요 여전히 자격화와 사회화에만 관심이 있어요 그래서 이걸 AI가 채점하든 사람이 채점하든 전 망할 가능성이 농후하다고 봅니다 근데 AI로 보조 채점을 하면 더 큰 문제가 생겨요 원래 글은 사람이 채점해도 점수를 다르게 판단할 수밖에 없어요 글을 보는 눈은 주관적이거든요 그래서 합의를 하는 과정이 반드시 필요해요 AI가 들어온다고 해서 도움이 될 게 없어요 지금의 LLM 모델은 랄루시네이션이 필연적이기도 하고요 AI를 사용하는 시점도 중요해요 AI로 먼저 채점을 하고 그걸 기반으로 교사가 검토, 수정하는 순간 채점자는 AI의 채점 초안에 의존하게 돼요 수업에서 학생들이 AI를 활용할 때도 사람-AI-사람의 순서가 중요한 것처럼 채점도 이 순서로 해야 해요 근데 또 이렇게 하면 AI를 보조 도구로 쓰더라도 채점 부담을 줄이기 어렵겠죠 저는 성장을 위한 평가와 선발을 위한 평가가 너무 끈끈하게 얽혀 있기 때문에 서논술형 평가에 AI를 활용하자느니 말자느니 하는 말이 나온다고 생각해요 그래서 특히 수능에서는 채점을 평가원이나 교사가 하지 말고 개별 대학에서 해야 한다고 봐요 평가원은 시험을 출제하고 운영하는 역할을 하고, P/F만 가리는 거죠 대학은 자기 대학에 지원한 학생들의 답지만 채점하고, 줄을 세우고, 입맛에 맞는 학생을 선발하면 돼요 언제까지 공교육이 대학이 자기들 학생 뽑는 따까리 짓을 해야 하나 하는 생각이 들어요 주저리주저리 적어봤는데 결론은 AI 서논술형 채점은 도입하면 안된다는 생각입니다 뉴욕 시장도 학생의 답안을 채점하는 데 AI를 쓰는 걸 금지했는데 우리나라는 반대로 가고 있네요 ㅎㅎㅎ
요즘 워낙 AI가 빠르게 발전하는걸 보니까 서논술형 채점에 대한 것도 나중에는 자연스럽게 AI에게 맡기게 되지 않을까 생각해봅니다. 물론 신뢰를 쌓아가는 과정이 생기겠지만, 10년 이내에 AI채점에 더 신뢰가 쌓여 '엥 그걸 사람이 채점한다고?'라고 생각하는게 흔한 세상이 오지 않을까... 마치 자율주행이 이제 너무 당연해져서 '엥? 사람이 운전한다고? 안탈래,,,'라고 말하게 될 것 처럼요.