문제에 맞는 품질인가
AI가 만든 결과물,
학생의 실력으로
어떻게 평가할 것인가
대학 AI 프로젝트의 과정·개인 기여·검증 기록 설계
학생의 판단을 확인하는 평가로.
교수자, 학과장, 교육혁신·교수학습 담당자를 위한
근거 분석과 실행 도구
본문 개정 2026.09.16 · 최초 발행 2026.09.08
이번 호의 답
결과물은 보되,
결과물만으로 판단하지 않는다
학생의 실력은 결과물·과정·개인 기여·검증·설명을 서로 대조할 때 더 믿을 만하게 판단할 수 있다.
생성형 AI가 과제의 일부를 수행할 수 있다는 사실은 평가를 없애야 한다는 뜻이 아니다. 무엇을 배웠는지 보여 주는 증거를 한 파일에 몰아 두지 말아야 한다는 뜻에 가깝다. TEQSA는 신뢰할 수 있는 학습 판단을 위해 여러 유형의 포괄적이고 맥락화된 평가를 함께 보라고 권고한다. [S1] [S2]
어떤 선택과 수정이 있었나
학생이 직접 책임진 부분은 무엇인가
출처·수치·오류를 어떻게 확인했나
낯선 질문에도 판단을 재현할 수 있나
KAAI 평가 설계의 다섯 증거 축. 실증된 배점 공식이 아니라 과목별 루브릭을 설계하는 구조다.
평가 전에 세 가지를 먼저 정한다
첫째, AI를 사용해도 변하지 않아야 할 학습성과를 쓴다. 둘째, 과제 단계마다 허용되는 AI 사용 범위를 알린다. 셋째, 학생이 제출할 증거와 교수자가 확인할 질문을 함께 공개한다. 금지 여부만 공지하고 증거를 설계하지 않으면 학생도, 채점자도 경계를 해석해야 한다.
다섯 증거는 서로를 대신하지 않는다
다섯 증거 축은 제출물을 늘리기 위한 목록이 아니라, 한 종류의 증거가 만든 오판을 다른 증거로 줄이는 구조다. 완성도가 높아도 검증 기록과 설명이 어긋나면 판단을 멈춘다. 불일치는 곧 부정행위의 증거가 아니라 추가 확인이 필요한 지점이다.
교수자는 학습성과마다 가장 직접적인 증거와 이를 확인할 보조 증거를 먼저 고른다. 예를 들어 정책 제안서라면 최종 권고와 근거 대조표를 함께 보고, 조건을 바꾼 질문으로 같은 판단 기준을 다시 적용하는지 확인할 수 있다. 성적 판단과 별도 절차는 대학 규정에 따라 구분한다.
근거 1 · 탐지의 한계
탐지 점수는 의심 신호일 뿐,
학생 실력의 증거가 아니다
AI 탐지기는 학생의 사고 과정, 전공 이해, 저자성을 직접 측정하지 않는다.
Weber-Wulff 등은 2023년 14개 탐지기에 출처를 아는 영어 문서 54건을 넣어 총 756회 시험했다. 모든 도구의 정확도가 80% 미만이었고, 70%를 넘은 도구는 5개뿐이었다. 연구진은 사람 글을 AI 글로, AI 글을 사람 글로 분류하는 오류가 모두 발생한다고 보고했다. [S3]
출처: Weber-Wulff et al. (2023). 영어 중심 자료와 당시 도구·모델을 시험한 결과다. 현재 제품 성능으로 일반화하지 않는다. [S3]
공정한 처리 절차가 필요하다
탐지 결과만으로 감점하거나 부정행위를 확정하면 오분류의 부담을 학생에게 넘길 수 있다. 탐지 신호를 사용한다면 과제 지침, 초안과 변경 이력, 학생 설명, 원자료 대조 등 다른 증거와 함께 살피고 이의 제기 경로를 마련해야 한다. 이는 법률 판단이 아니라 평가 공정성을 위한 운영 권고다.
탐지 신호를 확인 질문으로 바꾸는 법
탐지 신호가 하는 일은 결론을 내리는 것이 아니라 확인 범위를 좁히는 것이다. 교수자는 신호가 나온 문장과 과제의 핵심 판단을 구분하고, 초안·원자료·변경 설명처럼 저자성과 학습을 더 직접 보여 주는 증거를 같은 기준으로 대조한다.
제2언어 사용, 보조공학, 문체 교정 등 학생의 작성 조건을 들을 기회를 두고, 검토 자료와 응답 경로를 알린다. 높은 탐지 점수와 달리 버전 기록·참고자료·설명이 일관된다면 점수만으로 감점하지 않는다. 설명이 맞지 않을 때도 추가 확인하며, 부정행위 판단은 대학의 절차와 권한에 따른다.
설계 1 · 학습성과와 증거
루브릭보다 먼저,
학습성과와 증거를 연결한다
평가 항목은 “AI를 잘 썼는가”가 아니라, 학생이 성취해야 할 역량에서 출발한다.
예를 들어 “전공 문제를 분석하고 타당한 해결안을 제안한다”가 학습성과라면, 완성 보고서만으로는 분석이 학생의 판단인지 확인하기 어렵다. 문제 정의 메모, 대안 비교, 원자료 검증, 구두 설명을 묶으면 같은 학습성과를 여러 방향에서 확인할 수 있다. [S1] [S2]
학생이 최종적으로 무엇을 알고 할 수 있어야 하는가
그 역량이 필요한 전공·직무 상황은 무엇인가
어느 단계에서 무엇을 허용하고 금지하는가
결과·과정·검증·개인 설명 중 무엇을 받는가
어떤 수준이면 성취로 인정하는가
KAAI 설계 절차. 각 단계는 앞 단계와 연결되어야 하며, 도구 이름이 학습성과를 대신하지 않는다.
| 학습성과 | 직접 증거 | 보조 증거 | 확인 질문 |
|---|---|---|---|
| 근거에 따라 대안을 선택한다 | 대안 비교표와 최종 선택 | 초안·수정 사유·원자료 | 다른 조건이면 선택이 어떻게 달라지는가? |
| AI 출력의 한계를 판단한다 | 오류·편향 점검 결과 | 프롬프트와 반례 테스트 | AI 답변을 버린 기준은 무엇인가? |
| 협업 결과에 기여한다 | 담당 산출물과 통합 결정 | 동료 확인·회의 기록 | 본인이 바꾼 핵심 결정은 무엇인가? |
운영 예시. 실제 대학의 성과 데이터가 아니며 전공 학습성과와 학칙에 맞게 수정한다.
증거의 타당성은 학습성과와의 거리로 판단한다
학습성과가 넓은 추상어로 남아 있으면 어떤 제출물도 그럴듯한 증거가 될 수 있다. 먼저 학생이 실제로 보여 줄 행동과 조건을 쓴 뒤, 그 행동을 직접 관찰하는 증거와 판단을 뒷받침하는 보조 증거를 구분해야 한다.
가령 ‘제약 아래 두 대안을 비교해 선택한다’가 성과라면 비교표만으로는 충분하지 않다. 학생이 우선순위를 정한 이유와 제약이 달라졌을 때 선택을 수정하는 설명까지 보아야 한다. AI가 만든 대안 목록은 사고의 입력일 수 있지만 선택 역량 자체의 증거는 아니다.
완성본은 뛰어나지만 과정 설명이 약하거나, 과정 기록은 풍부하지만 결론이 과제 조건을 벗어날 수도 있다. 이때 증거의 양을 합산하지 말고 어떤 증거가 목표 행동을 직접 확인하는지 판단한 뒤, 필요한 부분에만 추가 질문이나 짧은 재수행을 요청한다.
설계 2 · AI 허용 범위
허용과 금지 사이를
과제 단계별로 말한다
한 과목 안에서도 아이디어 탐색, 자료 해석, 글쓰기, 검증에 서로 다른 AI 규칙이 필요할 수 있다.
AI Assessment Scale은 평가에서 AI 사용을 5단계로 구분해 교수자와 학생의 대화를 돕는다. 이 보고서는 그 취지를 참고하되, 단계 번호를 성취 수준이나 우열로 사용하지 않는다. 과제마다 학습성과와 위험이 다르기 때문이다. [S4]
통제된 조건에서 학생 지식·기술만 사용
브레인스토밍과 구성에 사용, 생성 내용은 최종본에 넣지 않음
학생 원문을 다듬되 새 내용을 생성하지 않음
지정한 부분에 AI를 쓰고 결과를 비판적으로 평가
과제 목적 안에서 AI를 공동 도구로 활용
Perkins et al. (2024)의 AIAS를 KAAI가 한국어로 요약했다. 기관 정책에 맞게 조정하는 대화 도구이며 보편적 표준은 아니다. [S4]
지침 문장에는 네 요소를 넣는다
가능 단계, 금지 행동, 표시 방법, 학생 책임을 함께 쓴다. 예: “자료 탐색과 문장 교정에는 AI를 쓸 수 있다. 존재하지 않는 출처를 만들거나 개인정보를 입력해서는 안 된다. 사용한 도구·목적·핵심 수정은 부록에 적고, 최종 수치와 인용의 정확성은 학생이 확인한다.”
허용 범위는 도구가 아니라 학습 장면으로 쓴다
같은 도구도 문제 탐색에서는 허용하고 핵심 해석에서는 제한할 수 있다. 자료 후보를 찾는 데 AI를 쓰게 하더라도 원문 확인과 최종 인용은 학생이 맡도록 설계할 수 있다. 제품 이름보다 과제 단계, 허용 행동, 직접 판단, 제출 기록을 한 문서에서 연결한다.
전체 대화 대신 사용 목적, 채택하거나 버린 내용, 핵심 수정 사유를 받으면 평가 증거와 개인정보·저장 부담을 함께 조정할 수 있다. 유료 기능이나 특정 계정에 접근할 수 없는 학생에게는 같은 학습성과를 보여 줄 대체 경로를 두어 도구 조건이 점수 이점이 되지 않게 한다.
설계 3 · 과정 증거
완성본 옆에
판단이 바뀐 흔적을 둔다
모든 클릭을 감시할 필요는 없다. 평가할 판단과 연결된 최소한의 변화만 남긴다.
TEQSA는 학습 과정의 증거가 비판적 사고, 판단, 윤리적 결정, 성찰을 드러낼 수 있다고 설명한다. 과정을 기록하는 목적은 학생을 감시하는 것이 아니라 최종 산출물이 어떻게 만들어졌는지 판단할 근거를 얻는 데 있다. [S2]
| 시점 | 남길 증거 | 평가자가 보는 것 |
|---|---|---|
| 시작 | 문제 정의와 성공 기준 | 과제 이해와 범위 설정 |
| 탐색 | 사용한 자료·AI 목적·대안 | 자료 선택과 도구 판단 |
| 중간 | 핵심 초안 또는 프로토타입 | 초기 사고와 기술 적용 |
| 수정 | 바꾼 부분과 이유 | 피드백 수용과 오류 교정 |
| 완료 | 최종본·검증 결과·남은 한계 | 책임 있는 결론과 자기 평가 |
KAAI 운영 예시. 화면 녹화나 전체 대화 기록을 기본값으로 요구하지 않으며 개인정보·비용·저장 부담을 함께 고려한다.
과정 기록은 결정이 바뀐 지점을 겨냥한다
과정 증거는 많이 남길수록 강해지는 것이 아니다. 교수자는 학습성과를 판단하려면 어떤 결정의 전후를 보아야 하는지 먼저 정하고, 그 지점의 초안·피드백·수정 사유만 받는다. 시간표시나 클릭 수는 활동을 보여 줄 뿐 판단의 질을 직접 증명하지 않는다.
프로토타입 과제에서 확인할 것은 처음의 설계가 왜 달라졌는가이다. 최초 요구사항, 실패한 시험 한 건, 그 결과로 바꾼 설계, 아직 해결하지 못한 조건을 묶어 제출하게 하면 성공한 화면만 볼 때 놓치는 진단과 수정 역량을 살필 수 있다.
기록이 서로 어긋나면 더 긴 로그를 요구하기 전에 학생이 어떤 자료로 결정을 내렸는지 확인한다. 민감정보가 포함된 원문은 최소화하고, 기록 도구를 쓰기 어려운 학생에게는 구조화된 메모나 구두 설명 등 같은 판단을 보여 줄 방식도 허용한다.
설계 4 · 개인 기여
팀 결과를 나누지 말고,
각자의 판단을 확인한다
팀 프로젝트의 개인 평가는 “몇 퍼센트 일했는가”보다 “어떤 결정을 맡고 설명할 수 있는가”에 가깝다.
범위와 성공 기준을 설명
대안과 선택 사유를 설명
실패와 수정 과정을 설명
충돌 해결과 한계를 설명
역할은 전공과 과제에 따라 겹칠 수 있다. 기여율을 자동 계산하는 모델이 아니라 개인 설명 지점을 설계하는 예다.
세 종류의 증거를 교차 확인한다
담당 증거는 개인이 책임진 산출물과 결정 기록이다. 상호 증거는 팀원의 확인과 통합 기록이다. 응답 증거는 짧은 구두 질문, 현장 수정, 반례 적용처럼 학생이 자신의 판단을 다시 보여 주는 장면이다. 하나만으로 점수를 확정하지 않고 불일치가 크면 추가 확인한다.
| 확인 영역 | 질문 | 좋은 답의 특징 |
|---|---|---|
| 책임 | 본인이 최종 결정한 부분은 무엇인가? | 구체적 대상·대안·결정 이유가 있다 |
| 변화 | 팀 피드백으로 무엇을 바꿨는가? | 이전 상태와 수정 근거를 연결한다 |
| 전이 | 조건 하나가 달라지면 어떻게 수정할까? | 외운 설명이 아니라 기준을 적용한다 |
KAAI 질문 예시. 말하기 능력 자체가 전공 성취를 가리지 않도록 응답 방식과 접근성을 조정한다.
역할명이 아니라 책임진 결정을 확인한다
‘자료 조사’나 ‘개발’ 같은 역할명은 개인 기여의 크기와 질을 설명하지 못한다. 평가자는 학생이 맡은 결정, 그 결정이 팀 결과에 연결된 지점, 동료 피드백 뒤 바꾼 내용을 함께 보아야 한다. 세 증거가 일치할수록 책임 범위를 더 분명하게 판단할 수 있다.
예를 들어 한 학생이 데이터 정제 기준을 맡았다면, 담당 파일의 양보다 제외 규칙을 선택한 이유와 그 선택이 분석 결과에 미친 변화를 설명하게 한다. 이어 조건이 달라진 짧은 사례를 주고 기준을 다시 적용하게 하면 외운 역할 설명과 실제 판단을 구분할 수 있다.
동료 확인과 개인 설명이 다르면 어느 한쪽을 자동으로 우선하지 않는다. 통합 기록과 산출물 변화를 추가로 보고, 말하기 속도나 관계 갈등이 평가를 좌우하지 않도록 서면 응답이나 개별 시연 같은 대체 방식을 제공한다.
설계 5 · 검증 기록
“AI를 썼다”가 아니라,
무엇을 확인했는지 제출한다
AI 사용 공개는 시작점이다. 사실, 수치, 출처, 코드, 결과를 확인한 행동이 평가 증거가 된다.
KAAI 검증 흐름. 모든 과제에 모든 단계를 같은 깊이로 요구하는 것은 아니며 오류 비용에 맞춰 조정한다.
| 산출물 | 학생이 확인할 것 | 남길 증거 |
|---|---|---|
| 보고서·발표 | 원문 존재, 발행자, 날짜, 주장 범위 | 원문 링크·확인 위치·인용 대조 |
| 데이터 분석 | 데이터 출처, 결측, 단위, 계산 재현 | 데이터 사전·계산식·검산 결과 |
| 코드·서비스 | 실행 환경, 핵심 기능, 실패·보안 조건 | 테스트 목록·오류 로그·수정 결과 |
| 디자인·콘텐츠 | 권리, 대상 적합성, 사실 표현, 접근성 | 소스 목록·선택 사유·사용성 확인 |
KAAI 운영 예시. 분야별 전문 기준과 기관 규정을 대체하지 않는다.
검증 결과에는 “통과”만 쓰지 않는다. 무엇을 어떤 자료로 확인했는지, 어떤 한계가 남았는지 적는다. 확인할 원문이 없거나 결과를 재현할 수 없다면 문장을 약하게 하거나 제출 범위에서 제외한다.
검증의 깊이는 오류의 영향에 맞춘다
모든 문장과 산출물에 같은 검증 비용을 들일 필요는 없다. 교수자는 틀렸을 때 학습 결론이나 다른 사람의 판단에 미치는 영향, 오류를 되돌릴 수 있는 정도, 원자료에 다시 접근할 수 있는지를 기준으로 확인 깊이를 정한다.
자료 기반 발표라면 핵심 주장마다 원문 위치와 적용 범위를 남기고, 수치가 맞지 않으면 단위·시점·분모를 다시 확인하게 할 수 있다. 확인되지 않은 주장을 제외하거나 표현을 약하게 한 기록도 검증 실패가 아니라 근거에 맞춰 결론을 조정한 증거다.
출처끼리 결론이 다를 때는 하나를 임의로 고르지 않는다. 정의, 조사 대상, 시점, 측정 방법의 차이를 적고 과제 범위에서 판단할 수 없는 부분을 남겨 둔다. 검증표는 정답 목록이 아니라 결론의 경계를 설명하는 문서다.
설계 6 · AI 윤리
정확한 결과만으로는
책임 있는 결과가 되지 않는다
AI 프로젝트 평가는 개인정보·저작권·편향·투명성·사람의 책임을 결과 품질과 함께 다뤄야 한다.
UNESCO는 교육용 생성형 AI에 인간 중심 접근, 개인정보 보호, 윤리적·교육적 적합성 검토를 제안한다. KERIS 가이드는 AI 생성물, 타인의 저작물, 서비스 약관과 출처 표시를 교육 현장에서 확인하도록 돕는다. [S5] [S6]
| 영역 | 과제 전 질문 | 학생 제출 증거 |
|---|---|---|
| 개인정보·보안 | 입력하면 안 되는 정보는 무엇인가? | 비식별 처리·도구 설정·제외 기록 |
| 저작권·약관 | 어떤 자료와 생성물을 사용할 수 있는가? | 출처·라이선스·이용조건 확인 |
| 편향·공정성 | 누가 불리해지거나 빠질 수 있는가? | 반례·대상군별 점검·수정 사유 |
| 투명성·책임 | AI 사용과 인간 판단을 어떻게 구분할까? | 사용 목적·핵심 결정·최종 책임자 |
일반 교육 설계표이며 개별 사건의 법률 판단을 대신하지 않는다.
윤리 항목을 선택과 수정의 증거로 바꾼다
윤리 점검은 ‘문제가 없다’는 확인란으로 끝나지 않는다. 어떤 위험을 예상했고, 누구에게 영향이 갈 수 있는지, 자료나 설계를 어떻게 바꿨는지를 남겨야 평가 가능한 판단이 된다. 확인하지 못한 조건은 안전하다고 가정하지 않고 적용 범위의 한계로 적는다.
공개 텍스트의 분류 과제를 설계할 때도 자료의 이용 조건과 식별 가능 정보를 먼저 살핀다. 서로 다른 사례에 같은 기준을 적용해 결과를 비교하고, 문제가 발견되면 자료를 제외하거나 결과 사용 범위를 줄인 이유를 기록하게 할 수 있다.
공정성 점검의 대상과 기준은 과제 맥락에서 정해야 하며 모든 사람에 대한 안전을 한 번의 시험으로 입증했다고 쓰지 않는다. 위험이 남으면 시연과 외부 적용을 구분하고, 전문 기준이나 대학 규정이 요구하는 별도 검토를 따른다.
적용 1 · 전공별 차이
같은 증거 축을 쓰되,
전공의 타당성 기준은 바꾼다
모든 전공에 같은 과제와 배점을 복사하면 실제 역량보다 형식 준수만 평가할 수 있다.
| 계열·과업 | 중심 결과 | 과정·검증 증거 | 현장 확인 |
|---|---|---|---|
| 경영·사회 · 의사결정안 | 문제 정의와 이해관계자 판단 | 데이터 출처·대안·가정 변화 | 새 조건에서 권고 수정 |
| 인문 · 해석과 논증 | 주장과 텍스트 해석 | 1차 자료·반대 해석·인용 대조 | 근거를 바꿔 논지 재구성 |
| 공학·자연 · 모델·프로토타입 | 기능·계산·실험 결과 | 요구사항·테스트·실패·재현 | 오류를 주고 진단·수정 |
| 디자인·예술 · 경험·작품 | 목적·형식·사용자 경험 | 리서치·변형·권리·피드백 | 선택을 설명하고 즉석 조정 |
| 보건·교육 · 사례 판단 | 안전·전문 기준·대상 적합성 | 근거 수준·위험·감독·개인정보 | 사례 변형에 대응 설명 |
KAAI 설계 예시. 자격·면허·인증이 관련된 전공은 해당 전문 기준과 대학 규정을 우선한다.
형식보다 전문적 판단을 본다
보고서, 영상, 코드, 작품처럼 결과 형식은 달라도 평가는 전공의 판단 기준으로 돌아와야 한다. 공학에서는 재현과 안전, 인문에서는 해석과 근거, 디자인에서는 목적과 사용자 경험의 연결이 더 큰 비중을 가질 수 있다. AI 사용 기록은 이 판단을 드러내는 보조 증거다.
전공화는 실패의 의미를 다시 정의하는 일이다
같은 ‘검증’이라도 전공마다 실패가 뜻하는 바가 다르다. 과목 책임자는 해당 분야에서 결과를 믿지 말아야 할 조건과 학생이 반드시 직접 판단해야 할 지점을 먼저 정한 뒤, 공통 증거 축의 비중과 확인 방식을 조정한다.
공학 과제에서는 재현되지 않는 시험을 찾아 수정하는 장면이 중요할 수 있고, 인문 과제에서는 같은 자료로 가능한 반대 해석을 비교하는 장면이 중요할 수 있다. 두 경우 모두 AI 사용량이 아니라 전공 기준을 적용한 선택과 설명을 평가한다.
융합 프로젝트는 하나의 공통 루브릭으로 모든 기여를 평준화하지 않는다. 공동 문제 정의와 검증 책임은 함께 보고, 분야별 판단은 해당 전공 기준으로 나누어 본다. 기준이 충돌하면 어느 기준을 왜 우선했는지 통합 결정에 남긴다.
적용 2 · 평가표
배점은 복사하지 말고,
성취 수준의 문장을 가져간다
루브릭은 분량과 도구 숙련도가 아니라 판단의 질과 검증 가능성을 구분해야 한다.
| 평가 축 | 충족 | 부분 충족 | 미충족 |
|---|---|---|---|
| 문제·전공 이해 | 요구·제약·성공 기준을 연결한다 | 일부 조건은 있으나 우선순위가 약하다 | 문제와 결과의 연결을 설명하지 못한다 |
| 과정·판단 | 대안·피드백·수정의 이유가 추적된다 | 과정은 있으나 핵심 결정의 이유가 비어 있다 | 최종본 외에 판단 증거가 없다 |
| 개인 기여 | 담당 결정과 팀 통합을 구체적으로 설명한다 | 작업은 보이나 책임 범위가 모호하다 | 개인 기여를 확인할 증거가 없다 |
| 검증·재현 | 원문·계산·테스트를 다른 사람이 확인할 수 있다 | 일부 확인했으나 범위·실패 조건이 빠졌다 | 출처·검산·테스트가 없거나 재현되지 않는다 |
| 윤리·책임 | 권리·개인정보·편향·한계를 확인하고 대응한다 | 위험을 알지만 대응 기록이 불충분하다 | 금지 정보 입력·권리 무시 등 중대한 위험이 남는다 |
| 설명·전이 | 새 조건에 기준을 적용해 결과를 수정한다 | 기존 결과는 설명하지만 새 조건 적용이 약하다 | 결과의 핵심 선택을 설명하지 못한다 |
KAAI 공통 골격. 과목별 배점과 통과 기준은 학습성과·학칙·학생 지원 여건에 따라 별도로 정한다.
채점자 간 판단을 맞추는 방법
과제 시작 전에 익명 예시 산출물 2~3개를 같은 루브릭으로 채점하고, 점수보다 판단 근거가 어디서 갈리는지 기록한다. 중대한 윤리 위반은 단순 감점인지 별도 학칙 절차인지 사전에 구분한다. 구두 설명은 짧고 구조화된 질문으로 운영하며 접근성 지원을 제공한다.
루브릭 문장은 관찰 가능한 차이를 보여야 한다
성취 수준은 ‘우수하다’처럼 인상을 적는 대신 어떤 증거가 있고 무엇이 빠졌는지를 구분해야 한다. 채점자는 학생이 사용한 도구보다 문제 조건의 연결, 수정 이유, 검증의 재현 가능성처럼 산출물에서 확인할 행동에 표시한다.
채점 전에는 서로 다른 수준의 익명 예시를 복수의 채점자가 독립적으로 읽고, 점수 차이보다 인용한 증거의 차이를 비교한다. 같은 문장을 다르게 해석했다면 배점을 평균내기 전에 수준 기술어와 예외 조건을 고친다.
증거 부족과 규정 위반은 같은 칸에서 처리하지 않는다. 학습성과 증거가 모호하면 추가 질문이나 제한된 재수행으로 확인하고, 별도 절차가 필요한 사안은 실제 대학 규정에 따른다. 한 항목의 중대한 문제를 다른 항목의 높은 점수로 상쇄할지도 과제 전에 정한다.
적용 3 · 교과목과 학위과정
한 과목의 방어보다,
학위과정의 증거망을 설계한다
모든 과목에 같은 통제형 시험을 추가하는 방식은 평가 부담과 불평등을 키울 수 있다.
TEQSA의 2025년 자료는 학습성과 보증을 구성하는 세 경로를 제시한다. 학위과정 전체를 연결하는 방식, 각 교과목 안에서 독립 수행을 확인하는 방식, 두 접근을 섞는 방식이다. 각 경로에는 자원·유연성·전공 구조에 따른 장단점이 있다. [S1]
여러 과목의 증거를 학습성과에 연결한다.
강점 · 성장과 통합 역량을 본다부담 · 높은 조정 비용각 과목에 독립 수행 확인 지점을 둔다.
강점 · 책임과 적용이 분명하다부담 · 시험·감독이 늘 수 있다핵심 성과는 과정 전체, 일부는 과목 안에서 확인한다.
강점 · 단계적 전환과 전공 유연성부담 · 경계·책임 설계 필요TEQSA 2025의 3 pathways를 KAAI가 요약했다. 호주 규제 맥락의 비처방적 지침이며 한국 대학에 그대로 적용하는 표준이 아니다. [S1]
과목 지도를 그리면 중복과 공백이 보인다
학위과정 수준의 증거망은 모든 과목에 같은 제출물을 더하는 방식이 아니다. 졸업 성과별로 어느 과목에서 처음 연습하고, 어디서 피드백을 받고, 어느 지점에서 독립 수행을 확인할지 연결하면 반복 부담과 평가 공백을 함께 볼 수 있다.
처음에는 한 성과를 골라 입문·중간·종합 과목의 과제와 증거를 나란히 놓아 볼 수 있다. 같은 기록을 반복해 받기보다 단계별 난도와 책임을 정한다. 과정 차원의 승인된 성과 기록을 활용하되, 과목 간 정보의 범위·접근 권한·보존은 대학의 학생정보·개인정보 규정에 따라 최소화한다.
독립 수행 확인은 한 가지 시험 형식으로 고정할 필요가 없다. 구두, 서면, 실기처럼 같은 성과를 보여 줄 수 있는 방식을 과목 조건과 학생 지원 여건에 맞춰 설계하고, 최종 선택은 해당 대학의 교육과정과 규정에 따른다.
적용 4 · 15주 운영 예시
평가 증거는 마지막 주가 아니라
학기 안에서 자란다
기말 결과물에 모든 점수를 몰아주지 않고, 학습이 진행되는 장면에서 작은 증거를 모은다.
역량 진단 · 학습계약
AI 원리·한계 · 윤리
전공 문제 정의
자료·도구 선택
초안·프로토타입
테스트·피드백
팀 통합 · 품질 확인
윤리·권리 점검
발표·구두 확인
자기평가·인계
KAAI 대학 AI 교육과정 설계 정본을 평가 관점으로 재구성한 운영 예시다. 실제 대학 성과나 15주 수업의 효과를 측정한 자료가 아니다. [S8]
주차는 기관의 학사 교시와 과목 특성에 맞춰 바꾼다. 핵심은 같은 학생의 판단이 시간에 따라 어떻게 깊어졌는지 볼 수 있게 시작·중간·완료 증거를 연결하는 것이다.
초기 증거는 판정보다 피드백에 먼저 쓴다
학기 초의 문제 정의와 위험 판단은 완성도를 재는 최종 증거가 아니라 이후 판단이 어떻게 달라졌는지 볼 기준점이다. 교수자는 초기 기록에 피드백을 주고, 중간 수정과 최종 설명에서 학생이 그 피드백을 선택적으로 적용한 이유를 연결해 본다.
중간 시험에서 자료의 편향이 드러났을 때에는 실패 자체보다 시험 조건을 바꾸고 결과 범위를 줄인 과정을 평가할 수 있다. 마지막 발표에서는 성공한 결과만 재현시키지 말고 남은 한계가 다른 조건에서 어떤 영향을 주는지 설명하게 한다.
매주 기록을 받는다고 증거가 좋아지는 것은 아니다. 피드백이나 성취 판단에 쓰지 않는 항목은 수집하지 않고, 팀 통합 시점처럼 판단이 크게 바뀌는 지점에 집중한다. 제출 부담도 다음 운영에서 수정할 근거로 따로 기록한다.
운영 · 교수자와 학과
과제 하나를 바꾸고,
과정 전체의 빈틈을 확인한다
평가 개편은 문구 수정만이 아니라 학습성과, 학생 안내, 채점, 이의 처리, 데이터 보관을 함께 바꾸는 일이다.
학습성과와 현재 과제가 실제로 맞물리는지 확인
AI 허용 단계·금지 행동·접근 지원을 명시
결과·과정·개인 기여·검증·설명 중 최소 묶음 선택
예시 산출물로 채점자 판단과 학생 부담을 확인
제출·구두 확인·이의 처리·데이터 보관 절차 실행
성취와 부담 자료를 분리해 다음 학기 수정
KAAI 운영 흐름. “AI 사용이 줄었다”를 교육 효과로 대신하지 않고 학습성과 증거와 운영 부담을 함께 본다.
| 역할 | 결정할 것 | 남길 기록 |
|---|---|---|
| 학과·과정 책임자 | 학위성과·공통 원칙·전공 예외 | 과정 수준 평가 지도·변경 승인 |
| 교수자 | 과제·허용 범위·루브릭·질문 | 과제 안내·채점 근거·예외 처리 |
| 학생 지원·도서관·정보 부서 | 접근성·출처·계정·데이터 지원 | 도움 경로·도구 조건·보관 기준 |
| 학생 | AI 사용·검증·개인 기여·한계 설명 | 제출 증거 패키지·자기 확인 |
역할 예시. 실제 조직 명칭과 의사결정 권한은 대학 규정에 맞춘다.
운영은 역할 사이의 인계까지 설계해야 한다
평가 원칙이 같아도 역할 사이의 인계가 비어 있으면 학생 안내와 실제 채점이 달라질 수 있다. 각 단계마다 누가 결정하고, 어떤 문서를 다음 역할에 넘기며, 예외가 생겼을 때 누구에게 되돌아가는지를 정해야 한다.
운영 예시로 교수자는 과제 지침과 루브릭을 책임지고, 과정 책임자는 학습성과 지도와 전공 공통 원칙의 정렬을 확인할 수 있다. 지원 부서는 접근 가능한 도구와 자료 이용 조건을 안내한다. 실제 직함과 승인 권한은 대학 규정에 맞춰 정한다.
도구 접근 불가, 대체 제출 요청, 채점 근거의 불일치가 생기면 자동 감점하지 않고 결정권자와 확인 자료를 분명히 한다. 예외 처리 결과는 다음 운영에서 지침·지원·루브릭 중 무엇을 고칠지 판단하는 자료로 남긴다. 학기 뒤에는 학습성과 증거와 운영 부담을 분리해 검토해 한쪽의 개선이 다른 쪽의 약화를 가리지 않게 한다.
바로 쓰는 도구
다음 과제 공지에
이 열두 항목을 넣는다
아래 항목에 답할 수 있으면 학생은 무엇을 배우고, 어디까지 AI를 쓰고, 무엇으로 평가받는지 알 수 있다.
- 이 과제의 학습성과는 무엇인가?
- 실제 해결할 문제와 결과 사용자는 누구인가?
- AI 사용이 허용되는 단계는 어디인가?
- 금지되는 입력·행동·자료는 무엇인가?
- 사용한 AI를 어떤 형식으로 표시하는가?
- 학생이 직접 해야 하는 핵심 판단은 무엇인가?
- 과정에서 남길 최소 증거는 무엇인가?
- 팀 안의 개인 기여를 어떻게 확인하는가?
- 출처·수치·코드·결과를 어떻게 검증하는가?
- 개인정보·저작권·편향을 어떻게 점검하는가?
- 구두 확인과 예외·접근성 지원은 어떻게 진행하는가?
- 채점·이의 제기·기록 보관 절차는 무엇인가?
KAAI 과제 공지 체크리스트. 기관 정책과 과목 조건을 적어 학생에게 과제 시작 전에 제공한다.
경성대학교의 공개 가이드라인도 과제에서 생성형 AI의 허용·금지 범위를 분명히 알리고, 오류 찾기와 비판적 리뷰를 평가에 넣는 방향을 제시한다. 이는 국내 대학이 이미 운영 문구를 구체화하고 있음을 보여 주는 한 사례이며 전국 공통 규정은 아니다. [S7]
체크리스트의 답은 학생이 행동으로 이해할 수 있어야 한다
열두 문항은 작성자의 확인표가 아니라 교수자와 학생 사이의 과제 계약이다. 각 답은 ‘적절히 사용한다’ 같은 표현을 피하고, 허용되는 단계, 금지되는 입력, 남길 증거, 확인 방식이 서로 모순되지 않게 써야 한다.
예를 들어 ‘AI 사용 가능’ 대신 ‘아이디어 후보 생성은 허용하되 핵심 해석은 학생이 작성하고, 채택한 후보와 수정 이유를 제출한다’고 적으면 행동 경계와 평가 증거가 함께 보인다. 특정 도구를 쓸 수 없을 때의 대체 경로도 같은 공지에 둔다.
공지 뒤 과제 조건이나 사용 가능한 도구가 달라지면 변경 내용과 적용 대상을 다시 알린다. 체크리스트에 답했다는 사실만으로 공정한 운영이 보장되지는 않으며, 채점·이의 처리·기록 보관은 실제 대학 규정과 지원 여건에 맞춰 확정한다.
범위·방법·참고문헌
이 보고서가 확인한 것과
확인하지 않은 것
공식·학술 원문과 KAAI 교육 설계를 구분해 읽고, 효과가 입증되지 않은 운영 예시는 그렇게 표시했다.
AI가 관여한 대학 프로젝트에서 학생의 학습성과를 어떤 증거로 판단할 것인가
2026년 9월 8일
고등교육 평가 지침, 동료검토 연구, 국제기구·공공기관 가이드, 국내 대학 사례
제품 홍보 수치, 출처가 불명확한 탐지 성능, 한국 대학 전체를 대표하지 않는 단일 사례의 일반화
호주 TEQSA · Enacting assessment reform in a time of artificial intelligence
2025-09-24 · 확인 위치: pp. 1–4, 13–15: 2 principles, 5 propositions, 3 pathways, institutional questions
적용 한계: 호주 고등교육의 제도·품질보증 맥락을 다룬 비처방적 지침이다. 한국 대학의 규정이나 효과 자료가 아니다.
호주 TEQSA · Assessment reform for the age of artificial intelligence
2023-11-23 · 확인 위치: pp. 1–6: guiding principles, process evidence, multiple contextualised assessment
적용 한계: 평가 개편 방향과 사례를 제시한다. 예시는 실제 효과가 검증된 처방전이 아니며 학문 분야에 맞게 조정해야 한다.
International Journal for Educational Integrity · Testing of detection tools for AI-generated text
2023-12-21 · 확인 위치: Methods; Results; Discussion: 14 tools, 54 cases, 756 tests, accuracy and error analysis
적용 한계: 2023년 당시 도구와 영어 중심 문서, 특정 ChatGPT 버전을 시험했다. 현재 모든 탐지기의 성능을 뜻하지 않지만 탐지 점수 단독 판정의 위험을 보여 준다.
2024-04-30 · 확인 위치: pp. 5–7: goals, five levels, implementation guidance
적용 한계: AI 허용 범위를 대화하고 과제를 설계하기 위한 5단계 틀이다. 모든 과목에 동일한 단계를 배정하라는 표준이나 성과 보장은 아니다.
UNESCO · Guidance for generative AI in education and research
2023-09-07 · 확인 위치: 공식 발행 페이지 및 보고서 Ch. 2–4, 6: human agency, privacy, ethical validation, pedagogical design
적용 한계: 세계적 정책 원칙이다. 한국 법률 자문이나 특정 도구의 안전성 인증으로 사용하지 않는다.
한국교육학술정보원 교육저작권지원센터 · 교육기관의 생성형 AI 활용을 위한 저작권 가이드라인
2024 · 확인 위치: Ⅱ AI 생성물의 저작권 보호 원칙; Ⅲ 수업 사례; Ⅳ FAQ
적용 한계: 교육 현장의 저작권 판단을 돕는 자료이며 개별 과제·계약·서비스 약관에 대한 법률 의견을 대신하지 않는다.
확인일 2026-09-08 · 확인 위치: 교수자·학습자 가이드라인: 허용 범위, 윤리 오리엔테이션, 비판적 리뷰
적용 한계: 한 대학의 현재 공개 지침이다. 전국 대학의 공통 규정으로 일반화하지 않는다.
KAAI · 대학 AI 교육과정 설계 정본
2026-07-16 · 확인 위치: 15주 구조와 M01–M05 등 모듈의 학습목표·활동·필수 산출물
적용 한계: 13쪽의 적용 예시를 구성하는 설계 입력이다. 외부 대학의 실제 운영 성과나 교육 효과를 입증하지 않는다.
발행 한국인공지능활용협회 KAAI
문서 대학 AI 교육 설계 리포트 제01호 · 2026.09.08 · v1.0
인용 안내 “한국인공지능활용협회(2026), AI가 만든 결과물, 학생의 실력으로 어떻게 평가할 것인가.”