Korean Elementary Curriculum Reasoning Benchmark · Results v0.3

AI는 초등학교를
이해하는가?

정답을 아는 것과 배움의 구조를 이해하는 것은 다릅니다. 같은 50문항을 모델마다 다섯 번 실행해 평균 성능과 흔들리는 지점을 함께 측정했습니다.

결과 보기
TOP 1 /100
TOP 2 /100

ONTOLOGY
ALIGNMENT

50교차 성취기준 문항
510후보 직접 선수 관계
7평가 표본 교과
5회 완료 모델
수집 실행 / 계획

01 / RESEARCH QUESTION

AI는 답을 생성한다.
순서를 설명할 수 있는가?

초등 학습은 개념의 목록이 아니라 선후 관계의 구조입니다. 이 벤치마크는 같은 성취기준 안의 명백한 ‘이해→적용’ 관계를 제외하고, 서로 다른 성취기준을 잇는 직접 선수 추천만 사용합니다.

“분수를 설명할 수 있는 모델이, 분수 전에 무엇을 배워야 하는지도 아는가?”

02 / RESULTS

40회 반복 최종 결과

2026-07-11 · 8개 모델 × 5회 · 총 40회 · exact match

실행 안정성

실행×문항 2-way bootstrap · CI 중첩 시 우열 단정 금지

과제별 평균 정렬도

5회 평균 · 높을수록 온톨로지와 일치

교과별 평균 정렬도

5회 평균 · 문항 수가 다른 탐색적 표본

03 / STABILITY EXPLORER

모델은 어디서
흔들렸나

5회 중 한 번이라도 온톨로지와 달랐던 문항을 실행별 응답 분포와 함께 봅니다.

04 / METHOD & LIMITS

측정한 것과
측정하지 않은 것

01

블라인드 입력

주제 ID와 성취기준 번호를 제거하고 한국어 주제명만 제공했습니다.

02

교차 관계만

서로 다른 성취기준을 잇는 510개 직접 선수 주장만 표본 후보로 사용했습니다.

03

모델당 5회

같은 50문항을 모델마다 다섯 번 실행하고 평균·범위·표준편차와 문항별 일치율을 계산했습니다.

04

해석 경계

점수는 온톨로지 정렬도입니다. 보편적 교수 순서나 모델의 전체 교육 능력이 아닙니다.

중요한 한계

모델별 5회는 단일 실행보다 낫지만 여전히 작은 표본입니다. 골드는 교과 전문가 합의가 아니라 현재 공개 온톨로지의 모델 상대적 추천 구조입니다. 50문항은 전체 관계의 탐색적 표본이며, 세 CLI에 공통인 seed·temperature 제어는 없습니다. 같은 날 수행한 5회 반복과 bootstrap 구간은 이 문항 안의 실행 변동만 보여주며 전체 교육 능력, 장기 서비스 변화, 미래 실행에 대한 신뢰구간이 아닙니다.