AI 새 모델 체감 테스트: 새 모델이 얼마나 좋아졌는지 직접 확인하는 앱
8개 분야 24문항의 표준 프롬프트로 새 모델을 채점하고, 두 모델을 레이더 차트로 비교합니다. 채점 기록은 이 브라우저에만 저장됩니다.
목차
AI 새 모델 체감 테스트
8개 분야 24문항의 표준 프롬프트를 새 AI 모델에 붙여넣고 답을 0/1/2로 채점하면, 두 모델의 결과를 레이더 차트로 겹쳐 어느 분야가 얼마나 좋아졌는지 보여 줍니다. 채점 기록은 이 브라우저에만 저장됩니다.
앱 열기 →새 AI 모델이 나올 때마다 발표 자료에는 벤치마크 점수가 실리지만, 그 점수만으로는 내가 하는 작업에서 무엇이 얼마나 좋아졌는지 알기 어렵습니다. 매번 즉석에서 질문을 지어내면 이전 모델을 테스트할 때와 조건이 달라져 비교가 되지 않습니다. 그래서 어느 모델에나 똑같이 물어보고 결과를 나란히 비교할 수 있는 표준 문항 세트를 만들었습니다.
8개 분야 24문항을 제공합니다
문항은 추론·논리, 수학·계산, 코딩, 한국어·언어, 정직성·환각, 지시 이행, 긴 글 처리, 창의성·글쓰기의 8개 분야에 각 3문항씩, 모두 24문항입니다. 각 문항에는 이 문항이 모델 간 차이를 드러내는 이유, 0점·1점·2점의 채점 기준, 채점할 때 살펴볼 항목이 함께 실려 있습니다. 예를 들어 정직성 분야에는 그럴듯한 거짓 전제를 담은 질문이 있어, 모델이 없는 사실을 지어내는지 아니면 전제부터 바로잡는지 확인할 수 있습니다.
프롬프트를 복사해 붙여넣고 채점합니다
사용 방법은 단순합니다. 문항의 프롬프트를 복사해 테스트하려는 모델의 채팅창에 붙여넣고, 모델의 답을 문항에 실린 채점 기준과 비교해 0점, 1점, 2점 중 하나로 기록합니다. 회원 가입이나 API 키는 필요 없고, 이 앱이 모델을 직접 호출하지도 않습니다. 어느 회사의 어떤 모델이든 채팅창만 있으면 같은 방식으로 테스트할 수 있습니다.
두 모델을 레이더 차트로 비교합니다
채점 결과는 모델별 세션으로 저장됩니다. 세션 두 개를 고르면 8개 분야의 점수를 레이더 차트로 겹쳐 보여 주어, 새 모델이 어느 분야에서 얼마나 좋아졌는지 한눈에 확인할 수 있습니다. 예를 들어 수학과 코딩은 만점에 가까운데 정직성 점수는 이전과 같다면, 그 모델의 답에서 사실 관계를 계속 확인해야 한다는 뜻입니다.
빠른 코스는 5분이면 끝납니다
24문항을 다 진행할 시간이 없으면 분야별 대표 문항 하나씩 여덟 개로 구성한 빠른 코스를 쓸 수 있습니다. 빠른 코스는 채점까지 5분 안에 끝나도록 짧은 문항으로 구성했습니다. 기본 문항 외에 자주 하는 작업을 사용자 정의 문항으로 추가할 수 있고, 문항과 채점 기록은 JSON 파일로 내보내거나 가져올 수 있어 다른 컴퓨터에서 이어서 쓰거나 다른 사람과 같은 문항으로 테스트할 수 있습니다.
채점 기록은 이 브라우저에만 저장됩니다
이 앱은 서버 없이 동작하는 정적 웹앱입니다. 모델별 세션과 채점 기록, 사용자 정의 문항을 포함해 입력한 모든 데이터는 이 브라우저에만 저장되며 서버로 전송되지 않습니다. 브라우저 데이터를 지우면 채점 기록도 함께 지워지므로, 오래 보관할 기록은 JSON 파일로 내려받아 두기를 권합니다.