Seunghoon Choi

AI 新模型体验测评:亲手检验新模型进步了多少的应用

用 8 个领域 24 道标准提示词给新模型打分,并以雷达图对比两个模型。评分记录只保存在当前浏览器中。

目录
AI 新模型体验测评应用图标
免费网页应用

AI 新模型体验测评

把 8 个领域 24 道标准提示词粘贴给新 AI 模型,按 0/1/2 给回答打分,就能以雷达图叠加显示两个模型的结果,看清它在哪些领域进步了多少。评分记录只保存在当前浏览器中。

打开应用 →

每当新的 AI 模型发布,官方材料上总会列出各种基准测试分数,但光看这些分数,很难知道它在我自己的日常任务里到底好了多少。如果每次都临场编题目,测试条件又和测旧模型时不一样,结果没法比较。所以我做了一套对任何模型都问同样问题、把结果并排对比的标准题库。应用界面为韩语。

提供 8 个领域 24 道题

题目覆盖推理·逻辑、数学·计算、编程、韩语·语言、诚实性·幻觉、指令遵循、长文处理、创意·写作共 8 个领域,每个领域 3 道,合计 24 道。每道题都附有它为何能拉开模型差距的说明、0 分/1 分/2 分的评分标准,以及打分时要重点观察的要点。例如诚实性领域有一道包含似是而非的错误前提的问题,可以用来检验模型是编造不存在的事实,还是先纠正前提本身。

复制提示词、粘贴并打分

使用方法很简单。复制题目的提示词,粘贴到想测试的模型的聊天窗口,再把模型的回答对照题目附带的评分标准,记为 0 分、1 分或 2 分。不需要注册账号或 API 密钥,应用本身也不会直接调用模型。无论哪家公司的哪个模型,只要有聊天窗口,就能用同样的方式测试。

用雷达图对比两个模型

评分结果会按模型保存为各自的会话。选中两个会话,应用就会把 8 个领域的得分叠加在同一张雷达图上,让你一眼看出新模型在哪些领域进步了多少。比如数学和编程接近满分,而诚实性得分却和以前一样,那就意味着对这个模型的回答仍然要持续核实事实。

快速模式 5 分钟即可完成

如果没时间做完 24 道题,可以使用由每个领域各选一道代表题组成的 8 题快速模式。快速模式选用的都是短题,连打分在内 5 分钟内就能完成。除默认题目外,还可以把自己常做的任务添加为自定义题目;题目和评分记录都能导出或导入为 JSON 文件,方便换台电脑接着用,或让别人用同一套题目来测试。

评分记录只保存在当前浏览器中

这是一款无服务器的静态网页应用。包括各模型的会话、评分记录和自定义题目在内,所有输入的数据都只保存在当前浏览器中,不会发送到服务器。清除浏览器数据时评分记录也会一并删除,需要长期保存的记录建议下载为 JSON 文件。