Seunghoon Choi

Prueba práctica de modelos de IA: comprueba tú mismo cuánto mejoró el nuevo modelo

Califica el nuevo modelo con un set estándar de 24 preguntas en 8 áreas y compara dos modelos en un gráfico de radar. Las calificaciones se guardan solo en este navegador.

Índice
Ícono de la app Prueba práctica de modelos de IA
App web gratuita

Prueba práctica de modelos de IA

Pega en el nuevo modelo de IA los prompts estándar de 24 preguntas en 8 áreas y califica cada respuesta con 0/1/2; la app superpone los resultados de dos modelos en un gráfico de radar y te muestra en qué áreas y cuánto mejoró. Las calificaciones se guardan solo en este navegador.

Abrir la app →

Cada vez que sale un nuevo modelo de IA, el anuncio trae puntajes de benchmarks, pero con esos números es difícil saber qué mejoró y cuánto en el trabajo que tú haces. Y si improvisas preguntas cada vez, las condiciones cambian respecto a cuando probaste el modelo anterior y la comparación deja de valer. Por eso creé un set estándar de preguntas que puedes hacerle igual a cualquier modelo para comparar los resultados lado a lado. La interfaz de la app está en coreano.

Incluye 24 preguntas en 8 áreas

Las preguntas cubren 8 áreas: razonamiento y lógica, matemáticas y cálculo, programación, coreano y lenguaje, honestidad y alucinaciones, seguimiento de instrucciones, textos largos, y creatividad y escritura, con 3 preguntas por área, 24 en total. Cada pregunta incluye por qué revela diferencias entre modelos, los criterios para calificar con 0, 1 o 2 puntos, y qué observar al calificar. Por ejemplo, en el área de honestidad hay una pregunta con una premisa falsa pero verosímil, para comprobar si el modelo inventa hechos que no existen o corrige la premisa desde el inicio.

Copia el prompt, pégalo y califica

El uso es simple. Copia el prompt de una pregunta, pégalo en el chat del modelo que quieres probar y compara la respuesta con los criterios de la pregunta para registrar 0, 1 o 2 puntos. No hace falta registrarse ni tener una clave de API, y la app tampoco llama a los modelos directamente. Puedes probar de la misma manera cualquier modelo de cualquier empresa, siempre que tenga un chat.

Compara dos modelos en un gráfico de radar

Las calificaciones se guardan como sesiones por modelo. Al elegir dos sesiones, la app superpone los puntajes de las 8 áreas en un gráfico de radar, y así ves de un vistazo en qué áreas y cuánto mejoró el nuevo modelo. Por ejemplo, si matemáticas y programación están cerca del puntaje máximo pero honestidad quedó igual que antes, significa que debes seguir verificando los datos en las respuestas de ese modelo.

El recorrido rápido termina en cinco minutos

Si no tienes tiempo para las 24 preguntas, puedes usar el recorrido rápido, compuesto por ocho preguntas, una representativa de cada área. Está armado con preguntas cortas para que termines, calificación incluida, en menos de cinco minutos. Además de las preguntas predeterminadas, puedes agregar como preguntas personalizadas las tareas que haces con frecuencia, y tanto las preguntas como las calificaciones se pueden exportar e importar como archivo JSON, para continuar en otra computadora o probar con otra persona usando las mismas preguntas.

Las calificaciones se quedan en este navegador

Esta app es una aplicación web estática que funciona sin servidor. Todo lo que ingresas, incluidas las sesiones por modelo, las calificaciones y las preguntas personalizadas, se guarda solo en este navegador y nunca se envía a un servidor. Si borras los datos del navegador, las calificaciones también se borran, así que te recomiendo descargar como archivo JSON los registros que quieras conservar por mucho tiempo.