Checklist de testeo de capacidades en modelos de IA generativa

Una guía estructurada para que el propio modelo se autoevalúe, declare sus límites de contexto y de documentos, y marque de forma explícita lo que no es verificable, reduciendo así alucinaciones y sesgos.

Se recomienda aplicar el testeo de manera periódica cada dos o tres meses
umbral seguro ~80%

Testear de forma sistemática la ventana de contexto y la capacidad de análisis documental de un modelo permite optimizar los flujos de trabajo y comprobar que el modelo puede asumir la tarea encomendada. Como las personas operadoras modifican las capacidades con frecuencia, conviene reaplicar este testeo de manera periódica y contrastar siempre lo declarado por el modelo con la documentación oficial.

1
Capacidad fundamental

Ventana de contexto

El bloque nuclear del testeo. Mide cuánta información puede manejar el modelo de una sola vez, distinguiendo entrada, total combinado y sus equivalencias.

Entrada

Límite de tokens por turno. Contexto consumible en una única petición.

Total

Contexto total. Entrada más historial acumulado de la conversación.

Equivalencias

Palabras y caracteres. Traducción aproximada de los tokens a magnitudes legibles.

0 %
umbral de uso seguro: agotar como máximo en torno a este porcentaje del contexto
Recomendación del checklist
Indica siempre si los límites se refieren a la entrada (contexto consumible), a la salida (longitud máxima de respuesta) o al total combinado, y declara las diferencias entre versión gratuita y de pago.
2
Análisis documental

Un documento individual

Cuánto puede abarcar el modelo al procesar un único archivo, medido en varias unidades complementarias.

Tamaño

Tokens, palabras y páginas

Tope máximo de un documento expresado en las tres magnitudes para facilitar la estimación.

Peso

Megabytes por archivo

Límite de peso admitido para un único fichero cargado.

Planes

Gratuita vs. de pago

Diferencias relevantes entre versiones, declaradas de forma explícita.

3
Análisis documental

Múltiples documentos

El comportamiento del modelo cuando se cargan varios archivos a la vez: número máximo, límite combinado de tokens, formatos y peso total.

IA Análisis
Conjunto

Número y límite combinado

Máximo de archivos simultáneos y tope total de tokens del conjunto cargado.

Formatos

Tipos admitidos

  • Texto y datos: pdf, docx, txt, csv, xlsx, md
  • Presentaciones: pptx
  • Imágenes: según multimodalidad del modelo
4
Más allá del contexto

Capacidades adicionales

Capacidades que condicionan la elección del modelo para una tarea concreta, ampliando el checklist original más allá de la ventana de contexto.

Salida

Tokens de respuesta

Longitud máxima de salida (output) que el modelo puede generar por respuesta.

Multimodalidad

Entrada y salida

Texto, imagen, audio o vídeo en entrada; texto, imagen, audio o código ejecutable en salida.

Herramientas

Tool use y código

Soporte de function calling, ejecución de código y análisis de datos.

Web

Navegación en tiempo real

Acceso a búsqueda web o navegación actualizada más allá de la fecha de corte.

Idiomas

Rendimiento sólido

Lenguas en las que el modelo declara un desempeño robusto.

Corte

Conocimiento

Fecha de corte declarada por el modelo, expresada en año y mes.

5
Evaluación cualitativa

Eficacia, rendimiento y seguridad

Requiere que la persona evaluadora interprete el comportamiento observado, no solo las cifras declaradas por el modelo.

Inicio Medio Final
Comportamiento

Rendimiento y retención

  • Comportamiento cerca del límite de contexto
  • Prueba de retención central (lost in the middle)
  • Degradación reportada al acercarse al tope
Datos

Privacidad y entrenamiento

  • Política de privacidad con URL verificable
  • Uso de conversaciones para entrenamiento: sí / no / configurable
  • Tratamiento de datos resumido

Aplica el testeo a tu modelo

Copia el prompt, se lo pegas a tu modelo y le das a enter