Testear de forma sistemática la ventana de contexto y la capacidad de análisis documental de un modelo permite optimizar los flujos de trabajo y comprobar que el modelo puede asumir la tarea encomendada. Como las personas operadoras modifican las capacidades con frecuencia, conviene reaplicar este testeo de manera periódica y contrastar siempre lo declarado por el modelo con la documentación oficial.
Ventana de contexto
El bloque nuclear del testeo. Mide cuánta información puede manejar el modelo de una sola vez, distinguiendo entrada, total combinado y sus equivalencias.
Límite de tokens por turno. Contexto consumible en una única petición.
Contexto total. Entrada más historial acumulado de la conversación.
Palabras y caracteres. Traducción aproximada de los tokens a magnitudes legibles.
Un documento individual
Cuánto puede abarcar el modelo al procesar un único archivo, medido en varias unidades complementarias.
Tokens, palabras y páginas
Tope máximo de un documento expresado en las tres magnitudes para facilitar la estimación.
Megabytes por archivo
Límite de peso admitido para un único fichero cargado.
Gratuita vs. de pago
Diferencias relevantes entre versiones, declaradas de forma explícita.
Múltiples documentos
El comportamiento del modelo cuando se cargan varios archivos a la vez: número máximo, límite combinado de tokens, formatos y peso total.
Número y límite combinado
Máximo de archivos simultáneos y tope total de tokens del conjunto cargado.
Tipos admitidos
- Texto y datos: pdf, docx, txt, csv, xlsx, md
- Presentaciones: pptx
- Imágenes: según multimodalidad del modelo
Capacidades adicionales
Capacidades que condicionan la elección del modelo para una tarea concreta, ampliando el checklist original más allá de la ventana de contexto.
Tokens de respuesta
Longitud máxima de salida (output) que el modelo puede generar por respuesta.
Entrada y salida
Texto, imagen, audio o vídeo en entrada; texto, imagen, audio o código ejecutable en salida.
Tool use y código
Soporte de function calling, ejecución de código y análisis de datos.
Navegación en tiempo real
Acceso a búsqueda web o navegación actualizada más allá de la fecha de corte.
Rendimiento sólido
Lenguas en las que el modelo declara un desempeño robusto.
Conocimiento
Fecha de corte declarada por el modelo, expresada en año y mes.
Eficacia, rendimiento y seguridad
Requiere que la persona evaluadora interprete el comportamiento observado, no solo las cifras declaradas por el modelo.
Rendimiento y retención
- Comportamiento cerca del límite de contexto
- Prueba de retención central (lost in the middle)
- Degradación reportada al acercarse al tope
Privacidad y entrenamiento
- Política de privacidad con URL verificable
- Uso de conversaciones para entrenamiento: sí / no / configurable
- Tratamiento de datos resumido
Aplica el testeo a tu modelo
Copia el prompt, se lo pegas a tu modelo y le das a enter