Clasifica el trabajo antes de comparar
Separa explicación de errores, generación de pruebas, refactorización, revisión de seguridad y cambios de varios archivos. Un modelo puede ser excelente en una tarea corta y menos eficiente cuando necesita mantener un plan durante muchas iteraciones.
Define también el entorno: lenguaje, framework, tamaño del repositorio, acceso a terminal, herramientas permitidas y condición de éxito. Sin ese marco, comparar sólo el texto de una respuesta es engañoso.
Cinco datos que cambian el resultado
Mira el modelo exacto y su versión, la ventana de contexto, la salida máxima, el uso de herramientas y el coste de entrada y salida. En agentes añade el esfuerzo de razonamiento, el número de llamadas y la latencia por ciclo.
Una ventana enorme no garantiza que el modelo use bien todo el repositorio. Mide recuperación de archivos relevantes, cambios correctos, pruebas ejecutadas y trabajo que queda pendiente.
Un protocolo sencillo para tu equipo
Prepara entre diez y veinte incidencias reales anonimizadas. Ejecuta el mismo prompt y las mismas herramientas, registra el coste, comprueba la suite y puntúa sólo el resultado aceptado. Guarda además los fallos para saber dónde conviene un modelo de mayor capacidad.
IA Versus mantiene rankings y preferencias separadas de estas pruebas. La ficha de un modelo puede orientarte; la decisión final debe salir de tus tareas y de tu presupuesto.
Siguiente paso