Principios
Seis reglas antes de puntuar.
Identidad exacta
Separamos organización, familia, versión, endpoint, producto y plan. Nunca puntuamos una marca como si fuera un modelo.
Fuentes trazables
Cada dato conserva URL, fecha, valor original, normalización, confianza y hash de la fuente.
Comparabilidad
Solo se comparan tareas, configuraciones y ventanas temporales compatibles. Lo dudoso queda fuera del ranking.
Snapshots
Cada lunes se publica una versión atómica del catálogo. Si algo falla, continúa visible la última versión válida.
Rankings mensuales
El primer lunes de cada mes congelamos datos, agregamos benchmarks y votos, y publicamos rankings versionados.
Sin coste por visita
La web lee resultados precalculados. Las futuras pruebas propias se ejecutarán por lotes con un presupuesto máximo.
Evaluaciones externas
No existe un ranking oficial único.
El proveedor es la fuente principal para especificaciones y precios, pero no debe actuar como juez de su propio rendimiento. Para puntuar cruzaremos fuentes independientes según la tarea.
Evaluaciones reproducibles con múltiples escenarios, métricas y modelos.
Stanford CRFM ↗Preferencia humana · votos anónimosLMArenaComparaciones a ciegas útiles para medir preferencia, separadas de los benchmarks objetivos.
LMArena ↗Programación · agentesSWE-benchPruebas sobre incidencias reales de repositorios; el agente y la configuración forman parte del resultado.
SWE-bench ↗Independiente · calidad, precio y velocidadArtificial AnalysisMide inteligencia, rendimiento de API y precio con metodología publicada.
Artificial Analysis ↗Solo importaremos una puntuación si conserva modelo exacto, fecha, versión del benchmark, configuración, muestra y unidad. Dos resultados con distinto agente o esfuerzo no se tratarán como equivalentes.
Fórmula por tarea
Los pesos se publican y se versionan.
55% rendimiento + 15% fiabilidad + 15% coste + 10% latencia + 5% comunidadNo existe una nota universal. Programación, investigación, imagen o atención al cliente necesitan muestras, métricas y pesos distintos.
Laboratorio futuro
Probar modelos sin fingir una equidad perfecta.
Casos, activos y límites iguales dentro de una ventana corta.
Mediana, dispersión, muestra e intervalo de confianza.
Tests, compilación y exactitud antes que un juez LLM.
Calidad, coste, latencia, fiabilidad y preferencia.
Publicación automática
Sin revisión humana, con límites.
Constraints, validaciones, cuarentena, logs y publicación transaccional protegen el catálogo. Una ejecución fallida nunca sustituye el snapshot que está funcionando.