Metodología v0.1

La confianza también se diseña.

Un ranking solo sirve si se puede explicar, reproducir y discutir. Esta es la base metodológica de IA Versus.

Principios

Seis reglas antes de puntuar.

01

Identidad exacta

Separamos organización, familia, versión, endpoint, producto y plan. Nunca puntuamos una marca como si fuera un modelo.

02

Fuentes trazables

Cada dato conserva URL, fecha, valor original, normalización, confianza y hash de la fuente.

03

Comparabilidad

Solo se comparan tareas, configuraciones y ventanas temporales compatibles. Lo dudoso queda fuera del ranking.

04

Snapshots

Cada lunes se publica una versión atómica del catálogo. Si algo falla, continúa visible la última versión válida.

05

Rankings mensuales

El primer lunes de cada mes congelamos datos, agregamos benchmarks y votos, y publicamos rankings versionados.

06

Sin coste por visita

La web lee resultados precalculados. Las futuras pruebas propias se ejecutarán por lotes con un presupuesto máximo.

Evaluaciones externas

No existe un ranking oficial único.

El proveedor es la fuente principal para especificaciones y precios, pero no debe actuar como juez de su propio rendimiento. Para puntuar cruzaremos fuentes independientes según la tarea.

Solo importaremos una puntuación si conserva modelo exacto, fecha, versión del benchmark, configuración, muestra y unidad. Dos resultados con distinto agente o esfuerzo no se tratarán como equivalentes.

Fórmula por tarea

Los pesos se publican y se versionan.

Índice equilibrado55% rendimiento + 15% fiabilidad + 15% coste + 10% latencia + 5% comunidad

No existe una nota universal. Programación, investigación, imagen o atención al cliente necesitan muestras, métricas y pesos distintos.

Laboratorio futuro

Probar modelos sin fingir una equidad perfecta.

Mismo input

Casos, activos y límites iguales dentro de una ventana corta.

Varias repeticiones

Mediana, dispersión, muestra e intervalo de confianza.

Objetivo primero

Tests, compilación y exactitud antes que un juez LLM.

Señales separadas

Calidad, coste, latencia, fiabilidad y preferencia.

Publicación automática

Sin revisión humana, con límites.

Constraints, validaciones, cuarentena, logs y publicación transaccional protegen el catálogo. Una ejecución fallida nunca sustituye el snapshot que está funcionando.