Software libre, open source y pesos abiertos no son lo mismo
Un modelo puede publicar sus pesos sin publicar todos los datos de entrenamiento, el código de entrenamiento o una licencia aprobada por la Open Source Initiative. La ficha debe decir exactamente qué componente se puede descargar y bajo qué condiciones.
Llama 4, por ejemplo, ofrece pesos y una licencia comunitaria propia. Ministral 3 y varios modelos de Mistral publican pesos con Apache 2.0. DeepSeek y Qwen tienen versiones abiertas, pero hay que revisar el checkpoint y el proveedor que lo sirve.
Qué modelos puedes valorar hoy
Para contexto extremo, Llama 4 Scout declara hasta 10 millones de tokens; Llama 4 Maverick llega a 1 millón y añade una arquitectura multimodal de mayor tamaño. Son opciones de infraestructura, no una tarifa API universal: el coste depende de la GPU, la cuantización y el servidor.
En el extremo compacto, Ministral 3 3B, 8B y 14B ofrecen 256K de contexto, modalidades de texto e imagen y licencia Apache 2.0. Son candidatos razonables para edge, asistentes locales, clasificación, RAG y automatizaciones donde el volumen justifica controlar el despliegue.
DeepSeek V4 Flash, V4 Pro y V4 Flash Vision Exp combinan pesos disponibles con endpoints compatibles. La versión Vision Exp añade imágenes, pero su estado experimental obliga a validar calidad y límites antes de usarla en producción.
Dónde probarlos sin pagar tokens por cada consulta
NaN Builders es una comunidad española que comparte recursos de GPU; no es un modelo. Ollama y Open WebUI simplifican la prueba local, mientras que vLLM sirve para montar un endpoint con batching y concurrencia. Dify y OpenHands añaden flujos y agentes, pero cada capa introduce sus propios permisos y riesgos.
Empieza con una prueba pequeña y aislada. Registra modelo exacto, cuantización, GPU, versión del servidor, prompt, latencia y resultado. No des por hecho que una demo en una GPU compartida representa el coste o el rendimiento de tu producción.
Cómo calcular el coste real
En una API, separa entrada, salida, caché, herramientas y reintentos. En local, suma amortización o alquiler de GPU, electricidad, almacenamiento, observabilidad, actualizaciones y soporte. Una tarifa cero por token puede ocultar una máquina infrautilizada.
La unidad útil es el coste por resultado aceptado. Si el modelo abierto necesita dos correcciones y una revisión adicional para completar una tarea, compáralo con ese trabajo incluido, no sólo con su precio nominal.
Cómo compararlos con modelos cerrados
Usa el mismo prompt, contexto, herramientas permitidas y criterio de aceptación. Separa exactitud, calidad de código, latencia, tasa de éxito, consumo y privacidad. Un ranking global no debe convertir una licencia abierta en una nota de calidad.
En IA Versus las fichas abiertas aparecen con su licencia, contexto, canales y fuentes. Las nuevas versiones entran en comparativas técnicas, pero no en rankings de rendimiento hasta que exista una señal comparable y reproducible.
Siguiente paso