Protocolo de pruebas · Ventas y operaciones

IA para ventas y CRM: dificultad y criterios.

Esta ficha define qué se medirá antes de ejecutar modelos. Una prueba reproducible vale más que una respuesta llamativa aislada.

Muestra de tareas

Qué debe resolver un modelo.

Los casos se preparan con datos permitidos, una instrucción estable y un criterio de aceptación que pueda comprobar otra persona.

  • Preparación de reuniones y cuentas
  • Resúmenes de llamadas y próximos pasos
  • Borradores de mensajes con revisión comercial

Lote inicial · agosto 2026

Modelos que conviene incluir en la primera pasada.

Son candidatos por adecuación declarada, canal de acceso y tarifa, no posiciones de un ranking. Ejecuta el mismo lote sobre todos los que estén disponibles en tu entorno y conserva el resultado completo.

Evaluación pendiente

Variante de GPT-5.6 orientada a cargas de alto volumen en las que el coste por tarea es una restricción principal.

Alto volumenClasificaciónAutomatizaciones con coste sensible
1,05M contexto$0.20 / 1M coste APIVer ficha
Evaluación pendiente

Modelo Sonnet de Anthropic para programación, uso de herramientas y trabajo agéntico, con precio introductorio vigente hasta el 31 de agosto de 2026.

ProgramaciónAgentesTrabajo profesional diario
1M contexto$2.00 / 1M coste APIVer ficha
Evaluación pendiente

Variante equilibrada de GPT-5.6 para combinar razonamiento, herramientas y coste en flujos profesionales cotidianos.

Trabajo diarioAgentesAnálisis con presupuesto
1,05M contexto$2.00 / 1M coste APIVer ficha

Dificultad

Tres niveles para no mezclar trabajos distintos.

01 · NIVEL

Básica

Una tarea concreta, datos completos y una salida con formato verificable.

02 · NIVEL

Intermedia

Varias restricciones, contexto de trabajo y comprobación de consistencia.

03 · NIVEL

Avanzada

Varios pasos, información incompleta controlada, coste y éxito medibles.

Matriz de evaluación

Cómo se decide si una respuesta sirve.

  1. Integración y permisos del CRM
  2. Calidad al resumir contexto de cuenta
  3. Coste por volumen de actividad

Además del criterio principal, cada ejecución conserva el modelo y versión exactos, configuración, tokens, coste, latencia, error y revisión necesaria.

Publicación

Cuándo aparecerá un resultado.

Solo se publicará una puntuación cuando la muestra, el prompt, la configuración, la fecha y el criterio de éxito estén disponibles. Hasta entonces esta página es un protocolo, no un ranking encubierto.

Límites del sector

Qué no automatizar sin control.

  • No inventes datos de clientes o acuerdos
  • Revisa mensajes antes de enviarlos
  • No automatices decisiones de precio o descuento sin reglas
Volver a la guía sectorial